Jovethra vs OpenAI.
Une comparaison comportementale reproductible des endpoints GPT-5.6. Nous mesurons des distributions de réponses courtes, pas des impressions ni une ressemblance de texte.
Le résultat, sans raccourci.
Le badge ci-dessous est généré depuis `summary.json`. Aucun verdict favorable n'est codé dans l'interface.
gpt-5.6-sol
api.openai.comgpt-5.6-sol
api.jovethra.xyzPlus bas signifie plus proche.
Jensen-Shannon divergence en base 2, moyenne sur les cellules partagées. Les intervalles sont calculés par bootstrap, jamais par fuzzy matching.
- Official Sol A ↔ B—
- Jovethra ↔ Official Sol—
- Delta Sol ↔ Luna— [—, —]
- Delta Sol ↔ Terra— [—, —]
Un même modèle peut produire des réponses différentes d'un échantillon à l'autre. L'auto-distance officielle mesure cette variation naturelle. Une proximité isolée ne suffit donc pas à conclure.
Les résultats ambigus restent ambigus. Le protocole ne convertit pas un score en probabilité d'identité.
40 cellules, quatre langues.
10 familles de tâches courtes × anglais, russe, chinois et arabe. Chaque cellule conserve ses catégories et ses réponses invalides.
Les réponses brutes publiées sont limitées à de courtes sorties de probe et sanitizées. Les clés, headers Authorization et instructions cachées ne font jamais partie des artefacts.
Les contrôles Sol, Luna et Terra sont mesurés dans les mêmes conditions pour séparer la question de famille et la question du modèle exact.
Les anomalies d'enveloppe restent visibles.
Un wrapper ou une injection amont peut modifier le comportement sans remplacer le modèle. Ce signal est séparé du score d'identité.
- Instructions cachéesnon publié en contenu
- Empreinte publiéehash SHA-256 seulement
- Tokenisationsignal auxiliaire
- Routing instableà déclarer si détecté
Une hausse de prompt tokens ou un champ `instructions` fourni par une réponse sans instruction client peut indiquer une transformation de contexte upstream. Cela peut perturber les distributions et réduire la force d'une comparaison.
Chaque audit est exécutable hors du site.
Le navigateur ne déclenche aucune requête payante. Le CLI opérateur est le seul chemin de collecte.
cd jovethra-versus
export OPENAI_API_KEY=...
export JOVETHRA_API_KEY=...
./versus doctor
./versus preflight
./versus audit --quick
Le budget OpenAI est une limite dure. Les échecs sont conservés, les retries sont bornés et la reprise utilise un checkpoint pour ne pas dupliquer les samples valides.
Mesurez vos endpoints directement.
Le mode BYOK est optionnel. Utilisez des clés à durée de vie courte ou révoquées immédiatement après usage.
Tester avec vos propres clés.
Les clés sont utilisées uniquement dans cet onglet, envoyées directement à OpenAI et Jovethra, puis effacées de la mémoire de l'interface à la fin du test. Elles ne transitent jamais par ce serveur et ne sont jamais enregistrées.
Les nombres ont une source.
Rapport initial: aucune collecte réelle. Dès qu'un audit validé est publié, les liens ci-dessous pointent vers les artefacts hashés.
Le hash d'un rapport est une preuve d'intégrité de fichier et de provenance déclarée, pas une attestation tierce.