Open-source model verification · v1

Jovethra vs OpenAI.

Une comparaison comportementale reproductible des endpoints GPT-5.6. Nous mesurons des distributions de réponses courtes, pas des impressions ni une ressemblance de texte.

Important. Cette expérience est opérée par Jovethra. Elle ne constitue pas une certification OpenAI et ne peut pas prouver cryptographiquement l'identité d'un modèle.
01 · Latest run

Le résultat, sans raccourci.

Le badge ci-dessous est généré depuis `summary.json`. Aucun verdict favorable n'est codé dans l'interface.

Verdict conservateur
INVALID AUDIT
0 samples0% valides0 cellules
Endpoint testé
OpenAI Officialgpt-5.6-sol
api.openai.com
Jovethragpt-5.6-sol
api.jovethra.xyz
02 · Statistical evidence

Plus bas signifie plus proche.

Jensen-Shannon divergence en base 2, moyenne sur les cellules partagées. Les intervalles sont calculés par bootstrap, jamais par fuzzy matching.

Distance to Sol
JSD · 0 = identique · 1 = disjoint
Distance to Luna
JSD · 0 = identique · 1 = disjoint
Distance to Terra
JSD · 0 = identique · 1 = disjoint
Calibration
  • Official Sol A ↔ B
  • Jovethra ↔ Official Sol
  • Delta Sol ↔ Luna [, ]
  • Delta Sol ↔ Terra [, ]
Why this matters

Un même modèle peut produire des réponses différentes d'un échantillon à l'autre. L'auto-distance officielle mesure cette variation naturelle. Une proximité isolée ne suffit donc pas à conclure.

Les résultats ambigus restent ambigus. Le protocole ne convertit pas un score en probabilité d'identité.

03 · Fingerprint cells

40 cellules, quatre langues.

10 familles de tâches courtes × anglais, russe, chinois et arabe. Chaque cellule conserve ses catégories et ses réponses invalides.

Battery paper40-v1 · measured snapshot
encell 01not published
rucell 02not published
zhcell 03not published
arcell 04not published
encell 05not published
rucell 06not published
zhcell 07not published
arcell 08not published
encell 09not published
rucell 10not published
zhcell 11not published
arcell 12not published
encell 13not published
rucell 14not published
zhcell 15not published
arcell 16not published
encell 17not published
rucell 18not published
zhcell 19not published
arcell 20not published
encell 21not published
rucell 22not published
zhcell 23not published
arcell 24not published
encell 25not published
rucell 26not published
zhcell 27not published
arcell 28not published
encell 29not published
rucell 30not published
zhcell 31not published
arcell 32not published
encell 33not published
rucell 34not published
zhcell 35not published
arcell 36not published
encell 37not published
rucell 38not published
zhcell 39not published
arcell 40not published
Snapshot policy

Les réponses brutes publiées sont limitées à de courtes sorties de probe et sanitizées. Les clés, headers Authorization et instructions cachées ne font jamais partie des artefacts.

Les contrôles Sol, Luna et Terra sont mesurés dans les mêmes conditions pour séparer la question de famille et la question du modèle exact.

04 · Context integrity

Les anomalies d'enveloppe restent visibles.

Un wrapper ou une injection amont peut modifier le comportement sans remplacer le modèle. Ce signal est séparé du score d'identité.

Diagnostic
  • Instructions cachéesnon publié en contenu
  • Empreinte publiéehash SHA-256 seulement
  • Tokenisationsignal auxiliaire
  • Routing instableà déclarer si détecté
Interprétation

Une hausse de prompt tokens ou un champ `instructions` fourni par une réponse sans instruction client peut indiquer une transformation de contexte upstream. Cela peut perturber les distributions et réduire la force d'une comparaison.

05 · Reproduce

Chaque audit est exécutable hors du site.

Le navigateur ne déclenche aucune requête payante. Le CLI opérateur est le seul chemin de collecte.

git clone https://github.com/Belius303/jovethra-versus
cd jovethra-versus
export OPENAI_API_KEY=...
export JOVETHRA_API_KEY=...
./versus doctor
./versus preflight
./versus audit --quick

Le budget OpenAI est une limite dure. Les échecs sont conservés, les retries sont bornés et la reprise utilise un checkpoint pour ne pas dupliquer les samples valides.

05b · BYOK browser test

Mesurez vos endpoints directement.

Le mode BYOK est optionnel. Utilisez des clés à durée de vie courte ou révoquées immédiatement après usage.

Optional · bring your own keys

Tester avec vos propres clés.

Les clés sont utilisées uniquement dans cet onglet, envoyées directement à OpenAI et Jovethra, puis effacées de la mémoire de l'interface à la fin du test. Elles ne transitent jamais par ce serveur et ne sont jamais enregistrées.

06 · Provenance

Les nombres ont une source.

Rapport initial: aucune collecte réelle. Dès qu'un audit validé est publié, les liens ci-dessous pointent vers les artefacts hashés.

Le hash d'un rapport est une preuve d'intégrité de fichier et de provenance déclarée, pas une attestation tierce.