Selon une enquête de Fortune publiée le 4 septembre, après la mise en ligne de l'article de blog présentant le modèle GPT-6 Astra d'OpenAI, les données d'évaluation figurant sur la page ont été modifiées à plusieurs reprises, certains indicateurs ayant été changés puis rétablis à leur valeur initiale.
La chronologie peut être reconstituée pas à pas grâce aux archives d'Internet Archive. Le 3 septembre à 14 h, heure de l'Est américain, l'article a été publié une première fois puis retiré ; à 14 h 23, un premier instantané a été enregistré ; à 15 h 32, le compte X d'OpenAI a publié un lien, qui s'est révélé cassé ; à 15 h 50, Sam Altman l'a partagé ; au sixième instantané, à 17 h 20, les chiffres du tableau avaient déjà changé. Le 4 septembre, les chiffres ont continué de bouger.
Ce qui a été modifié
La colonne du taux d'hallucination est celle qui a le plus visiblement changé. Astra est passé de 4,2 % à 2,0 %, puis est revenu à 4,2 % ; le modèle de comparaison GPT-5.6 Sol est passé de 12,2 % à 9,4 %, avant de revenir également à 12,2 %. Malgré cette baisse suivie d'un retour, la position relative des deux modèles n'a pas changé, mais la version intermédiaire diffusée sous forme de captures d'écran a réduit l'écart entre eux de plus de moitié.
Dans la colonne mathématiques, ce sont les notes des autres modèles qui ont été modifiées. Sur FrontierMath Tier 4 v2, le score propre d'Astra, 97,6 %, n'a jamais bougé ; la note de Fable 5.1, d'Anthropic, a été ramenée de 87,8 % à 78 %, avant de se stabiliser à 83 % ; celle de GPT-5.6 Sol a été ramenée de 83 % à 80,5 %, puis est également revenue à 83 %. À un moment donné, la note du concurrent a été amputée de près de dix points de pourcentage.
En cybersécurité, le score de GPT-5.6 Sol sur ExploitBench a été révisé à la hausse, de 5,5 % à 11,5 %. Quant à savoir si ce chiffre a lui aussi été ramené en arrière, Fortune indiquait encore le vérifier au moment de la publication de son enquête.
Par ailleurs, le résultat d'ARC-AGI-3 dans la version antérieure à l'embargo était de 98,6 %, mais il figurait à 99,99 % lors de la publication officielle ; dans la catégorie programmation, une modification mineure a fait passer un score de 57,7 % à 57,9 %.
Un porte-parole d'OpenAI a réagi en ces termes : "We care deeply about getting evaluations right. Most evaluations have noise within a few percentage points..." (nous tenons énormément à ce que les évaluations soient justes ; la plupart des évaluations comportent déjà une marge de bruit de quelques points de pourcentage).
Les chercheurs extérieurs ne partagent pas tous le même avis. Anka Reuel et Mike Hardy estiment : "This can be done in a very tight timeframe, and it's better for their marketing." (cela peut se faire dans un délai très court, et c'est plus avantageux pour leur communication marketing). Vincent Sunn Chen, de Snorkel AI, penche pour sa part vers une explication plus opérationnelle : "It's usually a function of final launch logistics." (c'est généralement le résultat de la logistique de dernière minute avant un lancement).
Dans quelles conditions ces scores ont-ils été obtenus
En bas de page de l'article de blog figure un avertissement : "Evaluation scores are the maximum at any effort" — les scores correspondent au meilleur résultat obtenu, quel que soit le niveau d'effort de calcul engagé. Cette phrase pèse plus lourd que n'importe laquelle des modifications apportées au tableau.
ARC-AGI-3 illustre bien l'ampleur de cet écart. Selon les mesures de l'Arc Prize Foundation elle-même, avec un harness (couche d'orchestration) puissant, le score atteint 99,9 % ; avec un harness standard, il tombe à seulement 63 %. Même modèle, mêmes questions, un écart de 36 points de pourcentage qui tient uniquement à cette couche de code d'orchestration externe.
Pour les lecteurs qui suivent ce sujet via des communautés sinophones, ce niveau d'information se perd généralement au fil de la diffusion. Une fois le tableau de résultats parvenu jusque-là, il ne reste le plus souvent que les chiffres et des captures d'écran de classement, sans la configuration du harness, le niveau d'effort de calcul ni la version de l'évaluation. Or ce que l'utilisateur ordinaire expérimente réellement, c'est ChatGPT ou l'API en configuration par défaut, une fois le produit finalisé — bien loin de cette "valeur maximale obtenue quel que soit l'effort engagé".
Fortune souligne également que la system card d'OpenAI manque de documentation méthodologique détaillée, ce qui complique toute reproduction indépendante des résultats. Qui a précisément initié ces vagues de modifications, et sur quelle base, n'est précisé nulle part dans les documents publics disponibles, et la réponse d'OpenAI n'a pas non plus abordé ce point.
Seules les archives peuvent être vérifiées
La seule preuve solide dans cette affaire, ce sont les six instantanés d'Internet Archive. Ils prouvent que les chiffres ont changé, à quel moment, et pour quelles valeurs — mais pas pourquoi.
Considérer le tableau d'évaluation publié le jour du lancement comme un fait journalistique citable en l'état est une pratique courante dans le secteur. L'épisode Astra montre qu'il vaut mieux, désormais, toujours préciser le moment exact de la consultation lorsqu'on le cite.
Sources : Fortune, CocoLoop, Arc Prize Foundation, blog officiel d'OpenAI ; Fortune a vérifié les horaires de chaque instantané ainsi que les évolutions successives des scores de taux d'hallucination, FrontierMath, ExploitBench et ARC-AGI-3, tandis que le blog d'OpenAI a confirmé le texte original de l'avertissement sur le mode de calcul des scores.