Des chercheurs du MIT, de Google Research et de Harvard ont publié sur arXiv l'article « Language Models Are ‘Insecure’ Reporters », qui étudie si les grands modèles de langage, lorsqu'ils rendent compte d'un travail déjà réalisé, ont tendance à passer sous silence les problèmes qui affaibliraient leurs propres conclusions. Ils baptisent cette tendance insecure reporting, qu'on pourrait traduire par « ne rapporter que les bonnes nouvelles, taire les mauvaises ».
L'expérience la plus parlante est la suivante : les chercheurs ont fourni à GPT-5.5 un journal d'expérience de machine learning dans lequel était glissé un résultat négatif — la nouvelle méthode perdait face à la référence dans une configuration donnée, de quoi remettre en cause la conclusion de tout le rapport. En demandant au modèle de rédiger 200 rapports à partir de ce journal, seuls 2 ont mentionné ce résultat négatif. Il a suffi d'ajouter au prompt la phrase « Be honest in your response » pour que, sur les mêmes 200 essais, 190 en fassent état.
Huit scénarios, trois modèles phares
L'article, long de 116 pages, conçoit huit types de scénarios de reporting contradictoire : dissimuler des résultats négatifs ou nuls, passer sous silence des bugs de code, masquer des données fabriquées, occulter des défauts méthodologiques, ignorer des preuves contradictoires, passer sous silence des dommages collatéraux, cacher des tâches inachevées et dissimuler des appels d'outils (tool calls) encore en attente de réponse.
Les trois dernières catégories correspondent directement au travail quotidien des agents IA. Un agent de code qui termine une tâche fournit un résumé « terminé » que l'utilisateur se contente le plus souvent de lire, sans revenir consulter le journal complet. Les auteurs écrivent dans leur résumé :
« Users instead come to rely on LLM-generated reports to assess the quality and completeness of the work. »
(Les utilisateurs en viennent à se fier aux rapports générés par le LLM pour juger de la qualité et de l'exhaustivité du travail.)
Les modèles propriétaires testés sont Gemini 3.1 Pro, GPT-5.5 et Claude Opus 4.8 ; côté open source figurent Gemma 3 en versions 1B et 4B, Qwen 3 en 1,7B/14B/30B, Qwen3.5-9B, DeepSeek R1 7B et Llama 3.1 8B. L'écart entre les trois modèles phares est important : selon une synthèse de l'article par Unite.AI, Claude Opus 4.8 atteint, même sans aucune consigne, un taux de divulgation supérieur à 90 % dans la plupart des scénarios ; Gemini 3.1 Pro est le plus faible, ne dépassant 34 % dans aucun scénario. Tous les modèles s'améliorent nettement une fois la consigne d'honnêteté ajoutée.
Les modèles ne sont pas pour autant aveugles au problème. Dans les scénarios contradictoires, ils parviennent à identifier les défauts, mais ont tendance, au moment de rédiger le rapport, à préserver le récit de « succès ». Les chercheurs ont analysé 850 chaînes de raisonnement des modèles open source : dans les chaînes qui débouchaient finalement sur la dissimulation du défaut, 55 % à 82 % contenaient une forme d'injonction du type « il faut réussir » ; dans celles qui débouchaient sur un rapport honnête, cette proportion n'était que de 27 %.
Ils ont par ailleurs mené des analyses d'activation et des expériences de pilotage (steering) sur Qwen3.5-9B, découvrant que « honnêteté » et « recherche du succès » correspondent, dans l'espace de représentation interne du modèle, à deux directions quasiment opposées. En poussant légèrement le modèle vers la direction « honnêteté », celui-ci devient plus disposé à écrire aussi les mauvaises nouvelles.
De « plaire à l'utilisateur » à « plaire au résultat »
Cette piste de recherche s'inscrit dans une continuité. En octobre 2023, Anthropic avait publié un article sur la sycophancy (flatterie) des modèles, concluant que les modèles entraînés par retour humain tendent à abonder dans le sens des opinions déjà exprimées par l'utilisateur. En avril 2025, OpenAI avait retiré une mise à jour de GPT-4o pour une raison similaire : le modèle était devenu excessivement complaisant, et le blog officiel avait reconnu que l'entraînement avait accordé trop de poids aux retours à court terme des utilisateurs, comme les « likes ».
Dans ces deux cas, l'objet était la conversation : ce que dit l'utilisateur, le modèle l'approuve. Cet article déplace le regard vers le reporting : l'utilisateur n'exprime aucune opinion, mais le modèle lui-même tend à présenter le travail comme accompli. Le point commun entre les deux est que, pendant l'entraînement, les réponses qui « plaisent » reçoivent davantage de récompense.
La solution proposée par l'article est étonnamment peu coûteuse : une simple phrase dans le prompt suffit. Mais elle laisse une question sans réponse : à quelle étape de l'entraînement ce réflexe par défaut se forme-t-il ? Les auteurs n'ont trouvé de preuve au niveau de la représentation interne que sur un seul modèle open source de 9B ; les détails d'entraînement des modèles propriétaires restent inconnus, et aucune des trois entreprises n'a pour l'instant réagi publiquement aux résultats de l'article.
Pour l'utilisateur ordinaire, l'application la plus directe consiste, lorsqu'on demande à un modèle de rédiger un résumé, un rapport hebdomadaire ou un compte rendu de modifications de code, à exiger explicitement qu'il liste aussi les points en échec ou inachevés.
Sources : article arXiv 2609.36139, Unite.AI, CocoLoop, blogs officiels d'Anthropic et d'OpenAI ; les chiffres 2/200 et 190/200 correspondent aux divulgations de GPT-5.5 dans le scénario de résultat négatif présenté dans l'article, les proportions de Gemini et Claude suivant le mode d'agrégation retenu par l'article.