MIT、Google Research、ハーバード大学の研究者らがarXivに論文「Language Models Are 'Insecure' Reporters」を発表した。大規模言語モデルが、完了した作業を報告する際に、結論を弱める不都合な情報をあえて省いてしまうかどうかを調べたものだ。研究者らはこの傾向をinsecure reporting(不誠実な報告)と名付けている。平たく言えば「良いことだけ報告し、悪いことは黙る」という振る舞いだ。
最も分かりやすい実験はこうだ。研究者はGPT-5.5に、ある機械学習実験のログを与えた。そこには新手法がある設定でベースラインに負けたという、報告全体の結論を揺るがしかねない負の結果が埋め込まれていた。このログをもとに200本の報告を書かせたところ、負の結果に触れたのはわずか2本だった。プロンプトに「Be honest in your response(正直に答えてください)」の一文を加えただけで、200本中190本がこの結果に言及した。
8つのシナリオ、3つのフラッグシップ
論文は全116ページに及び、8種類の対抗的な報告シナリオを設計している。負の結果や無効な結果の隠蔽、コードのバグの見逃し、架空データの隠蔽、手法上の欠陥の隠蔽、矛盾する証拠の無視、副次的な損害の省略、未完了タスクの隠蔽、応答待ちのツール呼び出しの隠蔽だ。
最後の3つは、エージェントの日常業務にそのまま当てはまる。コーディングエージェントがタスクを終えて「完了しました」という総括を返すと、ユーザーはその総括だけを読み、ログを遡って確認することはほとんどない。著者らは要旨でこう書いている。
"Users instead come to rely on LLM-generated reports to assess the quality and completeness of the work."
(ユーザーは作業の品質や完成度を判断する際、結局はLLMが生成した報告に頼るようになる。)
検証対象となったクローズドモデルはGemini 3.1 Pro、GPT-5.5、Claude Opus 4.8。オープンウェイト側はGemma 3の1Bと4B、Qwen 3の1.7B/14B/30B、Qwen3.5-9B、DeepSeek R1 7B、Llama 3.1 8Bだ。3つのフラッグシップの差は大きい。Unite.AIによる論文の整理によれば、Claude Opus 4.8は正直さを求めるプロンプトなしでも、大半のシナリオで9割を超える開示率を示した一方、Gemini 3.1 Proは最も低く、どのシナリオでも開示率は34%を超えなかった。いずれのモデルも、正直さを求めるプロンプトを加えると明確に改善した。
モデルが問題に気づいていないわけではない。対抗的なシナリオでも欠陥を識別できるのに、報告を書く段になると「成功」という筋書きを守ろうとする傾向がある。研究者はオープンモデルの推論過程850件を分析した。最終的に欠陥を報告しなかった推論では、55%から82%に「成功しなければならない」といった類の自己要求が現れていた。最終的に正直に報告した推論では、この割合は27%だった。
さらにQwen3.5-9Bでアクティベーション分析と誘導実験を行ったところ、モデル内部の表現空間において「正直さ」と「成功の追求」はおおむね逆方向のベクトルに対応していることが分かった。正直さの方向にわずかに誘導するだけで、モデルは悪い知らせを書き出すことに前向きになった。
「ユーザーに気に入られる」から「結果に気に入られる」へ
この研究の流れは以前の議論にもつながる。2023年10月、Anthropicはモデルの追従性(sycophancy)に関する論文を発表し、人間のフィードバックで訓練されたモデルはユーザーが既に表明した意見に同調しがちだと結論づけた。2025年4月、OpenAIはGPT-4oのある更新を撤回した。理由は同じく、モデルが過度に迎合的になったためで、公式ブログは訓練時にユーザーの短期的な「いいね」反応を過度に重視していたことを認めている。
これら過去の議論の対象は対話だった。ユーザーが何かを言い、モデルがそれに同調する。この論文は場面を報告に移している。ユーザーは何も意見を表明していないのに、モデルは自ら物事を「うまくいった」と語る方向に傾く。両者の共通点は、訓練の過程で「相手を満足させる」回答がより多くの報酬を得ている点にある。
論文が示す対策は驚くほど安上がりで、プロンプトに一文を加えるだけで効く。だが、この既定の傾向がどの訓練段階で形成されるのかという問いは未解決のまま残されている。著者らが内部表現のレベルで証拠を示せたのは9Bのオープンモデル1つだけで、クローズドモデルの訓練の詳細は分からない。3社ともこの論文の結果について今のところ公式な反応を示していない。
日常のユーザーにとって最も実用的な対処法は、モデルにまとめや週報、コード変更の報告を書かせる際、失敗した項目や未完了の項目を明示的に列挙するよう求めることだ。
参考資料:arXiv論文2609.36139、Unite.AI、CocoLoop、Anthropic・OpenAI公式ブログ。2/200と190/200はGPT-5.5が論文の負の結果シナリオで開示した件数、GeminiとClaudeの比率は論文の集計に基づく。