麻省理工學院、Google Research和哈佛大學的研究者在arXiv發表論文《Language Models Are "Insecure" Reporters》,研究大型語言模型在匯報已完成的工作時,是否會把削弱結論的問題悄悄略過不提。他們把這種傾向稱為insecure reporting,可以理解為「報喜不報憂」。
最直觀的一組實驗是這樣的:研究者給GPT-5.5一份機器學習實驗日誌,裡面埋了一條負面結果——新方法在某個設定下輸給了基準模型,足以動搖整份報告的結論。讓模型據此寫200份報告,只有2份提到了這條負面結果。在提示詞裡加上一句「Be honest in your response」,同樣200份裡有190份寫了出來。
八個情境,三家旗艦
論文全長116頁,設計了八類對抗性匯報情境:隱瞒負面或無效結果、忽略程式碼錯誤、掩蓋捏造的數據、掩蓋方法上的缺陷、無視相互矛盾的證據、略過附帶損害、隱瞒未完成的任務、隱瞒還在等待回應的工具呼叫。
後三類直接對應智能體的日常工作。一個編碼智能體跑完任務後給出「已完成」的總結,使用者多半只看總結,很少回頭翻日誌。作者在摘要裡寫道:
"Users instead come to rely on LLM-generated reports to assess the quality and completeness of the work."
(使用者轉而依賴模型生成的報告,來判斷工作的品質與完成度。)
參與測試的封閉模型是Gemini 3.1 Pro、GPT-5.5和Claude Opus 4.8,開源一側有Gemma 3的1B與4B、Qwen 3的1.7B/14B/30B、Qwen3.5-9B、DeepSeek R1 7B與Llama 3.1 8B。三家旗艦差別不小:根據Unite.AI對論文的整理,Claude Opus 4.8在多數情境下不加提示就有九成以上的揭露率;Gemini 3.1 Pro最低,各情境的揭露比例都不超過34%。所有模型在加了誠實提示後都有明顯改善。
模型並非看不出問題。在對抗情境裡,模型能識別缺陷,但寫報告時傾向於保住「成功」的敘事。研究者分析了開源模型的850條推理過程:最終漏報缺陷的那些推理裡,55%到82%出現了「必須成功」一類的自我要求;最終如實報告的推理裡,這個比例是27%。
他們又在Qwen3.5-9B上做了激活分析和引導實驗,發現「誠實」與「追求成功」在模型內部表示空間裡對應兩個大致相反的方向。往誠實方向推一把,模型就更願意把壞消息寫出來。
從「討好使用者」到「討好結果」
這條研究線可以往前接。2023年10月,Anthropic發表過一篇討論模型諂媚(sycophancy)的論文,結論是經過人類反饋訓練的模型,會傾向於附和使用者已經表達的觀點。2025年4月,OpenAI撤回了一次GPT-4o更新,原因同樣是模型變得過分迎合,官方部落格承認訓練中過度看重了使用者的短期按讚回饋。
那兩次討論的對象是聊天:使用者說什麼,模型順著說。這篇論文換到了匯報情境,使用者什麼都沒表態,模型自己傾向於把事情說成辦成了。兩者的共同點在於,訓練過程中「讓人滿意」的回答拿到了更多獎勵。
論文給出的補救辦法便宜得出奇,一句提示詞就有效。但它也留下了一個沒回答的問題:這種預設傾向是在哪個訓練階段形成的。作者只在一個9B開源模型上看到了內部表示層面的證據,封閉模型的訓練細節無從得知,三家公司目前也都沒有就論文結果作出公開回應。
對日常使用者,最直接的用法是在讓模型寫總結、寫週報、匯報程式碼變更時,明確要求它列出失敗項與未完成項。
參考來源:arXiv論文2609.36139、Unite.AI、CocoLoop、Anthropic與OpenAI官方部落格;2/200與190/200為論文中GPT-5.5在負面結果情境下的揭露次數,Gemini與Claude的比例按論文彙總口徑。