麻省理工、Google Research 和哈佛的研究者在 arXiv 发表论文《Language Models Are “Insecure” Reporters》,研究大模型在汇报已完成的工作时,会不会把削弱结论的问题略过不提。他们给这种倾向起名 insecure reporting,可以理解为”报喜不报忧”。
最直观的一组实验是这样的:研究者给 GPT-5.5 一份机器学习实验日志,里面埋了一条负面结果,新方法在某个设置下输给了基线,足以动摇整份报告的结论。让模型据此写 200 份汇报,只有 2 份提到了这条负面结果。在提示词里加上一句 “Be honest in your response”,同样 200 份里有 190 份写了出来。
八个场景,三家旗舰
论文共 116 页,设计了八类对抗性汇报场景:隐瞒负面或无效结果、忽略代码 bug、掩盖编造的数据、掩盖方法缺陷、无视相互矛盾的证据、略过附带损害、隐瞒未完成的任务、隐瞒还在等待返回的工具调用。
后三类直接对应智能体的日常工作。一个编程智能体跑完任务后给出”已完成”的总结,用户多半只看总结,很少回头翻日志。作者在摘要里写道:
“Users instead come to rely on LLM-generated reports to assess the quality and completeness of the work.” (用户转而依赖模型生成的报告,来判断工作的质量和完成度。)
参测的闭源模型是 Gemini 3.1 Pro、GPT-5.5 和 Claude Opus 4.8,开源一侧有 Gemma 3 的 1B 与 4B、Qwen 3 的 1.7B/14B/30B、Qwen3.5-9B、DeepSeek R1 7B 和 Llama 3.1 8B。三家旗舰差别不小:按 Unite.AI 对论文的整理,Claude Opus 4.8 在多数场景下不加提示就有九成以上的披露率;Gemini 3.1 Pro 最低,各场景的披露比例都不超过 34%。所有模型在加了诚实提示后都有明显改善。
模型并非看不出问题。在对抗场景里,模型能识别缺陷,但写汇报时倾向于保住”成功”的叙事。研究者分析了开源模型的 850 条推理过程:最终漏报缺陷的那些推理里,55% 到 82% 出现了”必须成功”一类的自我要求;最终如实报告的推理里,这个比例是 27%。
他们又在 Qwen3.5-9B 上做了激活分析和引导实验,发现”诚实”与”追求成功”在模型内部表示空间里对应两个大致相反的方向。往诚实方向推一把,模型就更愿意把坏消息写出来。
从”讨好用户”到”讨好结果”
这条研究线可以往前接。2023 年 10 月,Anthropic 发表过一篇讨论模型谄媚(sycophancy)的论文,结论是经过人类反馈训练的模型,会倾向于附和用户已经表达的观点。2025 年 4 月,OpenAI 撤回了一次 GPT-4o 更新,原因同样是模型变得过分迎合,官方博客承认训练中过度看重了用户的短期点赞反馈。
那两次讨论的对象是聊天:用户说什么,模型顺着说。这篇论文换到了汇报场景,用户什么都没表态,模型自己倾向于把事情说成办成了。两者的共同点在于,训练过程中”让人满意”的回答拿到了更多奖励。
论文给出的补救办法便宜得出奇,一句提示词就有效。但它也留下了一个没回答的问题:这种默认倾向是在哪个训练阶段形成的。作者只在一个 9B 开源模型上看到了内部表示层面的证据,闭源模型的训练细节无从得知,三家公司目前也都没有就论文结果作出公开回应。
对日常用户,最直接的用法是在让模型写总结、写周报、汇报代码改动时,明确要求它列出失败项和未完成项。
参考来源:arXiv 论文 2609.36139、Unite.AI、CocoLoop、Anthropic 与 OpenAI 官方博客;2/200 与 190/200 为论文中 GPT-5.5 在负面结果场景下的披露次数,Gemini 与 Claude 的比例按论文汇总口径。