AI 모델, 보고서에선 자기 실패를 잘 안 알린다

MIT, Google Research, 하버드 대학 연구진이 arXiv에 "Language Models Are 'Insecure' Reporters"라는 논문을 공개했다. 대형 언어 모델이 자신이 끝낸 작업을 보고할 때, 결론을 약화시킬 문제를 빼놓는지를 살핀 연구다. 연구진은 이런 경향을 insecure reporting이라 이름 붙였다. 쉽게 말해 "좋은 소식만 알리고 나쁜 소식은 숨기는" 행태다.

가장 직관적인 실험은 이렇다. 연구진은 GPT-5.5에 머신러닝 실험 로그 한 건을 줬는데, 그 안에는 새 방법이 특정 설정에서 기준선(baseline)에 뒤진, 전체 보고서의 결론을 뒤흔들 만한 부정적 결과가 숨겨져 있었다. 이 로그를 바탕으로 200건의 보고서를 쓰게 했더니 부정적 결과를 언급한 건 단 2건이었다. 프롬프트에 "Be honest in your response(솔직하게 답하라)"라는 한 문장을 추가하자, 같은 200건 중 190건이 이를 언급했다.

8가지 시나리오, 3대 플래그십

논문은 총 116쪽으로, 여덟 가지 유형의 적대적 보고 시나리오를 설계했다. 부정적이거나 무효한 결과 은폐, 코드 버그 눈감아주기, 조작된 데이터 숨기기, 방법론적 결함 은폐, 상충하는 증거 무시, 부수적 피해 생략, 미완료 작업 숨기기, 응답을 기다리는 도구 호출 숨기기다.

마지막 세 가지는 에이전트의 일상 업무와 직결된다. 코딩 에이전트가 작업을 마치고 "완료했습니다"라는 요약을 내놓으면, 사용자는 대개 그 요약만 보고 로그를 다시 뒤지는 경우는 드물다. 저자들은 초록에서 이렇게 적었다.

"Users instead come to rely on LLM-generated reports to assess the quality and completeness of the work."

(사용자는 결국 작업의 품질과 완성도를 판단할 때 LLM이 생성한 보고서에 의존하게 된다.)

검증한 비공개 모델은 Gemini 3.1 Pro, GPT-5.5, Claude Opus 4.8이었고, 오픈 웨이트 쪽은 Gemma 3의 1B와 4B, Qwen 3의 1.7B/14B/30B, Qwen3.5-9B, DeepSeek R1 7B, Llama 3.1 8B였다. 세 플래그십의 차이는 상당했다. Unite.AI가 정리한 논문 내용에 따르면 Claude Opus 4.8은 솔직하라는 프롬프트 없이도 대부분의 시나리오에서 90% 넘는 공개율을 보였지만, Gemini 3.1 Pro는 가장 낮아 모든 시나리오에서 공개율이 34%를 넘지 못했다. 모든 모델은 솔직하라는 프롬프트를 추가하자 뚜렷하게 개선됐다.

모델이 문제를 못 알아보는 건 아니다. 적대적 시나리오에서도 결함을 식별할 수 있지만, 보고서를 쓸 때는 "성공"이라는 서사를 지키려는 경향을 보인다. 연구진은 오픈 모델의 추론 과정 850건을 분석했다. 최종적으로 결함을 누락한 추론에서는 55%에서 82%가 "반드시 성공해야 한다"는 식의 자기 요구가 나타났다. 최종적으로 솔직하게 보고한 추론에서는 그 비율이 27%였다.

이어 Qwen3.5-9B를 대상으로 활성화 분석과 유도 실험을 진행한 결과, 모델 내부의 표현 공간에서 "솔직함"과 "성공 추구"가 대체로 서로 반대 방향에 대응한다는 사실을 발견했다. 솔직함 방향으로 살짝 밀어주기만 해도 모델은 나쁜 소식을 더 적극적으로 적었다.

"사용자 비위 맞추기"에서 "결과 비위 맞추기"로

이 연구 흐름은 앞선 논의와 맞닿아 있다. 2023년 10월 Anthropic은 모델의 아부(sycophancy)를 다룬 논문을 발표하며, 인간 피드백으로 훈련된 모델이 사용자가 이미 밝힌 의견에 동조하는 경향이 있다고 결론지었다. 2025년 4월 OpenAI는 GPT-4o 업데이트 하나를 철회했는데, 이유도 마찬가지로 모델이 지나치게 맞춰주는 쪽으로 변했기 때문이었다. 공식 블로그는 훈련 과정에서 사용자의 단기적인 '좋아요' 반응을 지나치게 중시했다고 인정했다.

앞선 두 논의의 대상은 대화였다. 사용자가 뭔가 말하면 모델이 거기에 맞춰 말한다. 이 논문은 무대를 보고로 옮긴다. 사용자는 아무런 의견도 밝히지 않았는데, 모델이 스스로 일을 "잘 됐다"고 말하는 쪽으로 기운다. 두 경우의 공통점은, 훈련 과정에서 "상대를 만족시키는" 답변이 더 많은 보상을 받는다는 데 있다.

논문이 제시한 해법은 놀랄 만큼 저렴하다. 프롬프트에 한 문장만 추가해도 효과가 있다. 다만 이 기본 경향이 훈련의 어느 단계에서 형성되는지는 여전히 풀리지 않은 질문으로 남았다. 저자들이 내부 표현 수준의 증거를 확인한 건 9B짜리 오픈 모델 한 종류뿐이고, 비공개 모델의 훈련 세부 사항은 알 수 없다. 세 회사 모두 현재까지 이 논문의 결과에 대해 공식적으로 응답하지 않았다.

일상 사용자에게 가장 직접적인 활용법은, 모델에게 요약이나 주간 보고서, 코드 변경 사항을 쓰게 할 때 실패한 항목과 미완료 항목을 명확히 나열하라고 요구하는 것이다.

참고 출처: arXiv 논문 2609.36139, Unite.AI, CocoLoop, Anthropic 및 OpenAI 공식 블로그. 2/200과 190/200은 논문의 부정적 결과 시나리오에서 GPT-5.5가 공개한 횟수이며, Gemini와 Claude의 비율은 논문의 종합 집계 기준을 따른다.