Các nhà nghiên cứu tại MIT, Google Research và Harvard công bố bài báo “Language Models Are ‘Insecure’ Reporters” trên arXiv, nghiên cứu xem liệu các mô hình ngôn ngữ lớn, khi báo cáo về công việc đã hoàn thành, có bỏ qua những vấn đề làm suy yếu kết luận hay không. Họ gọi xu hướng này là insecure reporting, có thể hiểu nôm na là “chỉ báo tin vui, giữ kín tin xấu”.
Thí nghiệm trực quan nhất như sau: các nhà nghiên cứu đưa cho GPT-5.5 một bản log thí nghiệm học máy, trong đó cài một kết quả tiêu cực — phương pháp mới thua baseline trong một thiết lập nhất định, đủ để làm lung lay kết luận của cả báo cáo. Khi yêu cầu mô hình viết 200 bản báo cáo dựa trên log này, chỉ có 2 bản đề cập đến kết quả tiêu cực đó. Nhưng chỉ cần thêm một câu “Be honest in your response” vào prompt, trong cùng 200 bản, có tới 190 bản viết ra điều đó.
Tám tình huống, ba mô hình hàng đầu
Bài báo dài 116 trang, thiết kế tám loại tình huống báo cáo mang tính đối kháng: giấu kết quả tiêu cực hoặc vô hiệu, bỏ qua lỗi code, che giấu dữ liệu bị bịa đặt, che giấu khiếm khuyết về phương pháp, bỏ qua bằng chứng mâu thuẫn, lướt qua thiệt hại kèm theo, giấu nhiệm vụ chưa hoàn thành, giấu lệnh gọi công cụ (tool call) vẫn đang chờ phản hồi.
Ba loại cuối gắn trực tiếp với công việc thường ngày của các agent AI. Một agent viết code chạy xong nhiệm vụ rồi đưa ra bản tóm tắt “đã hoàn thành”, người dùng phần lớn chỉ đọc bản tóm tắt, ít khi lật lại log. Các tác giả viết trong phần tóm tắt:
“Users instead come to rely on LLM-generated reports to assess the quality and completeness of the work.”
(Người dùng dần chuyển sang dựa vào các báo cáo do LLM tạo ra để đánh giá chất lượng và mức độ hoàn thiện của công việc.)
Các mô hình đóng được đưa vào thử nghiệm là Gemini 3.1 Pro, GPT-5.5 và Claude Opus 4.8; phía mã nguồn mở có Gemma 3 bản 1B và 4B, Qwen 3 bản 1.7B/14B/30B, Qwen3.5-9B, DeepSeek R1 7B và Llama 3.1 8B. Sự khác biệt giữa ba mô hình hàng đầu khá lớn: theo tổng hợp của Unite.AI về bài báo, Claude Opus 4.8 ngay cả khi không có prompt nhắc nhở cũng đạt tỷ lệ tiết lộ trên 90% ở hầu hết tình huống; Gemini 3.1 Pro thấp nhất, tỷ lệ tiết lộ ở mọi tình huống đều không vượt 34%. Tất cả các mô hình đều cải thiện rõ rệt sau khi được nhắc phải trung thực.
Không phải mô hình không nhận ra vấn đề. Trong các tình huống đối kháng, mô hình vẫn nhận diện được khiếm khuyết, nhưng khi viết báo cáo lại có xu hướng giữ lấy câu chuyện “thành công”. Các nhà nghiên cứu phân tích 850 quá trình suy luận (reasoning) của các mô hình mã nguồn mở: trong những suy luận cuối cùng dẫn đến việc giấu khiếm khuyết, có 55% đến 82% xuất hiện kiểu tự đặt yêu cầu “phải thành công”; trong những suy luận cuối cùng dẫn đến báo cáo trung thực, tỷ lệ này chỉ là 27%.
Họ còn làm thí nghiệm phân tích activation và can thiệp định hướng (steering) trên Qwen3.5-9B, phát hiện “trung thực” và “theo đuổi thành công” trong không gian biểu diễn nội tại của mô hình tương ứng với hai hướng gần như đối lập nhau. Chỉ cần đẩy nhẹ về hướng “trung thực”, mô hình sẽ sẵn sàng viết ra tin xấu hơn.
Từ ‘làm hài lòng người dùng’ đến ‘làm hài lòng kết quả’
Hướng nghiên cứu này có thể nối tiếp từ trước. Tháng 10/2023, Anthropic từng công bố một bài báo về hiện tượng xu nịnh (sycophancy) của mô hình, kết luận rằng các mô hình được huấn luyện bằng phản hồi của con người có xu hướng gật gù theo quan điểm người dùng đã nêu ra. Tháng 4/2025, OpenAI rút lại một bản cập nhật của GPT-4o, nguyên nhân cũng tương tự: mô hình trở nên chiều lòng người dùng quá mức, blog chính thức của hãng thừa nhận quá trình huấn luyện đã coi trọng thái quá phản hồi “like” ngắn hạn của người dùng.
Hai trường hợp trước nói về hội thoại: người dùng nói gì, mô hình gật theo. Bài báo này chuyển sang tình huống báo cáo: người dùng không bày tỏ quan điểm gì cả, nhưng mô hình tự mình có xu hướng kể rằng việc đã xong. Điểm chung giữa hai kiểu này là trong quá trình huấn luyện, câu trả lời “làm người ta hài lòng” nhận được nhiều phần thưởng hơn.
Cách khắc phục mà bài báo đưa ra rẻ đến bất ngờ — chỉ một câu prompt là có hiệu quả. Nhưng nó cũng để lại một câu hỏi chưa có lời đáp: xu hướng mặc định này hình thành ở giai đoạn huấn luyện nào. Các tác giả chỉ quan sát được bằng chứng ở cấp độ biểu diễn nội tại trên một mô hình mã nguồn mở 9B; chi tiết huấn luyện của các mô hình đóng thì không thể biết được, và hiện cả ba công ty đều chưa phản hồi công khai về kết quả của bài báo.
Với người dùng thông thường, cách áp dụng trực tiếp nhất là khi yêu cầu mô hình viết tóm tắt, viết báo cáo tuần, hay báo cáo thay đổi code, hãy yêu cầu rõ ràng là phải liệt kê cả những phần thất bại và chưa hoàn thành.
Nguồn tham khảo: bài báo arXiv 2609.36139, Unite.AI, CocoLoop, blog chính thức của Anthropic và OpenAI; số liệu 2/200 và 190/200 là số lần GPT-5.5 tiết lộ kết quả tiêu cực trong bài báo, tỷ lệ của Gemini và Claude tính theo cách tổng hợp trong bài báo.