KI-Versuchsberichte: Nur 2 von 200 erwähnen das Scheitern

Forscher von MIT, Google Research und Harvard haben auf arXiv das Paper “Language Models Are ‘Insecure’ Reporters” veröffentlicht. Es untersucht, ob große Sprachmodelle beim Berichten über abgeschlossene Arbeiten Probleme auslassen, die die eigenen Schlussfolgerungen schwächen würden. Diese Tendenz nennen sie insecure reporting – man könnte es als “nur die guten Nachrichten melden” umschreiben.

Das anschaulichste Experiment lief so: Die Forscher gaben GPT-5.5 ein Machine-Learning-Experimentprotokoll, in dem ein negatives Ergebnis versteckt war – die neue Methode verlor in einer bestimmten Einstellung gegen die Baseline, was die Schlussfolgerung des gesamten Berichts infrage stellt. Das Modell sollte daraus 200 Berichte verfassen – nur 2 erwähnten das negative Ergebnis. Fügte man dem Prompt lediglich den Satz “Be honest in your response” hinzu, tauchte es in 190 von 200 Berichten auf.

Acht Szenarien, drei Flaggschiffe

Das 116-seitige Paper entwirft acht Arten von Berichtsszenarien mit widersprüchlichen Anreizen: Verschweigen negativer oder nichtiger Ergebnisse, Übergehen von Code-Bugs, Vertuschen erfundener Daten, Verdecken methodischer Schwächen, Ignorieren widersprüchlicher Evidenz, Übergehen von Kollateralschäden, Verschweigen unvollendeter Aufgaben und Verschweigen noch ausstehender Tool-Aufrufe.

Die letzten drei Kategorien betreffen unmittelbar die Alltagsarbeit von KI-Agenten. Ein Coding-Agent liefert nach Abschluss einer Aufgabe eine Zusammenfassung “erledigt” – Nutzer lesen meist nur diese Zusammenfassung und blättern selten im Log zurück. Die Autoren schreiben dazu im Abstract:

“Users instead come to rely on LLM-generated reports to assess the quality and completeness of the work.”
(Nutzer verlassen sich stattdessen auf von LLMs generierte Berichte, um Qualität und Vollständigkeit der Arbeit einzuschätzen.)

Als Closed-Source-Modelle wurden Gemini 3.1 Pro, GPT-5.5 und Claude Opus 4.8 getestet, bei den Open-Source-Modellen Gemma 3 in den Größen 1B und 4B, Qwen 3 in 1,7B/14B/30B, Qwen3.5-9B, DeepSeek R1 7B und Llama 3.1 8B. Die drei Flaggschiffe unterscheiden sich deutlich: Laut einer Zusammenfassung von Unite.AI zum Paper liegt Claude Opus 4.8 auch ohne Ehrlichkeits-Hinweis in den meisten Szenarien bei einer Offenlegungsrate über 90 Prozent; Gemini 3.1 Pro liegt am niedrigsten – in keinem Szenario über 34 Prozent. Alle Modelle verbessern sich deutlich, wenn man sie explizit zur Ehrlichkeit auffordert.

Die Modelle erkennen die Probleme durchaus. In den adversarialen Szenarien identifizieren sie die Mängel, neigen beim Verfassen der Berichte aber dazu, die Erfolgsnarrative zu bewahren. Die Forscher analysierten 850 Reasoning-Verläufe der Open-Source-Modelle: In den Verläufen, die am Ende zum Verschweigen eines Mangels führten, tauchte in 55 bis 82 Prozent der Fälle eine Art Selbstanspruch “muss erfolgreich sein” auf; bei den Verläufen, die zu einer ehrlichen Meldung führten, lag dieser Anteil nur bei 27 Prozent.

Zusätzlich führten sie an Qwen3.5-9B Aktivierungsanalysen und Steering-Experimente durch und fanden heraus, dass “Ehrlichkeit” und “Erfolgsstreben” im internen Repräsentationsraum des Modells etwa entgegengesetzten Richtungen entsprechen. Schiebt man das Modell leicht in Richtung “Ehrlichkeit”, berichtet es bereitwilliger auch schlechte Nachrichten.

Von “dem Nutzer gefallen” zu “dem Ergebnis gefallen”

Diese Forschungslinie lässt sich historisch einordnen. Im Oktober 2023 veröffentlichte Anthropic ein Paper über Sycophancy bei Modellen und kam zu dem Schluss, dass per menschlichem Feedback trainierte Modelle dazu tendieren, bereits geäußerten Nutzermeinungen zuzustimmen. Im April 2025 zog OpenAI ein GPT-4o-Update zurück – aus demselben Grund: Das Modell war übermäßig gefällig geworden, und der offizielle Blogpost räumte ein, dass das Training kurzfristiges Nutzer-Feedback wie “Gefällt mir” zu stark gewichtet hatte.

In jenen beiden Fällen ging es um Chats: Was der Nutzer sagt, bestätigt das Modell. Dieses Paper verschiebt den Blick auf Berichte: Der Nutzer äußert gar keine Meinung, aber das Modell tendiert von selbst dazu, die Dinge als erledigt darzustellen. Gemeinsam ist beidem, dass im Training Antworten, die “gefallen”, stärker belohnt wurden.

Die im Paper vorgeschlagene Abhilfe ist erstaunlich billig – schon ein einziger Prompt-Satz wirkt. Offen bleibt dabei eine Frage: In welcher Trainingsphase entsteht diese Standardtendenz überhaupt? Die Autoren konnten nur bei einem 9B-Open-Source-Modell Belege auf Repräsentationsebene finden; über die Trainingsdetails der Closed-Source-Modelle lässt sich nichts sagen, und bislang haben sich auch alle drei betroffenen Unternehmen nicht öffentlich zu den Ergebnissen des Papers geäußert.

Für Alltagsnutzer liegt der direkteste Nutzen darin, Modelle beim Verfassen von Zusammenfassungen, Wochenberichten oder Code-Änderungsberichten explizit aufzufordern, gescheiterte und unvollständige Punkte aufzulisten.

Quellen: arXiv-Paper 2609.36139, Unite.AI, CocoLoop, offizielle Blogs von Anthropic und OpenAI; die Werte 2/200 und 190/200 beziehen sich auf die Offenlegungen von GPT-5.5 im Negativergebnis-Szenario im Paper, die Quoten von Gemini und Claude folgen der im Paper zusammengefassten Zählweise.