Die neue Mathematikmeldung zu Claude sollte nicht als Durchbruch gelesen werden, bei dem AI ein Jahrhundertproblem in einem Schritt löst.
Anthropic veröffentlichte am 10. August Material zu einer unveröffentlichten Claude-Version, die einen ernsthaften Versuch an der Riemannschen Vermutung unternehmen sollte. Die Vermutung wurde nicht bewiesen, doch Anthropic meldet Fortschritt bei einem verwandten Resultat: Die bekannte Untergrenze für den Anteil der Riemann-Zeta-Nullstellen, die die Vermutung erfüllen, stieg von 41,6% auf 67,2%.
Grenze zuerst
Die Riemannsche Vermutung bleibt offen. Claudes Ergebnis betrifft die engere Frage, welcher Mindestanteil von Nullstellen auf der kritischen Linie bewiesen werden kann.
Die Belege bestehen aus Forschungsseite, technischer Arbeit, Expert Note und Lean-Formalisierung mit bestandenem Standardprüfer. Anthropic sagt, zwei eigene Mathematiker hätten die Arbeit validiert, außerdem hätten Brian Conrey und Dan Goldston sie kurzfristig geprüft.
Der Ausgangsprompt lautete:
“Take a real stab at the Riemann hypothesis.”
Claude sollte das Problem ernsthaft angehen.
Woher 67,2% kommt
41,6% ist die frühere Untergrenze, 67,2% die neue Claude-Untergrenze; 1859 und der Preis von einer Million Dollar beschreiben die größere ungelöste Vermutung.
Auch der Prozess zählt. Claude probierte zunächst 650 Ideen ohne Erfolg. Danach koordinierte es etwa 60 Subagenten über anderthalb Tage, führte 2.400 Shell-Befehle aus, schrieb Hunderte Python-Skripte und lud 54 arXiv-Arbeiten herunter. Die Ausgabe umfasste 31 Millionen Token.
Mathematiker bleiben wichtig
Die menschliche Rolle verschwindet nicht. Das Modell erweitert die Suche, Mathematiker prüfen den Anschluss an vorhandene Forschung, Lean macht Teile maschinenprüfbar.
Der nächste Agent-Test
Jetzt zählen unabhängige öffentliche Begutachtung, die Reichweite der Lean-Formalisierung und Reproduzierbarkeit bei anderen Problemen.
Quellen: Anthropic Research, technische Arbeit von Claude, Lean-Formalisierungsrepository, Clay Mathematics Institute, CocoLoop, verwandte arXiv-Arbeiten; geprüft wurden die Untergrenzen 41,6% und 67,2%, 31 million output tokens, 650 ideas, 60 subagents, 2400 shell commands, 54 papers und der Lean-comparator-Status.