Der Mathe-Check-up

OpenAI hat gerade über 700 „Lösungen“ für einige der härtesten Mathe-Probleme weltweit gedroppt, um zu zeigen, dass ihre Modelle krass viel auf dem Kasten haben. Sie haben sogar eine Beratungsgruppe – die Advisory Group on Mathematics and Artificial Intelligence (AGMAI) – hinzugezogen, um alles legit zu halten. Aber mal real talk: Die Mathe-Community feiert den Hype so gar nicht. Es gibt extrem starke „Hausaufgaben abgegeben, ohne den Rechenweg zu zeigen“-Vibes.

Warum die Experten sauer sind

Die AGMAI hat klare Regeln aufgestellt, wie Tech-Labs mit solchen Beweisen umgehen sollten. Sie forderten insbesondere, keine proprietären Modelle mehr zu nutzen und sicherzustellen, dass Menschen die Ergebnisse überhaupt nachvollziehen können. OpenAI hat die erste Vorgabe quasi ignoriert und bei der zweiten das Ziel verfehlt. Nur ein winziger Teil der Veröffentlichungen enthielt den „Chain of Thought“-Prozess, und weniger als die Hälfte der Beweise war formalisiert – was eigentlich der Industrie-Standard ist, um die Korrektheit mathematischer Beweise sicherzustellen.

Der bekannte Mathematiker Terence Tao hat den aktuellen Ansatz in den sozialen Medien kritisiert. Er wies darauf hin, dass KI-User oft nur auf einen „gelöst“-Stempel aus sind, ohne die Ergebnisse wirklich zu verstehen oder sich mit dem Fachgebiet auseinanderzusetzen. Es ist ein riesiges L für die akademische Integrität, wenn man keine Fragen zu dem Beweis beantworten kann, den man gerade „geschrieben“ hat.

Der Übersetzungs-Fail

Ein neues Paper von Forschern aus Cambridge und dem King’s College London deckte ein großes rotes Flag auf: die Kluft zwischen den „natursprachlichen“ Erklärungen der KI und dem formalen Code, der zur Verifizierung genutzt wird. Sie fanden Diskrepanzen in einer Lösung, die OpenAI für ein massives Problem der Navier-Stokes-Gleichungen beansprucht hatte. Im Grunde ist das Modell „lost in translation“, und Experten sagen, dass wir diesen Outputs ohne ernsthafte Peer-Reviews nicht trauen sollten. Es ist wild, dass sie den menschlichen Reality-Check überspringen, der eigentlich das Rückgrat wissenschaftlicher Entdeckungen bilden sollte.

Warum das wichtig ist

Bei Mathe geht es nicht nur darum, ein Ergebnis zu bekommen; es geht um den Wissenszuwachs, der dabei hilft, andere Probleme zu lösen. Wenn eine KI eine Lösung ausspuckt, die kein Mensch versteht, ist die Arbeit nicht erledigt – sie fängt eigentlich erst an. Wie Melanie Wood, Professorin in Harvard, es ausdrückte: Zum Zeitpunkt der Veröffentlichung gibt es kein menschliches Verständnis, was diese großen Behauptungen eher wie Marketing als wie einen wissenschaftlichen Durchbruch wirken lässt.