- Bei zehn offenen Problemen, bei denen es seit mindestens zehn Jahren keinen wesentlichen Fortschritt gab, hat OpenAIs nächstes großes Modell, eine interne Version von Astra, neue Ergebnisse erzeugt; die Themen reichen von hochdimensionaler Geometrie über Quantenkomplexität bis hin zu Gitterkryptografie
- Für die Suche nach Lösungen wurden nach Sol-API-Preisen Tokens im Wert von etwa 2.000 US-Dollar verwendet; anschließend bereiteten Menschen mit demselben Modell die Arbeiten vor, und das Modell formalisierte jedes Argument als Lean-Zertifikat
- Zu den wichtigsten Ergebnissen zählen ein Existenzbeweis nicht-sofischer Gruppen, eine Widerlegung der Connes-Rigiditätsvermutung, eine Untergrenze von
n⁴/log nfür arithmetische Formeln zur Berechnung der Permanent sowie ein exponentieller Parallel-Repetition-Satz für allgemeine Zwei-Personen-Quantenspiele - Die Schranken für Kugelpackungen sowie binäre und sphärische Codes wurden verbessert, die Härte polynomialer Approximationsfaktoren für das Closest-Vector-Problem und die Ehrhart-Volumenvermutung wurden gelöst, und auch die Erdős-Probleme 146, 180 und 183 wurden beantwortet
- OpenAI erklärt, dass Menschen zwar für die Vorbereitung der Arbeiten, die Lean-Formalisierung und die Korrektheit verantwortlich seien, die mathematischen Argumente aber von KI erzeugt wurden; daher sollten sie nicht als menschliche Autorschaft ausgewiesen, sondern der Beitrag der KI ehrlich zugeschrieben werden
Zehn von Astra erzeugte Ergebnisse
- Um Entdeckungen von Wissenschaftlern und Mathematikern zu beschleunigen, stellt OpenAI über ChatGPT for Academic Researchers 100.000 Personen sein bestes ChatGPT-Modell kostenlos zur Verfügung und evaluiert Modelle auch während der Entwicklung fortlaufend an offenen Forschungsproblemen
- Im Mai veröffentlichte OpenAI eine von KI erzeugte Widerlegung der Erdős-Vermutung zu Einheitsabständen, die bei der Evaluierung eines unveröffentlichten Modells entdeckt wurde; daraus ergaben sich anschließend weitere Arbeiten in Mathematik und theoretischer Informatik
- Die ausgewählten Probleme hatten seit mindestens zehn Jahren, meist deutlich länger, keinen wesentlichen Fortschritt in ihren Kernergebnissen gesehen und standen in den jeweiligen mathematischen Communities im Fokus erheblichen Interesses
- Eine interne Version von Astra fand die Lösungen; die gesamten Suchkosten lagen nach Sol-API-Preisen bei etwa 2.000 US-Dollar
- Menschen bereiteten die Argumente mithilfe desselben Modells als Paper auf
- Das Modell formalisierte jedes Argument als Lean-Zertifikat
- Ebenfalls veröffentlicht wurde eine Erläuterung der Schlussfolgerungsprozesse des Modells zu jeder Lösung
- Die zehn Ergebnisse sind:
- Hochdimensionale Kugelpackungen: Neue obere Schranken für die Dichte von Kugelpackungen, abgesenkt bis zum Cohn–Elkies-Kritikalpunkt
- Binäre und sphärische Codes: Exponentielle Verbesserung der Schranken für die maximale Größe binärer Codes bei vorgegebenem Mindestabstand sowie ähnliche Ergebnisse für hochdimensionale sphärische Codes
- Nicht-sofische Gruppen: Eine Konstruktion, die die Existenz nicht-sofischer Gruppen etabliert und damit ein zentrales offenes Problem der Gruppentheorie löst
- Connes-Rigiditätsvermutung: Widerlegung einer langjährigen Vermutung, dass bestimmte Gruppen durch von-Neumann-Algebren eindeutig bestimmt werden
- Arithmetische Schaltkreiskomplexität: Neue Untergrenzen für die Berechnung der Permanent mit arithmetischen Schaltkreisen und Formeln; die Untergrenze für arithmetische Formeln liegt in der Größenordnung
n⁴/log n - Quanten-Parallel-Repetition: Beweis eines exponentiellen Parallel-Repetition-Satzes für allgemeine Zwei-Personen-Quantenspiele, der ein Grundprinzip der klassischen Komplexitätstheorie erweitert
- Closest-Vector-Problem: Nachweis der Härte polynomialer Approximationsfaktoren bei einem zentralen Gitterproblem mit Bezug zu Post-Quanten-Kryptografie
- Ehrhart-Volumenvermutung: Bestimmung des maximal möglichen Volumens konvexer Körper in allen Dimensionen, deren einziger innerer Gitterpunkt der Schwerpunkt ist
- Mehrfarbige Ramsey-Zahlen: Superexponentielle Untergrenze für mehrfarbige Dreiecks-Ramsey-Zahlen, wodurch Erdős-Problem 183 gelöst wird
- Vermutungen in der extremalen Graphentheorie: Ergebnisse zu Kompaktheits- und Degenerationsvermutungen lösen Erdős-Probleme 146 und 180
- Zu den Arbeiten, die nach der früheren Widerlegung der Einheitsabstandsvermutung entstanden, gehören Gegenbeispiele zur Summe-Produkt-Vermutung über den reellen Zahlen, Zerlegende Primzahlen und das Elekes–Rónyai-Problem, Quadratische Zeitnotwendigkeit für Paare mit größtem Abstand in superkonstanten Dimensionen unter SETH, Kommunikationskomplexität von Punkt-Geraden-Inzidenzen über den reellen Zahlen und Wiederholte Distanzen in Minkowski-Gittern
Zuschreibung der Forschung und Rolle der mathematischen Community
- Das Aufkommen von KI-Systemen, die zur mathematischen Forschung beitragen können, wirft Fragen auf, die ein einzelnes Technologieunternehmen kaum allein beantworten kann; OpenAI respektiert Positionen, die sich um die Auswirkungen von KI sorgen, darunter die Unterzeichner der Leiden Declaration on AI and Mathematics
- Die Art und Weise, wie Ergebnisse entstanden sind, sollte bei Autorenschaft und Beitragszuschreibung ehrlich abgebildet werden
- Wenn vollständig von KI erzeugte Beweise als menschliche Arbeit ausgewiesen werden, verzerrt das sowohl den Beitrag des Systems als auch die tatsächliche intellektuelle Arbeit der Menschen
- Menschen unterstützen die Vorbereitung der Paper und die Lean-Formalisierung und tragen Verantwortung für die Korrektheit, doch die mathematischen Argumente selbst wurden vom KI-System erzeugt
- OpenAI erwartet, dass die mathematische Community die Ergebnisse prüft und einordnet und die Ideen anschließend zu neuer Forschung und neuen Entdeckungen weiterentwickelt
- Während KI sich zu einem immer ausgefeilteren Forschungspartner entwickelt, ist breiter Zugang entscheidend, damit Wissenschaftler und Mathematiker die Zukunft ihrer jeweiligen Fachgebiete erkunden und definieren können
1 Kommentare
Hacker-News-Kommentare
Die größte Beschwerde ist der Mangel an Transparenz beim gesamten Experiment und Aufbau. Es ist schwer zu glauben, dass man das Modell diese 10 Aufgaben jeweils nur einmal hat lösen lassen; die genannten 2.000 Dollar ohne Offenlegung des gesamten Versuchsdesigns können daher leicht als P-Hacking missverstanden werden.
Ich würde gern wissen, wie viele Aufgaben dem Modell insgesamt gegeben wurden, welcher Anteil vor dem Aufgeben ungelöst blieb und welche Kosten dabei anfielen, wie viele Versuche es pro Aufgabe gab und welche Kosten die Ausführungsumgebung einschließlich Zugriff auf Arbeitscluster verursachte.
Man müsste auch prüfen, ob OpenAI fähige Kombinatorik-Forscher eingestellt hat, die die Aufgaben gelöst haben, während das Modell nur nebenbei eingesetzt wurde.
Noch erstaunlicher ist, dass dieser Beitrag nicht einmal ganz oben auf der HN-Startseite stand. Selbst wenn es nur ein Fortschritt gegenüber früheren Ergebnissen ist, zeigt das, dass uns die Vorstellung, AI könne in Mathematik und Informatik bedeutende Fortschritte erzielen, inzwischen kaum noch überrascht.
Der Einfluss von AI lässt sich inzwischen kaum noch bestreiten, und es bleibt fast kein Platz mehr, die Torpfosten weiter zu verschieben. Als Nächstes müsste man sie wohl aus dem Stadion tragen.
Je schneller die Leute aus der Verleugnung herauskommen und anfangen, das ernsthaft zu behandeln, desto besser.
Ich bin kein Experte auf dem Gebiet, auf dem OpenAI Fortschritte erzielt haben will, und möchte die Ergebnisse daher nicht vorschnell abwerten, aber ich sorge mich, dass die Formulierungen im Blog zu Marketingzwecken übertrieben sein könnten.
Es stimmt zwar, dass es zuvor keinen rechnerischen Ansatz gab, der diese Probleme zuverlässig löste; entscheidend ist aber, ob dieser Beweis der Mathematik neue Ideen hinzugefügt hat oder ob er lediglich in großem Maßstab nach einer passenden Kombination von Werkzeugen aus der bestehenden Literatur gesucht hat.
Ich möchte wissen, ob es sich um Probleme handelte, deren Antwort von Anfang an intuitiv und deren Beweis machbar wirkte, die aber für Experten nicht wertvoll genug waren, um Zeit darauf zu verwenden, oder ob sie im Kern schwierig waren und die AI mehr geleistet hat, als nur eine riesige Lösungsschablone zu füllen.
Anders gesagt lässt sich Innovation recht konkret daran messen, in welchem Maß sie zuvor nicht verbundene Gedanken und Felder verknüpft. Puja Ohlhaver hat dazu vorgetragen, und ich habe ein Experiment unterstützt: https://www.youtube.com/watch?v=guLDNMAOn24
advancedSorgen vor Marketingübertreibung auslöst. Forschende auf PhD-Niveau haben einen erheblichen Teil ihrer Laufbahn diesen Problemen gewidmet, daher ist die Formulierung angemessen.Eine der frühen Prognosen einer AI-Beschleunigung war, dass Systeme, die ungelöste Probleme der höheren Mathematik lösen, durch neue Entdeckungen in Mathematik und Informatik auch die Softwareleistung sprunghaft erhöhen würden.
Die heutigen Ergebnisse liegen auf dem Niveau der mathematischen Forschungsfront, das bei Menschen etwa den besten 100 bis 1.000 weltweit, also ungefähr den obersten 0,00001 %, entspräche; zugleich sieht man auch in Software große Fortschritte, etwa als OpenAI ein GPU-Kernel-Problem behob und die Leistung um rund 15 % verbesserte. Dass große Modelle gleichzeitig mathematische und softwaretechnische Fähigkeiten erwerben, die in kleinerem Maßstab unmöglich sind, verbindet beides über Scaling Laws und die Generalisierung von Intelligenz.
Allerdings halte ich es inzwischen für weniger wahrscheinlich als früher, dass mathematische und wissenschaftliche Entdeckungen direkt Softwareleistungssteigerungen erschließen. Tech-Unternehmen setzen Mathematik-Promovierte eher in Software Engineering als in reiner Mathematik ein, und der Grund, warum sie so gut sind, liegt oft eher in allgemeiner Intelligenz als in neuesten akademischen Entdeckungen.
Daher ist es zwar ein Beleg dafür, dass Modelle besser werden, aber schwerlich ein Zeichen, dass wir unmittelbar vor einer durch Spitzenmathematik ausgelösten explosiven Beschleunigung (foom) stehen.
Die Fähigkeiten einer nicht einmal namentlich genannten internen AI sind beeindruckend, aber Namen menschlicher Beitragender tauchen nirgends auf. Irgendjemand muss diesem Modell doch zumindest Kaffee gekocht haben.
Ich frage mich, wie hoch die Gesamtkosten dieser Forschung waren, wenn man auch die Gehälter von Mathematikern und Ingenieuren einrechnet.
https://x.com/polynoamial/status/2083470822258467194
Ich frage mich, was passiert, wenn Unternehmen wie OpenAI anfangen, solche Ergebnisse nicht zu veröffentlichen, sondern sie einfach in die Trainingsdaten aufzunehmen.
Selbst wenn gemeint ist, sie intern zur Modellverbesserung zu nutzen, wäre der Zusatznutzen einiger korrekter Beweise gering, und wahrscheinlich würden sie letztlich aus dem Modell extrahiert und nach außen bekannt.
Orte wie OpenAI könnten Experten faktisch Tokens im Wert von Millionen Dollar verbrauchen lassen. Da sie nicht die gesamte Rechenleistung rund um die Uhr verkaufen, liegen die internen Kosten meist eher in der Größenordnung der Stromkosten.
Wenn die Rechenressourcen dennoch nicht vollständig ausgelastet sind, fragt man sich, ob die vielen künftig geplanten Rechenzentren wirklich nötig sind.