- Wie Token, die die AI-Nutzung anzeigen, werden Tasks – Arbeitseinheiten von Daten, die die Fähigkeiten von Modellen verbessern – voraussichtlich einen riesigen Markt bilden, an dem sich AI-Investitionen messen lassen
- Da Internet-Trainingsdaten und einfache, allgemeine Fähigkeiten an Sättigung stoßen, werden hochwertige Daten, die das implizite Wissen von Expert:innen in realen Umgebungen vermitteln, zum Engpass für den Modellfortschritt
- Tasks liefern einen Anfangszustand und eine Arbeitsumgebung und bewerten Ergebnisse mit Belohnungssignalen oder Verifikatoren, sodass Modelle Arbeitsabläufe von Expert:innen lernen, die sich allein mit dem offenen Internet nur schwer reproduzieren lassen
- Die Datenausgaben von OpenAI und Anthropic steigen jährlich um das 10-Fache, und Mercor erreichte nach 1 Mrd. US-Dollar ARR im Februar innerhalb von 4 Monaten 2 Mrd. US-Dollar
- Da Recht, Medizin, Finanzen, Software und Wissenschaft jeweils eigene Datensätze, Evaluierungssysteme und Reinforcement-Learning-Umgebungen benötigen, dürfte sich der Wettbewerb um Dateninfrastruktur zwischen AI-Laboren, Anwendungsunternehmen und allgemeinen Unternehmen ausweiten
Die Token-Ökonomie als Maßstab für AI-Wachstum
- Inference-Token haben sich als zentrale Kennzahl etabliert, um das Wachstum des AI-Ökosystems zu verfolgen
- Börsennotierte Unternehmen veröffentlichen monatlich verarbeitete Token, um ihre AI-Dynamik zu zeigen
- Analyst:innen vergleichen die Token-Nutzung nach Modell, etwa über OpenRouter-Rankings
- Führungskräfte messen mit der Token-Nutzung im Zeitverlauf den Stand von AI-Investitionen und Einführung
- Token abstrahieren komplexe Schlussfolgerungsprozesse zu einer einzigen Maßeinheit und fungieren so als gemeinsame Sprache, mit der sich die AI-Skalierung auch ohne technischen Hintergrund verstehen lässt
- Mehr AI-Nutzer:innen, der Wechsel von Nicht-Inference-Modellen zu Inference-Modellen und der Übergang von Abfragen zu Agenten führen alle zu mehr Token
- Auch Hintergrundagenten und Agenten für langfristige Aufgaben erhöhen den Token-Verbrauch
- Da sich breitere Einführung und höhere Token-Intensität pro Modell überlagern, steigt die Gesamtnutzung schnell, und Investitionen sowie neue Unternehmen strömen in den Inference-Markt
- Die hohe Sichtbarkeit des Inference-Markts kann jedoch auch andere Entwicklungen verdecken, die ähnlich groß werden könnten, aber schwerer zu verstehen sind
Das Entstehen der Task-Economy
- In den vergangenen 3 Jahren haben sich LLMs von grundlegenden Frage-Antwort-Systemen über komplexes Schlussfolgern hin zu Agenten entwickelt, die über längere Zeit echte Arbeit ausführen
- Frühe Modellverbesserungen stützten sich auf Internetdaten und mehr Rechenressourcen, doch durch die folgenden zwei Veränderungen werden zusätzliche hochwertige Daten zum Engpass
- Neue Daten, die sich aus dem Internet lernen lassen, sind weitgehend ausgeschöpft
- Einfache und allgemeine Fähigkeiten nähern sich zunehmend der Sättigung
- Die Task-Economy bezeichnet den Markt, der die für weitere Modellverbesserungen nötigen Daten erzeugt und bereitstellt
Tasks als Einheit der Modellverbesserung
- Im Reinforcement Learning ist ein Task die Einheit, an der ein Modell übt
- Er liefert dem Modell einen Anfangszustand und eine Umgebung zum Handeln
- Er bewertet das Verhalten des Modells mit Belohnungssignalen oder Verifikatoren
- Er bündelt die Bewertungen vieler Tasks zu einem Lernsignal und justiert das Modell in Richtung der Verhaltensweisen mit hoher Punktzahl
- Streng genommen ist damit die Grundlage für das nachgelagerte Training per Reinforcement Learning gemeint, hier wird der Begriff jedoch als umfassende Einheit für jede datenbasierte Modellverbesserung verwendet
- Da die Branche fortlaufend neue Datenformate für Modellverbesserungen schafft, erweitert sich auch der Umfang von Tasks
- Klassisches Data Labeling erinnert an Bounding Boxes oder Daumen-hoch-/Daumen-runter-Bewertungen von LLM-Antworten, doch der heutige Markt entwickelt sich zu komplexeren und wertvolleren Arbeiten weiter
Wie das bei juristischer Arbeit funktioniert
- Mit dem offenen Internet trainierte AI kann die Grundlagen des Rechts und veröffentlichte Präzedenzfälle verstehen, aber die Daten, die nötig sind, um die tatsächliche Arbeit kompetenter Anwält:innen zu reproduzieren, sind im Internet nicht ausreichend vorhanden
- Um hochwertige juristische Arbeit zu trainieren, müssen die folgenden Elemente kombiniert werden
- Prompts wie Vertragsprüfung oder das Ausarbeiten von Argumentationen
- reale relevante Umgebungen wie juristische Datenräume
- Ergebnisvalidierung nach Maßstäben wie dem Leaderboard für Corporate-Lawyer-Agenten
- Solche Tasks lehren das Modell nicht nur, was es tun soll, sondern auch, wie es die Aufgabe ausführen soll; je mehr hochwertige Tasks vorhanden sind, desto besser werden die Modellfähigkeiten
Gemeinsame Wachstumsstruktur von Token und Tasks
- Wenn Token die Grundeinheit für Inference und Modellnutzung sind, können Tasks als Grundeinheit der Modellverbesserung verstanden werden
- Mit wachsender AI-Einführung und steigenden Datenanforderungen führender Modelle nimmt die Nachfrage nach Tasks zu
- der Wechsel von einfachen Präferenzlabels zu Arbeiten auf Basis von Bewertungsrastern erfahrener Fachleute
- das Auftreten domänenspezifischer Agenten auf Expertenniveau
- Agenten übernehmen Aufgaben über längere Zeithorizonte
- Unternehmen führen Evaluierungssysteme in großem Maßstab ein
- Diese Faktoren überlagern sich ähnlich wie im Markt für Inference-Token und treiben das schnelle Wachstum der Task-Economy an
Datenausgaben und Signale für Marktwachstum
- OpenAI und Anthropic verzehnfachen ihre Datenausgaben pro Jahr, indem sie Expert:innen mobilisieren, um Daten und Trainingsmaterial für Agenten zu erstellen
- Einige führende AI-Anwendungsunternehmen und allgemeine Unternehmen erhöhen Ausgaben für einzelne Task-bezogene Vorhaben innerhalb kurzer Zeit auf mehr als 100 Mio. US-Dollar
- dahinter steht die Einschätzung, dass Applied AI mit einer differenzierten Datenstrategie bessere Ergebnisse liefern kann als allgemeine Standardmodelle
- Die Task-Economy-Plattform Mercor erreichte im Februar 1 Mrd. US-Dollar ARR und kam 4 Monate später auf 2 Mrd. US-Dollar ARR
- Agenten, die Arbeit in anspruchsvollen Fachgebieten reproduzieren, befinden sich noch in einer frühen Phase, und die Ausweitung der Datenausgaben in Unternehmen hat gerade erst begonnen
- Unter der Annahme, dass 99 % des menschlichen Wissens in den Köpfen der Menschen steckt, dürfte sich der Kreis von Teilnehmenden und Käufern ausweiten, wenn AI-Labore, Anwendungsunternehmen und allgemeine Unternehmen implizites Wissen in Modelle und Agenten überführen
Warum der Task-Markt schwer sichtbar ist
- Ein erster Grund, warum online weniger über Tasks als über Token gesprochen wird, ist, dass sich die Ausgaben bislang auf äußerst verschlossene führende AI-Labore konzentriert haben
- Labore legen ihre Strategien zur Modellverbesserung sowie ihre Ausgaben für Daten und Tasks kaum offen
- Die Lage verändert sich, weil AI-Anwendungsunternehmen und allgemeine Unternehmen an der Task-Economy teilnehmen, um sich von Standardmodellen abzuheben
- Diese Akteure werden ihre eigenen Datenaktivitäten eher vermarkten und damit die Sichtbarkeit des Task-Markts erhöhen
- Ein zweiter Grund ist, dass es bislang keine gemeinsame Einheit gab, die den Wert so einfach abstrahiert wie Token im Inference-Markt
- Wenn Tasks als standardisierte Werteinheit genutzt werden, können auch Menschen ohne technisches Wissen einschätzen, wie stark die Branche in die Verbesserung von AI-Fähigkeiten investiert
- Derzeit gibt es noch keinen Dienst wie ein „OpenRouter für Tasks“, der Größe und Wachstum des Task-Markts in Echtzeit zeigt
- Quartalsdaten von Mercor zu von Expert:innen geleisteten Arbeitsstunden dienen als indirekter Indikator für das Marktwachstum
Aufbau von Daten für die gesamte Wirtschaftstätigkeit
- Um jede Arbeit, die auf einem Laptop ausgeführt wird, mit Agenten zu automatisieren, müssen Anwendungen, Umgebungen und Task-Verteilungen der gesamten Wirtschaft abgedeckt werden
- Dafür ist ein groß angelegter Datenaufbau über Fachberufe, wissenschaftliche Disziplinen und Consumer-Anwendungsfälle hinweg nötig
- Recht, Medizin, Finanzen, Software und Wissenschaft benötigen jeweils von Expert:innen erstellte Datensätze
- Auch domänenspezifische Evaluierungssysteme und Reinforcement-Learning-Umgebungen müssen separat aufgebaut werden
- AI-Labore, Anwendungsunternehmen und allgemeine Unternehmen werden konkurrieren, indem sie ihre Dateninfrastruktur über wirtschaftlich nützliche Arbeit aller Art ausbauen
- Organisationen, die beim Aufbau von Dateninfrastruktur erfolgreich sind, können führende Fähigkeiten kontinuierlich verbessern und Marktanteile gewinnen
- Wenn sich die Task-Economy verbreitet und sichtbarer wird, dürfte die AI-Branche neben Token auch den Task-Umfang als wichtigen Wachstumsindikator verfolgen
Verbesserungen von Algorithmen und Umfang der Diskussion
- Allgemeine AI-Fähigkeiten können sich nicht nur durch Daten, sondern auch durch Verbesserungen von Algorithmen erhöhen
- Dass algorithmische Verbesserungen hier ausgeklammert werden, soll künftige Möglichkeiten nicht bestreiten, sondern den Fokus der Diskussion auf Daten und die Task-Economy legen
Noch keine Kommentare.