6 Punkte von chessire 1 일 전 | Noch keine Kommentare. | Auf WhatsApp teilen

GPT-4.5, kommerzielle Lebensdauer 4,5 Monate

  • GPT-4.5, das bei seiner Veröffentlichung im Februar 2025 das teuerste Spitzenmodell war (Input 75 $/Output 150 $ pro 1 Mio. Tokens), wurde noch vor Ablauf von 5 Monaten aus der API entfernt. Es ist das kurzlebigste Modell in der Geschichte von OpenAI, und Entwickler, die darauf Produkte aufgebaut haben, stecken in einem ständigen Migrationszyklus fest
  • Die Lehre, die der Markt daraus zog, lautete: „Baue kein Business auf dem Modell eines anderen auf.“ Das Thema dieses Beitrags ist jedoch, dass diese Lehre nur zur Hälfte stimmt

Die Modellebene wird zur Commodity

  • Nach SWE-bench Verified liegen die Top-5-Modelle innerhalb von 0,4 Punkten beieinander, während sich die Preise um das Fünffache unterscheiden. Über den gesamten Markt hinweg beträgt der Abstand zwischen den billigsten Tokens und Premium-Reasoning-Tokens mehr als das 600-Fache – der Preis ist kein verlässlicher Stellvertreter für Leistung mehr
  • Der Abstand zwischen Open-Weight-Modellen und geschlossenen Frontier-Modellen liegt laut öffentlichen Benchmarks im Schnitt bei 4 Monaten (bei privaten Benchmarks bei 8–10 Monaten) und bleibt seit über 18 Monaten stabil. Der Abstand ist real, aber klein, vorhersagbar und wächst nicht

Vier Risiken der Abhängigkeit von Frontier-APIs

  • Preisschwankungen: Claude 3.5 Haiku wurde nach einer Vervierfachung des Preises bereits einen Monat später teilweise zurückgenommen, o3 wurde über Nacht um 80 % billiger. Ein neuer Tokenizer kann beim gleichen Text zudem bis zu 35 % mehr Tokens erzeugen – das Problem ist nicht die Richtung der Erhöhung oder Senkung, sondern die Varianz
  • Abschaltungszyklen: Im Februar 2026 werden GPT-4o, 4.1 und o4-mini mit nur etwa 3 Monaten Vorankündigung gesammelt eingestellt. Es gibt bereits den Begriff „prompt drift“ dafür, dass Prompts, die über ein Jahr hinweg verfeinert wurden, auf neuen Modellen anders funktionieren
  • Plattform-Absorption: die Verwundbarkeit von GPT-Wrappern, wenn Anbieter Funktionen, die Wrapper zuvor geliefert haben, in ihr eigenes Produkt integrieren
  • Regulierung: Im Juni 2026 wurde Anthropic Fable 5 aufgrund von US-Exportkontrollrichtlinien weltweit für 19 Tage vollständig gestoppt – eine Variable, die nicht einmal der Anbieter selbst kontrollieren kann

Die vier Risiken gehen auf ein einziges Problem zurück – die Abhängigkeit von fremdgehosteten Frontier-Modellen

  • Der Eigenbetrieb von Open Source eliminiert Preisschwankungen, Abschaltungen und regulatorische Sperren und mildert Plattform-Absorption ab. Bereits erhaltene Weights werden weder eingestellt noch zurückgeholt
  • Zu den Kosten ehrlich gesagt: Beim Eigenbetrieb auf Consumer-GPUs liegen die Kosten bei etwa 1 $ pro Million Tokens (3 Jahre Abschreibung + Stromkosten, 30 % Auslastung) und sind damit teurer als die günstigste Open-Weight-API (0,14 $/0,28 $) – bei den absoluten Kosten verliert man also
  • Die Wirtschaftlichkeit des Eigenbetriebs liegt nicht im Durchschnitt, sondern in der Varianz. Hinzu kommt: Die billigste API speichert Eingabedaten für Trainingszwecke – der versteckte Preis des Niedrigpreises sind Ihre Daten

Gleiche Diagnose, gegenteilige Therapie

  • Die Diagnose, dass ein Content-Business, das sich im Maßstab von Big Tech auf Frontier-APIs stützt, verwundbar ist, stimmt
  • Wenn kleinere Akteure jedoch im good-enough-Bereich Open Source selbst betreiben, kappen sie gerade die Abhängigkeit, die diese Verwundbarkeit erzeugt – wer die Diagnose von Big Tech unverändert auf kleine Startups kopiert, liegt falsch

Nicht gratis (vier Bremsen)

  • Commodity-Input erzeugt Commodity-Output – ein Burggraben entsteht nur durch Distribution, die orthogonal zu AI ist, exklusive Daten, Domain-Integration sowie Verifikation und Urteilsvermögen
  • Die good-enough-Grenze verschiebt sich nach oben – wer dort einfach nur parkt, parkt in einer Zone sinkender Margen
  • Die Grenze verläuft nicht nach Domäne, sondern nach Aufgabenschwierigkeit: In NIST-Evaluierungen waren die besten Open-Weight-Modelle in Mathematik praktisch gleichauf mit Frontier-Modellen, lagen aber bei Cyber, abstraktem Schlussfolgern und langfristigem agentischem Coding um mehr als 30 Punkte zurück
  • Eigenbetrieb verlangt direkt operative, Tuning- und Validierungsfähigkeiten sowie Compliance-Verantwortung – die Abhängigkeit verschwindet nicht, sondern verlagert sich vom API-Anbieter auf die eigenen Fähigkeiten

Fazit: Entscheidend sind Verifikation und Urteilskraft

  • Selbst wenn man dasselbe Open Model verwendet: Wer den Output unverändert ausliefert, hat eine Demo; wer Fakten, Zahlen und Identifikation hinter eine Verifikationsschicht stellt, hat ein Produkt
  • Der entscheidende Faktor bei AI Content ist die ingenieurmäßige Urteilskraft, günstige Modelle in verlässliche Produkte zu verwandeln, und Open Source wird für diejenigen mit dieser Urteilskraft zur Waffe

Dies ist ein direkt von mir verfasster Beitrag. Austausch über Stack-Design zwischen lokalem Betrieb und API ist willkommen.

Noch keine Kommentare.

Noch keine Kommentare.