Während Rechenzentren Milliarden verschlingen, Energieversorger über Stromengpässe klagen und Spitzenchips zu Höchstpreisen gehandelt werden, spielt sich auf der Anwendungsseite das genaue Gegenteil ab: Die Kosten für künstliche Intelligenz befinden sich im freien Fall. Eine umfassende Untersuchung der renommierten Forschungsorganisation Epoch AI unter dem Titel „The Plunging Price of Thought“ belegt nun erstmals mit harten Zahlen, wie rasant die Grenzkosten für automatisierte Denkprozesse schrumpfen. Seit 2023 verbilligt sich ein gleichbleibendes Niveau an KI-Fähigkeiten um durchschnittlich 47 Prozent pro Quartal - das entspricht einer jährlichen Verbilligung um das 13-Fache.

Damit übertrifft der Preissturz bei KI-Inferenz jede andere Basistechnologie der menschlichen Industriegeschichte bei Weitem. Weder die Elektrifizierung im 20. Jahrhundert noch der Siegeszug der Mikroprozessoren unter Moores Gesetz oder die Entschlüsselung des menschlichen Genoms erreichten je eine vergleichbare Dynamik.

Der historische Vergleich: 54-mal schneller als die Elektrifizierung

Um die Tragweite des aktuellen Trends einzuordnen, haben die Forscher Luke Emberson und David Roodman den Verfall der Inferenzkosten mit den historischen Preisreihen früherer technologischer Umbrüche verglichen. Gemessen in logarithmischen Wachstumsraten fällt der Preis für eine gegebene Denkleistung viermal schneller als die Kosten der DNA-Sequenzierung in ihrer intensivsten Phase zwischen 2001 und 2025. Gegenüber dem klassischen Rechenleistungszuwachs früherer Computergenerationen (1940 bis 2001) sinken die Inferenzkosten sechsmal schneller, gegenüber Lithium-Ionen-Akkus 18-mal schneller und im Vergleich zum historischen Preisverfall bei elektrischem Strom im Jahrhundert vor 1973 sogar 54-mal schneller.

Technologie / Infrastruktur Referenzzeitraum Jährliche Verbilligung Tempo im Vergleich zu KI
KI-Denkleistung („Price of Thought“) 2023 – 2026 ca. 13× pro Jahr (47 % pro Quartal) Referenzwert (1×)
DNA-Sequenzierung 2001 – 2025 ca. 1,84× pro Jahr KI verbilligt sich 4× schneller
Historische Rechenleistung (Moore) 1940 – 2001 ca. 1,51× pro Jahr KI verbilligt sich 6× schneller
Lithium-Ionen-Batterien 1991 – 2024 ca. 1,16× pro Jahr KI verbilligt sich 18× schneller
US-Wohnstrom 1892 – 1973 ca. 1,05× pro Jahr KI verbilligt sich 54× schneller

Die Datengrundlage stützt sich auf fünf standardisierte Leistungsprüfungen, darunter anspruchsvolle Prüfungsfragen auf Promotionsniveau in Physik, Chemie und Biologie (GPQA Diamond), mathematische Wettbewerbsaufgaben (MATH und FrontierMath Tiers 1–3) sowie taktische Strategiespiele (Schach-Puzzles und verdeckte Logiktests). Über alle Disziplinen hinweg zeigt sich ein konsistentes Bild: Bei komplexen mathematischen Beweisen stürzen die Kosten mit 50 bis 52 Prozent pro Quartal besonders steil ab, während spielbasierte Logikaufgaben mit 39 bis 43 Prozent vierteljährlichem Rückgang etwas moderater nachgeben.

Das makroökonomische Paradoxon

Teure Eingangsressourcen: Die physische Basis des KI-Booms wird zusehends knapper und kostspieliger. Für Highend-Beschleuniger, Umspannwerke, Kühlsysteme und spezialisierte Elektroingenieure zahlen Hyperscaler Rekordaufschläge.

Kollabierende Ausgabepreise: Am Ende der Verwertungskette steht jedoch ein Endprodukt - strukturierte Information und Inferenz -, dessen Grenzkosten sich in atemberaubendem Tempo gegen Null bewegen.

Vom 30-Cent-Denkvorgang zum Bruchteil eines Cents

Wie drastisch sich diese Entwicklung in der Praxis auswirkt, verdeutlicht die Studie an einem konkreten Modellvergleich. Als OpenAI Ende Januar 2025 sein Denkmodell o3 veröffentlichte, kostete die Lösung einer Frage aus dem anspruchsvollen GPQA-Diamond-Test bei einer Erfolgsquote von 75 Prozent im Schnitt rund 30 US-Cent an Rechenzeit. Knapp 18 Monate später erzielte das neuere Modell GPT-5.6 Luna dieselbe Trefferquote für lediglich 0,0004 US-Dollar - also für vier Hundertstel eines Cents pro Frage.

Das entspricht einem 725-fachen Preisverfall in weniger als anderthalb Jahren. Um diese Relation greifbar zu machen, ziehen die Autoren einen bildhaften Vergleich zur Automobilbranche: Es sei so, als würde der Listenpreis eines Neuwagens innerhalb von 18 Monaten von 50.000 Dollar auf 69 Dollar zusammenbrechen.

Ein wesentlicher Treiber dieser Entwicklung ist die Dynamik an der technologischen Leistungsspitze (State of the Art). Direkt nach dem Erscheinen eines neuen Leistungsniveaus fallen die Preise am schnellsten: Im ersten Quartal nach dem Debüt schrumpfen die Kosten durchschnittlich um 66 Prozent pro Quartal (entspricht einer 75-fachen Verbilligung pro Jahr). Zu diesem Zeitpunkt können Anbieter zunächst Innovationsprämien verlangen, bevor Konkurrenzdruck und effizientere Modellarchitekturen die Preise drücken. Zwei Jahre nach dem Erreichen einer neuen Bestmarke verlangsamt sich dieser Prozess auf immer noch beachtliche 32 Prozent pro Quartal (Faktor 4,7 pro Jahr).

Architektur-Effizienz und der Preiskampf der Labore

Dass Denkleistung derart rapide günstiger wird, liegt nicht allein an schnellerer Hardware, sondern vor allem an algorithmischen Fortschritten. Wie Epoch AI bereits bei der Analyse weltweiter Rechenkapazitäten herausarbeitete, erzwingen die hohen Betriebskosten eine konsequente Optimierung der Modellarchitekturen. Techniken wie Destillation (das Übertragen von Wissen großer Modelle auf kompakte Netze), spekulatives Decoding, Mixture-of-Experts und Quantisierung senken den Rechenaufwand pro Antwort dramatisch.

Zugleich tobt zwischen den führenden KI-Konzernen ein erbitterter Preiskampf. Erst vor wenigen Monaten brachten chinesische Anbieter die weltweiten Token-Preise ins Rutschen. Diesem Trend folgten die westlichen Branchengrößen unmittelbar: Während Anthropic mit dem Start von Claude Opus 5.5 Flaggschiff-Fähigkeiten bei 40 Prozent geringeren Kosten bereitstellte, reagierte OpenAI postwendend mit radikal verbilligten Token-Preisen für GPT-6 Sol und Luna.

Einschränkungen der Studie: Benchmarks vs. reale Unternehmenspraxis

Trotz der eindrucksvollen Zahlen mahnen die Studienautoren zur sachlichen Differenzierung. Die ermittelte Pareto-Kurve - also das jeweils günstigste am Markt verfügbare Modell für ein bestimmtes Testergebnis - bildet ein theoretisches Optimum ab. In der realen Wirtschaftswelt können Unternehmen diese Einsparungen oft nicht eins zu eins realisieren:

  • Synthetische Benchmarks vs. echte Wertschöpfung: Ein standardisierter Multiple-Choice-Test wie GPQA misst isoliertes Faktenwissen und logische Schlussfolgerungen. In Unternehmensabläufen zählen dagegen Systemstabilität, Tool-Aufrufe über APIs, geringe Latenzzeiten und die saubere Integration in bestehende Datenbanken.
  • Das Problem des „Benchmaxxing“: Da Benchmark-Ergebnisse als wichtigstes Marketinginstrument der KI-Labore dienen, optimieren Entwickler ihre Trainingsdaten und Feinabstimmungen gezielt auf bekannte Prüfungsfragen. Um diesen Verzerrungseffekt zu messen, testete Epoch AI auch das geheime Testformat Mystery Game Puzzles, dessen Spielregeln den KI-Herstellern nicht vorab bekannt waren. Doch auch dort sanken die Kosten um 39 bis 44 Prozent pro Quartal - der Verfall ist also real, wenngleich ein kleiner Teil auf Trainingsoptimierung zurückgehen dürfte.
  • Wechselkosten in der Praxis: Die Annahme, dass Anwender wöchentlich nahtlos zum jeweils billigsten Modellanbieter wechseln, trifft auf IT-Abteilungen selten zu. Datenschutzprüfungen, Sicherheitszertifizierungen, Rahmenverträge bei Cloud-Anbietern und Prompt-Anpassungen verhindern einen permanenten Anbieterwechsel.

🎯 Was das für die Praxis bedeutet

1. Keine langfristigen Festpreis-Kontrakte: Wer sich heute für zwei Jahre an starre API-Preise bindet, zahlt in zwölf Monaten ein Vielfaches des Marktpreises. Verträge sollten flexible Preisanpassungsklauseln oder kurze Kündigungsfristen vorsehen.

2. Abstraktionsschichten in der Software: Software-Architekturen müssen Modellaufrufe über neutrale Schnittstellen und API-Gateways kapseln. Nur so können Anwendungen bei jeder neuen Modellgeneration sofort auf günstigere Destillationsmodelle umschalten.

3. Denkprozesse in Dauerschleifen einplanen: Weil Inferenz spottbillig wird, lohnt sich das Jevons-Paradoxon. Aufgaben, die früher manuell oder gar nicht geprüft wurden - wie die automatische Verifikation von Quellcode, mehrstufige Faktenabgleiche oder automatisierte Kundenrecherchen -, können nun wirtschaftlich rund um die Uhr von Agentenschwärmen ausgeführt werden.

4. Kleinmodelle vor Großmodellen testen: Jede Aufgabe sollte primär gegen die neuesten Kompaktmodelle getestet werden. Teure Spitzenmodelle werden nur noch dort benötigt, wo absolute Höchstleistung an der Grenze des menschlich Machbaren gefordert ist.

Dieser Artikel enthält eingebettete Inhalte externer Anbieter, etwa Videos oder Social-Media-Beiträge. kiwoche.com ordnet diese Inhalte redaktionell ein, übernimmt sie jedoch nicht als eigene Inhalte. Die Rechte daran verbleiben bei den jeweiligen Rechteinhabern; für die externen Inhalte sind die jeweiligen Anbieter verantwortlich. Eingebettete Inhalte können vollständig oder teilweise mit KI erstellt oder bearbeitet worden sein.

📰 Quellen
Epoch AI Studie ↗ Epoch AI auf X ↗ Jon Hernandez auf X ↗
Teilen: