GrundlagenBeurteilen und EinordnenKapitel 05von 8 im Pfad
Geschwindigkeit der Entwicklung
„Wie schnell geht das eigentlich?“ hat keine einzelne Antwort, weil mehrere Größen gleichzeitig wachsen. Sie wachsen alle, und sie wachsen unterschiedlich schnell. Genau diese Unterschiede sind die eigentliche Auskunft.
Warum eine Verdopplung schwer vorzustellen ist
Zwei Rechnungen dazu sind älter als jede Kennzahl auf dieser Seite, und beide kommen ohne KI aus.
Die erste ist die Legende vom Reiskorn auf dem Schachbrett: Auf das erste Feld kommt ein Korn, auf jedes weitere doppelt so viel wie auf das vorige. Über 64 Felder summiert sich das auf 18.446.744.073.709.551.615 Körner. Der Sprung liegt dabei ganz hinten. Auf dem 64. Feld allein liegen mehr Körner als auf allen 63 Feldern davor zusammen, genau eines mehr. Bei Feld 32 ist die Hälfte der Felder abgearbeitet, auf dem Tisch liegt dann rund ein Vier-Milliardstel der Endmenge.
Die zweite Rechnung faltet ein Blatt Papier, und jede Faltung verdoppelt die Dicke. Bei einem Zehntelmillimeter, also einem gewöhnlichen Blatt, reicht der Stapel nach 42 Faltungen bis zum Mond: 439.805 Kilometer gegen einen mittleren Abstand von 384.400 Kilometern (externe Seite, science.nasa.gov). Nach 41 Faltungen sind es 219.902, also gut die Hälfte des Weges, und eine einzige weitere Faltung schafft den Rest. Ein doppelt so dünnes Blatt kostet eine Faltung mehr; an der Größenordnung ändert das nichts.
Und hier hört das Bild auf. 42 Faltungen gibt es in der Wirklichkeit nicht. Der Rekord steht bei zwölf Faltungen (externe Seite, guinnessworldrecords.com), aufgestellt 2002 von Britney Gallivan, und dafür brauchte sie ein Seidenpapier von 1.219 Metern Länge. Was sich verdoppelt, stößt irgendwann an eine physische Grenze. Welche das in diesem Feld sind, steht am Ende dieser Seite.
Die Takte im nächsten Abschnitt sind genau solche Verdopplungen, gerechnet in der Zeit statt auf einem Brett.
seitlich verschiebbar
eigene Rechnung, Stand 09/2026
Sechs Takte nebeneinander
Gemessene Verdopplungszeiten, Stand August 2026:
| Was | Verdopplung | Seit |
|---|---|---|
| Rechenaufwand für ein Spitzenmodell | 5,2 Monate | 2020 |
| Weltweiter Bestand an Rechenchips | 6,8 Monate | laufend |
| Aufgabenlänge, die ein Modell schafft | 7 Monate | 2019 |
| Rechenaufwand für dieselbe Leistung (halbiert) | 8 Monate | 2012 |
| Leistung je ausgegebenem Dollar | 1,7 Jahre | 2023 |
| Speicherbandbreite einer Grafikkarte | 2,8 Jahre | 2008 |
Zeile 1, 2 und 6 stammen aus dem Kennzahlenblatt von Epoch AI (externe Seite, epoch.ai). Zeile 3 kommt aus der Zeithorizont-Messung, die Kapitel 03 genauer behandelt:
Zeile 5 stammt aus einer eigenen Erhebung über gekaufte Chips:
At that rate, the performance a dollar buys doubles every 1.7 years (externe Seite, epoch.ai)
Zwischen der schnellsten und der langsamsten Zeile liegt der Faktor 6,5, also 5,2 Monate gegen 33,6. Wer von „exponentiellem Fortschritt“ liest, sollte deshalb fragen, welche dieser Zeilen gemeint ist.
Welcher Takt bei Ihnen ankommt
Für die Frage, was in einem Betrieb ankommt, zählen die unteren Zeilen mehr als die oberen. Der Rechenaufwand an der Spitze sagt, was ein Labor investiert. Was ein Dollar kauft, sagt, was Sie bezahlen; die Erhebung rechnet in Dollar.
Der Abstand dazwischen ist auch der Grund, warum ein neues Spitzenmodell selten sofort billiger ist als sein Vorgänger. Die Fähigkeit wächst am schnellsten, der Preis fällt am langsamsten, und dazwischen liegt die Zeit, in der ein Anbieter seine Rechnung machen muss.
Dabei verläuft die Preiskurve sprunghaft:
Zwei Jahre nahezu Stillstand, dann eine Verdopplung. Ein glatter Jahreswert verdeckt das.
Die Verfahren werden auch besser
Zeile 4 ist die am wenigsten bekannte und zugleich die bemerkenswerteste. Sie misst die Verfahren selbst: Wie viel Rechenleistung braucht man heute für eine Leistung, die früher mehr gekostet hat. Hardware und Geld stehen dabei fest.
Dieselbe Arbeit ordnet den Befund allerdings selbst ein, und dieser Satz fehlt in fast jeder Wiedergabe:
Die besseren Verfahren wirken also schnell, und im gemessenen Zeitraum hat die schiere Rechenleistung noch mehr bewegt. Wer nur die erste Hälfte zitiert, erzählt eine Geschichte über Erfindungsreichtum, wo die Daten eine über Investitionen erzählen.
Der Antrieb hat 2024 gewechselt
Bis dahin kam der Fortschritt vor allem aus größeren Trainingsläufen. Der Rechenaufwand dafür wuchs jahrelang stetig:
Seit 2024 kommt etwas dazu, und es zeigt sich in zwei voneinander unabhängigen Messreihen:
Nachdenkende Modelle rechnen länger, während sie antworten. Das verschiebt Aufwand vom Training in den Betrieb, und was das kostet, steht in Grundkurs, Kapitel 10.
Was diese Zahlen nicht sagen
Eine Verdopplungszeit beschreibt, was bisher geschehen ist. Sie sagt nichts darüber, wie lange das so weitergeht. Jede der sechs Zeilen kann an eine Grenze stoßen, und für zwei davon sind die Grenzen absehbar: Strom und die Zeit, die der Bau eines großen Rechenzentrums braucht.
Hinter den Takten aus Ebene 1 stehen zwei Gesetzmäßigkeiten, die man kennen sollte. Die erste ist von 2020, die zweite hat sie zwei Jahre später korrigiert, und beide gelten bis heute für das Training.
Das Skalierungsgesetz
Kaplan und Mitautoren maßen 2020, wie der Fehler eines Sprachmodells mit drei Größen fällt:
Ein Potenzgesetz. Das heißt: Der Fehler fällt zuverlässig, aber immer langsamer. Wer ihn halbieren will, braucht ein Vielfaches an Aufwand, und wer ihn noch einmal halbieren will, wieder.
Die praktische Empfehlung daraus lautete, große Modelle zu bauen und das Training früh abzubrechen:
Die Korrektur
Zwei Jahre später maßen Hoffmann und Mitautoren dasselbe an über 400 Modellen und kamen zum gegenteiligen Rat:
Die Faustregel, die daraus wurde, ist einprägsam:
Damit war die Größe eines Modells als Kennzahl entwertet. Ein kleineres, länger trainiertes Modell kann ein größeres schlagen, und genau deshalb sagt eine Parameterzahl heute wenig über die Fähigkeit. Was sie noch sagt, steht in Kapitel 01: Sie bestimmt, was auf ein Gerät passt. Welche Modellklasse aus dieser Entwertung entstanden ist, behandelt KI-Wissen, Kapitel 10.
Der zweite Weg
2024 kam ein Weg dazu, der beim Antworten ansetzt statt beim Trainieren. Snell und Mitautoren untersuchten, wie viel es bringt, ein Modell länger rechnen zu lassen, bevor es antwortet. Ihr wichtigster Befund ist eine Einschränkung:
Es hängt also an der Aufgabe. Bei einer, die das Modell ohnehin manchmal löst, wirkt zusätzliche Rechenzeit stark:
test-time compute can be used to outperform a 14x larger model (externe Seite, arxiv.org)
Bei einer, die es gar nicht kann, wirkt sie nicht. Die praktische Folge steht in Grundkurs, Kapitel 10: Der zweite Regler neben der Modellgröße ist der Reasoning Effort, und er kostet Wartezeit und Token.
Der dritte Weg, und wie sicher er gemessen ist
Neben dem Training und der Antwortzeit gibt es einen dritten Zuwachs, und er kostet gar keine Rechenleistung: bessere Verfahren. Epoch AI hat ihn an über 200 Auswertungen aus elf Jahren gemessen, mit dem Ergebnis aus Ebene 1, dass sich der nötige Rechenaufwand für dieselbe Leistung etwa alle acht Monate halbiert.
An dieser Zahl lohnt sich der Blick auf die Streuung. Das Vertrauensintervall reicht von 5 bis 14 Monaten, also fast um den Faktor drei. Und die Arbeit nennt ihre eigene Schwäche:
Though limited by noisy benchmark data (externe Seite, arxiv.org)
Wer diese acht Monate neben die 5,2 aus Zeile 1 stellt, vergleicht damit zwei Zahlen sehr verschiedener Güte. Das gilt für die ganze Tabelle: Sie ordnet Größenordnungen und lädt nicht dazu ein, Zeilen auf den Monat genau gegeneinanderzustellen.
Die Beschleunigung von 2024
Diese Verlagerung ist in den Zahlen sichtbar, und zwar in zwei Reihen, die verschiedene Dinge messen. Epoch AI verfolgt einen eigenen Fähigkeitsindex, METR die Aufgabenlänge. Beide knicken im selben Jahr nach oben:
Zwei unabhängige Erhebungen mit demselben Befund sind ein stärkeres Argument als eine. Die Erklärung dazu bleibt allerdings eine Vermutung, und die Quelle sagt das selbst mit dem Wort „coincides“: Sie nennt einen zeitlichen Zusammenfall, keinen nachgewiesenen Grund.
Warum die Fähigkeit schneller wächst als der Preis fällt
Die METR-Arbeit benennt, woher der Zuwachs bei der Aufgabenlänge kommt:
Verlässlichkeit ist eine Eigenschaft des Nachtrainings und der Umgebung, also etwas, das ohne mehr Rechenleistung besser werden kann. Die Preisachse dagegen hängt an Fertigung und Lieferketten, und die haben ihren eigenen Takt.
Deshalb laufen die beiden Kurven auseinander. Ein Betrieb, der plant, sollte beide getrennt betrachten: Was ein Modell kann, ändert sich schneller als das, was es kostet.
Verdopplungszeiten sind eingängig und werden deshalb überstrapaziert. Drei Fragen halten sie im Rahmen: Was behauptet die zugrunde liegende Kurve, wo liegt der Engpass, und was folgt daraus für eine Planung.
Was ein Potenzgesetz behauptet
Die Skalierungsarbeit von 2020 misst über einen bemerkenswerten Bereich:
Sieben Größenordnungen sind ein Faktor von zehn Millionen. Eine Regelmäßigkeit, die darüber hält, ist ungewöhnlich stabil.
Sie behauptet allerdings etwas anderes, als die meisten daraus lesen. Ein Potenzgesetz sagt, dass der Fehler mit wachsendem Aufwand fällt, und zwar immer langsamer. Es sagt nichts darüber, welche Fähigkeit bei welchem Fehlerwert erscheint. Der Weg von der gemessenen Größe zu einer nützlichen Aussage über Können ist eine eigene Frage, und genau dafür gibt es die Zeithorizont-Messung aus Kapitel 03.
Und es sagt nichts über die Zeit. Dass sich der Rechenaufwand alle 5,2 Monate verdoppelt hat, ist eine Beobachtung über Investitionen, keine Folge des Gesetzes.
Der stille Engpass
Unter den Zahlen aus Ebene 1 sticht eine heraus. Die Speicherbandbreite einer Grafikkarte verdoppelt sich seit 2008 alle 2,8 Jahre, während sich der Rechenaufwand an der Spitze alle 5,2 Monate verdoppelt (Kennzahlenblatt (externe Seite, epoch.ai), Stand 05.02.2026). Rechenwerke gewinnen also erheblich schneller an Tempo als der Weg, auf dem die Zahlen zu ihnen kommen.
Beim Erzeugen von Text ist genau das die bindende Größe. Für jedes einzelne Token muss ein Modell seine Gewichte durch das Rechenwerk schieben, und dabei wartet der Rechner mehr, als er rechnet. Der eigene Werkstattbericht Was lokale Modelle schneller macht misst diesen Fall an einem Arbeitsrechner über vier Textsorten.
Daraus folgt eine unbequeme Erwartung: Die Antwortgeschwindigkeit wird sich langsamer verbessern als die Fähigkeit. Wer heute mit Wartezeiten kämpft, plant also besser mit dem heutigen Tempo. Die nächste Chipgeneration verschiebt diese Grenze nur um einen Bruchteil dessen, was sie an Rechenleistung bringt.
Was den Preis bremst
Die Preisachse hat einen eigenen Takt und einen eigenen Verlauf:
At that rate, the performance a dollar buys doubles every 1.7 years (externe Seite, epoch.ai)
Wichtiger als die Zahl ist die Form der Kurve. Sie verläuft in Sprüngen, gebunden an Chipgenerationen, und dazwischen liegen lange flache Strecken. Wer aus einem Jahreswert einen Monatswert macht, rechnet mit einer Glätte, die es nicht gibt.
Was den Ausbau begrenzt
Zwei Größen sind physisch und deshalb die härtesten Grenzen im Feld. Die eine ist Strom:
Eine Verdopplung des Strombedarfs jedes Jahr lässt sich einige Male wiederholen und danach nicht mehr. Die zweite Größe ist die Bauzeit: Ein Rechenzentrum im Gigawattbereich braucht rund zwei Jahre, und diese Zeit lässt sich mit Geld kaum verkürzen.
Bemerkenswert an der Stromangabe ist, dass sie ihr Vertrauensintervall nennt. Die meisten Zahlen in diesem Feld tun das nicht, und eine Zahl ohne Streuung verführt dazu, ihr mehr Genauigkeit zuzutrauen, als sie hat.
Was eine Verdopplungszeit hergibt
Sie beschreibt die Vergangenheit. Jede der sechs Zeilen aus Ebene 1 ist eine angepasste Gerade durch gemessene Punkte. Über den letzten Punkt hinaus sagt sie nichts, und diese Seite zeichnet solche Linien deshalb nicht weiter.
Die METR-Arbeit selbst zieht eine solche Folgerung und kennzeichnet sie als das, was sie ist: eine Fortschreibung unter der Annahme, dass die Ergebnisse auf wirkliche Softwarearbeit übertragbar sind. Beides sind Annahmen, und die Arbeit diskutiert sie im selben Abschnitt.
Sie eignet sich für Größenordnungen. Wenn sich eine Fähigkeit alle sieben Monate verdoppelt, lohnt es sich, eine Anwendung, die heute knapp scheitert, in einem halben Jahr erneut zu versuchen. Eine Anwendung, die heute um den Faktor zehn scheitert, ist damit knapp zwei Jahre entfernt: Zehn erreicht man über drei bis vier Verdopplungen, also nach 23 Monaten.
Und sie zeigt, wo Sie einhaken. Der Zuwachs bei der Aufgabenlänge kam laut Messung aus Verlässlichkeit und aus dem Umgang mit Fehlern (gemessen von METR (externe Seite, arxiv.org)). An beidem lässt sich ohne Modellwechsel arbeiten, und wie das aussieht, steht in Agenten und Harness, Kapitel 04.
Quellen
12 Einträge, davon 7 Schlüsselarbeitenalle erreichbar
Erreichbarkeit automatisch geprüft
SchlüsselarbeitDatenerreichbar
Trends in Artificial Intelligence (externe Seite, epoch.ai)
epoch.aigeprüft 24.09.2026
Das laufend fortgeschriebene Kennzahlenblatt von Epoch AI, Stand 05.02.2026. Es führt die Wachstumsraten nebeneinander, die zusammen das Tempo ergeben, und der Befund liegt in ihren Unterschieden: Die Trainingsrechenleistung an der Spitze verdoppelt sich seit 2020 alle 5,2 Monate, der weltweite Bestand an Rechenchips alle 6,8 Monate, die Speicherbandbreite einer Grafikkarte dagegen seit 2008 nur alle 2,8 Jahre.
SchlüsselarbeitDatenerreichbar
Training compute of frontier AI models grows by 4-5x per year (externe Seite, epoch.ai)
epoch.aigeprüft 24.09.2026
Sevilla und Roldán werten am 28.05.2024 eine erweiterte Modelldatenbank aus und beziffern, wie schnell der Rechenaufwand für ein Spitzenmodell wächst. Der Zeitraum endet im Mai 2024; für den Verlauf danach führt Epoch AI das Kennzahlenblatt fort.
SchlüsselarbeitDatenerreichbar
AI capabilities progress has sped up (externe Seite, epoch.ai)
epoch.aigeprüft 24.09.2026
Edelman und Lee messen am 23.12.2025 an zwei voneinander unabhängigen Reihen einen Knick im Jahr 2024: Der eigene Fähigkeitsindex und der Zeithorizont von METR beschleunigen beide. Die Quelle nennt zugleich die Vermutung über den Grund, nämlich das Aufkommen der nachdenkenden Modelle.
SchlüsselarbeitOriginalarbeiterreichbar
Measuring AI Ability to Complete Long Software Tasks (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Kwa, West, Becker und 21 weitere Mitautoren von METR schlagen im März 2025 eine Kennzahl vor, die eine Modellfähigkeit in menschlicher Arbeitszeit ausdrückt: die Aufgabenlänge, die ein Modell mit einer bestimmten Wahrscheinlichkeit schafft. Gemessen wurde an 170 Aufgaben, für die zuerst Fachleute die Bearbeitungszeit lieferten. Die Arbeit nennt ihre eigenen Grenzen ausdrücklich, darunter die Übertragbarkeit auf Arbeit außerhalb der Testreihe.
SchlüsselarbeitOriginalarbeiterreichbar
Algorithmic progress in language models (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Ho und Mitautoren von Epoch AI messen am 09.03.2024 an über 200 Auswertungen aus den Jahren 2012 bis 2023, wie schnell die Verfahren selbst besser werden: Für dieselbe Leistung genügt in immer kürzeren Abständen die halbe Rechenleistung. Die Arbeit ordnet den Befund selbst ein, und der Nebensatz dazu fehlt in fast jeder Wiedergabe: Der Zuwachs an Rechenleistung hat im selben Zeitraum noch mehr beigetragen als die besseren Verfahren.
SchlüsselarbeitOriginalarbeiterreichbar
Scaling Laws for Neural Language Models (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Kaplan und Mitautoren bei OpenAI messen am 23.01.2020, wie der Fehler eines Sprachmodells mit Modellgröße, Datenmenge und Rechenaufwand fällt. Das Ergebnis ist ein Potenzgesetz, einzelne der Verläufe über mehr als sieben Größenordnungen, und damit lässt sich der Ertrag eines größeren Trainingslaufs vorher abschätzen. Vier Monate vor GPT-3. Die eigene Empfehlung der Arbeit, sehr große Modelle auf vergleichsweise wenig Daten zu trainieren, hat DeepMind 2022 mit Chinchilla korrigiert, siehe chinchilla-2022.
SchlüsselarbeitOriginalarbeiterreichbar
arxiv.orggeprüft 24.09.2026
Snell, Lee, Xu und Kumar messen am 06.08.2024 den zweiten Weg, auf dem Modelle besser werden: mehr Rechenzeit beim Antworten statt beim Trainieren. Der Beleg dafür, dass die Wirkung dieses Wegs von der Schwierigkeit der Aufgabe abhängt, und für die Größenordnung, in der er ein größeres Modell schlagen kann.
Datenerreichbar
epoch.aigeprüft 24.09.2026
Somala misst am 13.08.2026 die Preisachse, die in den Fähigkeitszahlen fehlt: Wie viel Rechenleistung ein Dollar kauft, und in welchem Takt sich das verdoppelt. Wichtig ist der Hinweis auf den sprunghaften Verlauf, denn ein glatter Jahreswert verdeckt hier zwei Jahre Stillstand.
Dokumentationerreichbar
Moon Facts (externe Seite, science.nasa.gov)
science.nasa.govgeprüft 24.09.2026
Das Faktenblatt der NASA zum Mond. Hier gebraucht für eine einzige Größe: den mittleren Abstand von Erde und Mond mit 384.400 Kilometern. Die Seite nennt ihn ausdrücklich als Durchschnitt, denn die Bahn ist eine Ellipse und der Abstand schwankt über einen Monat um mehrere zehntausend Kilometer. Für eine Überschlagsrechnung, die eine Verdopplung anschaulich machen soll, reicht der Mittelwert; dass es einer ist, gehört in den Satz daneben.
Originalarbeiterreichbar
Most times to fold a piece of paper (externe Seite, guinnessworldrecords.com)
guinnessworldrecords.comgeprüft 24.09.2026
Der Rekordeintrag zum Falten eines einzelnen Blattes: Britney Gallivan faltete am 27.01.2002 als erster Mensch ein Blatt neun-, zehn-, elf- und zwölfmal. Das Register ist die Stelle, die diesen Rekord führt, und belegt damit den Vorgang. Die Herleitung dazu, warum bei wenigen Faltungen Schluss ist, steht in Gallivans Schrift »How to Fold Paper in Half Twelve Times« (Historical Society of Pomona Valley, 2002) und ist online nicht abrufbar. Der Eintrag nennt die Bedingung mit: Das Papier war ein Seidenpapier von 1.219 Metern Länge, also nichts, was auf einem Schreibtisch liegt.
Originalarbeiterreichbar
Training Compute-Optimal Large Language Models (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Hoffmann und Mitautoren messen am 29.03.2022 an über 400 Modellen, wie Parameterzahl und Datenmenge bei festem Rechenbudget zusammengehören, und korrigieren damit die Empfehlung von scaling-laws-2020: Bei doppelter Modellgröße gehört die doppelte Datenmenge dazu. Chinchilla mit 70 Milliarden Parametern schlägt Gopher mit 280 Milliarden. Der Beleg dafür, dass die Parameterzahl allein wenig über ein Modell sagt.
Datenerreichbar
The power required to train frontier AI models is doubling annually (externe Seite, epoch.ai)
epoch.aigeprüft 24.09.2026
Emberson und Rahman schätzen am 19.09.2024 aus 45 Beobachtungen, wie schnell die Leistungsaufnahme eines Trainingslaufs an der Spitze wächst. Der Eintrag nennt sein Vertrauensintervall selbst und ist damit eine der wenigen Angaben in diesem Feld, die ihre Unsicherheit ausweist.