BeiträgeMeinungen

Eine Rangliste ohne Wert

2026 begannen Unternehmen, den Token-Verbrauch ihrer Beschäftigten zu ranken. Wie es dazu kam, warum dieselben Leute wenige Wochen später zurückruderten und was zwei Durchgänge einer randomisierten Studie über den Zusammenhang von Verbrauch und Wirkung sagen.

MeinungStand Lesezeit 7 min

Im Frühjahr 2026 stand in einer firmeninternen Bestenliste eine Zahl: 281 Milliarden Token, verbraucht von einer einzigen Person, in dreißig Tagen. Zu Listenpreisen sind das mehr als eine Million Dollar. Die Liste hatte ein Mitarbeiter selbst gebaut, sie hieß Claudeonomics, sie führte die 250 stärksten Verbraucher unter mehr als 85.000 Beschäftigten, und weit oben bekam man einen Titel verliehen: „Token Legend“ (externe Seite, fortune.com).

Was diese 281 Milliarden über die Arbeit dieser Person aussagen, weiß niemand.

Wie der Verbrauch zum Ausweis wurde

Die Sätze dazu kamen von ganz oben, und sie waren öffentlich. Auf einem Technikgipfel in San Francisco erzählte der Technikchef von Meta im Februar 2026, sein bester Ingenieur verbrauche sein Jahresgehalt in Token und sei dafür „5x to 10x more productive“ (externe Seite, forbes.com). Sein Kommentar dazu: „This is easy money.“ Und: „No limit.“

Einen Monat später sagte der Chef von Nvidia in einem Podcast (externe Seite, x.com), er wäre zutiefst beunruhigt, wenn ein Ingenieur mit 500.000 Dollar Gehalt nicht wenigstens 250.000 Dollar in Token verbrauche. Der Chef von Databricks ließ die Entwicklungsabteilung für einen Kollegen klatschen, der in zwei Wochen über 7.000 Dollar verbraucht hatte. Ein Gründer schrieb bei LinkedIn, er glaube inzwischen, „the winners in any category will be the ones who spend the most tokens“ (externe Seite, forbes.com).

Aus solchen Sätzen entsteht sehr schnell eine Rangliste. Sie sind ja bequem: Der Verbrauch steht in der Abrechnung, er lässt sich täglich abrufen, er braucht kein Urteil und keine Rückfrage. Damit hat er alles, was eine Kennzahl attraktiv macht, außer einem Bezug zur Sache.

Das Muster ist nicht auf Konzerne beschränkt

Wer denkt, so etwas passiere nur hinter Firmentüren, findet die gleiche Bauform frei im Netz. Es gibt Werkzeuge, die den eigenen Verbrauch aus den Arbeitsverzeichnissen der Programmierassistenten auslesen und ins Netz stellen. Eines beschreibt sich selbst als Zähler, mit dem man sich mit Freunden misst (externe Seite, github.com), und stellt in Aussicht, wer von ihnen als erster eine Billion Token zusammenhabe. Ein anderes führt eine öffentliche Rangliste mit öffentlichen Profilen (externe Seite, github.com). Der Wettbewerb ist dort der Zweck.

Das ist der Kern von Tokenmaxxing, und darin steckt bereits der Fehler: Die Endung stammt aus dem Netzjargon und bedeutet, eine einzelne Eigenschaft bis zum Anschlag zu treiben, ohne Rücksicht darauf, wofür sie steht.

Der Rückzug kam schnell

Die Bestenliste bei Meta verschwand zwei Tage, nachdem sie öffentlich bekannt geworden war. Ihr Erbauer nahm sie selbst herunter, mit der Begründung, Daten daraus seien nach außen gelangt. Der Text, den die Beschäftigten danach vorfanden, endete mit dem Satz, man habe „made the decision to shutter Claudeonomics for now“ (externe Seite, fortune.com).

Wenige Wochen später schrieb derselbe Technikchef, der im Februar „easy money“ gesagt hatte, ein Rundschreiben an die Belegschaft. Niemand solle KI-Werkzeuge benutzen, nur um sie benutzt zu haben, und: „token usage alone is not a measure of impact of any kind“ (externe Seite, the-decoder.com). Ab 2027 soll es Budgets je Bereich geben, ein zentrales Dashboard und automatische Warnungen bei auffälligen Kostensprüngen. Der Anlass steht in derselben Meldung: In gut dreißig Tagen waren 73,7 Billionen Token zusammengekommen, die Ausgaben für den internen Gebrauch bewegten sich auf einen Milliardenbetrag zu.

Vier Monate zwischen „kein Limit“ und „kein Maß für Wirkung“. Das ist schnell für eine Kennzahl, die vorher nirgends geprüft wurde.

Warum es nicht funktionieren konnte

Es gibt eine Messung dazu, und sie ist älter als die Debatte. Im Juli 2025 veröffentlichte METR einen randomisierten Versuch (externe Seite, arxiv.org): 16 erfahrene Entwickler, 246 echte Aufgaben aus Projekten, an denen sie im Schnitt seit fünf Jahren arbeiteten. Die eine Hälfte der Aufgaben durften sie mit KI-Werkzeugen bearbeiten, die andere nicht.

Vorher erwarteten sie, mit den Werkzeugen 24 Prozent schneller zu sein. Hinterher schätzten sie, sie seien 20 Prozent schneller gewesen. Gemessen brauchten sie 19 Prozent länger.

Diese drei Zahlen erledigen jede Rangliste des Verbrauchs, und zwar nicht, weil sie beweisen würden, dass die Werkzeuge nichts taugen. Sie beweisen etwas Unbequemeres: Die Beteiligten können ihre eigene Wirkung nicht einschätzen. Wer viel benutzt, fühlt sich schnell. Das Gefühl und die Uhr gehen dabei um fast vierzig Prozentpunkte auseinander.

Die zweite Messung, und warum sie nichts rettet

Die 19 Prozent sind ein Stand von 2025, und wer sie heute zitiert, sollte dazusagen, was aus ihnen geworden ist. METR hat ab August 2025 erneut gemessen, mit zehn Beteiligten aus der ersten Runde und 47 neu angeworbenen. Diesmal kam eine Beschleunigung heraus, 18 Prozent bei den Rückkehrern und 4 Prozent bei den Neuen. Vorzeichen gedreht, selber Personenkreis, ein Jahr später.

Trotzdem taugt auch diese Zahl nicht als Beleg, und das sagen die Autoren selbst:

we believe that the data from our new experiment gives us an unreliable signal of the current productivity effect of AI tools (externe Seite, metr.org)

Das Konfidenzintervall reicht von 38 Prozent schneller bis 9 Prozent langsamer und schließt die Null ein. Wichtiger ist der Grund, warum die Anordnung nicht mehr gilt. Der Versuch verlangt, dass ein Teil der Aufgaben ohne KI bearbeitet wird, und dazu waren zu wenige bereit:

we have observed a significant increase in developers choosing not to participate in the study because they do not wish to work without AI (externe Seite, metr.org)

Von denen, die mitmachten, reichten 30 bis 50 Prozent (externe Seite, metr.org) einzelne Aufgaben gar nicht erst ein, weil sie diese ohne KI nicht angehen wollten. Übrig bleibt eine Stichprobe ohne die Fälle, bei denen der Gewinn am größten gewesen wäre. Die Bezahlung war zudem von 150 auf 50 Dollar je Stunde gesenkt worden, was nach Einschätzung der Autoren dazu beitrug. METR baut den Versuch deshalb um.

Für die Rangliste ist dieser Befund unbequemer als jede Zahl aus beiden Durchgängen. Der saubere Vergleich, den eine Firma bräuchte, um die Wirkung ihrer Ausgaben zu belegen, ist praktisch nicht mehr herstellbar, weil die Vergleichsbedingung niemand mehr freiwillig herstellt. Wer trotzdem eine Rangfolge aufstellt, misst weiterhin den Verbrauch. Was der über die Wirkung sagt, ist seit dem ersten Durchgang unverändert.

Dazu kommt eine schlichtere Eigenschaft. Verbrauch ist eine Eingangsgröße, kein Ergebnis. Er lässt sich beliebig erzeugen, notfalls über Nacht, ohne dass ein Mensch dabei ist. Eine Zahl, die leicht zu erheben und noch leichter zu erhöhen ist, taugt nicht als Maßstab. Sie wird zum Ziel, sobald sie zum Maßstab erklärt wird, und hört genau in diesem Moment auf, etwas zu messen.

Der Fehler ist älter als die Sache

In der Softwareentwicklung gibt es diesen Fehler seit Jahrzehnten. Man hat Zeilen Code gezählt, weil Zeilen zählbar sind. Man hat behobene Fehler gezählt, bis Fehler entstanden, die sich gut beheben ließen. Die Reaktion der Technikverantwortlichen (externe Seite, leaddev.com) auf die Token-Ranglisten fiel entsprechend aus: Eine ehemalige Entwicklungsverantwortliche berichtete, sie habe ihre Erhebung nach der Einführungsphase wieder abgeschafft, weil sie „did nothing to measure developer productivity“ (externe Seite, leaddev.com). Ein anderer nannte es einen Rückfall in die Zeit vor DORA (der Forschungsgruppe, die die heute gebräuchlichen Kennzahlen für Software-Auslieferung geprägt hat), in die Ära des „measuring lines of code“ (externe Seite, leaddev.com).

Neu ist nur der Preis. Zeilen zu zählen war kostenlos. Diese Kennzahl kostet pro erhobener Einheit Geld, und zwar in einer Größenordnung, die in der Quartalsplanung auffällt.

Was daran ernst gemeint war

Es lohnt sich, den Gedanken freizulegen, aus dem die Übertreibung entstand, denn er ist richtig. Wer ein Werkzeug nur nebenbei benutzt, lernt seine Grenzen nicht kennen. Wer eine Woche lang ernsthaft damit arbeitet, weiß danach, wo es taugt und wo es Unsinn produziert, und diese Erfahrung ist mit Lesen nicht zu ersetzen. In den Anfangsmonaten einer neuen Technik ist ein Anschub deshalb vernünftig, und eine Anzeige des eigenen Verbrauchs ist ein legitimes Werkzeug dafür.

Der Bruch liegt zwischen Anschub und Rangfolge. Eine Anzeige sagt: Schau es dir an. Eine Rangliste sagt: Du bist Platz 43. Das erste ist eine Einladung, das zweite ist eine Aussage über eine Person, und für diese Aussage gibt es keine Grundlage.

Wer wissen will, ob KI-Werkzeuge in einem Betrieb etwas bringen, muss das Ergebnis messen, und das ist unbequem: Es dauert länger, es braucht einen Vergleich, und manchmal kommt heraus, was man nicht hören wollte. Genau deshalb ist der Verbrauch so beliebt geworden.

Was dieser Text nicht belegt

Die Sätze der Firmenchefs sind öffentlich gefallen, auf Konferenzen, in einem Podcast, bei LinkedIn. Die Studie ist frei nachlesbar, die Werkzeuge auch.

Alles, was in den Unternehmen selbst geschah, ist es nicht. Die Bestenliste, ihre Titel, die Zahl 281 Milliarden, das Rundschreiben und die geplanten Budgets stehen in internen Unterlagen, die kein Unternehmen veröffentlicht hat. Nachlesen lässt sich davon nur die Berichterstattung. Diese Quellen sind deshalb unten als Bericht gekennzeichnet, und sie sind der Grund, warum dieser Text eine Meinung ist. Zur Untersuchung würde er erst mit den Unterlagen selbst.

Sollte sich einer dieser Punkte als falsch erweisen, ändert das an der Sache wenig. Die beiden Durchgänge der randomisierten Studie sind der eigentliche Einwand, und der zweite wiegt schwerer als der erste.

Quellen

9 Einträge8 erreichbar · 1 abgeschaltet

Erreichbarkeit automatisch geprüft

Zurück zu allen Beiträgen

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.