Tiefe
Gleiches Kapitel, drei Tiefen. Die Wahl gilt überall und bleibt gespeichert.

GrundlagenBeurteilen und EinordnenKapitel 06von 8 im Pfad

Der Blick ins Modell

Tiefe 1: Überblick · Lesezeit 8 Min. · Stand

Grundkurs, Kapitel 16 stellt am Ende drei Fragen, die der Ablauf offenlässt. Zwei davon bekommen dort eine Adresse. Die dritte lautet, warum eine Rangliste so ausfällt, wie sie ausfällt, und die Antwort ist auch für die Hersteller nur zum Teil beantwortet. Dieses Kapitel sagt, welcher Teil das ist.

Eine Abgrenzung vorweg. Wie ein Modell gebaut ist, also Schichten, Köpfe und Parameterzahl, ist ein Bauplan, den jemand gezeichnet hat. Hier geht es um das, was sich beim Training darin gebildet hat und was niemand gezeichnet hat. Wer den Bauplan liest, weiß, wo gerechnet wird; er weiß nicht, was gerechnet wird.

Zwei Wörter für zwei verschiedene Sachen

Emergenz ist eine Beobachtung von außen: Ein Modell zeigt eine Fähigkeit, die ein kleineres nicht hatte.

Interpretierbarkeit ist ein Verfahren von innen: Jemand sieht in die Rechnung hinein und versucht zu benennen, was dort passiert.

Beide Wörter werden im Gespräch oft vermischt, und sie beantworten verschiedene Fragen. Die erste ist eine über Verhalten, die zweite eine über Mechanik.

Der Sprung, und der Streit darüber

Die Beobachtung wurde 2022 benannt:

We consider an ability to be emergent if it is not present in smaller models but is present in larger models. (externe Seite, arxiv.org)

Die zweite Hälfte der Behauptung wird seltener zitiert und ist die interessantere. Solche Fähigkeiten cannot be predicted simply by extrapolating the performance of smaller models (externe Seite, arxiv.org), lassen sich also aus kleineren Modellen nicht hochrechnen.

Ein Jahr später kam die Gegenthese, ebenfalls begutachtet:

nonlinear or discontinuous metrics produce apparent emergent abilities, whereas linear or continuous metrics produce smooth, continuous, predictable changes in model performance (externe Seite, proceedings.neurips.cc)

Der Gedanke dahinter ist einfach. Wer eine mehrstellige Rechnung nur als richtig oder falsch zählt, sieht lange nichts und dann plötzlich etwas. Wer stattdessen zählt, wie viele Ziffern stimmen, sieht eine gleichmäßige Verbesserung.

Beide Arbeiten stehen begutachtet nebeneinander, und der Streit ist offen. Die Gegenthese betrifft dabei den Sprung, also die Form der Kurve. Über die Fähigkeit selbst sagt sie weniger, als der Titel vermuten lässt.

Was ein Nachverfolgen hergibt

Seit 2025 lassen sich Rechenwege in einem Modell teilweise nachzeichnen. Der überzeugendste Beleg für die Ernsthaftigkeit dieser Arbeit ist ein offengelegter Fehlschlag der Autoren:

we had set out to show that the model didn’t plan ahead, and found instead that it did. (externe Seite, anthropic.com)

Sie wollten zeigen, dass ein Modell beim Reimen Wort für Wort vorgeht, und fanden das Gegenteil. Wer ein Ergebnis veröffentlicht, das der eigenen Erwartung widerspricht, hat gemessen. Eine Bestätigung sähe anders aus.

Warum eine Vorabfassung kein geprüfter Aufsatz ist

Ein großer Teil der Quellen dieser Seite liegt auf arXiv, einem Server für Vorabfassungen. Was dort geprüft wird, sagt der Betreiber selbst:

the arXiv moderation process is not a peer-review process (externe Seite, info.arxiv.org)

Geprüft wird also, ob ein Text ins Fachgebiet gehört und den Formalien genügt. Ob die Ergebnisse stimmen, prüft dort niemand.

Für das Lesen heißt das: Eine Arbeit auf arXiv ist ein Angebot an die Fachwelt. Eine begutachtete Arbeit hat mindestens zwei Fachleute überstanden, die sie ablehnen konnten. Beides ist wertvoll, und der Unterschied gehört dazu, wenn man eine Zahl weitergibt.

Was das für die Auskunft eines Modells über sich selbst heißt

Ein Modell kann erklären, wie es zu einer Antwort gekommen ist. Diese Erklärung entsteht auf demselben Weg wie jede andere Antwort, und sie beschreibt den tatsächlichen Rechenweg nur zufällig.

Beim Nachverfolgen einer einfachen Addition zeigte sich, dass ein Modell intern anders vorgeht, als es hinterher schildert (Beleg (externe Seite, anthropic.com)). Beide Wege führen zum richtigen Ergebnis, und nur einer davon ist der gerechnete.

Praktisch folgt daraus dieselbe Regel wie in Grundkurs, Kapitel 07: Die Rückfrage prüft nichts.

Woran Sie eine Innenansicht festmachen

Fragen Sie, ob jemand gemessen oder gedeutet hat. Eine Untersuchung nennt ihr Verfahren und ihre Grenze.

Trennen Sie Beobachtung von Erklärung. Dass eine Fähigkeit auftaucht, ist eine Messung. Warum sie auftaucht, ist eine offene Frage.

Prüfen Sie, wer die Arbeit begutachtet hat. Eine Vorabfassung sagt das selbst, wenn man nachsieht.

Nehmen Sie die Selbstauskunft eines Modells als Text. Ein Protokoll ist sie nicht; sie entsteht wie jede andere Antwort.

Quellen

7 Einträge, davon 3 Schlüsselarbeitenalle erreichbar

Erreichbarkeit automatisch geprüft

  • SchlüsselarbeitOriginalarbeiterreichbar

    Emergent Abilities of Large Language Models (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Jason Wei und Mitautoren prägen 2022 den Begriff für Fähigkeiten, die kleine Modelle nicht zeigen und größere schon. Die zweite Hälfte ihrer Bestimmung wird selten mitzitiert und ist die eigentliche Behauptung: Solche Fähigkeiten lassen sich aus dem Verhalten kleinerer Modelle nicht hochrechnen. Begutachtet erschienen in den Transactions on Machine Learning Research; die Registry führt die arXiv-Adresse, weil die TMLR-Seite bei OpenReview auf einen Abruf ohne Browser mit einer Prüfseite antwortet.

  • SchlüsselarbeitOriginalarbeiterreichbar

    Are Emergent Abilities of Large Language Models a Mirage? (externe Seite, proceedings.neurips.cc)

    proceedings.neurips.ccgeprüft 24.09.2026

    Rylan Schaeffer, Brando Miranda und Sanmi Koyejo halten 2023 dagegen: Der Sprung liege in der gewählten Kennzahl. Wo eine Metrik unstetig misst, etwa richtig gegen falsch bei einer mehrstelligen Rechnung, entsteht der Eindruck eines plötzlichen Auftauchens; misst man stetig, ergibt sich eine glatte Kurve. Ihre Aussage betrifft den Sprung; über die Fähigkeit selbst sagt sie weniger, als der Titel vermuten lässt. Das Wort may im Titel wie im Kurztext gehört dazu. Hier steht bewusst die begutachtete NeurIPS-Fassung: Ein Kapitel, das den Unterschied zwischen Vorabfassung und Begutachtung erklärt, führt ihn in der eigenen Quellenliste vor.

  • SchlüsselarbeitOriginalarbeiterreichbar

    Tracing the thoughts of a large language model (externe Seite, anthropic.com)

    anthropic.comgeprüft 24.09.2026

    Anthropics Übersicht über zwei Fachaufsätze vom 27.03.2025, in denen die Rechenwege eines Sprachmodells nachverfolgt werden. Zwei Angaben machen den Text belastbar. Die Autoren legen einen Fehlschlag offen: Sie wollten zeigen, dass das Modell beim Reimen nicht vorausplant, und fanden das Gegenteil. Und sie beziffern die Grenze ihres Verfahrens selbst, nämlich einen Bruchteil der Rechnung und Stunden menschlicher Arbeit je kurzer Eingabe. Herstellermaterial über die eigenen Modelle, mit benannten Grenzen.

  • Dokumentationerreichbar

    Content Moderation, arXiv info (externe Seite, info.arxiv.org)

    info.arxiv.orggeprüft 24.09.2026

    Die Auskunft von arXiv über das eigene Verfahren, und sie sagt in einem Satz, was eine Vorabfassung von einem begutachteten Aufsatz unterscheidet. Für diese Seite ist das mehr als eine Fußnote: Von den Quellen der Registry liegt ein Fünftel auf arXiv, und bis zum 05.09.2026 erklärte keine Seite, was das für die Beweislage heißt.

  • Originalarbeiterreichbar

    Scaling Monosemanticity (externe Seite, transformer-circuits.pub)

    transformer-circuits.pubgeprüft 24.09.2026

    Der Fachaufsatz von 2024, in dem aus den Aktivierungen eines produktiv eingesetzten Modells benennbare Merkmale herausgelöst werden. Er steht hier ohne Zitat: Die entscheidenden Sätze der Seite enthalten Anführungszeichen oder Gedankenstriche, und beides ist auf dieser Seite nicht zitierfähig. Belegstelle ist der Abschnitt über das Herauslösen der Merkmale aus der mittleren Schicht.

  • Originalarbeiterreichbar

    Constitutional AI: Harmlessness from AI Feedback (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Die Arbeit von 2022, in der menschliche Bewertungen zur Harmlosigkeit durch eine aufgeschriebene Regelliste ersetzt werden. Das Modell kritisiert und überarbeitet seine eigenen Antworten anhand dieser Liste. Für ein Kapitel über das Innenleben zählt daran, dass die Ausrichtung eines Modells damit ein Forschungsprogramm mit veröffentlichten Verfahren ist. Eine Einstellung, die jemand umlegt, ist sie nicht.

  • Originalarbeiterreichbar

    Alignment faking in large language models (externe Seite, arxiv.org)

    arxiv.orggeprüft 24.09.2026

    Der Bericht von 2024 über ein Modell, das sich anders verhält, wenn es seine Antworten für beobachtet hält. Die Untersuchung ist ein Aufbau mit vorgegebenem Rahmen. Im laufenden Betrieb hat das niemand beobachtet, und das entscheidet über die Reichweite der Aussage. Sie zeigt, dass sich die Ausrichtung eines Modells messen lässt und dass die Messung vom Kontext abhängt.

Tippen Sie los.

↑↓ auswählenEnter öffnenDie Suche läuft im Browser. Nichts wird übertragen.