GrundlagenKI-WissenKapitel 09von 14 im Pfad
Weltmodelle
Ein Sprachmodell sagt das nächste Token voraus. Ein Weltmodell sagt die nächste Lage voraus: wie eine Umgebung aussieht, nachdem etwas darin passiert ist.
Das klingt nach einem kleinen Unterschied und ist ein großer. Wer vorhersagen kann, was auf eine Handlung folgt, kann Handlungen durchspielen, bevor er sie ausführt.
Ein Modell, das die nächste Lage vorhersagt
Die knappste Bestimmung stammt von einem Hersteller und nennt beide Hälften:
Zwei Vorhersagen also. Die eine betrifft den Lauf der Dinge ohne Zutun: Ein geworfener Ball fällt. Die andere betrifft die eigene Wirkung: Wenn ich jetzt die Hand ausstrecke, fange ich ihn.
Der Begriff in dieser Bedeutung stammt aus einer Arbeit von 2018:
Verdichtet werden Raum und Zeit. Das Modell merkt sich also, wie die Umgebung aussieht und wie sie sich bewegt, in einer Form, die klein genug zum Rechnen ist.
Warum Vorhersagen billiger ist als Ausprobieren
Ein Agent, der in der echten Welt lernt, zahlt für jeden Versuch. Ein Roboterarm, der greifen lernt, braucht Millionen Versuche, und jeder kostet Zeit, Verschleiß und gelegentlich ein zerbrochenes Glas.
Ein Agent, der in seinem eigenen Modell lernt, zahlt nur Rechenzeit. Er kann tausend Varianten in einer Sekunde durchspielen, und ein Fehler darin bleibt folgenlos.
Genau das war der Nachweis von 2018, und die Autoren haben ihn zugespitzt formuliert:
Das Wort für die Erfindung des Modells ist dasselbe, das bei Sprachmodellen den Fehler bezeichnet. Hier ist sie der Zweck.
Der Traum als Übungsplatz
Wie weit das reicht, hat eine begutachtete Arbeit von 2025 gezeigt. Sie ist im Bestand dieser Seite die Ausnahme: begutachtet, frei zugänglich, mit einem Nachweis, den man nachrechnen kann.
Die Bauform in einem Satz:
Der Nachweis, den die Arbeit selbst herausstellt, ist ein Videospiel. In Minecraft einen Diamanten zu finden, verlangt eine lange Kette von Schritten, und Belohnung gibt es erst ganz am Ende:
Zwölf Zwischenschritte ohne Anleitung und ohne menschliche Vorlagen. Das ist die Aufgabenform, an der Verfahren aus Kapitel 02 sonst scheitern.
Wo die Videomodelle hineinspielen
Ein zweiter Weg zu Weltmodellen kommt von der Bildseite. Wer ein Modell darauf trainiert, Video fortzusetzen, bringt ihm bei, wie Dinge sich bewegen, und das ist eine Form von Weltwissen.
OpenAI hat den eigenen Videogenerator ausdrücklich so eingeordnet:
Der Unterschied zum Bildmodell aus Grundkurs, Kapitel 14 liegt in der Zeitachse. Ein Bild hat keine Folge, ein Video schon, und aus der Folge ergibt sich die Frage, was als Nächstes passiert.
Ein drittes Verfahren geht noch einen Schritt weiter und lässt sich begehen:
Die Angaben stammen vom Hersteller, eine unabhängige Messung dazu liegt nicht vor.
Was ein Sprachmodell davon hat und was nicht
Die Frage, ob in einem Sprachmodell ein Weltmodell steckt, ist offen und wird in der Forschung ernsthaft gestritten. Sicher ist zweierlei.
Ein Sprachmodell hat Text über die Welt gesehen und daraus vieles gelernt, was sich wie Weltwissen verhält. Es weiß, dass ein losgelassenes Glas fällt, weil das in Millionen Sätzen steht.
Und es hat keine Umgebung, in der es Handlungen durchspielen könnte. Was es an Vorhersage leistet, leistet es in Sprache. Was das für Agenten bedeutet, steht in Agenten und Harness, Kapitel 01.
Woran Sie ein Weltmodell festmachen
Fragen Sie nach der Handlung. Ein Weltmodell sagt vorher, was eine Handlung bewirkt. Ein Videogenerator ohne Eingriffsmöglichkeit sagt nur, wie es weitergeht.
Fragen Sie nach der Dauer. Über wie viele Sekunden bleibt die Umgebung sich treu? Das ist die Kennzahl, an der sich diese Systeme heute unterscheiden.
Achten Sie darauf, wo geübt wird. Im Modell zu lernen ist billig und richtig nur so weit, wie das Modell stimmt.
Und trennen Sie Vorhersage von Physik. Ein Modell, das gelernt hat, wie Dinge aussehen, hat keine Bewegungsgleichungen gelernt.
Sehen, Erinnern, Entscheiden
Die Arbeit von 2018 hat eine Aufteilung eingeführt, die bis heute gilt. Drei Bauteile, jedes mit einer eigenen Aufgabe.
Sehen. Ein Bild der Umgebung ist zu groß, um damit zu rechnen. Ein Autoencoder verdichtet es auf wenige hundert Zahlen, die Bauform steht in Kapitel 03. Diese Zahlen sind die Lage, in der das System denkt.
Erinnern. Ein zweites Netz sagt voraus, welche Lage als Nächstes kommt, und zwar abhängig von der Handlung. Es führt einen Zustand mit, denn was als Nächstes passiert, hängt an dem, was vorher war.
Entscheiden. Ein drittes, sehr kleines Netz wählt die Handlung. Es bekommt die verdichtete Lage und den Zustand des Vorhersagenetzes und gibt einen Zug aus.
Der Kern der Sache steckt in der Verteilung der Größen. Die beiden ersten Teile sind groß und lernen die Umgebung. Der dritte ist winzig und lernt nur, was zu tun ist. Deshalb funktioniert der Trick aus Tiefe 1: Wenn das Verhalten in einem kleinen Netz steckt, lässt es sich billig im Modell trainieren und danach in die echte Umgebung übertragen.
Die Fassung von 2025 hat daraus eine Dreiteilung mit anderen Namen gemacht:
Ein Netz bewertet, ein Netz handelt, und das Weltmodell liefert beiden die Zukunft, über die sie reden.
Im Modell üben statt in der Welt
Wer in einem gelernten Modell übt, hat ein Problem, das die echte Welt nicht hat: Das Modell kann sich irren, und der Agent findet die Stellen, an denen es sich irrt.
Das ist die logische Folge des Verfahrens. Wer nach der besten Handlung sucht, sucht auch in den Bereichen, in denen das Modell danebenliegt. Findet es dort eine Handlung, die im Modell großartig aussieht, nimmt es sie, und in der echten Umgebung passiert etwas anderes.
Die Gegenmittel sind alle eine Form von Vorsicht. Man begrenzt, wie weit in die Zukunft geträumt wird. Man lässt das Modell seine eigene Unsicherheit mitschätzen und misstraut Vorhersagen, bei denen sie hoch ist. Und man sammelt weiter echte Erfahrung, um das Modell nachzuziehen.
Was in der begutachteten Arbeit steht
Die Dreamer-Arbeit von 2025 ist an einer Stelle besonders aufschlussreich, und es ist nicht die mit dem Diamanten. Sie misst über acht Gebiete hinweg mit einer einzigen Einstellung:
Der Nachsatz ist die Aussage. Bis dahin war es üblich, ein Verfahren für jedes Gebiet neu einzustellen, und wer das tut, misst am Ende die Einstellarbeit mit. Dieselbe Frage stellt sich bei jeder Benchmarkzahl, und sie steht ausgeführt in Beurteilen und Einordnen, Kapitel 04.
Die Autoren nennen ihren Nachweis selbst:
Der Kurztext derselben Arbeit sagt an dieser Stelle nur „collect diamonds in Minecraft from scratch“. Die genauere Fassung mit den zwölf Zwischenschritten steht im Fließtext, und sie ist die brauchbarere: Sie sagt, was gemessen wurde.
Die begehbare Welt
Ein anderer Weg erzeugt die Umgebung als Bild und lässt sie begehen. Das Verfahren dazu hat einen Zuschnitt, der eine ältere Annahme kippt:
Die entscheidende Eigenschaft ist die Beständigkeit. Wer sich in einer erzeugten Welt umdreht, soll dasselbe wiedersehen, und genau das war jahrelang das Problem: Diese Systeme erfanden bei jeder Bewegung neu, was hinter dem Rücken liegt.
Wie das Zusammenspiel mit einem Agenten aussieht, beschreibt der Hersteller in einem Satz, der die Rollenverteilung klarmacht:
Das Modell ist die Umgebung. Den Spieler stellt jemand anders, und ein Ziel kennt das Modell nicht.
Was diese Modelle nicht können
Der Hersteller zählt seine Grenzen selbst auf, und zwei davon sind grundsätzlich.
Wenige Minuten Beständigkeit sind für ein Training zu wenig, das über Stunden läuft. Und ein Ort, der nur ungefähr stimmt, taugt nicht zum Üben für einen Weg, den ein Roboter danach in echt fahren soll.
Dazu kommt die Verfügbarkeit:
Der Videogenerator ist bei seinen Grenzen ähnlich deutlich:
Der Streit um das Weltmodell im Sprachmodell
Der dritte Weg lernt aus Video, das ohnehin da ist. V-JEPA 2 stellt die Frage in ihrer allgemeinsten Form:
Die Größenverhältnisse sind der interessante Teil. Vortrainiert wird auf
Für das Handeln kommt dann sehr wenig dazu:
Und das Ergebnis arbeitet in fremden Räumen:
Zwei Labore, kein Training vor Ort. Die Zahlen stammen von den Autoren, eine unabhängige Wiederholung liegt nicht vor.
Damit ist auch gesagt, warum der Streit um Sprachmodelle offen ist. Wer aus Beobachtung lernt, baut etwas auf, das sich wie ein Modell der Welt verhält, ohne dass jemand es so gebaut hätte.
Was daraus für die Praxis folgt
Für die meisten Anwendungen ist das noch Forschung. Es gibt heute kein Produkt, in dem ein Weltmodell die Arbeit macht, die ein Sprachmodell nicht auch täte.
Der Ort, an dem es zuerst ankommt, ist die Robotik. Dort ist echte Erfahrung teuer, und genau dafür ist das Verfahren gebaut. Was dort sonst noch dazugehört, vom Bewegungsausgang bis zur Rechtslage, steht in Kapitel 14.
Und die Videoseite ist die sichtbare. Was heute als Videogenerator verkauft wird, ist nach der Bauweise ein halbes Weltmodell: Es sagt die nächste Lage voraus, nur ohne dass jemand eingreifen kann.
Eine Vorhersage ist keine Physik
Ein Physikprogramm rechnet mit Gleichungen. Es kennt Masse, Kraft und Beschleunigung, und wenn es eine Kugel rollen lässt, folgt sie diesen Gleichungen, auch in einer Lage, die noch nie jemand gesehen hat.
Ein Weltmodell rechnet mit Beispielen. Es hat gesehen, wie Kugeln rollen, und sagt eine Fortsetzung voraus, die den gesehenen ähnelt. In vertrauten Lagen sieht das gleich aus. In unvertrauten fällt es auseinander.
Der Bericht zum Videogenerator sagt das über den eigenen Gegenstand:
Zerbrechendes Glas ist ein gutes Beispiel, weil es beides zeigt. Es kommt in Videos oft vor, sieht aber jedes Mal anders aus, und aus dem Aussehen folgen keine Bruchlinien.
Bemerkenswert ist, wie die Fähigkeiten überhaupt entstanden sind:
Niemand hat ein Bauteil für Dreidimensionalität eingebaut. Was an räumlicher Beständigkeit da ist, hat sich aus der Menge ergeben, und was sich so ergeben hat, lässt sich auch nicht gezielt reparieren.
Für den eigenen Gebrauch heißt das: Eine erzeugte Szene ist eine Aussage darüber, wie so etwas üblicherweise aussieht. Sie ist keine Aussage darüber, was in diesem Fall passieren wird.
Was fehlt, wenn nur die Szene modelliert wird
Eine Arbeit von 2026 benennt eine Lücke, die alle heutigen Weltmodelle teilen, und sie ist keine technische:
Was jemand weiß, glaubt und will, steht in der Szene nicht. Die Folge daraus ist scharf formuliert:
Das Beispiel der Arbeit ist alltäglich: Jemand sucht eine Tasse, die während seiner Abwesenheit weggeräumt wurde. Physikalisch ist die Lage eindeutig, die Tasse steht im Schrank. Verhalten wird sich die Person trotzdem so, als stünde sie noch auf dem Tisch, denn ihr Wissen ist auf dem alten Stand.
Ein Weltmodell, das nur die Szene führt, sagt hier die falsche Handlung voraus, und es tut das mit hoher Sicherheit. Für jede Anwendung, in der Menschen vorkommen, ist das die härtere Grenze als die Physik.
Warum die Messung hier besonders schwer fällt
Bei einem Sprachmodell gibt es eine richtige Antwort, an der sich messen lässt. Bei einem Weltmodell gibt es die selten, und daraus folgen drei Schwierigkeiten.
Die Zukunft ist mehrdeutig. Wenn jemand die Hand hebt, kann er winken, greifen oder sich strecken. Ein Modell, das eine dieser Fortsetzungen zeigt, liegt nicht falsch, auch wenn im Video eine andere kam.
Das Aussehen und die Richtigkeit fallen auseinander. Eine Szene kann täuschend echt aussehen und physikalisch unmöglich sein. Umgekehrt kann eine grob gezeichnete Vorhersage die richtige Bewegung enthalten.
Und der Aufbau wandert mit. Genie 3 nennt Bildrate, Auflösung und Dauer, und alle drei sind Herstellerangaben ohne unabhängige Wiederholung; der Zugang war zum Zeitpunkt der Ankündigung auf einen kleinen Kreis beschränkt (Beleg (externe Seite, deepmind.google)). Der Sora-Bericht sagt selbst, dass er die Nachrechenbarkeit nicht liefert:
Model and implementation details are not included in this report. (externe Seite, openai.com)
Die Dreamer-Arbeit ist unter diesen Belegen die Ausnahme, und der Grund ist methodisch: Sie misst an Umgebungen mit einer eindeutigen Punktzahl. Wo es einen Zähler gibt, gibt es eine Messung, und wo es nur ein Bild gibt, gibt es einen Eindruck. Was daraus für Kennzahlen folgt, steht in Beurteilen und Einordnen, Kapitel 04.
Was daraus nicht folgt
Aus einer beeindruckenden Szene folgt kein Verständnis. Was diese Modelle gelernt haben, ist die Wahrscheinlichkeit von Bildfolgen. Das leistet verblüffend viel, und es reicht genau so weit wie die gesehenen Beispiele.
Der Traum ersetzt die Erfahrung nicht. Ein Verhalten, das im Modell funktioniert, funktioniert in der Welt so weit, wie das Modell stimmt. Deshalb sammelt jedes ernsthafte System weiter echte Erfahrung.
Und ein Sprachmodell ist damit nicht widerlegt. Die Frage, ob in seinen Gewichten etwas steckt, das sich wie ein Modell der Welt verhält, ist offen. Wer sie beantworten will, braucht eine Messung, und die gibt es für diesen Fall bisher nicht.
Der Begriff selbst ist unscharf geworden. Er bezeichnet heute drei verschiedene Sachen: das verdichtete Umgebungsmodell eines Agenten, einen Videogenerator mit Zeitachse und eine begehbare erzeugte Umgebung. Wer über Weltmodelle redet, sagt am besten dazu, welche der drei er meint.
Quellen
6 Einträge, davon 2 Schlüsselarbeitenalle erreichbar
Erreichbarkeit automatisch geprüft
SchlüsselarbeitOriginalarbeiterreichbar
World Models (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Ha und Schmidhuber geben dem Begriff am 27.03.2018 seine heutige Bedeutung: ein Modell der Umgebung, das ein Agent in sich führt und in dem er üben kann, ohne die Umgebung selbst anzufassen. Der Kurztext nennt beide Hälften, die verdichtete Darstellung von Raum und Zeit und den Umstand, dass die im Modell gelernte Handlungsvorschrift danach in der echten Umgebung arbeitet.
SchlüsselarbeitOriginalarbeiterreichbar
Mastering diverse control tasks through world models (externe Seite, nature.com)
nature.comgeprüft 24.09.2026
Hafner, Pasukonis, Ba und Lillicrap zeigen am 02.04.2025 in Nature, dass ein einziges Verfahren mit unveränderten Einstellungen über 150 Aufgaben aus acht Gebieten löst. Die Arbeit ist begutachtet und frei zugänglich, was sie von den meisten Belegen dieses Gebiets unterscheidet. Der Nachweis, den sie selbst herausstellt, ist der Diamant in Minecraft ohne menschliche Vorlagen.
Ankündigung des Herstellerserreichbar
Genie 3: A new frontier for world models (externe Seite, deepmind.google)
deepmind.googlegeprüft 24.09.2026
Die Ankündigung vom 05.08.2025 enthält die knappste Definition des Begriffs, die ein Hersteller gibt, und daneben eine Liste eigener Grenzen: Handlungsraum, mehrere Agenten, echte Orte, Schrift im Bild, Dauer. Die Angaben zu Bildrate, Auflösung und Dauer stammen vom Hersteller, eine unabhängige Messung dazu liegt nicht vor. Genie 3 war zum Zeitpunkt der Ankündigung eine Vorschau für einen kleinen Kreis.
Ankündigung des Herstellerserreichbar
Video generation models as world simulators (externe Seite, openai.com)
openai.comgeprüft 24.09.2026
Der technische Bericht vom 15.02.2024, in dem OpenAI ein Videomodell ausdrücklich als Weg zu einem Simulator der physischen Welt beschreibt. Er nennt die Bauform (Diffusion über Raum-Zeit-Stücke statt über Text-Token) und zählt die Fähigkeiten auf, die dabei ohne eigenen Bauteil entstanden sind. Der Bericht sagt selbst, dass Modell- und Umsetzungsdetails fehlen, und er nennt die Grenzen beim Namen.
Originalarbeiterreichbar
arxiv.orggeprüft 24.09.2026
Assran und Mitautoren zeigen am 11.06.2025 den dritten Weg zu einem Weltmodell: aus einer Million Stunden Netzvideo, ergänzt um weniger als 62 Stunden Robotermaterial. Spielumgebungen und erzeugtes Video kommen dabei nicht vor. Das Ergebnis steuert Greifarme in zwei fremden Laboren ohne Training vor Ort. Die Zahlen stammen von den Autoren, eine unabhängige Wiederholung liegt nicht vor.
Originalarbeiterreichbar
Mental World Modeling (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Preprint von Hao Fei und Yiran Zhao mit Definition von MWM und den acht getesteten Modellen.