GrundlagenKI-WissenKapitel 14von 14 im Pfad
Physical AI
Alles, was auf dieser Seite bisher vorkam, spielt sich auf einem Bildschirm ab. Ein Modell bekommt Text, Bilder oder Ton und gibt Text, Bilder oder Ton zurück. Physical AI meint den Fall, in dem am Ausgang eine Bewegung steht.
Ein Greifarm, der ein Reagenzglas umsetzt. Ein Fahrzeug, das bremst. Ein Laufroboter, der eine Kiste hebt. Der Unterschied zum Chatfenster liegt darin, dass ein Fehler hier etwas anfasst.
Wo der Begriff herkommt
Populär gemacht hat ihn NVIDIA, und die knappste Bestimmung steht in einer Ankündigung vom Januar 2026:
Drei Teile also: die Welt verstehen, überlegen, Handlungen planen. Derselbe Text schiebt einen Vergleich hinterher, den man im Ohr behalten sollte, weil er von einem Hersteller stammt, der die Rechenkarten dazu verkauft:
The ChatGPT moment for robotics is here. (externe Seite, nvidianews.nvidia.com)
Auf Deutsch schreibt dasselbe Haus physische KI (externe Seite, blogs.nvidia.de), in Überschrift und Einleitung. In der Wirtschaftspresse lesen Sie beides.
Warum Bewegung schwerer ist als Text
Die Fähigkeiten von Sprachmodellen wachsen mit der Menge an Text, die es im Netz gibt. Für Bewegung gibt es diesen Vorrat nicht. Physical Intelligence, eine Firma, die genau daran arbeitet, sagt es so:
Jede Fähigkeit muss also mit genau diesem Roboter und für genau diese Aufgabe erhoben werden. Wer eine Million Beispiele braucht und sie einzeln von Hand aufnehmen muss, kommt nicht weit.
Dazu kommt eine Umkehrung, die seit den achtziger Jahren bekannt ist und die dieselbe Firma auf ihren Fall münzt:
Schach und Proteinfaltung gelten als gelöst. Ein Hemd zusammenlegen gilt als schwer. Was ein Kind nebenbei kann, ist für eine Maschine die härtere Aufgabe.
Die Bauform hat einen Namen
Was heute gebaut wird, heißt Vision-Language-Action-Modell, kurz VLA. Google DeepMind beschreibt es in einem Satz:
Hinein gehen also Kamerabilder und ein Satz in normaler Sprache. Heraus kommen Steuerbefehle für Gelenke und Greifer. Es ist derselbe Aufbau wie bei einem Sprachmodell mit Bildeingang aus Grundkurs, Kapitel 13, mit einer weiteren Ausgabeform hinten dran.
Ein Beispiel dieser Bauform steht schon in diesem Pfad: Das Robotermodell von Generalist AI in Kapitel 01 nimmt Video, Ton und Gelenkstellungen entgegen und gibt hundert Steuerbefehle je Sekunde aus.
Wo geübt wird, wenn die Welt zu teuer ist
Aus dem Datenproblem folgt die zweite Hälfte des Gebiets. Wenn echte Versuche zu teuer sind, wird woanders geübt: in einer Simulation oder in einem Modell, das die Umgebung selbst vorhersagt. Wie das geht und wo es aufhört, steht in Kapitel 09.
Für dieses Kapitel reicht die Aufgabenteilung: Ein Weltmodell sagt vorher, was passieren würde. Ein VLA-Modell entscheidet, was zu tun ist. Geübt wird in einer Nachbildung, gehandelt wird mit dem Modell.
Wo solche Systeme heute wirklich arbeiten
Die sichtbaren Beispiele sind Laufroboter auf Messeständen. Die Belege, die sich heute nachlesen lassen, kommen aus Laboren und Fertigungsbetrieben, und die Aufgabe dort ist unspektakulär: Geräte verschiedener Hersteller sprechen verschiedene Sprachen, und jemand muss übersetzen.
Anthropic hat dafür im August 2026 einen offenen Standard geöffnet, den Model Hardware Standard. Er gibt Agenten einen einheitlichen Zugang zu Mikroskopen, Pipettierrobotern und Greifarmen:
MHS reduces this integration work to hours or minutes. (externe Seite, anthropic.com)
Vorher dauerte dasselbe Wochen bis Monate. Was hier gebaut wird, ist die physische Entsprechung zu dem, was das Model Context Protocol für Software tut, und das steht in Grundkurs, Kapitel 09.
Was die Anbieter selbst einschränken
Der klarste Satz über die Grenze dieser Systeme stammt vom Anbieter, dessen Modell darin steckt:
Ein Modell, das die Welt aus Text und Bildern kennt, hat sie nie angefasst. Bei Genentech hielt Claude eine Schaumbildung in einer Probe für einen Softwarefehler und wiederholte den Vorgang, was den Schaum vermehrte. Ein Mensch musste erklären, dass hier die Physik im Weg stand.
Woran Sie ein solches System festmachen
Fragen Sie, was am Ausgang steht. Kommt dort Text heraus, den ein Programm danach in Bewegung übersetzt, oder Steuerbefehle direkt aus dem Modell? Das ist der Unterschied zwischen einem Sprachmodell mit Roboteranschluss und einem VLA-Modell.
Fragen Sie, wo die Trainingsdaten herkommen. Aufgenommene Bewegung, Video aus dem Netz oder Simulation. Jede der drei Quellen hat eine andere Lücke zur Wirklichkeit.
Fragen Sie, wer gemessen hat. In diesem Gebiet stammen fast alle Zahlen vom Hersteller selbst, und unabhängige Wiederholungen sind die Ausnahme.
Und fragen Sie nach dem Menschen daneben. Solange die Anbieter Fachaufsicht verlangen, ist ein solches System ein Werkzeug mit Bediener.
Ein VLA-Modell entsteht nicht auf der grünen Wiese. Es beginnt als Bild-Sprach-Modell und bekommt einen weiteren Ausgang.
Der Umbau vom Bild-Sprach-Modell zum Bewegungsmodell
Google DeepMind beschreibt den Eingriff so knapp, dass die Bauform daraus ablesbar wird:
Bewegung als weitere Ausgabeform, angehängt an ein vorhandenes Modell. Der Grund für diesen Umweg ist Weltwissen: Ein Modell, das aus dem Netz gelernt hat, weiß, wie eine Tasse aussieht, wozu ein Henkel da ist und was ein Toaster tut. Diese Kenntnis noch einmal aus Roboterdaten zu gewinnen wäre aussichtslos.
Die Arbeit hinter π0 sagt dasselbe über ihren Ausgangspunkt:
Das Modell darunter ist klein, gemessen an dem, was sonst diskutiert wird:
Der Grund für die Bescheidenheit liegt in der Taktrate. Ein Chat darf eine Sekunde überlegen, eine Hand am Glas darf das nicht:
Fünfzig Entscheidungen je Sekunde setzen dem Modell eine Obergrenze. Was in Kapitel 10 über kleine Modelle steht, gilt hier aus einem harten Grund: Größe kostet Zeit, und die Zeit ist verbraucht.
Die vier Wege an Bewegungsdaten
Das Nadelöhr aus Tiefe 1 hat vier Ausgänge, und jeder hat eine andere Lücke zur Wirklichkeit.
seitlich verschiebbar
eigene Darstellung, Stand 07.09.2026
Ein Mensch führt den Roboter. Eine Bedienerin steuert die Arme über eine Fernbedienung durch die Aufgabe, und die Gelenkstellungen werden mitgeschrieben. Das ergibt saubere Beispiele in genau der Form, die das Modell später ausgeben soll. Es ist auch der langsamste Weg, weil jede Stunde Material eine Stunde Arbeit kostet.
Video aus dem Netz. Menschen tun in Videos ununterbrochen Dinge mit ihren Händen. Diese Aufnahmen zeigen keine Gelenkstellungen, deshalb ergibt sich daraus keine fertige Steuerung, wohl aber ein Gefühl für Abläufe. Wie weit das reicht, steht in Kapitel 09 am Beispiel V-JEPA 2.
Simulation. Eine physikalische Nachbildung der Werkstatt, in der tausend Roboter gleichzeitig üben, ohne dass etwas zu Bruch geht. NVIDIA nennt den Zustand dieses Wegs unumwunden:
Ein Weltmodell. Statt eine Umgebung von Hand nachzubauen, wird sie gelernt. Cosmos beschreibt genau diese Rolle:
Die Übersichtsarbeit von 2025 ordnet die letzten beiden Wege als die zwei Grundlagen des Gebiets ein, und die Aufteilung ist außen gegen innen:
Der Simulator steht neben dem Roboter, das Weltmodell steckt in ihm.
Was der Sprung in die Welt kostet
Jede Übung außerhalb der Wirklichkeit erkauft ihre Billigkeit mit einer Abweichung. Reibung, Beleuchtung, das Nachgeben eines Kabels, die Verzögerung eines Motors: In der Nachbildung stimmt davon vieles ungefähr, und ungefähr genügt einer Hand am Glas selten.
Das Grundproblem steht in der Cosmos-Ankündigung in einem Satz:
Verallgemeinern mit wenig Material und aus zerstückelten Werkzeugketten. Beides zusammen beschreibt, warum dieses Gebiet langsamer vorankommt als die Textseite, obwohl dieselben Modelle darunter liegen.
Die Gegenbewegung dazu ist Genauigkeit in der Nachbildung. Die vier großen Industrieroboter-Hersteller gehen genau diesen Weg, und NVIDIA nennt die Anforderung dabei selbst:
Vom Spezialisten zum Generalisten
Die Bewegung, die bei Sprache stattgefunden hat, wiederholt sich hier. Vorher gab es ein Programm je Aufgabe:
Today’s robots are narrow specialists. (externe Seite, pi.website)
Und NVIDIA beschreibt die Richtung, in die es geht:
Was ein Grundmodell daran ändert, steht ausführlich in Kapitel 01. Für die Robotik heißt es: Ein Modell für viele Aufgaben und viele Bauformen statt eines Programms je Handgriff.
Der Nachweis dafür ist bei π0 die Bandbreite der Roboter im Training, vom Einzelarm über zwei Arme bis zum fahrbaren Greifer. Was dabei offen bleibt, sagen die Autoren selbst:
Wie ein Agent an ein Gerät kommt
Die zweite Hälfte des Gebiets hat mit Bewegung wenig zu tun und mit Anschluss alles. Ein Modell kann noch so gut planen, wenn es das Gerät nicht ansprechen kann.
Anthropics Model Hardware Standard löst das über einen einheitlichen Treiber:
Die Verwandtschaft zum Model Context Protocol aus Grundkurs, Kapitel 09 ist kein Zufall: Dieselbe Frage, einmal für Software und einmal für Geräte. Ein Agent findet ein Gerät, liest seine Fähigkeiten und ruft sie auf.
Ein Detail daran gehört zum Interessantesten der ganzen Sache. Der Treiber liefert dem Modell Angaben, die aus dem Programmcode allein nicht hervorgehen:
Das Gewicht eines Arms steht in keiner Schnittstelle. Es stand bisher in einem Papierhandbuch oder im Kopf des Technikers. Standardisiert wird hier also der Befehl und dazu das Wissen über das Gerät.
Was gemessen ist und was daran fehlt
Die veröffentlichten Zahlen dieses Gebiets stammen fast durchweg von den Häusern, die die Modelle bauen. Ein Beispiel für die Bauart solcher Angaben:
Verdopplung auf einem Maßstab, den derselbe technische Bericht beschreibt. Was dabei fehlt, ist die Gegenprobe eines Dritten. Wie man solche Angaben liest, steht in Beurteilen und Einordnen, Kapitel 04.
Eine Ausnahme ist die Herkunft der π0-Arbeit: Sie ist bei einer Fachkonferenz erschienen und damit begutachtet, was in diesem Gebiet selten vorkommt. Die Vergleichswerte gegen andere Modelle darin hat trotzdem das Haus selbst erhoben.
Zwei Sätze aus demselben Jahr, von zwei Häusern, die beide an der Sache arbeiten. NVIDIA im Mai 2026:
Physical Intelligence am Ende des Textes zu ihrem eigenen Modell:
Beide Aussagen stammen von Beteiligten. Die erste kommt von einem Haus, das Rechenkarten verkauft, die zweite von einem, das Modelle baut und um Investoren wirbt. Wer den Abstand zwischen ihnen auflösen will, braucht Messungen, und genau daran fehlt es.
Warum die Zahlen dieses Gebiets schwer zu lesen sind
Der Aufbau wandert mit. Eine Erfolgsquote von 59 Prozent auf zehn Aufgaben sagt wenig, solange Aufgaben, Roboter, Umgebung und Beleuchtung vom messenden Haus gewählt wurden. Bei Sprachmodellen gibt es öffentliche Prüfsammlungen mit festen Fragen, und selbst dort steht die Kritik aus Beurteilen und Einordnen, Kapitel 04. Hier ist die Prüfsammlung physisch und steht in genau einem Labor.
Teilerfolge zählen mit. Wo eine Aufgabe aus mehreren Handgriffen besteht, vergeben die Häuser Punkte für halbe Ausführungen. Das ist sinnvoll und macht zwei Zahlen aus zwei Häusern unvergleichbar, solange die Bewertungsregel nicht danebensteht.
Der Vergleich ist selten fremd. Wer die eigenen Werte gegen zwei ältere Modelle stellt und beide selbst betreibt, hat eine Gegenüberstellung erhoben. Für eine unabhängige Wiederholung müsste ein fremdes Labor denselben Aufbau nachstellen, mit derselben Hardware.
Und die Kosten stehen nirgends. NVIDIA benennt sie immerhin der Art nach:
Wie viel Kapital, sagt kein Haus. Die Zeitangabe von Monaten auf Tage in derselben Ankündigung bezieht sich auf Trainingsläufe und beantwortet die Frage nach dem Gesamtaufwand nicht.
Was ein Körper an Fehlern hinzufügt
Die Grenze zwischen einer gelernten Vorhersage und gerechneter Physik steht in Kapitel 09 und wird hier nicht wiederholt. Der Körper fügt drei eigene Fehlerquellen hinzu.
Die Rückkopplung ist geschlossen. Ein Sprachmodell erzeugt Text, und wenn er falsch ist, liest ihn jemand. Ein VLA-Modell erzeugt eine Bewegung, die die Umgebung verändert, die es im nächsten Bild wieder ansieht. Ein kleiner Fehler verschiebt den Zustand, aus dem heraus die nächste Entscheidung fällt. Genau das war der Schaumfall bei Genentech aus Tiefe 1: Die Wiederholung des Vorgangs verschlimmerte die Lage, die zur Wiederholung geführt hatte.
seitlich verschiebbar
eigene Darstellung, Stand 07.09.2026
Der Zeitdruck ist hart. Fünfzig bis hundert Entscheidungen je Sekunde lassen keinen Raum für die Verfahren, mit denen Sprachmodelle ihre Antworten verbessern. Nachdenken auf Vorrat, mehrere Anläufe, eine zweite Meinung einholen: All das kostet Zeit, die am fallenden Glas nicht da ist.
Die Wahrnehmung ist die halbe Aufgabe. Was ein Modell an Steuerbefehlen ausgibt, kann nur so gut sein wie das, was es sieht. Die Verfahren dahinter sind ein eigenes Fach und stehen in Kapitel 05.
Die Übersichtsarbeit von 2025 fasst den Gegenstand des Fachs so:
Wahrnehmen, überlegen, handeln. Die drei Schritte laufen fünfzigmal je Sekunde im Kreis, und jeder von ihnen kann fehlgehen.
Sicherheit ist hier ein altes Fach
Google DeepMind stellt seinen Sicherheitsabschnitt mit einer Erinnerung ein:
Kollisionsvermeidung, Kraftbegrenzung, Standsicherheit: Diese Schutzschichten sind Jahrzehnte alt und sitzen unterhalb des Modells. Ein VLA-Modell setzt sich darauf. Was neu hinzukommt, ist die Frage, ob eine geplante Handlung im gegebenen Zusammenhang zulässig ist, und die beantwortet das Modell.
Anthropic zieht eine zweite Grenze, und sie ist praktischer Natur:
Ein Gerät ohne Schnittstelle bleibt außen vor. In einer Werkstatt mit Maschinen aus drei Jahrzehnten ist das die Mehrheit.
Das zweite Gesetz
Für KI-Systeme kennt diese Seite die KI-Verordnung, sie steht in Kapitel 12. Eine Maschine mit einem lernenden Modell darin fällt zusätzlich unter ein zweites Gesetz, und das ist in der Diskussion unterbelichtet.
Die Maschinenverordnung löst die Maschinenrichtlinie von 2006 ab. Ihr Anwendungsbeginn steht in Artikel 54:
Sie gilt ab dem 14. Januar 2027. (externe Seite, eur-lex.europa.eu)
Der vielfach genannte 20. Januar 2027 kommt im Verordnungstext an keiner Stelle vor, weder für den Anwendungsbeginn noch für die Aufhebung der alten Richtlinie.
Drei Stellen daraus betreffen ein lernendes System unmittelbar. Anhang I führt eine eigene Klasse von Bauteilen, für die eine fremde Stelle prüfen muss:
Die Anforderungen an das Produkt selbst nennen die Lernphase ausdrücklich:
Ein Modell, das im Betrieb weiterlernt, muss also nachweisen, wo sein Lernen aufhört. Und die Verordnung zieht selbst die Grenze, ab der diese Pflichten greifen:
Eine kamerabasierte Personenerkennung, die im Werk nichts dazulernt, fällt damit heraus. Der Unterschied liegt im Weiterlernen im Feld.
Was daraus nicht folgt
Aus einer beeindruckenden Vorführung folgt keine Serienreife. Ein Video von einem Roboter, der ein Hemd faltet, zeigt einen gelungenen Durchlauf. Die Erfolgsquote steht daneben oder nirgends.
Aus einem Grundmodell folgt keine Beliebigkeit der Hardware. Die Modelle werden auf bestimmten Bauformen erhoben und laufen dort. Übertragung auf eine fremde Bauform ist ein eigener Forschungsgegenstand mit eigenen Zahlen.
Und aus dem Anschluss folgt keine Fachkenntnis. Ein Standard, der einem Agenten den Zugriff auf ein Mikroskop öffnet, sagt nichts darüber, ob der Agent das Experiment versteht. Die Anbieter selbst verlangen an dieser Stelle Fachaufsicht, und das ist die belastbarste Aussage, die das Gebiet derzeit über sich macht.
Quellen
10 Einträge, davon 1 Schlüsselarbeitalle erreichbar
Erreichbarkeit automatisch geprüft
SchlüsselarbeitOriginalarbeiterreichbar
π0: A Vision-Language-Action Flow Model for General Robot Control (externe Seite, arxiv.org)
arxiv.orggeprüft 24.09.2026
Black und 23 Mitautoren stellen am 31.10.2024 ein Grundmodell für Roboter vor, das über mehrere Bauformen hinweg dieselbe Steuerung fährt, von Einzelarm bis mobiler Greifer. Erschienen bei der Konferenz Robotics: Science and Systems 2025 und damit begutachtet, was in diesem Gebiet die Ausnahme ist. Beschreibt das Verfahren, ein vortrainiertes Bild-Sprach-Modell um einen fortlaufenden Bewegungsausgang zu erweitern.
Ankündigung des Herstellerserreichbar
nvidianews.nvidia.comgeprüft 24.09.2026
NVIDIAs CES-Ankündigung vom 05.01.2026 bestimmt den Begriff in einem Halbsatz und nennt dazu, wer darauf baut: Boston Dynamics, Caterpillar, Franka Robotics, LG Electronics, NEURA Robotics. Vorgestellt werden Cosmos, das VLA-Modell GR00T N1.6, der Prüfstand Isaac Lab-Arena und das Jetson-T4000-Modul. Eine Herstellerankündigung, und derselbe Hersteller verkauft die Rechenkarten dazu.
Ankündigung des Herstellerserreichbar
π0: Our First Generalist Policy (externe Seite, pi.website)
pi.websitegeprüft 24.09.2026
Der Begleittext von Physical Intelligence zur Arbeit, und die deutlichste Beschreibung des Datenproblems der Robotik: Für Sprache liegt das Netz bereit, für Bewegung gibt es nichts Vergleichbares. Nennt acht Roboterbauformen im Training, bis zu 50 Steuerbefehle je Sekunde und ein Ausgangsmodell mit 3 Milliarden Parametern. Die Vergleichswerte gegen OpenVLA und Octo hat das Haus selbst erhoben.
Dokumentationerreichbar
Google DeepMind, Gemini Robotics (externe Seite, deepmind.google)
deepmind.googlegeprüft 24.09.2026
Die Modellseite von Google DeepMind, laufend überschrieben und ohne Datum je Fassung. Sie erklärt die Bauform Vision-Language-Action in einem Satz und trennt sie vom Modell für räumliches Denken. Ohne hinterlegtes Zitat wäre ein Verweis darauf eine Aussage über den heutigen Stand.
Ankündigung des Herstellerserreichbar
Previewing the Model Hardware Standard (externe Seite, anthropic.com)
anthropic.comgeprüft 24.09.2026
Anthropic-Ankündigung des Model Hardware Standard, Beleg für Funktionsweise und Einsatzbereiche der Laborgeräte-Steuerung.
Ankündigung des Herstellerserreichbar
blogs.nvidia.degeprüft 24.09.2026
Die deutsche Fassung der GTC-Ankündigung vom 17.03.2026, und hier der Beleg für ein Wort: NVIDIA schreibt in Überschrift und Einleitung „physische KI“ und benutzt „physikalisch“ nur für die Genauigkeit einer Simulation. Dazu die Namen der Industrieroboter-Hersteller, die Omniverse und Isaac in ihre Werkzeuge einbauen, darunter KUKA, ABB, FANUC und YASKAWA.
Ankündigung des Herstellerserreichbar
Gemini Robotics brings AI into the physical world (externe Seite, deepmind.google)
deepmind.googlegeprüft 24.09.2026
Google DeepMind stellt am 12.03.2025 zwei Modelle vor und führt dabei die Bauform Vision-Language-Action als eigene Kategorie ein: ein Sprachmodell, das Bewegung als zusätzliche Ausgabeform bekommt. Nennt Apptronik als Partner für humanoide Roboter, den Datensatz ASIMOV für Sicherheitsmessungen und eine Verdopplung auf einem Verallgemeinerungs-Maßstab. Diese Zahl stammt aus dem eigenen technischen Bericht.
Ankündigung des Herstellerserreichbar
nvidianews.nvidia.comgeprüft 24.09.2026
Cosmos 3, vorgestellt am 31.05.2026 auf der GTC Taipei. Die Ankündigung benennt das Grundproblem des Gebiets in einem Satz, nämlich verallgemeinern mit wenig Trainingsmaterial, und beschreibt, wozu ein Weltmodell darin dient. Die Rangplätze auf den genannten Ranglisten und die Zeitersparnis von Monaten auf Tage sind Eigenangaben ohne unabhängige Nachmessung.
Originalarbeiterreichbar
arxiv.orggeprüft 24.09.2026
Eine Übersichtsarbeit von 18 Autoren, eingereicht am 01.07.2025 und zuletzt am 03.09.2025 überarbeitet. Sie ordnet das Gebiet nach den zwei Grundlagen, auf denen es steht: der Simulator außen, das Weltmodell innen. Ein Preprint ohne Begutachtung, brauchbar für die Einordnung des Feldes und nicht als Messung.
Originalarbeiterreichbar
Verordnung (EU) 2023/1230 über Maschinen (externe Seite, eur-lex.europa.eu)
eur-lex.europa.eugeprüft 24.09.2026
Die Maschinenverordnung löst die Maschinenrichtlinie von 2006 ab und gilt ab dem 14.01.2027. Neben der KI-Verordnung ist sie das zweite Gesetz, das eine lernende Maschine trifft: Anhang I führt Sicherheitsbauteile mit selbstentwickelndem Verhalten als eigene Klasse, die Risikobeurteilung muss die Lernphase abdecken, und ein Erwägungsgrund grenzt fest programmierte Software davon ab. Der vielfach genannte 20.01.2027 kommt im Verordnungstext nicht vor.