Was sind World Models in der KI? Ein Business-Leitfaden zu KI, die die Realität simuliert

Turn this article into takeaways for your work.
Each assistant summarizes the article only for you and suggests best practices for your work.
Aktualisiert im Juli 2026
Ein World Model ist ein KI-System, das darauf trainiert ist, eine interne, vorhersagende Simulation einer Umgebung aufzubauen: wie eine Szene aussieht, wie sich Objekte und Menschen darin bewegen und was nach einer Aktion als Nächstes passiert. Anstatt wie ein Sprachmodell das nächste Wort vorherzusagen, sagt ein World Model den nächsten Zustand einer Welt voraus.
Dieser Unterschied klingt klein. Ist er aber nicht. Es ist der Unterschied zwischen einer KI, die über die physische Welt spricht, und einer KI, die sie gut genug versteht, um in ihr zu handeln oder eine Version davon zu erschaffen, durch die Sie gehen, in der Sie einen Roboter testen oder aus der Sie ein komplettes Spiellevel generieren können.
Wie World Models eine interne Simulation lernen
Ein World Model merkt sich Fakten über die Welt nicht wie ein Lexikon. Es lernt Physik und Ursache-Wirkung, indem es enorme Mengen an Video- und Interaktionsdaten sowie (zunehmend) Sensorprotokolle von Robotern beobachtet und das Gesehene dann zu einer kompakten internen Darstellung des "Zustands" verdichtet: wo sich Objekte befinden, wie sie sich bewegen und was im nächsten Moment wahrscheinlich passiert.

Das Training folgt in der Regel drei Phasen:
- Rohe Sequenzen aufnehmen. Das Modell sichtet Millionen Stunden an Video-, Gameplay- oder Roboter-Demonstrationsmaterial, wobei jedes Bild mit der jeweiligen Aktion (eine Kamerabewegung, eine Roboterarmbewegung, ein Tastendruck) verknüpft ist, die das nächste Bild ausgelöst hat.
- Lernen, den nächsten Zustand vorherzusagen. Ausgehend vom aktuellen Zustand und einer Aktion lernt das Modell, immer wieder vorherzusagen, was als Nächstes kommt, bis seine interne Simulation nicht mehr von dem abweicht, wie sich die reale Welt tatsächlich verhält.
- Die Simulation vorwärts laufen lassen. Einmal trainiert, kann das Modell unbegrenzt neue Zustände generieren und dadurch quasi "vorstellen", was passieren würde, wenn eine Person, ein Roboter oder eine Kamera eine bestimmte Aktion ausführt, ohne dass diese Aktion jemals in der Realität stattfindet.
Googles DeepMind Genie 3 ist dafür ein anschauliches Beispiel. Es handelt sich um einen autoregressiven Transformer mit 11 Milliarden Parametern, der aus einem Text-Prompt in Echtzeit eine begehbare Welt in 720p und 24 Bildern pro Sekunde erzeugt, mit einem visuellen Gedächtnis von etwa einer Minute, damit die Umgebung konsistent bleibt, während Sie sich durch sie bewegen (Google DeepMind, 2026). Das ist der Kernablauf: Beschreiben Sie eine Welt, und Sie erhalten einen Ort, durch den Sie sich bewegen können, wobei das Modell fortlaufend vorhersagt, was als Nächstes erscheinen sollte, basierend darauf, wohin Sie sich gerade bewegt haben.
Das unterscheidet World Models auch von gewöhnlichen Videogeneratoren. Ein Videogenerator erzeugt einen festen Clip. Ein World Model behält einen dauerhaften internen Zustand bei und reagiert auf Eingaben, näher an einer Simulation als an einem Film.
Warum World Models wichtig sind
Robotik. Das Training von Robotern in der realen Welt ist langsam und teuer: Jeder fehlgeschlagene Griff oder jede Kollision kostet Zeit, Hardware und manchmal auch Sicherheit. World Models ermöglichen es Ingenieuren, zunächst in der Simulation große Mengen realistischer, physikalisch plausibler Trainingsszenarien zu erzeugen und dann das Gelernte auf die reale Maschine zu übertragen. Nvidia nennt das "Physical AI", und genau das ist die Grundidee hinter Cosmos: die Policy in einer simulierten Welt trainieren, bevor sie jemals mit einer realen in Berührung kommt.
Video- und Content-Generierung. Klassische KI-Video-Tools erzeugen einen Clip und sind damit fertig. Ein World Model lässt sich steuern, erneut aufrufen und erweitern, weshalb Unternehmen für Videogenerierung wie Runway sich explizit auf World Models statt auf einmalige Clips ausrichten. Längere, steuerbare, physikalisch stimmige Generierung ist der nächste Schritt nach "Prompt eingeben, 5 Sekunden Video erhalten".
Planung und agentische KI. Ein KI-Agent, der das wahrscheinliche Ergebnis einer Aktion simulieren kann, bevor er sie ausführt, kann mehrere Schritte vorausplanen, anstatt nur Schritt für Schritt zu reagieren. Das ist ein bedeutendes Upgrade gegenüber Agenten, die nur in Textform argumentieren: Ein World Model gibt einem Agenten etwas, das der Vorstellungskraft nahekommt, eine Möglichkeit, einen Plan gedanklich zu testen, bevor Ressourcen dafür eingesetzt werden.
Ein möglicher Weg zu allgemeinerer KI. Large Language Models sind außergewöhnlich gut darin, Text zu verarbeiten, aber Text ist eine Beschreibung der Welt, nicht die Welt selbst. Forscher, darunter Fei-Fei Li, argumentieren, dass räumliche Intelligenz, also ein Verständnis dafür, wie sich Objekte, Raum und Zeit tatsächlich verhalten, eine eigenständige Fähigkeit ist, die Sprache allein einem Modell nicht beibringt. World Models sind eine der konkreteren Wetten der Branche darauf, diese Lücke zu schließen.
Wichtige Akteure und Projekte im Jahr 2026
Google DeepMind, Genie 3. DeepMinds World Model erzeugt in Echtzeit spielbare, textgesteuerte Umgebungen. Es wurde am 29. Januar 2026 für Google-AI-Ultra-Abonnenten ausgerollt, nachdem es 2025 debütiert hatte, und stellt bislang die klarste öffentliche Demonstration von Echtzeit-, interaktiver Welterzeugung dar (Google DeepMind, 2026; 9to5Google, 2026).
World Labs, gegründet von Fei-Fei Li. World Labs entwickelt Marble, ein World Model, das Text-Prompts, Fotos, Videoclips oder grobe 3D-Layouts in dauerhafte, editierbare, begehbare 3D-Umgebungen verwandelt, gezielt ausgerichtet auf räumliche Branchen wie Architektur, Gaming und Design (World Labs, via TechCrunch, 2026).
Nvidia Cosmos. Cosmos ist Nvidias Plattform für Weltfundamentmodelle für das, was das Unternehmen "Physical AI" nennt, und erzeugt synthetische Trainingsdaten und Aktionstrajektorien, um die Entwicklung von Robotik und autonomen Fahrzeugen zu beschleunigen. Cosmos 3, das 2026 eingeführt wurde, wurde mit rund 20 Billionen Tokens multimodaler Daten trainiert, darunter fast eine Milliarde Bilder und 400 Millionen reale und synthetische Videos (Nvidia Newsroom, 2026).
Runway. Bekannt vor allem für KI-Videogenerierung, hat Runway seine Roadmap auf World Models ausgerichtet und im Februar 2026 in einer Series-E-Runde 315 Millionen US-Dollar eingesammelt, explizit um "die nächste Generation von World Models vorzutrainieren", zusätzlich zu einem ersten World Model, das im Dezember 2025 ausgeliefert wurde (TechCrunch, 2026).
Diese vier Organisationen konkurrieren nicht mit identischen Produkten. DeepMind und Runway tendieren zu generativen, videoartigen World Models, die Sie in Echtzeit erkunden. World Labs tendiert zu dauerhaften, editierbaren 3D-Szenen. Nvidia tendiert zu physikalischer Genauigkeit für Roboter und Fahrzeuge. Zusammen definieren sie die aktuelle Form dieser Kategorie.
World Models im Vergleich zu LLMs
| World Models | Large Language Models | |
|---|---|---|
| Lernt aus | Video-, Simulations- und Roboterinteraktionsdaten, gekoppelt mit Aktionen | Text, Code und anderer geschriebener Sprache |
| Sagt vorher | Den nächsten Zustand einer Umgebung (visuell, räumlich, physisch) | Das nächste Token in einer Textsequenz |
| Ausgabe | Begehbare Umgebungen, Video oder Aktionstrajektorien | Text, Code, strukturierte Daten |
| Kernstärke | Räumliches und physisches Denken, "Was-wäre-wenn"-Simulation | Sprachliches Denken, Wissenssynthese, Konversation |
| Interaktivität | Reagiert in Echtzeit auf Aktionen (bei führenden Modellen) | Reagiert auf Prompts, nicht auf physische Aktionen |
| Typischer Einsatz heute | Robotertraining, Spiel-/Welterzeugung, räumliches Design | Chatbots, Coding-Assistenten, Dokumentenanalyse, Suche |
| Reifegrad 2026 | Früh: wenige Minuten Konsistenz, begrenzter Einsatz | Ausgereift: breit im produktiven Einsatz |
Grenzen von World Models
World Models entwickeln sich schnell weiter, sind aber noch weit von einer ausgereiften Technologie entfernt.

- Kurze Konsistenzfenster. Genie 3 hält eine kohärente Welt für einige Minuten aufrecht, nicht Stunden. Lang laufende Simulationen driften weiterhin ab oder verlieren an Kohärenz.
- Hohe Rechenkosten. Das Training mit zig Billionen Tokens an Video- und Simulationsdaten sowie die Echtzeitgenerierung mit nutzbaren Bildraten erfordern deutlich mehr Rechenleistung als das Training eines Textmodells vergleichbaren Anspruchs.
- Unvollkommene Physik. Diese Modelle lernen Physik statistisch, anhand von Beispielen, nicht anhand erster Prinzipien. Sie können weiterhin Szenen erzeugen, in denen sich Objekte auf eine Weise verhalten, die nicht mit der realen Mechanik übereinstimmt.
- Spärliche Daten zur Interaktion mit der realen Welt. Text ist online im Überfluss vorhanden. Hochwertiges Video, gekoppelt mit präzisen Aktionsdaten (insbesondere von echten Robotern), ist vergleichsweise knapp und teuer zu erfassen.
- Noch kein gemeinsamer Benchmark. Anders als Sprachmodelle, für die es Dutzende standardisierter Bewertungen gibt, verfügen World Models noch nicht über eine vereinbarte Methode, um zu messen, "wie gut" eine Simulation ist, was Anbietervergleiche für Käufer erschwert.
- Sim-to-Real-Lücke. Eine Roboter-Policy, die in einer simulierten Welt einwandfrei funktioniert, kann in der Fabrikhalle dennoch versagen, wenn die Simulation eine reale Variable übersehen hat. Daher benötigt das Simulationstraining weiterhin eine Validierung in der realen Welt.
Wichtige Fakten: World Models in Zahlen
- Googles DeepMind Genie 3 erzeugt in Echtzeit begehbare Welten in 720p und 24 Bildern pro Sekunde, mit einem visuellen Gedächtnis von etwa einer Minute, um die Welt konsistent zu halten, während Sie sich durch sie bewegen. Quelle: Google DeepMind
- Nvidias Weltfundamentmodell Cosmos 3 wurde mit rund 20 Billionen Tokens multimodaler Daten trainiert, darunter fast eine Milliarde Bilder und 400 Millionen reale und synthetische Videos. Quelle: Nvidia Newsroom
- World Labs, gegründet von Fei-Fei Li, sammelte im Februar 2026 rund 1 Milliarde US-Dollar ein, darunter 200 Millionen US-Dollar von Autodesk, womit sich die Gesamtfinanzierung auf etwa 1,23 Milliarden US-Dollar erhöhte. Quelle: TechCrunch
- Die Bewertung von World Labs stieg Berichten zufolge von 1 Milliarde US-Dollar bei der Gründung 2024 auf rund 5 Milliarden US-Dollar bis Januar 2026, innerhalb von etwa sechzehn Monaten. Quelle: Bloomberg
- Runway sammelte im Februar 2026 in einer Series-E-Runde 315 Millionen US-Dollar bei einer Bewertung von 5,3 Milliarden US-Dollar ein, teilweise vorgesehen für das Vortraining der nächsten Generation seiner World Models. Quelle: TechCrunch
- Generative AI, die übergeordnete Kategorie, zu der World Models gehören, wuchs 2025 um mehr als 200 % bei privaten Investitionen und vereinte fast die Hälfte aller privaten KI-Finanzierungen weltweit auf sich. Quelle: Stanford HAI, 2026 AI Index Report
Auswirkungen auf Unternehmen und Branchen
Für die meisten Unternehmen sind World Models kein kurzfristiger Posten, aber aus mehreren Gründen lohnt es sich, sie im Blick zu behalten.

Robotik und Fertigung sind die klarsten frühen Nutznießer. Wenn Ihr Unternehmen auf physische Automatisierung, Lagerrobotik oder autonome Fahrzeuge angewiesen ist, werden World Models still und leise zur Standardmethode, mit der Anbieter die synthetischen Trainingsdaten erzeugen, die diese Systeme benötigen, was sich in den nächsten Jahren in schnelleren Einführungszyklen und weniger kostspieligen Fehlschlägen beim Training in der realen Welt niederschlagen dürfte.
Räumliche und kreative Branchen (Architektur, Immobilien, Gaming, Industriedesign, Film) erhalten ein unmittelbareres Werkzeug: ein Foto, eine Skizze oder einen Text-Prompt in einen begehbaren 3D-Raum zu verwandeln, genau das Versprechen hinter Marble von World Labs. Das verkürzt den Weg zwischen "Idee" und einem Rundgang, den Sie tatsächlich bewerten können.
Jeder, der agentische KI entwickelt oder einsetzt, sollte diesen Bereich im Auge behalten, auch wenn er nie mit einem Roboter zu tun hat. Wenn Agenten irgendwann Zugang zu einer internen "Vorstellungskraft" erhalten, also der Fähigkeit, das Ergebnis eines Plans zu simulieren, bevor sie ihn ausführen, verändert das, was Unternehmen vernünftigerweise an einen Agenten delegieren können, gegenüber dem, was weiterhin eine menschliche Prüfung erfordert.
Budgetseitig sollten Sie World Models wie jede vorproduktive Technologie behandeln: vielversprechend, gut finanziert und noch nicht geeignet, um einen kritischen Workflow darauf aufzubauen. Der Rechen- und Datenbedarf ist erheblich, die Konsistenzfenster werden noch in Minuten gemessen, und es gibt noch keine standardisierte Methode, um das World Model eines Anbieters mit dem eines anderen zu vergleichen. Beobachten Sie den Bereich, pilotieren Sie eng begrenzt, wenn er für Ihre Branche direkt relevant ist, und setzen Sie 2026 keinen Kernprozess darauf.
Häufig gestellte Fragen zu World Models in AI
Was ist ein World Model in der KI?
Ein World Model ist ein KI-System, das darauf trainiert ist, eine interne Simulation einer Umgebung aufzubauen, indem es lernt, wie sich Objekte, Akteure und Raum verhalten, um vorherzusagen, was nach einer bestimmten Aktion als Nächstes passiert. Es ist die Technologie hinter Tools wie Google DeepMinds Genie 3 und Marble von World Labs.
Wie unterscheidet sich ein World Model von einem Large Language Model?
Ein Large Language Model sagt das nächste Wort in einem Text voraus. Ein World Model sagt den nächsten Zustand einer Umgebung voraus, visuell, räumlich oder physisch, basierend auf dem aktuellen Zustand und einer Aktion. LLMs denken über Sprache nach; World Models denken über Raum und Zeit nach.
Ist Sora ein World Model?
Sora und ähnliche Text-zu-Video-Tools teilen einige zugrunde liegende Techniken mit World Models, da beide lernen, kohärente zukünftige Bilder vorherzusagen. Der Unterschied, den die meisten Forscher ziehen, ist die Interaktivität: Ein World Model reagiert nahezu in Echtzeit auf laufende Nutzeraktionen, während ein Standard-Videogenerator aus einem einzelnen Prompt einen festen Clip erzeugt.
Warum investieren Google, Nvidia und Runway gerade jetzt alle in World Models?
Jedes Unternehmen zielt auf eine andere Anwendung ab. Google DeepMind baut mit Genie 3 universell einsetzbare interaktive Welten. Nvidias Cosmos-Plattform zielt auf synthetische Trainingsdaten für Roboter und autonome Fahrzeuge ab. Runway erweitert sein Geschäft mit Videogenerierung um dauerhafte, steuerbare simulierte Umgebungen. Alle drei sehen in World Models die nächste große Fähigkeitsebene nach Sprach- und Bildgenerierung.
Wofür werden World Models in der Robotik eingesetzt?
World Models erzeugen große Mengen realistischer, physikalisch plausibler Trainingsszenarien in der Simulation, sodass Ingenieure das Verhalten von Robotern trainieren und testen können, ohne die Kosten, den Zeitaufwand und das Risiko Tausender realer Versuch-und-Irrtum-Durchläufe. Nvidias Cosmos-Plattform ist gezielt auf diesen Anwendungsfall ausgerichtet.
Wie lange kann ein World Model eine konsistente Umgebung aufrechterhalten?
Stand 2026 halten führende Modelle wie Genie 3 eine kohärente, begehbare Welt für einige Minuten am Stück aufrecht, nicht für Stunden. Die Erweiterung dieses Konsistenzfensters ist eine der wichtigsten offenen technischen Herausforderungen in diesem Bereich.
Stehen World Models im Zusammenhang mit AGI?
Einige Forscher, darunter Fei-Fei Li, argumentieren, dass fundiertes räumliches und physisches Verständnis ein fehlendes Puzzleteil auf dem Weg zu allgemeinerer KI ist, da Sprache allein einem Modell nicht beibringt, wie sich die physische Welt tatsächlich verhält. World Models sind eine der konkreteren Wetten der Branche darauf, diese Lücke zu schließen, auch wenn sie nach wie vor ein früher, unbewiesener Schritt auf diesem Weg sind und keine ausgemachte Antwort.
Was ist Marble von World Labs?
Marble ist das World Model von World Labs, gegründet von Fei-Fei Li, das Text-Prompts, Fotos, Videoclips oder grobe 3D-Layouts in dauerhafte, editierbare, begehbare 3D-Umgebungen umwandelt, ausgerichtet auf Branchen wie Architektur, Gaming und Design.
Sollte mein Unternehmen jetzt in World-Model-Technologie investieren?
Für die meisten Unternehmen lohnt es sich, World Models eher zu beobachten als heute bereits einzuführen. Derzeit sind sie vor allem für Robotik, autonome Fahrzeuge und räumliches Design relevant. Für die meisten anderen Funktionen ist die Technologie noch früh: kurze Konsistenzfenster, hohe Rechenkosten und noch keine standardisierten Benchmarks machen sie eher zu einer Kategorie zum "genau beobachten" als zum "jetzt darauf aufbauen".
Verwandte Ressourcen
Erkunden Sie diese verwandten Konzepte, um Ihr Verständnis von World Models zu vertiefen:
- Large Language Models (LLMs) - Wie sich textbasierte KI von World Models unterscheidet
- KI-Agenten - Wie agentische Systeme World Models nutzen könnten, um vorauszuplanen
- Multimodale KI - KI, die mehrere Datentypen verarbeitet, eine Grundlage, auf der viele World Models aufbauen
- Diffusionsmodelle - Die Bild- und Videogenerierungstechnik, die vielen World-Model-Architekturen zugrunde liegt
- Reinforcement Learning - Wie Agenten aus simulierten Umgebungen lernen, eng verbunden mit dem Training von World Models
- Generative KI - Die übergeordnete Kategorie von KI, die neue Inhalte erzeugt, einschließlich simulierter Welten
- Transformer-Architektur - Das technische Rückgrat hinter Modellen wie Genie 3
- Foundation Models - Die großen, universell einsetzbaren Modelle, auf denen sowohl World Models als auch LLMs aufbauen
- Computer Vision - Wie KI die visuellen Daten interpretiert, mit denen World Models trainiert werden
Externe Ressourcen
- Google DeepMind - Genie 3: A New Frontier for World Models - Offizielle Ankündigung und technische Details
- Nvidia Newsroom - Nvidia Launches Cosmos 3 - Nvidias Weltfundamentmodell für Physical AI
- TechCrunch - World Labs Lands $200M From Autodesk - Finanzierung von World Labs und Details zum Produkt Marble
- Stanford HAI - 2026 AI Index Report, Economy Chapter - Die oben zitierten Investitionsdaten zu generativer KI
Teil der AI Terms Collection. Zuletzt aktualisiert: 2026-07-16

Co-Founder, Rework.com