Weltmodelle versprechen seit Monaten den nächsten großen Entwicklungsschritt der künstlichen Intelligenz: Sie sollen Computern und Maschinen beibringen, wie sich Objekte im dreidimensionalen Raum verhalten, wie Schwerkraft, Reibung oder Flüssigkeiten wirken und wie die reale Welt auf Aktionen reagiert. Bislang blieben die meisten dieser Systeme jedoch theoretische Forschungspapiere oder geschlossene Labordemos. Das US-Startup Odyssey ändert das nun und stellt sein Basis-Weltmodell Odyssey 3 in einer frei zugänglichen Forschungsvorschau direkt im Webbrowser zur Verfügung.

Nur drei Wochen nachdem das von Oliver Cameron und Dr. Jeff Hawke geführte Unternehmen Odyssey 3 als universelle Basis für Roboterarme, autonome Fahrzeuge und Spielfiguren angekündigt hatte, folgt nun der praktische Härtetest. Über die kostenlose Forschungsvorschau können Nutzer eigene Textbeschreibungen eingeben, dreidimensionale Szenen generieren und sich anschließend mit Tastatur und Maus in Echtzeit durch die virtuelle Umgebung bewegen.

Vom statischen Video zur interaktiven Physik-Simulation

Klassische Videomodelle wie Runway oder OpenAI Sora berechnen einen festen Filmclip von wenigen Sekunden Länge. Der Betrachter kann das Geschehen nach dem Start nicht mehr beeinflussen. Odyssey verfolgt einen grundlegend anderen Ansatz: Das Modell fungiert als dynamisches System, das fortlaufend die nächsten Zustände einer Umgebung vorhersagt, während ein menschlicher Nutzer oder ein KI-Agent darin agiert.

In der Browser-Vorschau lässt sich die erzeugte Welt aus drei verschiedenen Blickwinkeln erkunden: aus der Ego-Perspektive (First-Person), aus der Verfolger-Perspektive (Third-Person) oder über eine völlig freie Kamerabewegung. Während der laufenden Simulation können Anwender neue Ereignisse oder Steuerbefehle einspeisen und beobachten, wie die virtuelle Physik darauf reagiert.

Wie sich das in der Praxis anfühlt, zeigen erste Reaktionen aus der Entwickler-Community. Ein Software-Entwickler demonstrierte auf X in einer kurzen Zusammenfassung, wie das System auf unvorhergesehene Eingaben reagiert und Bewegungsabläufe flüssig berechnet:

Spitzenplatz im DeepMind-Benchmark Physics-IQ

Neben der interaktiven Web-Vorschau liefert Odyssey in seinem technischen Bericht zum Launch detaillierte Messergebnisse zur physikalischen Genauigkeit. Auf dem Prüfstand Physics-IQ Verified, der von Anates Labs gemeinsam mit Google DeepMind entwickelt wurde, erzielte die leistungsstärkste Variante Odyssey-3 Pro einen Wert von 66,1 Punkten im Video-to-Video-Vergleich. Laut der offiziellen Rangliste vom 7. Oktober 2026 ist das der höchste bislang dokumentierte Wert.

Physics-IQ prüft gezielt, ob ein Modell die Grundgesetze der realen Natur versteht. Dazu gehören Festkörpermechanik, Fluiddynamik, Optik, Magnetismus und Thermodynamik. Die Modelle erhalten Videoclips realer physikalischer Experimente und müssen vorhersagen, wie das Experiment im nächsten Moment weitergeht. Im Standbild-zu-Video-Test (Image-to-Video) kam Odyssey-3 Pro auf 54,7 Punkte.

Auch im WorldMark-Benchmark, der das Befolgen von Steuerbefehlen, Bildqualität und das räumliche Gedächtnis misst, schneidet das Modell stark ab. In unternehmenseigenen Tests belegte Odyssey 3 in drei von vier Kategorien den ersten Platz - darunter in stilisierten First-Person-Szenen mit 77,2 Punkten, womit es konkurrierende Systeme wie LingBot-World (77,0) und AlayaWorld (76,7) knapp hinter sich ließ.

Modellarchitektur im Überblick

Diffusions-Transformer als Basis: Odyssey 3 nutzt einen autoregressiven Video-Diffusions-Transformer, der zeitlich aufgelöste Steuersignale verarbeitet.

Kausale Maskierung: Das System lernt über Teacher Forcing und Kausal-Masken, direkt an vorherige Beobachtungen anzuknüpfen.

Destillation für Echtzeit: Damit das Modell im Browser flüssig reagiert, kombiniert Odyssey Distribution-Matching mit gegnerischer Destillation (Adversarial Distillation).

Drei Modellstufen für unterschiedliche Anforderungen

Um sowohl rechenintensive Präzisionssimulationen als auch flüssige Web-Demos zu ermöglichen, teilt Odyssey die Modellfamilie in drei Versionen auf:

Modell Auflösung Schwerpunkt Physics-IQ (V2V) Zugang
Odyssey-3 Flash 832 × 480 Maximale Reaktionsschnelligkeit, wenige Rechenschritte Auf Latenz optimiert Kostenlos im Browser
Odyssey-3 (Standard) 832 × 480 Günstige Simulationen bei 1 $ / GPU-Stunde (MI355X) Hohe Kosteneffizienz API auf Anfrage
Odyssey-3 Pro 1280 × 720 Höchste physikalische Genauigkeit für Forschung und Training 66,1 Punkte (SOTA) API auf Anfrage

Interessant ist der wirtschaftliche Ansatz: Odyssey kalkuliert die Betriebskosten der Standardversion auf Basis von AMD Instinct MI355X-Beschleunigern mit rund einem Dollar pro GPU-Stunde. Damit will das Unternehmen die Kosten pro generierter Simulationsminute drastisch senken, um Trainingsumgebungen für Roboter und autonome Agenten im industriellen Maßstab bezahlbar zu machen.

Virtuelle Trainingsräume für künftige KI-Agenten

Das langfristige Ziel des Startups geht weit über unterhaltsame Browser-Demos hinaus. Odyssey positioniert sein Weltmodell als universelle Trainingsumgebung für künstliche Intelligenz. Autonome Agenten können darin gefahrlos und ohne Verschleiß physische Fähigkeiten erlernen, bevor sie auf teure Fabrikroboter oder Testfahrzeuge aufgespielt werden.

In internen Versuchen demonstrierte das Team bereits, wie sogenannte Action-Decoder an das eingefrorene Basismodell angedockt werden. Mit nur wenigen Dutzend Stunden an Demonstrationsdaten lernten Roboterarme komplexe Greifaufgaben und führten sogar selbstständige Korrekturmanöver durch, wenn ein Gegenstand aus der Fassung rutschte. Ähnliche Ansätze verfolgen auch Konkurrenten wie Fei-Fei Lis World Labs mit seinem Atlas-Modell oder Runway mit Worlds-2.

Trotz der beeindruckenden Benchmark-Werte bleiben Hürden bestehen: Die interaktive Vorschau nutzt die stark komprimierte Flash-Variante mit reduzierter Bildauflösung, während das hochpräzise Pro-Modell erhebliche Rechenzeit benötigt. Zudem behält Odyssey die Gewichte unter Verschluss; der Zugriff auf die Programmierschnittstelle erfolgt vorerst nur auf gesonderte Anfrage.

🎯 Was das für die Praxis bedeutet

1. Weltmodelle selbst erproben: Die kostenlose Browser-Vorschau ermöglicht es Produkt- und Technik-Teams erstmals, das Potenzial interaktiver Physiksimulationen ohne eigene Hardware-Cluster auszuwerten.

2. Günstigere Trainingsdaten für Robotik: Wenn Simulationen auf moderner Beschleuniger-Hardware für rund einen Dollar pro GPU-Stunde laufen, sinken die Erstellungskosten für synthetische Robotik-Trainingsdaten erheblich.

3. Vendor-Lock-in beachten: Da Odyssey keine Open-Source-Gewichte anbietet, begeben sich Entwickler bei einer tiefen Integration in eine proprietäre Schnittstellen-Abhängigkeit.

Dieser Artikel enthält eingebettete Inhalte externer Anbieter, etwa Videos oder Social-Media-Beiträge. kiwoche.com ordnet diese Inhalte redaktionell ein, übernimmt sie jedoch nicht als eigene Inhalte. Die Rechte daran verbleiben bei den jeweiligen Rechteinhabern; für die externen Inhalte sind die jeweiligen Anbieter verantwortlich. Eingebettete Inhalte können vollständig oder teilweise mit KI erstellt oder bearbeitet worden sein.

📰 Quellen
Odyssey Systems Blog ↗ Research Preview ↗
Teilen: