Bisherige multimodale KI-Systeme basieren fast ausnahmslos auf einem Flickenteppich spezialisierter Werkzeuge: Ein zentrales Sprachmodell analysiert den Nutzerauftrag, plant Zwischenschritte und delegiert Aufgaben über Schnittstellen an separate Bildgeneratoren, Videonetzwerke oder Roboter-Controller weiter. Jeder dieser Übergänge kostet wertvolle Latenzsekunden, zerstückelt den Gesamtkontext und führt bei komplexen Workflows regelmäßig zu Informationsverlusten. Das KI-Forschungsunternehmen Reka AI bricht diesen klassischen Aufbau nun radikal auf: Mit der Vorstellung von Rho-1 präsentiert das Team eine Research Preview eines 19 Milliarden Parameter schweren Omni-Reasoning-Modells, das Text, Standbilder, Video und motorische Roboterbefehle in einem einzigen neuronalen Netzwerk vereint.

Das von ehemaligen Forschern von Google DeepMind und Meta gegründete Startup demonstriert damit einen grundlegenden Architekturwechsel. Anstatt wie bisherige Vision-Language-Modelle nur Daten aufzunehmen oder wie reine Diffusionsmodelle lediglich Pixel auszugeben, arbeitet Rho-1 vollständig symmetrisch: Das Netzwerk liest und erzeugt dieselben fünf Modalitätskanäle nativ aus einem einzigen gemeinsamen Zustandsspeicher heraus.

Zwei Ströme in einem gemeinsamen Aufmerksamkeitsraum

Die technologische Grundlage von Rho-1 bildet eine zweigeteilte Transformer-Architektur. Innerhalb jedes einzelnen Transformer-Blocks wird die Rechenleistung auf zwei spezialisierte Gewichtungsströme aufgeteilt: einen Understanding-Stream für Sprachlogik, Schlussfolgerungen und visuelle Analyse sowie einen Generation-Stream, der latente Zustände schrittweise zu Bildern, Videosequenzen oder physischen Bewegungstrajektorien entrauscht.

Entscheidend ist dabei, dass beide Stränge nicht isoliert arbeiten, sondern über denselben Key-Value-Cache (KV-Cache) miteinander verknüpft sind. Nutzereingaben, Denkpfade (Chain of Thought), vorangegangene Videobilder und ausgegebene Motorikbefehle sammeln sich in einem gemeinsamen Repräsentationsraum an. Wenn eine Antwort eine visuelle Erzeugung erfordert, setzt der Verstehensstrom einen diskreten Übergabetoken ab. Ohne jegliche Schnittstellen-Latenz übernimmt der Generationsstrom daraufhin exakt den bisherigen Kontext und beginnt mit dem Rendern.

Eigenschaft Klassische Multi-Agenten-Pipeline Reka Rho-1 Omni-Architektur
Systemaufbau LLM-Planer steuert getrennte Spezialmodelle Ein einziges neuronales Netzwerk für alle Aufgaben
Kontextfluss Starker Informationsverlust an API-Grenzen Einheitlicher KV-Cache über alle Modalitäten hinweg
Signalrepräsentation Fragmentiert in getrennte Formate und Wrapper Diskrete Tokens (Text/Logik) und kontinuierliche Tokens (Bild/Aktion)
Trainingsziele Modelle werden unabhängig voneinander trainiert Parallele End-to-End-Optimierung (Next-Token & Flow Matching)
Startlatenz Video Rund 14 Sekunden (Routing, Prompt-Expansion, Queue) Rund 6 bis 7 Sekunden (Basis) bzw. 1 Sekunde (distilliert)

Auch das Training erfolgt simultan über zwei Zielvorgaben: Next-Token-Prediction für diskrete Symbolketten wie Text oder Bounding-Box-Koordinaten und Flow Matching für kontinuierliche Repräsentationen wie Bildpixel und Gelenkwinkel von Robotern. Laut Reka profitieren die Fähigkeiten wechselseitig voneinander: Verbessert das Modell sein räumliches Verständnis während des Text- und Logiktrainings, steigt messbar auch die visuelle Konsistenz generierter Videosequenzen.

Fünf Arbeitsschritte in einer einzigen Unterhaltung

In einer ungekürzten Sitzung demonstrieren die Entwickler die praktische Auswirkung dieses Ansatzes: In einem ersten Schritt zeichnet Rho-1 auf Anweisung eine Küstenszene mit einem rot-weiß gestreiften Leuchtturm. Direkt danach fordert der Nutzer das Modell auf, eine Markierungsbox um den Leuchtturm zu ziehen. Da die Szene bereits als nativer Zustand im Modellkontext liegt, ermittelt Rho-1 die Koordinaten direkt ohne zwischengeschaltetes Objekterkennungsmodell.

Im dritten Schritt animiert Rho-1 dieselbe Szene zu einem Kameraflug. Weil der erste Frame keine neu komprimierte Bilddatei ist, sondern direkt aus dem latenten Speicher fortgeführt wird, bleiben Lichtführung und Geometrie stabil erhalten. Im vierten Schritt verändert ein Prompt das Wetter in einen dichten Schneesturm, während Kamerapfad und Gebäude unverändert bleiben. Auf die abschließende Frage, was sich zwischen beiden Clips verändert habe, liest Rho-1 die Antwort direkt aus den Differenzen des latenten Zustands ab, anstatt eine nachträgliche Bilderkennung über exportierte Videobilder laufen zu lassen.

Geschwindigkeitsmessungen des Anbieters zeigen deutliche Unterschiede: Während eine herkömmliche Pipeline mit mehreren Spezialmodellen rund 13,8 Sekunden bis zum ersten Videoclip benötigt, liefert das 19B-Basismodell von Rho-1 ein abspielbares Ergebnis nach 7,0 Sekunden (bei einer Mediane-Generierungsrate von 0,79-facher Echtzeit). Eine auf acht Denoising-Schritte distillierte Variante erzeugt einen 5,3 Sekunden langen Videoclip sogar in rund einer Sekunde.

Vom Weltmodell zur physischen Robotersteuerung

Über reine Medienbearbeitung hinaus zielt die Architektur auf interaktive Weltmodelle und Robotik ab, ähnlich wie es Forscher bei räumlichen Weltmodellen wie Fei-Fei Lis Atlas oder Gründungsmodellen wie Odyssey 3 anstreben. Da Rho-1 kontinuierlich Stream an Stream anfügen kann, läuft die interne Simulation ohne Unterbrechung weiter. Nutzer können das Geschehen während der Generierung live steuern - etwa indem eine Drohne mitten im Flug nach links oder rechts abbiegt.

Für die Robotik bedeutet die gemeinsame Tokenisierung von Video und Motorik, dass Planung und Ausführung im selben Rechenschritt zusammenfallen. Das Netzwerk, das die zukünftigen Bilder einer Handkamera antizipiert, steuert zeitgleich die sieben Gelenkachsen eines Greifarms auf dem LIBERO-Simulationsbenchmark. Ergänzend setzt das Labor auf ein sogenanntes Inverse Dynamics Model (IDM): Dieses analysiert herkömmliche Internetvideos, rekonstruiert die dafür notwendigen physikalischen Kontrollsignale und wandelt unbeschriftetes Videomaterial in großflächige Trainingsdaten für Roboterbewegungen um, wie man es in Ansätzen auch von FLUX 3 Action von Black Forest Labs kennt.

Grenzen des Prototyps und Ausblick

Trotz der eindrucksvollen Architektur handelt es sich bei Rho-1 um eine experimentelle Research Preview und kein fertiges Endnutzerprodukt. Reka AI benennt die aktuellen Limitationen im technischen Bericht des Unternehmens bemerkenswert transparent:

  • Struktureller Drift bei langen Simulationen: Nach etwa 30 Sekunden ununterbrochener Videoausgabe verformen sich Raumaufteilungen und physikalische Zusammenhänge, selbst wenn Texturen fotorealistisch bleiben.
  • Niedrige native Videoauflösung: Das Modell generiert Videostreams derzeit lediglich mit 672 × 384 Pixeln.
  • Fragiles Video-Editing: Gezielte Bild- und Videoanpassungen funktionieren bei maßgeschneiderten Prompts flüssig, reagieren bei breiteren Formulierungen jedoch noch unvorhersehbar.
  • Zeitliche Objektzuordnung: Das Lokalisieren und Verfolgen von Objekten über bewegte Videosequenzen hinweg ist im Gegensatz zu Standbildern noch unvollständig integriert.

Erstaunlich bleibt vor allem das Trainingsbudget: Reka hat das gesamte Modell nach eigenen Angaben mit lediglich 320 Nvidia-H100-Grafikprozessoren über drei Monate hinweg von Grund auf trainiert - ein winziger Bruchteil der Compute-Ressourcen moderner Frontier-Labore. Die Erkenntnisse sollen nun direkt in die Inferenz-Infrastruktur der Reka Cloud einfließen, um Latenz- und Speicherengpässe beim parallelen Ausführen diskreter und kontinuierlicher Rechenoperationen im Produktionsbetrieb zu minimieren.

🎯 Was das für die Praxis bedeutet

1. Ende der isolierten Tool-Chains absehbar: Unternehmen, die heute komplexe KI-Pipelines aus getrennten Sprach-, Bild- und Audio-Modellen zusammenbauen, sollten die rasante Konvergenz zu nativen Omni-Architekturen beobachten. Integrierte Modelle reduzieren Latenzen und Fehlerquellen drastisch.

2. Physische KI rückt ins Zentrum: Die Verschmelzung von multimodaler Wahrnehmung und motorischer Steuerung zeigt, dass die Trennung zwischen generativer Medien-KI und industrieller Robotik zusehends verschwindet. Weltmodelle werden zum gemeinsamen Standard für virtuelle Simulationen und physische Automatisierung.

3. Vorerst Machbarkeitsstudie statt Produktivsystem: Wegen der niedrigen Auflösung und des strukturellen Drifts nach 30 Sekunden eignet sich Rho-1 aktuell noch nicht für Produktions-Workflows. Als architektonischer Wegweiser markiert das Modell jedoch einen entscheidenden Schritt in Richtung nahtloser multimodaler Intelligenz.

Dieser Artikel enthält eingebettete Inhalte externer Anbieter, etwa Videos oder Social-Media-Beiträge. kiwoche.com ordnet diese Inhalte redaktionell ein, übernimmt sie jedoch nicht als eigene Inhalte. Die Rechte daran verbleiben bei den jeweiligen Rechteinhabern; für die externen Inhalte sind die jeweiligen Anbieter verantwortlich. Eingebettete Inhalte können vollständig oder teilweise mit KI erstellt oder bearbeitet worden sein.

📰 Quellen
Reka Blog ↗ X Post @RekaAILabs ↗ Reka Website ↗
Teilen: