Das Freiburger KI-Unternehmen Black Forest Labs erweitert sein Portfolio um physische Steuerungssysteme: Mit FLUX 3 Action hat das Team ein quelloffenes 7-Milliarden-Parameter-Weltaktionsmodell (World Action Model, WAM) vorgestellt, das Kamerasignale und Roboterzustände direkt in feinmotorische Aktionen übersetzt. Anders als klassische Bild- oder Videogeneratoren prognostiziert das System nicht nur zukünftige Pixel, sondern verknüpft die visuelle Zukunftsvorhersage mit konkreten Steuerbefehlen für Roboterarme, Drohnen und virtuelle Spielumgebungen. Nach der Vorstellung der FLUX-3-Familie im Juli 2026 folgt damit die erste praxisreife Veröffentlichung für die Robotik, flankiert von frei zugänglichen Modellgewichten auf Hugging Face.

Weltmodelle versus VLA: Warum Vorhersage die Robotik verändert

Bisherige Ansätze zur Steuerung von Manipulatoren basieren häufig auf Vision-Language-Action-Modellen (VLA wie π0.5 oder Google RT-2). Diese übersetzen aktuelle Kamerasensoren direkt in Positionskorrekturen, ohne jedoch ein internes Modell darüber zu besitzen, wie sich die physikalische Umwelt durch die eigene Handlung verändert. World Action Models (WAM) gehen einen Schritt weiter: Sie generieren im selben neuronalen Durchlauf sowohl die zukünftigen Videobilder als auch die dazugehörigen Steuerungsbefehle. Das Modell simuliert mental, was im nächsten Moment geschehen wird, und gleicht die motorische Trajektorie kontinuierlich damit ab.

Bisher galt dieser Ansatz als extrem rechenintensiv. Das konkurrierende System Cosmos 3 Nano von Nvidia benötigt mit 16 Milliarden Parametern mehr als das doppelte Modellvolumen und beansprucht auf einem B200-Grafikprozessor rund 4,7-mal so viel Rechenzeit pro Sekunde Roboterbewegung wie schlanke VLA-Modelle. Black Forest Labs will diesen Zielkonflikt auflösen: FLUX 3 Action halbiert die Parameteranzahl auf 7 Milliarden und läuft laut Herstellerangaben je nach Inferenz-Konfiguration bis zu 3,95-mal schneller als Cosmos 3 Nano, ohne die gemeinsame Vorhersage von Video und Bewegung aufzugeben.

Benchmark-Rekord auf RoboLab-120 und Verifikation im Labor

In der Simulationsumgebung RoboLab-120, einem standardisierten Testparcours für allgemeine Aufgaben in der Robotik, erzielte FLUX 3 Action eine Erfolgsquote von 42,92 Prozent. Es verweist damit Cosmos 3 Nano (36,8 Prozent) sowie das derzeit führende offene VLA-Modell π0.5 (28,0 Prozent) auf die Plätze. Selbst geschlossene Forschungsmodelle wie OASIS WAM (39,0 Prozent) schneiden schwächer ab.

Um die Praxistauglichkeit abseits von Simulationen zu belegen, beauftragte das Unternehmen das Robotik-Labor Positronic Robotics mit einer verblindeten Testreihe an einem echten Franka-Emika-Roboterarm. Über zehn verschiedene Alltagsaufgaben aus dem DROID-Datensatz - darunter das Einräumen von Schwämmen, das Sortieren von Bechern und das Schließen von Schubladen - meisterte FLUX 3 Action 28 von 30 Versuchen (93,3 Prozent). Zum Vergleich: Cosmos 3 Nano erreichte im selben Versuchsaufbau 90,0 Prozent, während π0.5 bei 43,3 Prozent lag. Über die klassische Industriemanipulation hinaus demonstrierte das Freiburger Team Anpassungen an reale Drohnenflüge sowie an den Videospiel-Klassiker Doom, in dem die Steuerungsrichtlinie das visuelle Geschehen analysierte und die Spielfigur ohne virtuellen Tod durch die Level navigierte.

Destillation: 1-Schritt-Inferenz für Echtzeit-Einsätze

Die zentrale technische Hürde bei diffusionsbasierten Steuerungen liegt in der Latenz. Um Roboter im Takt von 15 Hertz flüssig zu bewegen, nutzt Black Forest Labs zwei aufeinander aufbauende Destillationsverfahren:

  • Guidance Distillation: Bei Diffusionsmodellen erfordert die Steuerbarkeit (Classifier-Free Guidance) normalerweise zwei Vorwärtsdurchläufe pro Zeitschritt. Durch das Destillieren in ein Schülermodell entfällt der ungesteuerte Durchlauf, was die Latenz halbiert und die Erfolgsquote im Testfeld stabil bei 42,24 Prozent hält.
  • Step Distillation: Reduziert die erforderlichen Abtastschritte von vier auf einen einzigen Vorwärtsschritt. Die Rechenzeit pro Aktionsblock - der 32 aufeinanderfolgende Aktionen beziehungsweise einen Bewegungshorizont von 2,13 Sekunden abdeckt - schrumpft auf 32,29 Millisekunden auf Nvidia B200 (FP8) und rund 43 Millisekunden auf H200-Chips.

Auf Hugging Face hat Black Forest Labs die Gewichte unter einer offenen Lizenz bereitgestellt. Die Sammlung umfasst neben der Basisarchitektur (flux-3-action-base) vortrainierte Gewichte für die industrielle DROID-Plattform sowie für den Open-Hardware-Roboterarm SO-101, der direkt mit Hugging Faces Robotik-Bibliothek LeRobot kompatibel ist.

Hybrid-Systeme: Zusammenspiel mit Denk-Modellen

Trotz der hohen Bewegungspräzision stoßen reine Aktionsmodelle an Grenzen, wenn es um übergeordnete Logik geht. Während FLUX 3 Action Bausteine mühelos greifen und stapeln kann, scheitert es gelegentlich an mehrstufigen Handlungsanweisungen wie dem Sortieren nach einer exakten Farbreihenfolge. Hochkomplexe Denk-Modelle wie GPT 6 Astra lösen derartige Logikaufgaben zwar fehlerfrei, verursachen jedoch Kosten von über 13 US-Dollar und Bedenkzeiten von rund 16 Minuten pro Erfolgsdurchlauf.

In einer Untersuchung hybridisierter Architekturen delegierte GPT 6 Astra die Ausführung an FLUX 3 Action und griff nur korrigierend ein, wenn der Roboterarm vom Farbplan abzuweichen drohte. Dieses Teamspiel reduzierte die Rechenkosten pro gelöster Aufgabe auf 8,77 US-Dollar und die Zeit auf rund 8 Minuten - ein Kostenvorteil von fast 30 Prozent gegenüber bisherigen Hybridkombinationen mit π0.5 bei einer Erfolgsquote von 90 Prozent.

Praxis-Einschätzung & Handlungsempfehlungen:

1. Einstieg über LeRobot: Für Entwicklungsabteilungen und Forschungsgruppen im DACH-Raum bietet der Checkpoint für den SO-101-Arm einen kostengünstigen Einstieg, um vortrainierte Weltmodelle auf eigener Labor-Hardware ohne teure Großrechner zu erproben.

2. Hybrid-Architekturen priorisieren: Statt Roboter vollständig über teure Denk-APIs zu steuern, sollten Unternehmen auf zweistufige Systeme setzen: Schnelle lokale Aktionsmodelle wie FLUX 3 Action übernehmen die Ausführung im Millisekundenbereich, während zentrale Sprachmodelle lediglich als strategische Aufsicht fungieren.

3. Lokale Inferenz mit FP8: Durch die 1-Schritt-Destillation lässt sich das 7B-Modell mit moderner 8-Bit-Quantisierung (FP8) auf Workstations mit Einzel-GPUs (wie RTX 6000 Ada oder 5090) mit Latenzen unter 50 Millisekunden betreiben.

Dieser Artikel enthält eingebettete Inhalte externer Anbieter, etwa Videos oder Social-Media-Beiträge. kiwoche.com ordnet diese Inhalte redaktionell ein, übernimmt sie jedoch nicht als eigene Inhalte. Die Rechte daran verbleiben bei den jeweiligen Rechteinhabern; für die externen Inhalte sind die jeweiligen Anbieter verantwortlich. Eingebettete Inhalte können vollständig oder teilweise mit KI erstellt oder bearbeitet worden sein.

📰 Quellen
BFL Research Report ↗ Hugging Face Collection ↗ Black Forest Labs auf X ↗
Teilen: