Magic-W0: Strukturiertes World-Action-Foundation-Model für physische Intelligenz
Magic-W0 ist ein als Preprint veröffentlichtes World-Action-Foundation-Model, das strukturierte Weltzustandsübergänge und kontinuierliche Aktionsgenerierung in einem einzigen Modell koppelt. Auf RoboDojo-Sim erreicht es mit einem durchschnittlichen Score von 27,10 den höchsten Wert unter den verglichenen World-Action-Models; nach Fine-Tuning auf realen Roboteraufgaben erzielt es eine durchschnittliche Erfolgsrate von 94,6 Prozent gegenüber 91,8 Prozent für π0.5. Die explizite Modellierung von 3D-Geometrie, 3D-Bewegung und Zukunftssemantik soll Generalisierung und schnelle Anpassung in komplexen Manipulationsaufgaben verbessern.
Wie lassen sich kontrollorientierte, strukturierte Repräsentationen der physischen Welt mit kontinuierlicher Aktionsgenerierung in einem einheitlichen Robotik-Foundation-Model eng koppeln?
Bestehende World-Action-Models sagen zukünftige Beobachtungen oder generische latente Zustände voraus, bilden aber keine strukturierten, für die Steuerung relevanten Weltzustände ab und koppeln Weltvorhersage und Aktionsgenerierung nicht bidirektional. Dadurch bleiben aktionsbedingte Zustandsänderungen nur implizit gelernt und statische visuelle Merkmale erfassen die zeitliche Dynamik nicht vollständig.
Frühere Ansätze umfassen aktionszentrierte VLAs wie RT-2, OpenVLA und π0.5, die Weltwissen nur implizit beim Aktionslernen aufnehmen, sowie WAMs wie DINO-WM, Fast-WAM, Unified World Models und V-JEPA 2, die zukünftige Frames oder latente Merkmale vorhersagen. Diese Verfahren rekonstruieren entweder für die Steuerung irrelevante Erscheinungsdetails oder lassen eine strukturierte, dreidimensionale und aufgabenbezogene Darstellung des Weltübergangs vermissen; zudem wird die Weltvorhersage nicht durchgehend mit der Aktionshypothese verschränkt.
Magic-W0 organisiert die Umgebungsentwicklung als Current State, Transition, Future State. Current State kombiniert VLM-Kontext mit Current 3D Geometry, Transition nutzt 3D Motion, Future State nutzt Future Semantics. Die Architektur verwendet einen Qwen3.5-2B-VLM-Backbone, einen 3D-Stream, einen semantischen Stream und einen Flow-Matching-Aktionsexperten mit layer-alignierter Joint Attention über 24 Tiefen. Aktionshypothesen konditionieren die Vorhersage zukünftiger Weltübergänge, während vorhergesagte Weltrepräsentationen die Aktionsgenerierung kontinuierlich informieren. Die Repräsentationen werden latent von frozen Track4World- und DINOv3-Lehrern überwacht. Für heterogene Daten wird ein einheitliches 34-dimensionales State-Action-Interface verwendet; vortrainiert wird auf etwa 2,014 Millionen Manipulationsepisoden aus menschlicher Ego-Perspektive, UMI, echten Robotern und Simulation sowie auf etwa 2,61 Millionen Vision-Language-Samples.
Auf RoboDojo-Sim erreicht Magic-W0 einen durchschnittlichen Score von 27,10 und eine durchschnittliche Erfolgsrate von 20,84 Prozent, der höchste Wert unter den verglichenen WAMs; der Score liegt 9,92 Punkte über OpenWAM-α. In der Dimension Generalization erreicht es Score 28,20 und SR 22,01 Prozent und übertrifft Xiaomi-Robotics-1 um 4,66 Punkte. Nach Fine-Tuning auf LIBERO beträgt die durchschnittliche Erfolgsrate 99,1 Prozent, mit 99,4 Prozent bei Spatial und 99,6 Prozent bei Goal. Auf fünf realen Roboteraufgaben mit je 100 unabhängigen Versuchen erreicht Magic-W0 eine durchschnittliche Erfolgsrate von 94,6 Prozent, verglichen mit 91,8 Prozent für π0.5; die größten Verbesserungen betreffen Object Storage von 90 auf 95 Prozent und Kitchen Storage von 91 auf 95 Prozent.
Die Autoren nennen als offene Punkte die Erweiterung auf präzise Manipulation mit geschickten Händen, die Integration von Tastsinn und Kraftsignalen sowie den zusätzlichen Rechenaufwand der mehrschichtigen World-Action-Interaktion und den Rückstand bei der Inferenzgeschwindigkeit gegenüber modernen VLA-Modellen. Im Paper nicht berichtet sind Ergebnisse zu taktilen oder kraftbasierten Aufgaben sowie eine detaillierte Latenzmessung im Vergleich zu allen Baselines.
Unternehmen aus Industrierobotik, Lager- und Haushaltsautomatisierung könnten Magic-W0 innerhalb von ein bis drei Jahren für Manipulationsaufgaben mit begrenztem Fine-Tuning nutzen, sofern Ziel-Domänendaten vorhanden sind und die Inferenzkosten gesenkt werden. Voraussetzung sind die Validierung auf weiteren Embodiments, die Integration von Tastsinn für feinmotorische Aufgaben und die Schließung der Geschwindigkeitslücke zu bestehenden VLA-Policies.
Der Volltext wird hier nicht wiedergegeben, weil die Lizenz der Studie das nicht erlaubt. Das Original steht auf arXiv.