Synthetisches VLA-Training und Fortschrittsausrichtung für szenenweite Luftmanipulation
In einem Preprint wird ein Framework vorgestellt, das lokale Vision-Language-Action-Verhalten für einen artikulierten Luftmanipulator synthetisch trainiert und über einen relationalen Szenengraph zu szenenweiten Missionen komponiert. Die lokale VLA-Politik erreicht unter Orakelbedingungen 65,0 % Erfolg, das Gesamtsystem schafft 42,0 % der simulierten Multi-Site-Missionen, und die gemessene Fortschrittsausrichtung MPAR reduziert den Phasenfehler bei 500 ms Latenz um 0,212 s. Erste physische Versuche bestätigen die Ausführbarkeit ohne Demonstrationen auf der Zielplattform.