Echtzeit-VLA-Inferenz: Nicht-uniformes Zwei-Stufen-Denoising spart 64 Prozent Rechenzeit
Das Paper stellt ein zweistufiges, nicht-uniformes Denoising für Flow-Matching-basierte Vision-Language-Action-Modelle vor; es reduziert die Modellinferenzzeit von 61,557 ms auf 21,956 ms, eine 2,804-fache Beschleunigung, bei vergleichbarer Aktionsfehlergröße. Zusätzlich wird ein verteiltes Echtzeit-Framework mit entkoppelten Raten für Inferenz, Aktionspublikation und Robotersteuerung entwickelt. In physischen Langzeit-Faltversuchen mit π0.5 erzielt Legato 96,7 Prozent Erfolg; die kombinierte Zwei-Stufen-Methode senkt die Erfolgsrate von Legato auf 86,7 Prozent, liefert aber deutliche Effizienzgewinne. Der Preprint motiviert die gemeinsame Optimierung von Modellinferenz und System-Timing.