DiffWAM: Video-Repräsentationen direkt in UAV-Trajektorien umsetzen
Die Autoren stellen mit DiffWAM ein System vor, das aus den Zwischenrepräsentationen eines eingefrorenen Videomodells kontinuierliche Kameratrajektorien für Drohnen ableitet, ohne zukünftige Videobilder zu generieren. Auf dem DiffWAM-1000-Benchmark erreicht das Verfahren eine Endpunkt-Erfolgsrate von 74,40 Prozent und eine Trajektorien-RMSE von 0,3492 Metern. Die Arbeit ist ein Preprint und zeigt, dass prädiktive Videomerkmale direkt für metrische Bewegungssteuerung genutzt werden können.
Können die in einem frühen Stadium eines Videogenerierungsmodells enthaltenen prädiktiven Repräsentationen direkt in kontinuierliche, metrisch korrekte Kameratrajektorien für UAVs umgesetzt werden, ohne die vollständige Videoerzeugung und geometrische Rekonstruktion zur Laufzeit durchzuführen?
Bestehende Ansätze für sprachgesteuerte UAV-Navigation nutzen entweder Videogenerierung mit anschließender Rekonstruktion oder aggregieren Merkmale aus vielen Schichten eines Videomodells. Diese Verfahren sind rechenintensiv, verlieren räumlich-zeitliche Korrespondenzen und liefern keine metrisch verankerte Trajektorie. Zudem sind VLN/VLA-Systeme auf Basis von Vision-Language-Modellen oft nicht in der Lage, kontinuierliche, strukturierte Bewegungen wie Orbit-Flüge oder Slalom-Manöver auszuführen.
Frühere Arbeiten wie NavDreamer, ImagineUAV oder WorldVLN erzeugen entweder zukünftige Videos und rekonstruieren daraus Kameraposen oder nutzen latente Weltmodelle mit diskreten Wegpunktaktionen. Fast-WAM und Faster-WAM lesen Aktionen aus aggregierten Merkmalen, verlieren aber durch globales Pooling räumliche Korrespondenzen; zudem fehlt eine geometrische Skalenreferenz. Diese Ansätze sind entweder zu langsam oder ungenau für kontinuierliche Flugmanöver.
DiffWAM liest ausgewählte frühe Merkmale (DiT-Blöcke 15, 25, 35) aus bis zu vier Denoising-Evaluationen des eingefrorenen Videomodells MiniMax H3 und fusioniert sie. Das Grid-Motion-Modul erhält räumlich-zeitliche Assoziationen, während Latent2Pose die Merkmale mit First-Frame-Geometrie des eingefrorenen MoGe2-Netzwerks kombiniert und daraus 38 zukünftige Posen (Position und Rotation) dekodiert. Training erfolgt asymmetrisch: Offline werden vollständige Video-Rollouts mit π³ rekonstruiert und mit MoGe2-Tiefen skalenkalibriert; der Student lernt, diese Trajektorien nur aus frühen Merkmalen und First-Frame-Geometrie zu reproduzieren. FastDreamer überlappt Inferenz und Flug und übergibt Trajektorien asynchron mit Zeitstempeln.
DiffWAM erzielt auf dem DiffWAM-1000-Benchmark (1.000 Stichproben) eine Endpunkt-Erfolgsrate von 74,40 Prozent, eine Trajektorien-RMSE von 0,3492 m, eine ADE von 0,3151 m, eine FDE von 0,4357 m und einen Rotationsfehler von 2,9179 Grad. Auf IndoorUAV-VLA erreicht es 56,77 Prozent und auf UAV-FLOW-Sim 91,42 Prozent. Die stärkste Baseline WorldVLN erreicht auf diesen Benchmarks 39,32 Prozent, 80,24 Prozent und 58,40 Prozent. In der Architektur-Ablation liegt DiffWAM bei RMSE und FDE um 50,19 Prozent bzw. 59,63 Prozent unter dem besten Vergleichssystem Faster-WAM. Eine Onboard-Implementierung DiffWAM-Flash erreicht auf NVIDIA Jetson AGX Thor eine P50/P95-Latenz von 1,080/1,101 Sekunden für die Modellpipeline. Reale Drohnenexperimente demonstrieren unter anderem Orbit-Flüge, S-förmige Manöver und mehrstufige Navigation.
Die Autoren weisen darauf hin, dass die Lehrertrajektorien auf rekonstruierten und skalenkalibrierten Schätzungen basieren und keine gemessene Ground-Truth darstellen. Die Endpunkt-Erfolgsrate prüft nicht die Qualität der Zwischenbewegung, und monokulare Skalenfehler können bestehen bleiben. Die Latenz von FastDreamer schließt Instruction-Rewriting und externe Kommunikation aus. Die realen Experimente sind Demonstrationen ohne quantitative Erfolgsmetriken. Es wird kein veröffentlichter Code erwähnt, und die Evaluation beschränkt sich auf einen Videobackbone und wenige reale Plattformen.
Unternehmen im Bereich Drohnen-Inspektion, Lieferung und Suche/Rettung könnten DiffWAM in 1 bis 3 Jahren nutzen, sofern die Robustheit in realen Umgebungen mit gemessenen Ground-Truth-Daten nachgewiesen wird. Die gezeigte Latenz von 1,08 Sekunden auf Jetson AGX Thor ermöglicht prinzipiell Bordbetrieb, aber Sicherheitszertifizierungen und die Integration in Flugregelungssysteme sind Voraussetzung. Kurzfristig ist der Einsatz in Forschungslaboren und zur Offline-Datengenerierung denkbar.
Der Volltext wird hier nicht wiedergegeben, weil die Lizenz der Studie das nicht erlaubt. Das Original steht auf arXiv.