Was ist ein Vision-Language-Action-Modell (VLA), und wer entwickelt es?
Ein Vision-Language-Action-Modell (VLA) ist ein einzelnes neuronales Netz, das Kamerabilder und eine Anweisung in natürlicher Sprache liest und daraus die nächsten Motorbefehle eines Roboters erzeugt; es entsteht, indem ein Bild-Sprach-Modell mit Roboterdemonstrationen weitertrainiert wird. Google DeepMind, Physical Intelligence, NVIDIA, Figure AI und Skild AI führen, Europa setzt auf NEURA, Humanoid und Genesis AI, und entschieden wird das Rennen zunehmend über die Kosten von Handlungsdaten.