ROBOTNESS
Branche7 Min. LesezeitROBOTNESS-RedaktionVereinigte Staaten

Was ist ein Vision-Language-Action-Modell (VLA), und wer entwickelt es?

Ein Vision-Language-Action-Modell (VLA) ist ein einzelnes neuronales Netz, das Kamerabilder und eine Anweisung in natürlicher Sprache liest und daraus die nächsten Motorbefehle eines Roboters erzeugt; es entsteht, indem ein Bild-Sprach-Modell mit Roboterdemonstrationen weitertrainiert wird. Google DeepMind, Physical Intelligence, NVIDIA, Figure AI und Skild AI führen, Europa setzt auf NEURA, Humanoid und Genesis AI, und entschieden wird das Rennen zunehmend über die Kosten von Handlungsdaten.

Was ist ein Vision-Language-Action-Modell (VLA), und wer entwickelt es? (Illustration: ROBOTNESS)
Zusammenfassung

Ein Vision-Language-Action-Modell (VLA) ist ein neuronales Netz, das Kamerabilder und eine sprachliche Anweisung wie „Leg die Tasse in die Spüle“ gemeinsam verarbeitet und die Motorbefehle ausgibt, die ein Roboter als Nächstes ausführen soll. Ausgangspunkt ist ein Bild-Sprach-Modell (VLM), wie es Fotos beschreiben kann; mit Roboterdemonstrationen weitertrainiert, liefert es statt Text Gelenkwinkel, Greiferbefehle und Fahrbewegungen.

Der Begriff kam im Juli 2023 in die Robotik, als Google DeepMind RT-2 als arXiv-Preprint vorstellte. Das Modell, trainiert auf Webbildern und Roboterdaten, erreichte bei unbekannten Objekten und Szenen laut Paper rund 62 Prozent Erfolg, doppelt so viel wie der Vorgänger RT-1 mit 32 Prozent. Drei Jahre später prägen Google DeepMind, Physical Intelligence, NVIDIA, Figure AI, Skild AI und Chinas AgiBot das Feld, und ihre Geldgeber haben einige der größten Finanzierungsrunden der Robotik gestemmt. Dieser Beitrag erklärt, wie die Modelle funktionieren, worin sie sich von klassischer Roboterprogrammierung und von Weltmodellen unterscheiden, wer vorn liegt und warum für Europas Industrie die Datenfrage wichtiger ist als die Modellarchitektur.

Wie aus Pixeln und Sätzen Motorbefehle werden

Die meisten VLA bestehen aus drei Bausteinen. Ein Vision-Encoder zerlegt jedes Kamerabild in visuelle Tokens. Ein vortrainiertes Sprach-Backbone liest diese Tokens zusammen mit der Anweisung und den Gelenkdaten des Roboters. Ein Action Head übersetzt schließlich den internen Zustand des Backbones in Stellgrößen für Gelenke, Greifer oder Räder. NVIDIA beschreibt diesen Aufbau in der Model Card von GR00T N1 genau so: ein SigLIP-2-Vision-Transformer für Bilder mit 224 mal 224 Pixeln, ein T5-Textencoder, ein kleines Netz für den Roboterzustand, das sich je nach Roboterkörper ändert, und ein Diffusions-Transformer, der die Bewegungen erzeugt.

Der Start mit einem Bild-Sprach-Modell bringt Wissenstransfer. Ein Backbone, das mit riesigen Mengen beschrifteter Webbilder trainiert wurde, kennt die meisten Gegenstände aus Haushalt und Fabrik bereits, sodass der Roboter auch mit Dingen umgehen kann, die im Robotertraining nie vorkamen. Die RT-2-Autoren berichten von 60 Prozent Erfolg bei solchen neu entstandenen Fähigkeiten, etwa dem Griff zum kleinsten Objekt auf dem Tisch, gegenüber 17 Prozent für RT-1. Offen bleibt, in welcher Form das Netz eine Bewegung überhaupt ausdrücken soll.

Tokens oder Fluss: zwei Wege zur Bewegung

Die ersten VLA behandelten Bewegungen wie Wörter. RT-2 teilte laut Paper acht Aktionsdimensionen, sechs für Position und Drehung des Greifers, eine für das Öffnen und eine für das Aufgabenende, in je 256 Stufen, sodass eine Bewegung zu einer kurzen Tokenfolge wurde. OpenVLA, ein Modell mit 7 Milliarden Parametern, das ein Team unter Führung der Stanford University im Juni 2024 mit offenen Gewichten veröffentlichte, nutzte denselben Ansatz und lag über 29 Aufgaben 16,5 Prozentpunkte vor Googles RT-2-X mit 55 Milliarden Parametern.

Für feinmotorische Arbeit sind Tokens zu langsam und zu grob. Das größte RT-2 regelte mit 1 bis 3 Hertz. Physical Intelligence koppelte bei π0, beschrieben in einem Preprint vom 31. Oktober 2024, an ein PaliGemma-Backbone mit 3 Milliarden Parametern einen eigenen Action Expert mit 300 Millionen Parametern und trainierte ihn per Flow Matching, einem Verwandten der Diffusionsverfahren aus der Bildgenerierung. Der Expert beginnt mit Zufallsrauschen und verfeinert es in zehn Schritten zu einem Block von 50 künftigen Aktionen; so steuert π0 Roboter mit bis zu 50 Hertz. GR00T N1 erledigt dieselbe Aufgabe mit einem Diffusions-Transformer.

Ein drittes Design trennt Denken und Reflex. Figure AIs Helix, vorgestellt am 20. Februar 2025, kombiniert laut Unternehmen ein Bild-Sprach-Modell mit 7 Milliarden Parametern bei 7 bis 9 Hertz mit einer Steuerung von 80 Millionen Parametern bei 200 Hertz und bedient damit 35 Freiheitsgrade auf zwei Bord-GPUs. NVIDIA nennt diese Aufteilung System 2 und System 1, und AgiBots GO-2 vom 8. September 2026 arbeitet mit einem asynchronen Doppelsystem aus langsamem Planer und schnellem Ausführungsmodul. Diese Schichtung unterscheidet ein VLA auch von der Software, die heute in Fabriken läuft.

Weder Teach-in noch Weltmodell

Klassische Industrieroboter werden Punkt für Punkt programmiert. Der Integrator lernt Wegpunkte per Handbediengerät ein oder plant die Bahn offline, und das Programm läuft unverändert, bis ein Bauteil anders liegt oder die Linie umgebaut wird. Ein VLA ersetzt dieses Skript durch eine gelernte Strategie, die in jedem Takt die Szene liest. Das macht Roboter robuster gegenüber Unordnung und neuen Teilen, kostet aber die strenge Wiederholgenauigkeit, die Zertifizierung nach Maschinenrecht einfach macht. Genau hier liegt Europas Zielkonflikt. Die EU hat KI-gesteuerte Maschinen im Juli 2026 aus der Hauptspur des AI Act genommen und Herstellern bis August 2028 Zeit gegeben, doch die Nachweispflichten der Maschinenverordnung bleiben.

Ein Weltmodell beantwortet eine andere Frage. Es sagt voraus, wie sich eine Szene verändert, meist als Video, wenn der Roboter handelt, und dient dazu, synthetische Trainingsdaten zu erzeugen oder Strategien vor dem Einsatz an echter Hardware zu prüfen. Runway gab am 30. September 2026 an, dass Ergebnisse im eigenen Weltmodell mit realen Ergebnissen zu 0,95 korrelieren. Die Ansätze wachsen zusammen. Runway nennt sein neues Praxis-1 ein World Action Model, das direkt Steuerbefehle ausgibt, und Generalist AI hat GEN-1 nach eigenen Angaben mit mehr als 500.000 Stunden Wearable-Aufnahmen menschlicher Handgriffe vortrainiert, ganz ohne Roboterdaten.

Wer baut VLA, und wer gibt sie frei

Google DeepMind stellte am 12. März 2025 Gemini Robotics auf Basis von Gemini 2.0 vor, mit Apptronik als Humanoid-Partner und der Münchner Agile Robots unter den ersten Testern; am 30. Juli 2026 folgte Gemini Robotics 2 für die Ganzkörpersteuerung von Humanoiden. Die Aktionsmodelle bleiben Partnern vorbehalten. Physical Intelligence geht den umgekehrten Weg und stellt π0, π0-FAST und seit September 2025 π0.5 im Repository openpi unter Apache-2.0-Lizenz bereit. NVIDIA veröffentlichte GR00T N1 am 18. März 2025 unter nicht kommerzieller Lizenz; das 3-Milliarden-Parameter-Modell GR00T N1.7 steht unter der NVIDIA Open Model License in Hugging Faces LeRobot-Bibliothek. Figure nutzt Helix nur für eigene Roboter, Skild AI verkauft Skild Brain und S1 über Einsätze beim Kunden.

Vision-Language-Action-Modelle im Vergleich
  • RT-2
    Entwickler
    Google DeepMind
    Erstveröffentlichung
    2023-07-28
    Parameter (Mrd.)
    55
    Offene Gewichte
    Nein (nur Partner)
  • OpenVLA
    Entwickler
    Team unter Stanford-Führung
    Erstveröffentlichung
    2024-06-13
    Parameter (Mrd.)
    7
    Offene Gewichte
    Ja
  • π0
    Entwickler
    Physical Intelligence
    Erstveröffentlichung
    2024-10-31
    Parameter (Mrd.)
    3,3
    Offene Gewichte
    Ja
  • Helix
    Entwickler
    Figure AI
    Erstveröffentlichung
    2025-02-20
    Parameter (Mrd.)
    7,08
    Offene Gewichte
    Keine Daten
  • Gemini Robotics
    Entwickler
    Google DeepMind
    Erstveröffentlichung
    2025-03-12
    Parameter (Mrd.)
    Keine Daten
    Offene Gewichte
    Nein (nur Partner)
  • GR00T N1
    Entwickler
    NVIDIA
    Erstveröffentlichung
    2025-03-18
    Parameter (Mrd.)
    2
    Offene Gewichte
    Ja (nicht kommerziell)
  • π0.5
    Entwickler
    Physical Intelligence
    Erstveröffentlichung
    2025-04-22
    Parameter (Mrd.)
    Keine Daten
    Offene Gewichte
    Ja
  • Skild Brain
    Entwickler
    Skild AI
    Erstveröffentlichung
    2025-07-29
    Parameter (Mrd.)
    Keine Daten
    Offene Gewichte
    Keine Daten
  • Gemini Robotics 2
    Entwickler
    Google DeepMind
    Erstveröffentlichung
    2026-07-30
    Parameter (Mrd.)
    Keine Daten
    Offene Gewichte
    Nein (nur Partner)
  • S1
    Entwickler
    Skild AI
    Erstveröffentlichung
    2026-08-18
    Parameter (Mrd.)
    Keine Daten
    Offene Gewichte
    Keine Daten
  • GO-2
    Entwickler
    AgiBot
    Erstveröffentlichung
    2026-09-08
    Parameter (Mrd.)
    Keine Daten
    Offene Gewichte
    Keine Daten

Erstveröffentlichung = erstes Paper, Model Card oder Firmenmitteilung. Helix = 7 Mrd. (System 2) plus 80 Mio. (System 1). Gewichte von π0.5 seit September 2025 über openpi. null = nicht offengelegt. Nur offengelegte Zahlen, keine Schätzungen.

Stand: 1. Okt. 2026

Offenheit ist Geschäftsstrategie. Laut openpi genügen für ein LoRA-Finetuning mehr als 22,5 Gigabyte GPU-Speicher, also eine RTX 4090. Für Hochschulen und mittelständische Automatisierer sinkt damit die Schwelle erheblich. Geschlossene Modelle halten Datenkreislauf und Kundenbeziehung beim Anbieter. Wirklich trennen sich die Lager bei den Datenkosten.

Der Kostenblock sind Daten, nicht Architektur

Anders als Chatbots können VLA ihre Trainingsdaten nicht aus dem Netz holen. Roboterdemonstrationen entstehen meist per Teleoperation, bei der ein Mensch den Roboter durch die Aufgabe führt. Figure trainierte Helix nach eigenen Angaben mit rund 500 Stunden Teleoperation, Physical Intelligence nutzte für π0 mehr als 10.000 Stunden aus sieben Roboterkonfigurationen und 68 Aufgaben. Skild AI rechnete im August vor, dass 380 Demonstrationen einer Aufgabe von mehr als vier Minuten 50 bis 100 Stunden Teleoperation kosten, und erklärte, sein S1-Modell erziele mit einem einzigen Video eine vergleichbare Wirkung.

NVIDIA erzeugte nach eigenen Angaben in 11 Stunden 780.000 synthetische Trajektorien, umgerechnet etwa 6.500 Stunden menschlicher Demonstration, und steigerte damit die Leistung von GR00T N1 um 40 Prozent. Auch Europas Industrie setzt auf Simulation. Wandelbots, SCHUNK und EY bündeln seit April 2026 die NOVA-Plattform, die GROW-Zelle und NVIDIA Omniverse zu einem Physical-AI-Angebot für den Mittelstand, und Siemens zählt laut NVIDIA zu den Evaluierern des On-Device-Weltmodells Cosmos 3 Edge.

Wie viele Daten die Modelle nach eigenen Angaben nutzten
  • Helix
    Entwickler
    Figure AI
    Datenart
    Teleoperation
    Stunden (offengelegt)
    500
  • π0
    Entwickler
    Physical Intelligence
    Datenart
    Roboter-Demonstrationen
    Stunden (offengelegt)
    10.000
  • π0.5
    Entwickler
    Physical Intelligence
    Datenart
    Mobile Manipulation (Teil des Mix)
    Stunden (offengelegt)
    400
  • GR00T N1
    Entwickler
    NVIDIA
    Datenart
    Synthetische Trajektorien (Stundenäquivalent)
    Stunden (offengelegt)
    6.500
  • LBM
    Entwickler
    Toyota Research Institute
    Datenart
    Roboter-Demonstrationen
    Stunden (offengelegt)
    1.700
  • GEN-1
    Entwickler
    Generalist AI
    Datenart
    Wearable-Aufzeichnungen von Menschen, keine Roboterdaten
    Stunden (offengelegt)
    500.000

Firmenmitteilungen und Paper (TRI laut arXiv-Preprint 2507.05331). Helix und π0.5 circa; π0 und GEN-1 mehr als. GR00T N1: 780.000 Trajektorien in 11 Stunden erzeugt, laut NVIDIA rund 6.500 Demonstrationsstunden, also etwa 590 Demonstrationsstunden je Stunde Generierung (6.500 / 11).

Stand: 1. Okt. 2026

Wohin das Geld fließt, auch in Europa

Skild AI sammelte im Januar 2026 1,4 Milliarden Dollar bei einer Bewertung von mehr als 14 Milliarden Dollar ein, Figure AI im September 2025 1 Milliarde Dollar bei 39 Milliarden Dollar Post-Money, Generalist AI im Juni 2026 400 Millionen Dollar, wie die Unternehmen mitteilten. Nur Skild hat Umsatz offengelegt, nach eigenen Angaben mehr als 100 Millionen Dollar wiederkehrenden Jahresumsatz und über 60 zahlende Kunden. In Europa sicherte sich NEURA Robotics aus Metzingen im Juni eine Serie C von bis zu 1,4 Milliarden Dollar, und Londons Humanoid erreichte im Juli mit 152 Millionen Dollar eine Bewertung von 1,35 Milliarden Dollar, mit Schaeffler und Bosch als Investoren.

Entwickler von Robotermodellen: zuletzt offengelegte Runden
  • Skild AI
    Runde
    Serie C
    Betrag (Mio. $)
    1400
    Post-Money (Mrd. $)
    14
    Datum
    2026-01-14
  • Figure AI
    Runde
    Serie C
    Betrag (Mio. $)
    1000
    Post-Money (Mrd. $)
    39
    Datum
    2025-09-16
  • Generalist AI
    Runde
    Wachstum
    Betrag (Mio. $)
    400
    Post-Money (Mrd. $)
    Keine Daten
    Datum
    2026-06-04
  • General Intuition
    Runde
    Venture
    Betrag (Mio. $)
    220
    Post-Money (Mrd. $)
    Keine Daten
    Datum
    2026-09-29
  • Dyna Robotics
    Runde
    Serie A
    Betrag (Mio. $)
    120
    Post-Money (Mrd. $)
    Keine Daten
    Datum
    2025-09-15
  • Genesis AI
    Runde
    Startrunde
    Betrag (Mio. $)
    105
    Post-Money (Mrd. $)
    Keine Daten
    Datum
    2025-06-30
  • Physical Intelligence
    Runde
    Serie B
    Betrag (Mio. $)
    Keine Daten
    Post-Money (Mrd. $)
    Keine Daten
    Datum
    2025-11-20

Jüngste Runde in der ROBOTNESS-Datenbank, laut Unternehmens- oder Investorenmitteilung. Bewertung von Skild AI laut Firma mehr als 14 Mrd. $. Bewertungssprung = 14 Mrd. $ / 1,5 Mrd. $ Post-Money der Serie A (Juli 2024) = 9,3-fach. null = nicht offengelegt.

Stand: 1. Okt. 2026

Europäische Robotik- und Robotermodell-Firmen: jüngste Runden
  • NEURA Robotics
    Land
    DE
    Runde
    Serie C
    Betrag (Mio. $)
    Keine Daten
    Post-Money (Mrd. $)
    Keine Daten
    Datum
    2026-06-10
  • Humanoid
    Land
    GB
    Runde
    Serie A
    Betrag (Mio. $)
    152
    Post-Money (Mrd. $)
    1,35
    Datum
    2026-07-21
  • Genesis AI
    Land
    FR
    Runde
    Startrunde
    Betrag (Mio. $)
    105
    Post-Money (Mrd. $)
    Keine Daten
    Datum
    2025-06-30
  • ANYbotics
    Land
    CH
    Runde
    Zusatzfinanzierung
    Betrag (Mio. $)
    60
    Post-Money (Mrd. $)
    Keine Daten
    Datum
    2024-12-12
  • Inbolt
    Land
    FR
    Runde
    Venture
    Betrag (Mio. $)
    12,5
    Post-Money (Mrd. $)
    Keine Daten
    Datum
    2026-09-30

ROBOTNESS-Datenbank, Firmen- und Investorenmitteilungen. NEURA nennt eine Serie C von bis zu 1,4 Mrd. $; Obergrenzen werden nicht als Betrag geführt (null). Keine Bewertung offengelegt = null.

Stand: 1. Okt. 2026

ROBOTNESS-Analyse

Das VLA selbst wird zur gemeinsamen Infrastruktur; dauerhaften Wert schöpft, wer die günstigste Quelle relevanter Handlungsdaten und die Einsätze besitzt, die sie laufend erzeugen.

Die Belege stehen in den Tabellen. Die Backbones laufen auf wenige öffentliche Bild-Sprach-Modelle zu, leistungsfähige offene VLA mit 2 bis 7 Milliarden Parametern sind frei verfügbar. Die Datenbasis dagegen reicht von rund 500 Stunden Teleoperation bei Helix bis zu mehr als 500.000 Stunden menschlicher Aufnahmen bei GEN-1. Skilds Bewertung von mehr als 14 Milliarden Dollar entspricht etwa dem 140-Fachen des genannten wiederkehrenden Umsatzes (14 Mrd. $ / 100 Mio. $) und dem 9,3-Fachen der Serie-A-Bewertung vom Juli 2024. Für Europa ist das eine Chance, denn Automobil- und Zulieferwerke von Schaeffler, Bosch oder BMW sind genau die Orte, an denen solche Daten entstehen.

Das stärkste Gegenargument lautet, dass Zuverlässigkeit weiterhin ein Modellproblem ist. Nach Google DeepMinds eigener Zählung gelangen Gemini Robotics 2 auf Apptroniks Apollo 2 nur 68,4 Prozent der Ganzkörpergriffe vom Tisch und 45,7 Prozent vom Boden. Wer diese Lücke mit besserer Architektur schließt, kann unabhängig vom Datenbestand gewinnen, und World Action Models wie Praxis-1 könnten das heutige VLA-Design zur Zwischenstufe machen.

Positives Szenario. Synthetische Daten, Wearables und In-Context-Lernen senken die Datenkosten weiter, offene Modelle erreichen Tausende Integratoren, und Hersteller mit großen Flotten im Feld bauen ihren Vorsprung aus. Europäische Zulieferer, die ihre Werke als Datenquelle organisieren, werden zu gefragten Partnern statt bloßer Kunden.

Negatives Szenario. Die Erfolgsquoten bei unstrukturierten Aufgaben verharren zwischen 60 und 80 Prozent, Käufer bleiben bei programmierten Zellen mit enger KI, und Bewertungen über 10 Milliarden Dollar erweisen sich als Preis für einen Forschungsvorsprung statt für ein Geschäft. Eine Konsolidierung wäre die Folge.

Unsere Einschätzung würde sich ändern, wenn ein geschlossenes Modell bei unbekannten Kunden ohne kundenspezifische Daten mehr als 90 Prozent Erfolg erreicht. Drei datierte Signale beobachten wir.

  • Die Beta-Flotte des Humanoid-Roboters von Humanoid, angekündigt für das vierte Quartal 2026.
  • LGs zweibeiniger Humanoid auf Basis von NVIDIA Isaac GR00T, Vorstellung im ersten Quartal 2027.
  • Das Ende der Übergangsfrist für KI-gesteuerte Maschinen im August 2028, das für europäische Hersteller über den Zertifizierungsweg lernender Roboter entscheidet.
Eckdaten
Definition
Ein Netz, das Kamerabilder und Sprachbefehl in Motorbefehle übersetzt
Begriff
RT-2 von Google DeepMind, arXiv-Preprint vom 28. Juli 2023
Token-Ansatz
RT-2 teilt 8 Aktionsdimensionen in je 256 Stufen
Flow-Ansatz
π0: 3 Mrd. PaliGemma plus 300 Mio. Action Expert, bis 50 Hz
Doppelsystem
Helix: 7-Mrd.-Modell mit 7 bis 9 Hz plus 80-Mio.-Steuerung mit 200 Hz
Offene Modelle
OpenVLA (7 Mrd.), π0 und π0.5 (openpi), GR00T N1 und N1.7
Teleoperationsdaten
Rund 500 Stunden für Helix, mehr als 10.000 Stunden für π0
Europas größte Runde
NEURA Robotics, Serie C bis zu 1,4 Mrd. $, Juni 2026
Regulierung
KI-gesteuerte Maschinen: Übergangsfrist bis August 2028
Größte VLA-Runde
Skild AI, 1,4 Mrd. $ Serie C, Bewertung über 14 Mrd. $
Quellen
ROBOTNESS Intelligence
  1. 01

    Warum das wichtig ist

    VLA-Modelle entscheiden, ob Allzweckroboter ein Softwaregeschäft werden oder ein Projektgeschäft bleiben, in dem jede Zelle einzeln programmiert wird. Wenn sich ein Modell, wie Google DeepMind für Gemini Robotics 2 angibt, in wenigen Stunden mit weniger als 200 Beispielen an einen neuen Roboter anpassen lässt, schrumpft die Inbetriebnahme von einem Engineering-Projekt auf eine Datensammlung von Tagen. Wertschöpfung wandert dann von Integratoren und Programmierern zu Modellanbietern und Datenbesitzern.

    Für Europa ist das heikel, weil die Stärke der Region genau im Integrationsgeschäft liegt: Systemhäuser, Greifer- und Antriebshersteller, Sondermaschinenbau. Wer die Modellschicht nicht besitzt, muss über Daten, Komponenten und Zertifizierungskompetenz verhandeln.

  2. 02

    Wettbewerbsanalyse

    Google DeepMind besitzt das stärkste Backbone, baut aber keine Roboter und braucht Partner wie Apptronik, Boston Dynamics oder Agile Robots für Felddaten. NVIDIA verschenkt GR00T, um Jetson Thor, Isaac und Cosmos zu verkaufen; Siemens evaluiert Cosmos 3 Edge, Wandelbots und SCHUNK bauen auf Omniverse. Physical Intelligence dominiert mit openpi die Forschung, Skild AI führt mit 100 Mio. $ wiederkehrendem Umsatz die Kommerzialisierung an.

    Europas Kandidaten verfolgen unterschiedliche Wege. NEURA Robotics setzt auf einen Full-Stack-Ansatz von Hardware bis Plattform und finanziert Zukäufe wie Bosch Rexroths ACTIVE Shuttle. Humanoid entwickelt mit KinetIQ eigene KI-Software für seinen Radhumanoiden, mit Schaeffler als Ankerkunde. Genesis AI aus Paris baut ein universelles Robotik-Grundmodell. Keiner dieser Anbieter hat bislang Modellumsätze offengelegt.

  3. 03

    Bewertungskontext

    Nach offengelegten Zahlen entspricht Skild AIs Bewertung von mehr als 14 Mrd. $ dem rund 140-Fachen des genannten wiederkehrenden Jahresumsatzes und dem 9,3-Fachen der Serie-A-Bewertung vom Juli 2024. Figure AIs 39 Mrd. $ Post-Money stehen keine offengelegten Umsätze gegenüber.

    Europa bewegt sich auf anderem Niveau. Humanoid erreichte im Juli 2026 1,35 Mrd. $ Post-Money, also knapp ein Zehntel von Skild. NEURA nannte für seine Serie C keine Bewertung. Die Lücke spiegelt weniger Technik als Kapitalmarkttiefe wider, und sie bestimmt, wer sich teure Datenkampagnen und Rechenzentren leisten kann.

  4. 04

    Folgen für die Lieferkette

    VLA hängen an drei Lieferketten: Trainingsrechenleistung, Rechenleistung im Roboter und Daten. Training läuft auf NVIDIA-GPUs und Google-TPUs; Figure hat sich bis zu 100.000 Vera-Rubin-GPUs in Texas gesichert. Im Roboter setzt sich NVIDIAs Jetson Thor durch, was europäische Hersteller von einem US-Anbieter abhängig macht.

    Daten werden zur Beschaffungskategorie: Teleoperationsstände, Motion-Capture-Labore, Simulationspipelines. Europas Trumpf sind die Werke von Automobilherstellern und Zulieferern sowie Komponenten wie Getriebe, Aktoren und Greifer. Schaeffler und Bosch investieren bereits in Humanoid und NEURA und sichern sich damit Zugang zu beiden Seiten.

  5. 05

    Worauf jetzt zu achten ist

    Erstens Zuverlässigkeit an fremden Standorten. Figure meldete für Helix 2.5 eine Zero-Shot-Erfolgsquote von 56 Prozent in 30 unbekannten Haushalten; Werte über 90 Prozent würden das Bild verändern.

    Zweitens die Beta-Flotte von Humanoid im vierten Quartal 2026 und die Umsetzung des Schaeffler-Auftrags. Drittens der regulatorische Pfad: Bis August 2028 muss geklärt sein, wie lernende Roboter unter der Maschinenverordnung konform nachgewiesen werden.

  6. 06

    Analystensicht

    These: Die Modellschicht wird schneller zur Massenware als die Datenschicht; gewinnen werden Unternehmen mit Einsätzen und Datenkreisläufen, nicht jene mit dem raffiniertesten Action Head. Zuversicht: mittel.

    Nicht hoch, weil Architektur weiter zählt. Der Sprung von Token-Ausgabe mit 1 bis 3 Hertz zu Flow Matching mit 50 Hertz und Doppelsystemen mit 200 Hertz war ein Designfortschritt. Nicht niedrig, weil alle offengelegten Zahlen den Abstand zwischen Spitze und Verfolgern eher mit Datenmenge und Anpassungskosten als mit Parameterzahl erklären. Für Europas Industrie folgt daraus, Werke als Datenquelle zu organisieren, bevor andere es tun.

  7. 07

    Offene Fragen

    An NEURA: Welches Grundmodell steuert die Roboter, und wem gehören die Daten aus Kundeneinsätzen? An Humanoid: Wie viel des Trainings von KinetIQ stammt aus Teleoperation, wie viel aus Simulation?

    An Siemens und Wandelbots: Wie wird ein lernender Roboter nach Maschinenverordnung zertifiziert, wenn sich sein Verhalten mit jedem Update ändert? An die EU-Kommission: Welche harmonisierten Normen sollen bis August 2028 vorliegen?