VLA(視覚言語行動)モデルとは何か、誰が開発しているのか
VLA(視覚言語行動)モデルは、カメラ映像と自然言語の指示を同時に読み込み、ロボットが次に実行するモーター指令を出力する単一のニューラルネットワークで、画像と言葉を理解する視覚言語モデルをロボットの実演データで追加学習して作る。グーグル ディープマインド、フィジカル インテリジェンス、エヌビディア、フィギュアAI、スキルドAIが先行し、ファナックや安川電機は外部モデルを自社ロボットに取り込む道を選んだ。

VLA(Vision-Language-Action、視覚言語行動)モデルとは、カメラ映像と「コップを流しに入れて」といった自然言語の指示を一度に受け取り、ロボットが次に実行すべきモーター指令を出力する一つのニューラルネットワークを指す。写真を説明できる視覚言語モデル(VLM)を出発点とし、ロボットの実演データで追加学習させることで、出力を文字から関節角度やグリッパーの開閉といった動作に置き換える。
この言葉がロボット分野に定着したのは2023年7月、グーグル ディープマインドがRT-2をarXivのプレプリントとして公開してからだ。論文によると、ウェブ画像とロボットデータを併せて学習したRT-2は、未知の物体や環境での成功率が約62%と、前世代RT-1の32%のほぼ2倍だった。3年後の現在、主役はグーグル ディープマインド、フィジカル インテリジェンス、エヌビディア、フィギュアAI、スキルドAI、中国の智元機器人(AgiBot)で、各社はロボット業界で最大級の資金を集めている。本稿では仕組み、従来のロボット教示や世界モデルとの違い、主要プレーヤー、そして人手不足に直面する日本の製造業にとってなぜデータの確保が勝負を分けるのかを順に読み解く。
画素と文章がモーター指令になるまで
多くのVLAは三つの部品でできている。ビジョンエンコーダーがカメラ画像を視覚トークンの列に変換し、事前学習済みの言語バックボーンがそれを指示文やロボットの関節状態と合わせて処理する。最後にアクションヘッドが、関節やグリッパー、車輪を動かす数値へと変換する。エヌビディアはGR00T N1のモデルカードでこの構成を明示している。224×224画素の画像を読むSigLIP 2の視覚トランスフォーマー、T5テキストエンコーダー、ロボットの機体ごとに切り替わる状態処理ネットワーク、そして動作を生成する拡散トランスフォーマーである。
VLMを出発点にする理由は知識の転移にある。膨大なウェブ画像で学んだバックボーンは家庭や工場にある物の大半をすでに見分けられるため、ロボット学習で一度も見ていない物でも扱える。RT-2の著者らは、机の上で最も小さい物を選ぶ、ウェブでしか見たことのない数字の上に缶を置くといった新たに現れた能力の評価で60%の成功率を記録し、RT-1の17%を大きく上回ったと報告した。残る課題は、動作をどのような形式で表現するかだ。
トークンか、フローか
初期のVLAは動作を単語のように扱った。論文によると、RT-2はグリッパーの位置と回転の6次元、開閉の1次元、作業終了の1次元の計8次元をそれぞれ256段階に区切り、動作を言語モデルが文字のように出力する短いトークン列に変えた。スタンフォード大学主導のチームが2024年6月に重みを公開した70億パラメータのOpenVLAも同じ手法を採り、29の作業でグーグルの550億パラメータのRT-2-Xを成功率で16.5ポイント上回ったとしている。
トークン方式は精密な作業には遅く、粗い。最大のRT-2の制御周期は毎秒1〜3回(1〜3Hz)にとどまった。フィジカル インテリジェンスが2024年10月31日のプレプリントで示したπ0は、30億パラメータのPaliGemmaに3億パラメータの「アクションエキスパート」を接続し、画像生成の拡散モデルと同系統のフローマッチングで学習させた。乱数ノイズから出発して10段階で今後50ステップ分の動作をまとめて生成し、最大50Hzで制御できると同社は説明する。GR00T N1は同じ役割を拡散トランスフォーマーで担う。
三つ目の設計は「考える部分」と「反射する部分」を分ける。フィギュアAIが2025年2月20日に発表したHelixは、7〜9Hzで動く70億パラメータのVLMと200Hzで動く8000万パラメータの制御方策を組み合わせ、機体に積んだGPU2基で35自由度を制御すると同社は発表した。エヌビディアはこの分担をSystem 2とSystem 1と呼び、智元機器人が2026年9月8日に公開したGO-2も低速の意味計画モジュールと高速の動作追従モジュールを非同期で組み合わせた。この階層構造こそが、工場で動く既存のロボットソフトとVLAを分ける点である。
ティーチングとも世界モデルとも違う
従来の産業用ロボットは点ごとに教える。SIerがティーチングペンダントで経由点を登録するか、オフラインで軌道を作成すれば、ワークの位置が変わるかラインを改造するまで同じ動きを繰り返す。VLAはこの台本を、制御周期ごとに状況を読み取る学習済みの方策に置き換える。雑然とした作業台や新しい部品に対応できる半面、安全認証を取りやすい厳密な繰り返し精度は手放すことになる。安川電機は2026年7月、MOTOMAN NEXTにグーグル ディープマインドのGemini Robotics ER 1.6を組み込み、細かな教示なしに上位の指示から作業を計画する一方、ビジョン、経路計画、力覚はロボット本来の機能に任せる仕組みを開発したと発表した。
世界モデルは別の問いに答える。ロボットが行動したときに場面がどう変わるかを主に映像として予測し、合成学習データの生成や実機に載せる前の方策検証に使う。ランウェイは9月30日、自社の世界モデル内での方策評価と実環境の結果の相関係数が0.95だったと公表した。もっとも両者の境界は薄れつつある。ランウェイは新モデルPraxis-1をロボット制御を直接出力する「世界行動モデル」と位置づけ、ジェネラリストAIはロボットデータを使わず、装着型機器で集めた50万時間超の人の動作データでGEN-1を事前学習したと説明している。
誰が作り、誰が公開するのか
グーグル ディープマインドは2025年3月12日、Gemini 2.0を基にしたGemini Roboticsを発表し、2026年7月30日には人型ロボットの全身制御に対応するGemini Robotics 2を公開した。行動モデルの提供は今もパートナーと信頼テスターに限られる。フィジカル インテリジェンスは逆の道を選び、openpiリポジトリでπ0、π0-FAST、2025年9月からはπ0.5をApache 2.0ライセンスで公開している。エヌビディアは2025年3月18日にGR00T N1を非商用ライセンスで公開し、30億パラメータのGR00T N1.7はエヌビディア オープンモデル ライセンスでハギングフェイスのLeRobotに組み込まれた。フィギュアはHelixを自社機専用とし、スキルドAIはSkild BrainとS1を導入先への配備という形で販売する。
- RT-2
- グーグル ディープマインド
- 2023-07-28
- 55
- 非公開(パートナー限定)
- OpenVLA
- スタンフォード大主導チーム
- 2024-06-13
- 7
- 公開
- π0
- フィジカル インテリジェンス
- 2024-10-31
- 3.3
- 公開
- Helix
- フィギュアAI
- 2025-02-20
- 7.08
- データなし
- Gemini Robotics
- グーグル ディープマインド
- 2025-03-12
- データなし
- 非公開(パートナー限定)
- GR00T N1
- エヌビディア
- 2025-03-18
- 2
- 公開(非商用)
- π0.5
- フィジカル インテリジェンス
- 2025-04-22
- データなし
- 公開
- Skild Brain
- スキルドAI
- 2025-07-29
- データなし
- データなし
- Gemini Robotics 2
- グーグル ディープマインド
- 2026-07-30
- データなし
- 非公開(パートナー限定)
- S1
- スキルドAI
- 2026-08-18
- データなし
- データなし
- GO-2
- 智元機器人(AgiBot)
- 2026-09-08
- データなし
- データなし
初公開は最初の論文、モデルカード、企業発表の日付。Helixはシステム2の70億とシステム1の8000万の合計。π0.5の重みは2025年9月にopenpiで公開。nullは非開示。開示値のみで推計は含まない。
2026年10月1日時点
日本の大手は外部モデルを取り込む側に回った。ファナックは2026年5月、Gemini Roboticsの信頼テスタープログラムへの参加と、Isaac GR00T Nによる双腕ロボットの模倣学習を公表した。スキルドAIは住友電装のワイヤーハーネス製造でS1の導入を進め、三井物産とは業務用厨房での試験運用に取り組むと説明している。富士通はファナック、安川電機、川崎重工業とエヌビディア技術を使った共通基盤づくりを始めた。
- ファナック
- グーグル ディープマインド
- Gemini Robotics信頼テスターに参加
- 2026-05-13
- ファナック
- エヌビディア
- Isaac GR00T Nで双腕ロボットを模倣学習
- 2026-05-15
- 安川電機
- グーグル ディープマインド
- MOTOMAN NEXTにGemini Robotics ER 1.6
- 2026-07-15
- 富士通
- ファナック、安川電機、川崎重工業
- エヌビディア技術で共通基盤を検討
- 2026-07-16
- 住友電装
- スキルドAI
- ワイヤーハーネス製造にS1導入へ
- 2026-09-10
- 三井物産
- スキルドAI
- 業務用厨房で汎用ロボットを試験
- 2026-09-10
各社のニュースリリースに基づく。スキルドAIとの案件の日付は同社が公表した日。
2026年10月1日時点
コストの本丸は構造よりデータ
チャットボットと違い、VLAは学習データをウェブから集められない。ロボットの実演データの多くは、人がロボットを遠隔操作して作業させる方式で集める。フィギュアはHelixの学習に約500時間の遠隔操作データを使い、フィジカル インテリジェンスはπ0に7種類のロボット構成と68の作業にまたがる1万時間超を投じた。スキルドAIは8月、4分を超える作業の実演を380回集めるには遠隔操作で50〜100時間かかると試算し、S1は動画1本で同等の効果を得られると主張した。
エヌビディアは11時間で78万本の合成軌道を生成し、これは人の実演約6500時間に相当、実データと混ぜてGR00T N1の性能を40%高めたと説明する。トヨタ リサーチ インスティテュートは2026年4月、Science Roboticsで約1700時間のロボット実演を基にした大規模行動モデルが少ない追加データで新しい作業を習得できると報告した(データ量はプレプリントによる)。
- Helix
- フィギュアAI
- 遠隔操作による実演
- 500
- π0
- フィジカル インテリジェンス
- ロボット実演データ
- 10,000
- π0.5
- フィジカル インテリジェンス
- 移動マニピュレーション(混合データの一部)
- 400
- GR00T N1
- エヌビディア
- 合成軌道(時間換算)
- 6,500
- LBM
- トヨタ リサーチ インスティテュート
- ロボット実演データ
- 1,700
- GEN-1
- ジェネラリストAI
- 人の装着型機器の記録、ロボットデータなし
- 500,000
企業発表と論文に基づく(TRIはarXivプレプリント2507.05331)。Helixとπ0.5は約、π0とGEN-1は以上。GR00T N1は11時間で78万本の軌道を生成し、エヌビディアは実演約6500時間に相当すると説明。生成1時間あたり実演約590時間(6500÷11)。
2026年10月1日時点
資金の流れ
各社の発表によると、スキルドAIは2026年1月に140億ドル超の評価額で14億ドルを、フィギュアAIは2025年9月に調達後評価額390億ドルで10億ドルを、ジェネラリストAIは2026年6月に4億ドルを調達した。売上高を公表しているのはスキルドだけで、9月10日に年間経常収益(ARR)1億ドル突破と有料顧客60社超を明らかにした。
- スキルドAI
- シリーズC
- 1400
- 14
- 2026-01-14
- フィギュアAI
- シリーズC
- 1000
- 39
- 2025-09-16
- ジェネラリストAI
- グロース
- 400
- データなし
- 2026-06-04
- ジェネラル インチュイション
- ベンチャー
- 220
- データなし
- 2026-09-29
- ダイナ ロボティクス
- シリーズA
- 120
- データなし
- 2025-09-15
- ジェネシスAI
- 創業ラウンド
- 105
- データなし
- 2025-06-30
- フィジカル インテリジェンス
- シリーズB
- データなし
- データなし
- 2025-11-20
ROBOTNESSデータベースの直近ラウンド。企業または投資家の発表に基づく。スキルドAIの評価額は140億ドル超と開示。評価額の上昇倍率=140億ドル÷2024年7月シリーズAの調達後評価額15億ドル=9.3倍。nullは非開示。
2026年10月1日時点
ROBOTNESS分析
VLAモデルそのものは共通基盤になりつつあり、持続的な価値は、現場で役立つ行動データを最も安く生み続ける導入現場を握る側に宿る。
根拠は表にある。バックボーンは少数の公開VLMに収れんし、20億〜70億パラメータ級の公開VLAは無償で入手できる。一方、学習データはHelixの遠隔操作約500時間からGEN-1の人の記録50万時間超まで1000倍の開きがある。スキルドの140億ドル超の評価額は公表ARRの約140倍(140億ドル÷1億ドル)で、2024年7月のシリーズA時点の15億ドルから18カ月で9.3倍になった。日本にとってこの構図は追い風になり得る。ファナック、安川電機、川崎重工業という産業用ロボット大手と、データが生まれる工場の現場を抱えるからだ。
最も強い反論は、信頼性が依然としてモデル設計の問題だという点だ。グーグル ディープマインド自身の集計でも、Gemini Robotics 2はアプトロニクのApollo 2で机上からのつかみ取り成功率が68.4%、床からは45.7%にとどまる。構造の工夫でこの差を先に埋めた研究機関がデータ量に関係なく勝つ可能性はあり、世界行動モデルが現在のVLA設計を過渡期のものにすることも考えられる。
強気シナリオ。合成データや装着型機器による記録、文脈内学習でデータコストが下がり続け、公開モデルがSIerに広がる。稼働台数の多いメーカーが現場データで優位を積み上げ、ファナックや安川電機の据え付け基盤が学習データの供給源として価値を持つ。
弱気シナリオ。非定型作業の成功率が6〜8割で頭打ちとなり、顧客はティーチング済みのセルと限定的なAIの組み合わせにとどまる。100億ドルを超える評価額が事業ではなく研究上の優位に付いた値段だったと判明し、業界再編が進む。
未知の顧客現場で顧客固有のデータなしに90%超の成功率を示す非公開モデルが現れれば、我々は見方を改める。日付のある三つの兆候を注視する。
- 英ヒューマノイド社の車輪型人型ロボットのβ版投入、2026年10〜12月期の予定。シェフラーが主要顧客となる。
- LGのIsaac GR00T採用の二足歩行人型ロボットの披露、2027年1〜3月期の予定。
- フィギュアとエヌスケールによるHelix学習用Vera Rubin GPUの初稼働、2027年後半の予定。
- カメラ映像と自然言語の指示からロボットのモーター指令を出す単一のネットワーク
- グーグル ディープマインドのRT-2、2023年7月28日のarXivプレプリント
- RT-2は動作8次元をそれぞれ256段階に分割
- π0、30億のPaliGemmaと3億のアクションエキスパート、最大50Hz
- Helix、70億モデルが7〜9Hz、8000万の方策が200Hz
- OpenVLA(70億)、π0とπ0.5(openpi)、GR00T N1とN1.7
- Helix約500時間、π0は1万時間超
- ファナックがGemini Robotics信頼テスター参加、安川電機がER 1.6を搭載
- 住友電装(S1導入へ)、三井物産(厨房で試験)
- スキルドAIのシリーズC 14億ドル、評価額140億ドル超
なぜ重要か
VLAは、汎用ロボットがソフトウエア事業になるのか、現場ごとに作り込むSI事業にとどまるのかを左右する。グーグル ディープマインドの説明どおり新しいロボットへの適応が数時間、200例未満で済むなら、新たな現場の立ち上げはエンジニアリング案件から数日のデータ収集に縮む。価値の重心はSIerやティーチング人材から、モデルの所有者と現場データを握る側へ移る。
日本の製造業にとっての意味は二つある。一つは人手不足の現場で、ティーチングできる技術者がいなくてもロボットを動かせる可能性。もう一つは、ファナックや安川電機が世界に据え付けたロボット群が、使い方次第で学習データの供給網になり得ることだ。
競合分析
グーグル ディープマインドは最も強いバックボーンを持つが、ロボットは作らない。ファナックと安川電機はそこに乗る形を選び、ファナックはGemini Roboticsの信頼テスターとなり、安川電機はER 1.6を判断層に据えた。エヌビディアはGR00TやCosmosを無償で公開してJetson Thorの需要を育て、ファナックや川崎重工業、富士通がその技術を使う。
米国勢ではスキルドAIが日本市場に最も深く入り込み、住友電装と三井物産を顧客に挙げる。フィジカル インテリジェンスは研究者層、フィギュアは自社機に特化する。日本勢は独自のVLAを前面に出しておらず、ロボット本体の信頼性、安全機能、据え付け基盤を武器に、外部モデルを使いこなす側に立つ構図だ。
企業価値の背景
開示値では、スキルドAIの評価額140億ドル超は公表ARR1億ドルの約140倍、2024年7月のシリーズAから18カ月で9.3倍に達した。フィギュアAIの390億ドルには開示売上高がなく倍率は出せない。
日本では、トヨタ リサーチ インスティテュートからスピンアウトしたウォールデン ロボティクスが2026年7月にシードで3億ドルを集め、評価額は11億ドルとなった。キビテクは9月、メーカーを問わないロボット制御層でシリーズB約6億円を調達した。モデル層の企業に付く評価倍率の高さは、日本の投資家も意識すべきだ。
サプライチェーンへの影響
VLAの供給網は学習用計算資源、ロボット搭載の計算資源、データの三つ。学習はエヌビディアのGPUとグーグルのTPUが握り、搭載側でもファナックがJetson Thor T5000を採用するなどエヌビディア依存が強まっている。
日本の強みは減速機、サーボ、センサーといった部品と、据え付け済みの膨大なロボットにある。VLAは関節トルクや力覚の質に性能が左右されるため、部品メーカーは単なる供給者ではなく、データの質を決める存在になる。富士通の共通基盤構想が実際にデータ共有の仕組みまで踏み込むかが焦点だ。
今後の注目点
第一に未知の現場での信頼性。フィギュアのHelix 2.5は未知の30世帯でゼロショット成功率56%と発表しており、これが現時点の公開基準線だ。90%を超えれば局面が変わる。
第二に安川電機とグーグル ディープマインドのシステムの用途と提供時期の発表、第三に住友電装でのS1の本格稼働である。スキルドに続いてモデル事業の売上高を開示する企業が出るかも注目点だ。
アナリストの見方
見立て:モデル層はデータ層より速く汎用品化しており、勝者は最も巧妙なアクションヘッドを持つ企業ではなく、導入現場とデータの循環を持つ企業になる。確信度は中程度。
高としない理由は、構造の工夫が依然として効くからだ。1〜3Hzのトークン方式から50Hzのフローマッチング、200Hzの二重システムへの進歩は設計によるものだった。低としない理由は、開示された数値の多くが、先行企業と後続の差をパラメータ数ではなくデータ量と適応コストで説明しているためだ。日本のロボット大手にとって、自前モデルより据え付け基盤をデータ資産に変える戦略の方が勝算は高いとみる。
問うべき論点
ファナックには、Gemini Roboticsの試験で得たデータを誰が保有し、顧客の現場データをモデル改良に使う条件をどう定めるのかを聞きたい。安川電機には、エージェント型システムの最初の用途と、教示レスによる立ち上げ時間の短縮幅を示すよう求めたい。
富士通には、共通基盤でロボットメーカー間のデータ共有をどこまで認めるのか、住友電装にはS1導入による工程の自動化率と投資回収期間を尋ねたい。