2026年7月30日、Google DeepMindは次世代ロボットAIモデル群「Gemini Robotics 2」を発表した。VLA(Vision-Language-Action)コア、具現推論エンジン、On-Device軽量モデルの三層構成で、これまでの「卓上操作」から「人形ロボットの全身制御」へと物理AIの適用範囲を大きく広げた。Apptronik Apollo 2が部屋を歩き、しゃがみ、じょうろを棚に収める。SharpaWaveの22自由度五指ハンドが結び目をつくる。Boston Dynamics Spotが人間の指示でポップコーンを取ってくる。複数のロボットが協調して作業を完了する──これらが単一のモデルファミリーで可能になった。
1. 三層の物理AIスタック
Gemini Robotics 2は3つの専門モデルから構成される。
| モデル | 役割 | 特徴 |
|---|---|---|
| Gemini Robotics 2 | VLAコア | 視覚・言語入力から直接モーター制御を出力。人形ロボットの足先から指先まで全身を統合制御 |
| Gemini Robotics ER 2 | 具現推論(ER) | 高次の「頭脳」。人間との対話、物理世界理解、数分間にわたる多段階タスク計画、進捗追跡、多ロボ協調を担当 |
| Gemini Robotics On-Device 2 | ローカルVLA | 端末上で動作。数時間のデータで全く新しいロボットボディに適応可能 |
ER 2はGemini API、Google AI Studio、Gemini Enterprise Agent Platformで提供開始。VLAとOn-Deviceは早期アクセスパートナーから展開される。
2. 全身制御──部屋の中を歩き、しゃがみ、物を置く
従来のロボットAIは上半身の操作が中心だった。Gemini Robotics 2は人形ロボットの全身を一つの連続した動作として制御する。
ApptronikのApollo 2に「じょうろを下段棚の緑の箱に入れて」と指示すると、モデルは以下をシームレスに実行した:
- 部屋を歩いてテーブルへ移動
- じょうろを掴む
- 棚まで歩く
- しゃがんで高さを避け
- 指定の箱に正確に収める
これは「歩行モデル」と「操作モデル」を切り替える従来型ではなく、バランス・移動・到達を統合した一本の推論チェーンである。DeepMindロボット部門責任者のCarolina Paradaは「AIを物理世界にもたらし、あらゆるロボットが使えるインテリジェンス層を構築するのが目標」と述べた。
3. 巧緻性の飛躍──結び目・ジップロック・精密挿入
Gemini Robotics 2は五指の22自由度SharpaWaveハンドを制御し、結び目をつくったりジップロック袋を閉じたりする。Franka Duoの並列グリッパーでは緊密な梱包作業も可能。公開された性能指標は以下の通り:
| タスク | 成功率 |
|---|---|
| テーブル上の物体把持 | 68.4% |
| 棚からの物体把持 | 76.3% |
| 精密挿入タスク | 89.6% |
人間の手ほどではないが、工業・物流・家庭の実タスクに耐えうるレベルに近づいている。DeepMindのロボット部門ディレクターKanishka Raoは「真の器用さはまだ遠い目標だ」としつつも、統合的な全身制御の実現を強調した。
4. ER 2がもたらす「時間的知性」と多ロボ協調
具現推論モデルER 2の進化が特筆される。連続した動画を見て、自分のタスク進捗を追跡し、失敗時に修正し、次のステップへのタイミングを判断する。
| 能力 | 指標 |
|---|---|
| タスク進捗分類精度 | 57.4% |
| 重要瞬間特定精度 | 91.3%(平均絶対時間誤差0.96秒) |
| ER 1.6に対する実行速度 | 4倍 |
さらに、異なる種類のロボットが共有された意味理解を通じて協調できる。Apptronik Apollo 2とFranka FR3 Duoが共同で複雑なワークフローをこなすデモも公開された。工場床や倉庫で複数ロボットが衝突や重複作業を避けつつ協働する未来が具体的になった。
5. 数時間で新しいロボットに適応──On-Device 2
On-Device 2はクラウド接続なしにロボット本体で動作する。200件未満のデモンストレーションで未知のロボットボディに適応できる。これは自律走行ロボット、ドローン、産業アームなど、通信が不安定またはレイテンシが厳しい環境での実用化を加速する。
6. 安全基準──ASIMOV-Agenticと人間接近検知
DeepMindは同時に安全技術レポートと「ASIMOV-Agentic」ベンチマークを公開。エージェンシックなロボットが人間に近接する環境で安全指示を守り、適切な距離を保てるかを評価する。ER 2はER 1.6を上回る安全性スコアを示した。
7. 競合地図──OpenAI、NVIDIA、中国勢との物理AI競争
| 企業 | 動向 |
|---|---|
| Google DeepMind | Gemini Robotics 2で全身制御・多ロボ協調を先行 |
| OpenAI | 視覚・言語・動作を統合した汎用ロボット基盤モデルを摸索 |
| NVIDIA | Isaac GR00Tなど開発者向け訓練ツールを提供。SharpaWaveもGR00T参照設計に採用 |
| 中国勢 | 宇樹科技、智元機器人など人形ロボットハードウェアで追撃 |
現時点ではGoogleが「モデル+パートナー展開」の両方で先行している。Hyundai工場でのGemini搭載ロボットの実証試験も計画されている。
まとめ──物理AIの「見せ場」から「仕事場」へ
Gemini Robotics 2は、ロボットAIが「デモの世界」から「実務の世界」へ移行する重要な節目だ。単一モデルで全身を動かし、五指で細かい作業をし、複数のロボットが協調する。まだ動きは慎重で、人間の速さや柔軟性には及ばない。しかし「AIが物理世界で自律的に働く」という構造が、初めて具体的な製品群として形になった。2026年後半、物理AIの競争はモデル性能だけでなく、ハードウェアパートナー網と実現場の適応速度を競う段階に入る。
本記事は、2026年7月30日付 DeepMind Blog、Humanoids Daily、Nowosci.ai、Bloomberg、网易科技、IT之家 などの報道に基づいて作成。