AI

Gemini Robotics 2とは|全身制御と提供範囲・検証手順を実装目線で解説【2026年8月】

Google DeepMindが2026年7月30日に公開したGemini Robotics 2は、脚から指先までを一つのモデルで動かすロボット向けAIです。歩行と物体操作を別々の制御器に分けず、視覚と言語の入力からそのままモーター制御を出す構成に変わりました。ただし2026年8月時点で一般提供されているのは推論担当のGemini Robotics ER 2だけで、機体を動かすVLA本体とオンデバイス版は早期アクセスのパートナー限定です。この記事では三モデルの役割分担、公表成功率の読み方、200例未満での新機体適応が成立する前提、製造・物流のどの工程なら任せてよいかまでを実装目線で整理します。

まとめ:Gemini Robotics 2で今日から動かせる範囲と待つべき範囲

先に結論を示します。2026年8月時点で自社の手元から検証できるのは、Google AI StudioとGemini API経由のGemini Robotics ER 2に限られます。ER 2は作業計画を立てる層であり、機体を直接動かす層ではありません。VLA本体とGemini Robotics On-Device 2は早期アクセスのパートナー向け提供にとどまり、一般開発者が単独で入手する経路は公表されていません。

実力ラインの見立ても押さえておきます。公表値では把持の成功率が位置によって45.7パーセントから76.3パーセントまで割れ、電球を外す動作が92パーセントに対し取り付ける動作は36パーセントでした。搬送と片付けは現実的な射程に入った一方、精密な組み付けを自動化の対象にするのは時期尚早と読むのが妥当な水準です。

取るべき行動は三つです。ER 2をAI Studioで触って自社作業の分解精度を測る、対応機体一覧に自社ハードが載るか確認して早期アクセスへ申し込む、工程を搬送・片付けと精密作業に仕分けて後者は人手のまま据え置く。

Gemini Robotics 2の三モデル構成と全身制御が変えた制御設計

Gemini Robotics 2は単一のモデル名ではなく、役割の異なる三つのモデルをまとめた呼び名です。この分担が提供状況の理解と検証設計の前提になります。

VLA・ER 2・On-Device 2で分かれた思考と実行の担当範囲

Gemini Robotics 2はVLA(Vision-Language-Action)モデルで、映像と言語の入力をモーター制御に変換する実行層です。Gemini Robotics ER 2は身体性を持った推論モデルにあたり、複数段階の作業計画、人間との対話、複数ロボットの調整を担います。Gemini Robotics On-Device 2はVLAの軽量版で、ネットワーク接続がない環境でも機体内部だけで推論を回します。

この分離は実装設計にそのまま効きます。「棚の左から二番目の箱に片付けて」という指示を手順へ分解するのがER 2、その手順を関節角度の連続に変えるのがVLAです。VLAという枠組み自体が初見なら、Gemini Roboticsとは何かで前世代の整理から読むと理解が早くなります。

歩行と物体操作を単一モデルで扱う全身制御が従来の分離構成と異なる点

従来のヒューマノイド制御は、歩行を担う脚部コントローラと把持を担うモデルを別に持ち、受け渡しを人手で設計していました。歩きながらかがんで床の物を取る動作は境界をまたぐため、動作ごとに調整が要ります。

Gemini Robotics 2はこの境界を取り払いました。公式デモではApptronikのApollo 2が、テーブルまで歩いてじょうろを取り、棚の指定位置に置く一連の動作を実行しています。開発側にとっての意味は、新しい全身動作を足すときに制御器間の受け渡しを設計し直さなくてよくなる点です。動作追加のコストが、制御設計からデータ収集へ移りました。

複数台のロボット協働をER 2が束ねる仕組みと向く作業単位の条件

複数ロボットの協働はER 2が担います。異なる種類のロボット同士が状況を伝え合い、一台では完了しにくい作業を分担する構成です。公式の説明では、散らかった部屋の片付けが例に挙げられました。

線引きは作業単位の粒度で判断できます。対象物が独立し、どれから手を付けても結果が変わらない作業は分担しやすい構造です。一方の完了が他方の前提になる直列の工程は、協働にしても待ち時間が増えるだけで速くなりません。倉庫のピッキングは前者、組立ラインの順序工程は後者です。

Apollo 2とFranka Duoの公表成功率から読む実力ラインと未達領域

公表値をタスク別に並べると、この世代の到達点が見えます。平均値ではなく分解して読むのが実務での使い方です。

把持位置で三割変わるApollo 2の成功率と現場設計への示唆

Apollo 2にInspire製ハンドを組み合わせた評価では、把持の成功率が位置によって45.7パーセントから76.3パーセントまで割れました。床置きだけが極端に低いのは、深くかがむ姿勢がバランス制御と視野の確保を同時に難しくするためと考えられます。

機体・ハンド タスク 公表成功率
Apollo 2+Inspireハンド 棚からの把持 76.3パーセント
Apollo 2+Inspireハンド テーブル上の把持 68.4パーセント
Apollo 2+Inspireハンド 床からの把持 45.7パーセント
Apollo 2+SharpaWave 電球を外す 92パーセント
Apollo 2+SharpaWave 電球を取り付ける 36パーセント
Apollo 2+SharpaWave ジップ袋の開閉 40パーセント
Franka Duo(グリッパ) 精密な挿入 89.6パーセント
Franka Duo(グリッパ) 工具のキッティング 78.9パーセント
Franka Duo(グリッパ) 一般的な移載 74.2パーセント

数値はGoogle DeepMind公式ブログ(2026年7月30日時点)の公表値です。現場設計への示唆は、床置きを前提にした導線を作らないことに尽きます。パレットや台車で作業高さを腰から胸にそろえるだけで、前提が45.7パーセント側から68.4パーセント側へ移りました。性能を待つより置き方を変えるほうが早く効きます。

電球の着脱で92パーセントと36パーセントに割れた器用さの限界

22自由度のSharpaWaveハンドを使った多指タスクの結果が、この世代の限界をはっきり示しています。電球を外す動作は92パーセント、取り付ける動作は36パーセントでした。

割れる理由は位置決めの許容誤差にあります。外す動作は掴んでから回すだけで、掴む位置が多少ずれても成立します。取り付ける動作はネジ山を合わせる必要があり、数ミリの誤差が失敗に直結しました。苦手なのは力の制御ではなく、接触状態を見ながらの微調整です。自社工程は位置決め精度の要求値で振り分けると判断を誤りにくくなります。

グリッパ主体のFranka Duoが示す二腕作業の実用水準と適用範囲

二腕構成のFranka Duoでは、精密な挿入が89.6パーセントに達しました。多指ハンドより単純なグリッパのほうが挿入作業で高い数値を出している点は見落とされがちです。

作業を五本指で人間と同じようにやらせる必要はありません。治具とグリッパで成立する工程なら、その構成のほうが成功率も安定性も上でした。多指ハンドが要るのは、把持対象の形状が事前に決まらず治具を作れない場面だけです。ロボットセルを組む発想と人の動きを置き換える発想では、いま時点は前者が現実的でした。

ER 2・VLA・On-Device 2の提供状況と今すぐ試せる導線

技術仕様より先に確認すべきは、どのモデルを誰が触れるかです。ここを取り違えると検証計画が最初から成立しません。

Google AI StudioとGemini APIで触れるER 2の範囲

Gemini Robotics ER 2はGoogle AI StudioとGemini API経由で提供が始まりました。Gemini Enterprise Agent Platform上ではプライベートプレビューの位置づけです。ER 2は映像・音声・テキストを受け取って作業を段階に分解する層で、機体がなくても検証できる範囲が広くあります。

ロボットを持たない段階でも検証は成立します。自社の作業を撮影した映像をER 2に与え、工程の分解、対象物の指し示し、進捗判定がどこまで当たるかを測る形です。ここで分解が破綻するなら、実機を用意しても結果は変わりません。マルチモーダル入力に慣れていないなら、Gemini 3.6 FlashでAPIの呼び出しとコスト感をつかむと、ER 2の検証へ移りやすくなります。

早期アクセス限定のVLAとOn-Device 2に近づく手順

実機を動かすVLA本体とOn-Device 2は、早期アクセスのパートナーにのみ提供されています。2026年8月時点で、一般提供の時期も価格体系も公表されていません。Trusted Tester Programの登録経路が案内されているため、申し込み自体は誰でも可能です。

通りやすさは保有機体と用途の具体性で決まります。対応機体を実際に持つこと、検証したい作業が定義されていること、安全管理の体制を説明できることの三点をそろえてから出します。機体がない状態で先に申し込んでも待ち時間が延びるだけでした。

公表された対応機体一覧から判断する自社ハードウェアの適合可否

公式に名前が挙がっているのは、Apptronik Apollo 2、Franka Duo、Dexmate、SO101、Trossenの各プラットフォームとBoston Dynamics、Agile Roboticsのシステムです。研究向けの安価な二腕アーム(SO101)から産業用ヒューマノイドまで幅があります。

自社の機体が一覧にない場合、選択肢は二つです。適応対象への追加を待つか、対応済みの機体を検証用に一台調達するか。後者ならSO101のような小型の二腕構成が扱いやすくなります。実機調達の前に工程を組むなら、Isaac Simのような環境で動線と作業高さを詰めると試行回数を減らせました。

少数デモ200例未満で新機体へ適応させる条件とデータ収集の実務設計

この世代で実務上いちばん効くのは、新しい機体への適応コストが下がった点です。ただし公表された「200例未満」という数字には前提があります。

200例未満という数字が成立する前提と数字が外れる場面の判別

公式の記述では、新しい二腕(bi-arm)の機体に対し200例未満のデモンストレーションと数時間で対応できるとされています。押さえるべきは「二腕の機体」という限定です。人型の全身制御を新規に習得させる場合の必要数は公表されていません。

数字が外れる場面は三つです。既存の対応機体と関節構成が大きく異なる場合、センサー構成(カメラ位置・数)が想定と違う場合、作業対象が透明や鏡面で扱いにくい場合。いずれかに該当するなら、200例を下限として扱い、数倍を見込む計画にしておくと安全でした。

数時間で終えるデータ収集の撮影環境と記録項目をそろえる設計手順

データ収集は段取りを決めてから始めないと、同じ日を二度やり直すことになります。実務では次の順序で組み立てます。

  1. 対象作業を一動作単位に切る(一連で記録するか分けるかを先に決める)
  2. カメラ位置と照明を固定し、収録中に変えない
  3. 成功試行だけでなく、失敗試行も理由を付けて残す
  4. 対象物の初期位置をばらつかせる範囲を決め、その範囲内で分布させる
  5. 1試行ごとに開始状態・終了状態・所要時間を記録する

四番目を省くと、決まった位置からしか掴めないモデルになります。実運用では対象物の位置が毎回ずれるため、収録時点でばらつきを入れる設計が結果を左右しました。複数系統のストリームをまとめて記録するなら、dora-rsのようなデータフロー基盤を挟むと再現性を確保できます。

二腕機体と人型機体で異なる適応コストの見積もり方と典型的な落とし穴

二腕は上半身の把持が中心で、動作の始点と終点が固定座標系に収まります。人型は移動が入るため、同じ作業でも立ち位置の違いが変数として加わりました。

落とし穴は、人型の適応コストを二腕の延長で見積もることです。歩行を含む動作は、把持が成功しても移動中の姿勢や停止位置で結果が変わります。人型なら収録工数を二腕の三倍、検証期間を二倍に置く計画が実感に近い見積もりでした。楽観するとPoCの期間内に評価まで届きません。

On-Device 2を前提にした機体側の構成要件と通信断への備え

クラウド推論とオンデバイス推論のどちらを基本に置くかは、後から変えにくい設計判断です。工程の性質から先に決めておきます。

ネットワーク非依存で動かす構成とクラウド併用時の責務の切り分け

Gemini Robotics On-Device 2は、ネットワーク接続なしで機体内部だけで推論を回すモデルです。無線環境が安定しない工場や倉庫、映像を外部へ出せない制約がある現場では、この構成が前提になります。

併用時の責務分担は計画と実行で切ります。作業計画と複数機体の調整はクラウド側のER 2、目の前の動作生成は機体側のOn-Device 2です。この分け方なら通信が切れても機体は動作を完了でき、次の指示だけが止まりました。動作生成をクラウドに置くと、通信断がそのまま動作の中断となり、掴んだ物を保持したまま停止します。

工場と倉庫で分かれる遅延許容量とオンデバイス採用を決める判断軸

遅延の許容量は現場によって分かれます。倉庫のピッキングや搬送は、数百ミリ秒の遅延が作業速度に影響しても安全上の問題になりにくい性質です。人が近くを通る通路での移動や力を加える作業では、判断の遅れが接触事故に直結しました。

判断軸は単純です。人が同じ空間にいる作業、または停止判断が要る作業はオンデバイスを必須とします。人が入らない区画の搬送だけならクラウド併用で始めてよい範囲です。安全柵の設計とも直結するため、機体の選定より先に決めると後戻りが減りました。

製造と物流の現場で採用してよい条件および現時点で見送るべき工程

ここからは判断を言い切ります。公表値と提供状況を踏まえたとき、2026年8月時点で採用してよい工程と待つべき工程ははっきり分かれています。

現時点で任せてよい搬送と片付けの工程および満たすべき前提条件

採用してよいのは、対象物を掴んで別の場所へ移す工程です。棚からの取り出しとグリッパでの挿入は、人がリカバリーできる前提なら実運用に載る水準でした。倉庫の入出庫、工具のキッティング、作業台の片付けが該当します。

条件は三つです。作業高さを腰から胸に統一する、失敗時に人が介入できる動線を確保する、対象物が壊れたときの損失が許容範囲に収まる。そろわない現場では、成功率の数字がそのまま運用の可否には変換されません。

精密組立と外観検査の工程を見送る根拠と当面の代替手段の選び方

見送るべきは、ネジ締めや嵌合を含む精密組立と、判定基準が言語化しにくい外観検査です。電球の取り付け36パーセント、ジップ袋の開閉40パーセントという数値は、接触しながらの微調整がまだ成立していないことを示します。三回に二回失敗する工程を自動化しても、リカバリーの人手が増えるだけでした。

当面の代替は工程を分けることです。位置決めを治具で吸収し、ロボットには搬送と粗い位置合わせまでを任せ、締結は専用機か人が担う構成にします。外観検査は汎用のロボットAIではなく、画像認識の個別モデルを立てるほうが精度もコストも見合いました。

導入判断で失敗する典型パターンとデモ映像から実力を読み取る視点

失敗の典型は、公式デモの映像を能力の平均値として受け取ることです。じょうろを棚に置く映像は成立していますが、その裏で床からの把持は45.7パーセントでした。映像に映るのは成功した試行であり、成功率そのものではありません。

映像から実力を読むときは三点を見ます。対象物の初期位置が毎回変わっているか、作業高さがどこか、動作が止まったときにどう復帰しているか。三つが映っていない映像は、自社工程への適合を判断する材料になりません。ベンダーのデモでも同じ観点で追加の試行を依頼します。

受託開発のPoCで実測すべき検証項目とASIMOV基準の安全評価

最後にPoCの設計です。公表された成功率は特定の機体と特定のタスクでの値なので、自社の条件で測り直す工程を必ず挟みます。

成功率を自社ラインで測り直すための試行設計と最低限の記録項目

測り直しの設計は、公表値と比較できる形にそろえるのが要点です。同一作業を最低50試行、対象物の初期位置を規定した範囲でばらつかせ、成功と失敗の判定基準を先に文書化します。判定基準を後から決めると、都合のよい解釈が入り込みました。

記録項目は、試行番号、初期位置、所要時間、成否、失敗時の分類(把持できない・落とす・位置ずれ・停止)の五つで足ります。この粒度があれば、失敗が視覚の問題か動作生成の問題かを切り分けられました。50試行を二日で回す段取りなら、条件を変えた再試行も同じ週内に収まります。

ASIMOV基準と人の接近時に働く停止条件を検証へ組み込む手順

安全側の評価も同時に回します。Google DeepMindはASIMOV-Agenticというベンチマークを用意し、安全でない操作の拒否と作業の実行可能性の予測を測る内容です。ER 2には人の接近に関する評価と、人が近づいた際の自動停止の仕組みが含まれると説明されています。

自社の検証には次の三つを試験項目として加えます。実行不可能な指示(存在しない物を取れ)を拒否するか、危険な指示(人に向けて物を投げろ)を拒否するか、作業中に人が規定距離まで近づいたとき停止するか。いずれも成功率とは独立に記録し、一件でも通過しない項目があれば運用条件の見直しに戻ります。安全は平均で評価しない領域です。

外部委託でPoCを回す場合の役割分担と契約前に詰める確認事項

ロボットAIのPoCは、機体の調達、データ収集、モデル適応、安全評価と工程が広く、社内だけで完結しにくい構造です。外部委託なら機体とデータは自社、モデル適応と評価設計は委託先という分担が現実的でした。データ収集を丸ごと外に出すと、自社の作業条件が反映されない収録になります。

契約前に詰めるのは、収集データの帰属、早期アクセス提供分の取り扱い、評価基準の合意、未達だった場合の打ち切り条件です。提供状況が流動的な段階では、期間を三か月程度に区切って評価地点を置く契約形態が向いています。ロボットAIを含むAI受託開発では、この検証設計を先に固めてから実装へ入るかどうかで、後半の手戻りが大きく変わりました。

よくある質問

Gemini Robotics 2について、導入検討の場でよく出る質問をまとめます。2026年8月時点の公表情報にもとづく回答です。

Gemini Robotics 2は日本の企業でも今すぐ使えますか?

ER 2はGoogle AI StudioとGemini API経由で提供されているため、日本からでも検証を始められます。VLA本体とOn-Device 2は早期アクセスのパートナー限定で、一般提供の時期は公表されていません。国内の商用導入事例も2026年8月時点で公表がなく、まずはER 2で作業分解の精度を測る段階から始めるのが現実的です。

前世代のGemini Robotics 1.5から何が変わりましたか?

最大の変更は、制御対象が上半身の把持からヒューマノイドの全身へ広がった点です。1.5世代は腕と手の操作が中心で、歩行は別系統の制御に任せる構成でした。第2世代は歩行・屈伸・把持を同一モデルの出力として扱い、複数ロボットの協働、22自由度の多指ハンド対応、オンデバイス版の提供も加わりました。

自社のロボットに対応させるにはどれくらいのデータが必要ですか?

公表されているのは、新しい二腕機体に対して200例未満のデモンストレーションと数時間という条件です。対応済み機体と近い構成の場合の値で、関節構成やセンサー配置が大きく異なる機体や人型の全身制御では同じ条件が示されていません。計画時は200例を下限に置き、数倍を見込む見積もりにしておくと検証期間の破綻を避けられます。

ヒューマノイド以外の産業用ロボットでも動きますか?

対応機体はApptronik Apollo 2やFranka Duoをはじめ、Dexmate、SO101、Trossen、Boston Dynamics、Agile Roboticsまで公表されています。二腕アームや研究用の小型機体も含まれ、ヒューマノイド専用ではありません。Franka Duoのグリッパ構成で精密な挿入が89.6パーセントに達しており、治具が使える工程では二腕構成のほうが成立しやすい状況でした。

導入コストと投資回収はどう見積もればよいですか?

モデル自体の価格体系は2026年8月時点で未公表のため、見積もれるのは機体調達費、データ収集の工数、安全設備の改修費の三つです。産業用ヒューマノイドは一台あたり数千万円規模の水準にあり、検証段階では小型の二腕機体で条件を確認してから本番機体を選ぶ順序が費用に見合います。回収計算は、置き換える工程の人時から失敗時のリカバリー工数を差し引いた実質削減分で組み立ててください。

関連記事

資料請求

RELATED POSTS 関連記事