GAIA-3は、英国の自動運転スタートアップWayveが2025年12月2日に発表した生成ワールドモデルです。規模は150億パラメータで、Wayveは前世代GAIA-2の2倍と説明しています。用途は走行映像を作ることそのものより、自社の自動運転AIを仮想空間で評価・検証することに置かれています。GAIAは「Generative Artificial Intelligence for Autonomy」の略です。
ただし、GAIAシリーズの最新版はもうGAIA-3ではありません。Wayveは2026年8月3日にGAIA-4を公開し、AIの運転判断が次の映像に反映される閉ループのシミュレーションと、レーダーの生成を加えました。この記事では、公式発表と論文で確認できる範囲に絞ってGAIA-3の仕組みと評価モードを整理し、GAIA-4で何が変わったかまで扱います。なお、AIエージェントの評価ベンチマーク「GAIA」や天文衛星「Gaia」とは別物です。
まとめ:GAIA-3の要点とGAIA-4との違い
- 規模:150億パラメータの潜在拡散ベースのモデル。ビデオトークナイザーはGAIA-2の2倍、学習計算量は5倍、学習データは約10倍で、9か国・3大陸の走行データを使っています。
- 目的:危険な場面を実車で再現せずに、自動運転AIを繰り返し同じ条件で評価すること。
- 評価モード:GAIA-3で加わったのは、自車の軌道だけを変えるWorld-on-Railsによる安全クリティカルなシナリオ生成、別のカメラ構成への変換(車体転移)、照明や天候を変える見た目の多様化の3つ。これらを組み合わせて、繰り返し実行できるオフライン評価スイートを作ります。
- 検証:初期研究では実走行の結果によく一致し、合成テストの棄却率が5分の1に下がったと発表されています。妥当性はウォーリック大学WMGと進める英国政府助成のDriveSafeSimでも検証中です。
- 限界とGAIA-4:GAIA-3のWorld-on-Railsでは他の車や歩行者が自車に反応しません。GAIA-4はAIの判断を次の映像に反映する閉ループ評価とレーダー生成に対応し、他の交通参加者を自車に反応させるreactive agentsも扱えるようになりました。
以下、世代ごとの違い、GAIA-3の評価モード、検証結果の読み方、限界の順に説明します。
Wayveが評価用に作った生成ワールドモデルとしてのGAIA-3
ワールドモデルは、周囲の環境がこの先どう変化するかを予測・生成するモデルです。GAIAシリーズは走行映像と車両の操作データから学習し、「自車がこう動いたら、カメラにはどう映るか」という映像を作ります。
GAIA-3の役割がはっきり評価寄りなのは、実車テストの弱点に理由があります。Wayveは公式ブログで、衝突やニアミス、制御を失う場面といった安全クリティカルな事象は「まれで予測できず、意図的に再現するには危険すぎる」と書いています。運転AIが上達するほど公道では問題の起きない走行ばかりが増え、弱点を確かめる材料が集まりません。実際の走行ログを出発点に、危険な分岐だけを仮想的に作れれば、この不足を補えます。
Wayveのチーフサイエンティスト、Jamie Shotton氏は発表で「GAIA-3により、ワールドモデルを視覚的な合成から真の自律走行の評価・検証へと進める」とコメントしています。映像のきれいさを競うモデルではなく、評価の道具として位置づけていることが分かる発言です。同じくロボットや自動運転向けに世界モデルを出しているNVIDIAの取り組みはCosmos 3の解説、DeepMindとWaymoの動きはGenie 3とWaymoのシミュレーション基盤の記事で扱っています。
GAIA-1からGAIA-4までの世代別スペックと追加機能
| 世代 | 公開 | パラメータ数 | 学習データ | 主な追加点 |
|---|---|---|---|---|
| GAIA-1 | 2023年6月(拡大版の発表は10月3日) | 初版10億/拡大版90億超 | ロンドンの走行4,700時間 | 映像・テキスト・操作から映像生成 |
| GAIA-2 | 2025年3月26日 | 84億(ワールドモデル部) | 英国・米国・ドイツ | マルチカメラ生成、細かな条件指定 |
| GAIA-3 | 2025年12月2日 | 150億 | GAIA-2の約10倍、9か国・3大陸 | 評価モード3種 |
| GAIA-4 | 2026年8月3日 | 公表なし | 公表なし | 閉ループ、レーダー生成 |
2023年10月に紹介されたGAIA-1の拡大版は、Wayveが2019年から2023年にロンドンで集めた4,700時間の走行データで学習しており、ワールドモデル部65億、ビデオデコーダー部26億の合計90億超のパラメータを持ちます。GAIA-2は技術報告で、潜在ワールドモデル部を84億パラメータとしています。WayveはGAIA-3を「GAIA-2の2倍の規模」と説明していますが、150億と84億の比は約1.8倍なので、2倍は概数と読むのが妥当です。
GAIA-2で加わったのは、複数カメラの映像を空間的・時間的に揃えて生成する機能と、条件指定の細かさです。速度やステアリングの曲率といった自車の操作、3Dバウンディングボックスで表した他車の動き、天候や時間帯、車線数・制限速度・横断歩道・信号といった道路情報を与えて映像を作れます。GAIA-3はこの土台を大きくし、評価に使うためのモードを揃えた世代です。
GAIA-3のスケール拡大:トークナイザー・計算量・学習データ
2倍のビデオトークナイザーと150億パラメータ
GAIA-3は潜在拡散(latent diffusion)をベースにしたモデルです。映像はまずビデオトークナイザーで圧縮した潜在表現に変換され、その空間で次の場面が生成されます。GAIA-3ではこのトークナイザーがGAIA-2の2倍の大きさになり、Wayveは現実の物理や因果関係をより忠実に表現できるようになったと説明しています。生成映像は輪郭がシャープになり、照明の一貫性やテクスチャの細部が向上し、特に道路標識の描写が改善したとされます。
標識の文字や信号の表示は、運転AIの判断を左右する情報です。評価用の映像でここが崩れていると、AIが誤った行動をとってもモデルの能力の問題なのか映像の破綻なのかを切り分けられません。トークナイザーの大型化は、見栄えより評価結果の信頼性に効く改良です。
計算量5倍・データ約10倍・9か国3大陸
学習にはGAIA-2の5倍の計算量を投じ、データ量は約10倍に増やしています。GAIA-2の学習データは英国・米国・ドイツでしたが、GAIA-3は3大陸の9か国に広がりました。9か国すべての国名は発表資料に一覧されていません。
データの国が増えると、左側通行と右側通行、標識の様式、道路の幅といった違いを1つのモデルで扱えます。複数国の道路を1つの生成モデルで扱えるため、地域ごとの評価シナリオを共通の仕組みで作りやすくなります。
GAIA-3の評価機能:安全クリティカル生成・オフライン評価・車体転移・頑健性
World-on-Railsによる安全クリティカルなシナリオ生成
中核になるのが、Wayveが「World-on-Rails」と呼ぶ手法です。実際に記録した走行シーンを出発点に、自車の軌道だけを書き換えます。他の車や歩行者は記録どおりの動きを続け、照明や天候、建物などの静的な要素も変わりません。たとえば記録上は無事に通過した交差点で、自車を対向車線寄りに進ませた場合の映像を作れます。
生成した場面が物理的に破綻していないかの確認には、LiDARで記録した実際の走行シーケンスを使っています。自車の軌道を変えて物体と衝突する場面を作り、元の記録の点群と生成フレームを重ね合わせて、ずれや不整合がないかを調べる方法です。
GAIA-3のオフライン評価スイートによるモデル比較
オフライン評価スイートは、発表資料が挙げる3つの新しい評価モードとは別に、それらを束ねて使う枠組みです。自車の行動を条件として与える機能に、必要に応じてWorld-on-Railsの変化を組み合わせると、1つの実シーンから条件を少しずつ変えた派生シナリオを量産できます。Wayveはこれを、規模を広げられ、繰り返し実行でき、結果を数値で測れるオフライン評価のテスト群と説明しています。運転モデルを更新するたびに同じテスト群を流せば、前のバージョンより良くなったか悪くなったかを同じ条件で比べられます。
別のカメラ構成への変換(車体転移)
元の映像は、前方1台、側方2台、後方2台の計5台のRGBカメラを積んだ車両で撮影されています。GAIA-3は、別の車両のカメラ構成で撮った少量のデータ(元の映像と対になっていないもの)があれば、同じシーンをその構成から見た映像に描き直せます。Wayveはこれを「embodiment transfer」と呼んでいます。
対象のカメラ構成の少量データを用意すれば、同じ珍しい場面を車種ごとに対で撮影する負担を減らせます。日産が次世代プロパイロットへのWayve AI Driver搭載で最終契約を結ぶなど、量産車への展開を進めるWayveにとって、実務上の意味が大きいモードです。
controlled visual diversityによる照明・天候の頑健性テスト
3つ目の評価モードは、見た目だけを変えて運転モデルの頑健性を確かめるものです。発表資料での名称は「controlled visual diversity」で、Wayveは運転モデルが見た目や照明、意味的な要素の変化に直面しても信頼できる動作を保つ必要があると説明しています。照明、テクスチャ、天候を変えても、シーンの形状や他車の動きは変わりません。晴天の記録を雨や夕方の見た目に変えて、同じ状況で判断がぶれないかを調べられます。見た目の変化で挙動が変わるなら、モデルが道路の構造ではなく色や明るさに頼って判断している疑いがあります。
DriveSafeSimでの妥当性検証と「棄却率5分の1」の読み方
生成した映像での評価結果が実車での結果と一致しなければ、評価の道具として使えません。Wayveはこの妥当性を、ウォーリック大学のWMG(Warwick Manufacturing Group)と組んだ英国政府助成のプロジェクトDriveSafeSimで検証しています。
WayveのGAIA-3発表資料によると、GAIA-3の初期の研究では、GAIA-3上でのテスト結果が実走行の結果によく一致し、合成テストの棄却率が5分の1に下がりました。発表文はこれをDriveSafeSimの成果とは書いておらず、GAIA-3の初期研究の結果として示しています。棄却率は、生成したテストのうち使えないと判断されて捨てられた割合を指すと読めます。捨てるテストが減れば、同じ計算量で得られる有効な評価が増えます。
ただし、この数字は「初期の研究」の結果で、母数や棄却の判定基準は発表資料にありません。Wayve自身もブログで、DriveSafeSimを通じた検証を「引き続き進める」と書いています。現時点では、シミュレーション上の評価で実車テストや認証試験を置き換えられることが示されたわけではありません。
GAIA-3の限界:他の交通参加者が自車に反応しない評価
World-on-Railsの「他の車は記録どおりに動く」という性質は、シーンの一貫性を保つ利点であると同時に、他者との相互反応を評価する際の制約でもあります。GAIA-4の発表でWayveは、World-on-Railsでは他の交通参加者が自車に反応しないこと、固定された記録を見せる評価ではモデルが何を予測するかしか分からないことを明記しました。
このため、GAIA-3による評価に向かない場面があります。合流で相手が譲るかどうか、歩行者が自車を見て止まるかどうかなど、相手の反応が結果を決める状況です。自車が急に進路を変えても他車が記録どおりに進むので、現実なら避けられた衝突が起きたり、逆に起きるはずの危険が再現されなかったりします。こうした駆け引きの評価をGAIA-3の結果だけで判断するのは避けるべきです。
生成モデルとしての課題も残ります。GAIA-2の公式ブログは、アーティファクトやハルシネーションの抑制、長い時間幅の複雑なシーンで生じる不整合、生成速度を課題に挙げていました。GAIA-3のブログでも、効率化とリアルタイム生成は引き続き取り組むテーマとされています。また、GAIA-3の発表資料には外部企業への提供や料金についての記載がなく、他社が導入できる製品として案内されているわけではありません。
GAIA-4で変わった点:閉ループシミュレーションとレーダー生成
2026年8月3日に公開されたGAIA-4は、GAIA-3で課題だった他者との相互作用の評価に手を入れた世代です。記録したシーンを新しいシミュレーションの出発点にし、そこへWayveのAI Driverを戻して走らせます。AIがブレーキを踏めば視点は減速し、ハンドルを切れば次に見える景色が変わる、という閉ループです。記録を再生するのではなく、AIの判断が生む先の展開を生成するため、現実には起きなかった展開も評価できます。
もう1つの追加がレーダーです。カメラ映像と並べてレーダーの検出結果も同じワールドモデルで生成し、Wayveはこれを自動運転シミュレーターとして業界初と説明しています。レーダーは霧や水しぶき、暗所など、カメラの視界が悪い条件で冗長性を担うセンサーです。記録したシーンを再構成するタスク向けに学習させたことで、記録された世界を保つ忠実度が2.5倍になったとされていますが、GAIA-4のパラメータ数は公表されていません。
World-on-Railsの扱いも変わりました。WayveのGAIA-4解説記事は、World-on-Railsをモデルの限界ではなく切り替えて使う機能と位置づけています。この制約を外すと、他の交通参加者が自車の動きに反応するreactive agentsになり、合流での譲り合いや交差点での駆け引きのように、実際のやり取りがないと試せない場面を扱えます。全員が記録どおりに動く保守的な再生は、検証用として残されています。
複数の運転モデル候補を同じシナリオ集に閉ループで通し、介入のたびに再生して原因を調べられる点も、GAIA-3のオフライン評価との違いです。GAIA-3の評価モードや検証の枠組みはGAIA-4の前提になっているので、GAIA-4を理解するうえでもGAIA-3の仕組みを押さえておく価値があります。カメラ映像から直接運転操作を学ぶエンドツーエンド型の考え方は、フィジカルAIと自動運転の解説で整理しています。
よくある質問
GAIA-3のパラメータ数はどれくらいですか?
GAIA-3のパラメータ数は150億です。Wayveは前世代GAIA-2の2倍の規模と説明しており、ビデオトークナイザーもGAIA-2の2倍の大きさになっています。学習にはGAIA-2の5倍の計算量が使われ、データは約10倍、9か国・3大陸の走行データです。GAIA-2の潜在ワールドモデル部は技術報告で84億パラメータとされ、2023年10月に紹介されたGAIA-1の拡大版は90億超(6月の初版は10億)でした。
WayveのGAIAシリーズの最新版はどれですか?
2026年9月時点の最新版は、2026年8月3日に公開されたGAIA-4です。GAIA-3が記録シーンから作ったシナリオによるオフライン評価を中心としていたのに対し、GAIA-4はAIの運転判断を次の映像に反映させる閉ループのシミュレーションに対応し、カメラ映像に加えてレーダーの検出結果も生成します。GAIA-4のパラメータ数は公表されていません。新しい世代が出ることもあるため、最新情報はWayveの公式サイトで確認してください。
GAIA-3はいつ発表されましたか?
GAIA-3は2025年12月2日に発表されました。シリーズとしては、GAIA-1が2023年6月に概念実証として公開され(技術報告は同年10月3日)、GAIA-2が2025年3月26日、GAIA-3が2025年12月2日、GAIA-4が2026年8月3日という順です。GAIA-1は6月の初版が10億パラメータで、10月に90億超の拡大版と技術報告が公開されています。
GAIA-3とGAIA-2の違いは何ですか?
主な違いは規模と用途です。GAIA-3はパラメータ数が150億でGAIA-2のワールドモデル部(84億)の約1.8倍、ビデオトークナイザーが2倍、計算量が5倍、データが約10倍で、学習データの地域は英国・米国・ドイツから9か国に広がりました。用途の面では、GAIA-2が多視点映像の生成と細かな条件指定を打ち出したのに対し、GAIA-3は安全クリティカルなシナリオ生成や車体転移など、自動運転AIを評価するためのモードを備えた点が違います。
ワールドモデルとは何ですか?
ワールドモデルは、周囲の環境がこの先どう変化するかを予測・生成するモデルです。自動運転では、走行映像と車両の操作データから学習し、自車が特定の操作をしたときにカメラに何が映るかを生成します。WayveのGAIAシリーズはこの種のモデルで、GAIA-3では生成した映像を運転AIの評価に使います。ロボットや自動運転向けには、NVIDIAのCosmosやDeepMindのGenieなども同じ分野のモデルとして公開されています。