DreamDojoは、NVIDIAとUC Berkeley・Stanford・UT Austin・HKUSTなどの研究者が公開した、ロボット向けの汎用ワールドモデルです。ロボットの遠隔操作データではなく、人が一人称視点で撮った44,711時間の映像を事前学習に使う点が特徴で、論文はarXivに2026年2月9日、コードとモデル重みは同年2月18日に公開されました。ここでは論文・GitHubリポジトリ・Hugging Faceのモデルカードという一次情報だけを使い、学習データの正確な内訳、蒸留で到達した生成速度、そして手元で動かすときに効いてくるライセンスと必要GPUを整理します。
まとめ:DreamDojoの要点
- 44,711時間はデータ混合全体の時間。DreamDojo-HV単体は43,827時間で、ほかにEgoDex 829時間、自社ラボ収録55時間が加わる。
- 基盤はNVIDIAのCosmos-Predict2.5。640×480の固定解像度で事前学習し、2B版と14B版の2系統がある。
- Self Forcingによる蒸留で、教師モデルの2.72FPSから生徒モデル10.81FPSへ。長尺評価ではH100 1枚で600フレーム(1分)を生成している。
- OODの人手選好評価で、14B版はCosmos-Predict2.5に対し物理的な正しさ73.50%、行動追従72.55%の勝率。
- ライセンスは3層で別々。コードはApache-2.0、重みはNVIDIA Open Model License、公開データセットはCC BY-NC 4.0(非商用)。
- 公開チェックポイントは2B・14B×(事前学習+GR-1/G1/AgiBot/YAM向け事後学習)の10種類と、潜在行動モデル1種類。
- 動作確認環境はNVIDIA H100 80GB。学習は事前学習がH100 256枚、既定の事後学習でもH100 128枚を使う。
44,711時間の正確な内訳と、行動ラベルなしの映像を学習に載せる仕組み
DreamDojo-HVは43,827時間、44,711時間は3データ源の合計
数字の帰属を最初に整理しておきます。論文が「世界モデルの事前学習として過去最大」と述べる44,711時間は、単一データセットの規模ではなく学習に使ったデータ混合全体の合計です。内訳は、クラウドソーシングで新規収集した自社データセットDreamDojo-HVが43,827時間、Apple Vision Proで収録された公開データセットEgoDexが829時間、研究チームが自社ラボの卓上環境で収録した検証用データが55時間。DreamDojo-HVという名前で44,711時間を語ると、公開データの寄与分を自社収録分に付け替えることになります。
混合全体では6,015種類のタスクと43,237種類の物体をカバーします。論文の表1とその説明では、先行研究が事前学習に使ったデータセットに対して収録時間15倍、スキル数96倍、シーン数2,000倍と報告されています。この「シーン2,000倍」という開きが、DROIDやAgiBot-Worldのようなロボット収録型データセットとの性格の違いをよく表しています。ロボットで撮る限り撮影場所はラボや実験施設に偏りますが、人が日常で撮る映像には台所も店舗も工場も最初から含まれています。
連続潜在行動による機体間の共通表現
大規模な人間映像に、ロボットの関節角度や速度に相当する行動ラベルが一律に付いているわけではありません。In-labとEgoDexには手の姿勢情報がありますが、43,827時間のDreamDojo-HVを含む混合全体で使える共通ラベルは存在しません。DreamDojoはここに「連続潜在行動(continuous latent actions)」を挟みます。隣接フレーム間で何が変わったかを自己教師あり学習でベクトルに埋め込み、それを人間映像とロボットデータに共通の代理行動として扱う設計です。
この一段を挟む実利は2つあります。ラベルのない映像をそのまま事前学習に投入できること、そして関節構成の異なる機体をまたいで同じ表現を使えること。潜在行動モデルの学習にはUnitree G1、Fourier GR-1、AgiBot、YAMのロボットデータが使われており、機体ごとに行動フォーマットを揃え直す工数を避けています。同じ「人間の映像から運転や操作を学ばせる」発想は自動運転側でも動いており、比較対象としてはWayve GAIA-3とは|150億パラメータの自動運転ワールドモデルとGAIA-4での変化が近い位置にあります。
Cosmos-Predict2.5を基盤とする学習と蒸留による高速化
事前学習の規模はH100 256枚
ワールドモデルの土台には、NVIDIAの事前学習済みCosmos-Predict2.5を使います。このモデルはWAN2.2トークナイザーが生成する連続潜在空間の上で動作し、DreamDojoは640×480の固定解像度・13フレーム長で事前学習されました。事前学習はNVIDIA H100を256枚使い、バッチサイズ1024で140,000ステップ回しています。同規模の計算資源を用意しないなら、公開済みの事前学習済みチェックポイントを起点に、自社ロボットのデータで事後学習する経路が候補になります。ただし論文の既定の事後学習もH100を128枚使い、バッチサイズ512で50,000ステップです。データ量が少ないことと計算負荷が小さいことは別で、事後学習だけなら手元のGPU 1枚で足りるという話にはなりません。
NVIDIAのロボティクス開発基盤との関係でいえば、DreamDojoはあくまで研究成果であり製品ではありません。物理エンジンで力学を解く従来型のシミュレータとは役割が違うため、Isaac Simの基本概要とNVIDIAロボティクス開発で果たす役割のような既存環境を置き換えるものではなく、並べて使う対象として見るのが妥当です。
蒸留による生成速度の改善:2.72FPSから10.81FPSへ
生成モデルをロボットのループに入れるには速度が要ります。DreamDojoはSelf Forcingの枠組みで教師モデルを生徒モデルへ蒸留しました。GR-1の長尺評価では、教師がPSNR 14.086・SSIM 0.442・LPIPS 0.412で2.72FPS、蒸留後の2B生徒がPSNR 13.146・SSIM 0.379・LPIPS 0.485で10.81FPS。PSNRとSSIMは高いほど、LPIPSは低いほど良好な指標です。蒸留後は3指標とも悪化しますが、生成速度は約4倍になります。
この10.81FPSはNVIDIA H100を1枚使ったときの実測で、予測長4フレーム・コンテキスト長12フレームという設定です。任意長の自己回帰生成が可能になりました。よく引かれる「1分」は、GR-1 Long Evalで教師と生徒に600フレームを生成させた長尺ストレステストの条件であって、ライブ遠隔操作の連続稼働時間を保証する値ではありません。
評価は6本のベンチマークで、比較対象は土台のCosmos-Predict2.5
評価はIn-lab Eval、EgoDex Eval、DreamDojo-HV Eval、Counterfactual Eval、EgoDex-novel Eval、DreamDojo-HV-novel Evalの6本で構成されます。14B版のスコアはIn-lab EvalでPSNR 21.413・SSIM 0.788・LPIPS 0.208、反事実的な行動を与えるCounterfactual EvalでPSNR 21.087・SSIM 0.793・LPIPS 0.185でした。
実務判断で効くのは人手選好評価のほうです。分布外シナリオで生成映像を並べて人に選ばせた結果、DreamDojo-14Bは土台のCosmos-Predict2.5に対して物理的な正しさで73.50%、行動追従で72.55%の勝率を取りました。2B版は同じ比較で62.50%と63.45%。比較相手が汎用の映像生成モデルではなく自分の基盤モデルである点に注意してください。この数字が示しているのは「人間映像での事前学習と潜在行動の追加が土台からどれだけ伸ばしたか」であって、他社のロボット基盤モデルに対する優劣ではありません。
GitHubで公開されたコード・重み・データと、3つに分かれたライセンス
DreamDojoの公開物と公開履歴
リポジトリのNews欄に記載された公開履歴は次のとおりです。2026年2月9日に論文がarXivへ、2月18日に事前学習・事後学習の両コード、2B・14Bの全チェックポイント、そしてGR-1の事後学習用データセットと評価セットが公開されました。リポジトリのAbout欄は本コードベースをICML 2026の公式実装と表示しています。
Hugging Face側のモデルカードは概要とリンクのみで、モデル一覧も入出力仕様も書かれていません。実際に何が置かれているかはファイルツリーを見る必要があります。
| 用途 | 2B系 | 14B系 |
|---|---|---|
| 事前学習済み | 2B_pretrain | 14B_pretrain |
| Fourier GR-1向け | 2B_GR1_post-train | 14B_GR1_post-train |
| Unitree G1向け | 2B_G1_post-train | 14B_G1_post-train |
| AgiBot向け | 2B_AgiBot_post-train | 14B_AgiBot_post-train |
| YAM向け | 2B_YAM_post-train | 14B_YAM_post-train |
| 潜在行動モデル | LAM_400k.ckpt | LAM_400k.ckpt |
ライセンスはコード・重み・データで別々
商用利用を検討するなら、ここが最初の確認点です。DreamDojoは公開物ごとにライセンスが違います。ソースコードはApache-2.0。Hugging Faceのモデル重みはNVIDIA Open Model License。そして公開されたデータセット、つまりGR-1の事後学習データと3種類の評価セットを収めたPhysicalAI-Robotics-GR00T-Teleop-GR1はCC BY-NC 4.0、すなわち非商用ライセンスです。
実務上の帰結ははっきりしています。公開データセットを使った学習や評価は、そのままでは商用の製品開発に持ち込めません。商用で回すなら、コードと重みを起点に自社で収集したロボットデータで事後学習する経路になります。公開データセットのほうは「社内なら安全」とは言い切れません。商業的利益を主目的とする利用に当たらないかを個別に確認し、当たるなら別途許諾が要ります。また、事前学習の本体である43,827時間のDreamDojo-HVは配布されていません。公式Hugging Faceに置かれたDreamDojo-HV_Evalは人間映像の一部ではなく、論文が「3つの人間データセットに現れる多様で新規なインタラクションを写し取り、Fourier GR-1ヒューマノイドで対応する評価セットを構築した」と述べているとおり、ロボットで撮り直した評価用データです。44,000時間の映像そのものを入手して事前学習から再現することは、現時点ではできない前提で計画してください。
セットアップはuvとH100 80GB
公式のSETUP.mdは「現行コードはNVIDIA H100 80GBでテストされている」と明記しています。ただし2B版・14B版それぞれの最小VRAMや推論時のメモリ消費量までは書かれていません。H100 80GBが一律の下限というわけでもなく、論文の遠隔操作デモではRTX 5090を積んだローカルのデスクトップでDreamDojo-2Bを動かしています。環境構築にはuvを使い、リポジトリ直下でinstall.shを実行します。
git clone https://github.com/NVIDIA/DreamDojo.git
cd DreamDojo
bash install.sh
install.shの中身はuvの導入に続いて uv sync --extra=cu128 --python 3.10 を実行し、PyTorch本体とpytorch3d、torchcodecなどを追加で入れる構成です。CUDA 12.8・Python 3.10が前提になっている点は、既存の学習環境と衝突しやすいので先に確認しておくとよいでしょう。
評価はリポジトリ直下のeval.shにまとまっていますが、このファイルはそのままでは動きません。中身は著者環境の絶対パス(PYTHONPATH・HF_HOME・仮想環境・チェックポイント置き場)を直接書いたラッパーで、引数を外から受け取る作りにもなっていません。実体は examples/action_conditioned.py なので、EVAL.mdが示す引数はこちらへ直接渡します。
source .venv/bin/activate
python examples/action_conditioned.py \
-o outputs/action_conditioned/basic \
--checkpoints-dir CHECKPOINTS_DIR \
--experiment dreamdojo_2b_480_640_gr1 \
--save-dir outputs/dreamdojo_eval \
--dataset-path datasets/PhysicalAI-Robotics-GR00T-Teleop-GR1/EgoDex_Eval \
--num-frames 49 \
--num-samples 100 \
--data-split full \
--deterministic-uniform-sampling
--checkpoints-dir には保存済みチェックポイントの親ディレクトリを、--experiment には設定名を指定します。eval.shが使っている設定名は dreamdojo_2b_480_640_gr1 です。--infinite を付けると新しいチェックポイントを定期的に検出し続けるため、事後学習を回しながら性能推移を追えます。なお上のコマンドはH100級のGPUとチェックポイント・データの配置を前提としており、手元での動作確認はその環境で行ってください。
DreamDojoの適用範囲と実機評価を補完する条件
公開された成果のうち、実務で当てにできるのはポリシー評価です。AgiBotの果物梱包タスクでは、DreamDojo内で測った成功率と実環境での成功率のPearson相関が0.995、MMRVは0.003でした。果物の置き方を変えた20場面での結果で、相関がこの水準にあるということは、実機を動かさずに方策の順位を付けられるということです。ただし論文自身が「DreamDojo内の絶対成功率は実環境より高く出やすく、細かな失敗を正確に生成できない」と書いています。順位は当てにできても成功率の絶対値は当てにできない、という読み方が正確です。費用対効果は、削減できる実機試行の時間と人件費を、生成モデルの推論と採点にかかる費用と突き合わせて測ります。モデルベースプランニングでも、一様サンプリング比で成功率が約2倍になったと報告されています。ライブ遠隔操作についてはPICO VRコントローラでのリアルタイム制御が示されていますが、こちらはデモンストレーションの域です。
一方、当てにすべきでない使い方もはっきりしています。DreamDojoが出力するのはピクセル空間の映像であり、接触力の数値や変形量が物理的に正しく求まるわけではありません。力制御の設計値を取り出す用途には向きません。評価も卓上のマニピュレーションが中心で、歩行やナビゲーションのような全身運動については検証範囲外です。加えて、人手選好評価の比較相手が自身の基盤モデルである以上、Gemini Robotics 2とは|全身制御と提供範囲・検証手順を実装目線で解説【2026年8月】のような他系統のロボット基盤モデルと直接比較した結果は、この論文からは読み取れません。導入検討の段階では、実機評価との順位一致を自社タスクで先に確かめたうえで、方策候補の絞り込みを補助する用途に限定して見るのが現実的です。
よくある質問
DreamDojoはどこで入手できますか?
コードはGitHubのNVIDIA/DreamDojo、モデル重みはHugging Faceのnvidia/DreamDojoで公開されています。いずれも2026年2月18日公開で、事前学習済みと事後学習済みの両方が置かれています。プロジェクトページはdreamdojo-world.github.ioです。
DreamDojoは商用利用できますか?
公開物ごとに条件が異なります。コードはApache-2.0で商用利用できますが、再配布時にはライセンスの同梱と著作権表示の保持といった条件が付きます。モデル重みはNVIDIA Open Model Licenseの条件に従って商用利用でき、利用・再配布の条項を確認してください。公開データセットのPhysicalAI-Robotics-GR00T-Teleop-GR1はCC BY-NC 4.0で非商用に限定されています。
DreamDojo-HVデータセットは公開されていますか?
43,827時間の本体は公開されていません。NVIDIA公式のHugging Faceで配布されているのは、Fourier GR-1で撮り直した評価データのDreamDojo-HV_Eval・EgoDex_Eval・In-lab_Evalと、事後学習用のGR1_robotです。
動かすにはどのGPUが必要ですか?
公式ドキュメントはNVIDIA H100 80GBでテストしたと記載しています。蒸留後の2B生徒モデルが10.81FPSを出したのもH100 1枚の条件ですが、遠隔操作デモではRTX 5090のデスクトップで2B版を動かしています。学習側は事前学習がH100 256枚、既定の事後学習でもH100 128枚です。
Cosmos Predict 2.5とDreamDojoは何が違いますか?
Cosmos-Predict2.5はDreamDojoの基盤アーキテクチャです。DreamDojoはその上に、人間映像による事前学習と連続潜在行動による行動制御を追加しています。分布外シナリオの人手選好評価では、14B版がCosmos-Predict2.5に対し物理的な正しさで73.50%の勝率を示しました。