楽天グループが2026年3月17日に公開した「Rakuten AI 3.0」は、プレスリリースで「オープンソースコミュニティ上の最良なモデルを基に」と説明されたまま、ベースモデル名を本文中で名指ししませんでした。この記事では、Hugging Faceの config.json と tokenizer.json を DeepSeek-V3 と直接突き合わせた結果、楽天が公開翌日に差し替えた公式ベンチマーク表、そして673GBという実配布サイズから逆算した動作要件を、一次情報だけで整理します。
まとめ:DeepSeek V3ベースという結論と、その根拠
- ベースはDeepSeek-V3。config.jsonのキーは和集合で46項目、うち42項目が共通で、値が違うのは
transformers_versionの1項目だけでした。 - tokenizer.json は両者でMD5が一致します。つまり日本語向けの語彙拡張は入っていません。7B・2.0で行っていた語彙拡張の方針が3.0で変わっています。
- ただし重み自体は別物です。総パラメータはRakuten側671.07B、DeepSeek-V3側684.53Bで一致しません。設定を引き継いだ追加学習済みモデルであって、単なる再配布ではありません。
- ライセンスはApache 2.0。DeepSeek由来のMIT表示はNOTICEで保持され、そのNOTICEはリリース当日に作成されています。
- 公式比較表は2026年3月18日に更新済みです。更新後の数値では、671Bの本モデルが120BのGPT-OSS-SwallowにMMLU-ProXとMATH-100で負けています。
- FP8の重みは673.2GB。公式が案内する8基構成をそのままH100 80GBのノードに投げると、起動時にメモリ不足で落ちます。
以下、それぞれの根拠を実際のファイルとプレスリリースの逐語で示します。
公開スペックと現在の入手経路
Rakuten AI 3.0は、経済産業省とNEDOのGENIACプロジェクトの一環として開発されました。楽天は2025年7月にGENIACの第3期公募へ採択され、学習費用の一部について補助を受けています。モデルの発表は2025年12月18日、Apache 2.0ライセンスでの重み公開は2026年3月17日です。公開時点のスペックは、楽天の日本語表記で約7,000億パラメータ、モデルカードの表記で総パラメータ671B、1トークンあたりの活性化パラメータ37B、コンテキスト長128Kとなっています。政策上の位置づけは日本語最大規模LLMとして登場したRakuten AI 3.0の開発背景とGENIACプロジェクトの位置づけで扱っています。
設定ファイル側の max_position_embeddings は163,840で、YaRNによる拡張(factor 40、拡張前4,096)が入っています。モデルカードが掲げる128Kは、この163,840トークンの枠内で実用上保証する長さという読み方になります。
配布は楽天公式のHugging Faceリポジトリ1本のみ。instruct版のような派生リポジトリは分かれておらず、チャット用テンプレートは本体の chat_template.jinja に同梱されています。2026年9月3日時点で楽天のHugging Face組織アカウントを作成日の新しい順に確認したところ、3.0より後に公開された大規模モデルはありません。3.0が現行の最新版です。
config.jsonとtokenizer.jsonの実物照合
共通42項目のうち値が違うのは transformers_version だけ
Rakuten AI 3.0の config.json は、先頭の architectures が DeepseekV3ForCausalLM、model_type が deepseek_v3 です。DeepSeek-V3公式リポジトリの config.json と全キーを突き合わせると、キーの和集合は46項目、そのうち両方に存在する42項目で値が異なるのは transformers_version(4.57.1 と 4.33.1)だけでした。片側にしかない4項目は、Rakuten側の aux_loss_alpha・pretraining_tp・seq_aux とDeepSeek側の auto_map で、いずれも学習時の補助設定とローダ指定にあたります。アーキテクチャを決めるフィールドは完全に一致します。
| config.jsonの項目 | Rakuten AI 3.0 | DeepSeek-V3 |
|---|---|---|
| n_routed_experts | 256 | 256 |
| num_experts_per_tok | 8 | 8 |
| n_shared_experts | 1 | 1 |
| first_k_dense_replace | 3 | 3 |
| num_hidden_layers | 61 | 61 |
| hidden_size | 7168 | 7168 |
| kv_lora_rank | 512 | 512 |
| vocab_size | 129280 | 129280 |
| max_position_embeddings | 163840 | 163840 |
この値の並びは、楽天自身が2025年12月18日のプレスリリースで書いた説明と一致します。同リリースは「アクティブパラメータには3つの密な層とエキスパートコンポーネントが含まれ、各トークンは、常にアクティブな『共有エキスパート』と8つの『専門エキスパート』を経由します」と述べています。first_k_dense_replace の3、n_shared_experts の1、num_experts_per_tok の8がそのまま日本語に置き換えられた形です。「128個のエキスパートから2つを選ぶ」と書かれた解説を見かけますが、設定値とも楽天の公式説明とも合いません。kv_lora_rank の512も、KVキャッシュを圧縮するMulti-head Latent AttentionがDeepSeek-V3のまま引き継がれていることを示します。
tokenizerはバイト単位で同一、ただし重みは別物
より踏み込んだ確認ができるのが tokenizer.json です。Rakuten AI 3.0とDeepSeek-V3の tokenizer.json をダウンロードしてハッシュを取ると、どちらも a3acd066a7f206efd5d5dd020e847f1f で一致しました。差分はゼロ、バイト単位で同じファイルです。vocab_size の129,280が一致するだけでなく、トークナイザ本体が手つかずということになります。
では単なるリブランドなのか。ここは違います。Hugging Faceが公開しているsafetensorsのメタデータを見ると、総パラメータはRakuten AI 3.0が671,067,257,432、DeepSeek-V3が684,531,386,000で一致しません。設定とトークナイザは引き継ぎつつ、重みそのものは楽天が追加学習を回して作り直した別のファイル群です。
トークナイザを触らなかった点は、楽天の過去モデルと比べると方針転換にあたります。Rakuten AI 7Bのモデルカードには、Mistral-7B-v0.1をベースにしたうえで語彙を32,000から48,000へ拡張し、日本語の1トークンあたり文字数を改善したと明記されています。Rakuten AI 2.0の8x7Bも vocab_size は48,000。日本語トークナイザの作り込みは、初代から2.0まで一貫した楽天の技術的な売りでした。3.0はそこを引き継いでいません。
実務上の含意ははっきりしています。同じ日本語文を入れたときのトークン消費量は、Rakuten AI 3.0とDeepSeek-V3で同じ。トークン効率を期待して3.0を選ぶ理由はなく、日本語性能の差は追加学習の中身から来ています。
もう一点、ベースの世代も押さえておく価値があります。DeepSeek-V3がHugging Faceに公開されたのは2024年12月25日です。楽天が3.0を出した2026年3月の時点で、DeepSeek本家はすでにDeepSeek-V3.2とは?V3.2-Speciale・DSAの仕組みと性能・使い方・料金を徹底解説で扱ったV3.2(2025年12月公開)へ進んでおり、現在はDeepSeek V4とは?Compressed Sparse Attention(CSA)の仕組みとPro/Flashの性能・料金・移行期限のV4系が動いています。3.0の土台は、公開時点ですでに1世代前の設計でした。
「最良なモデル」表記とNOTICEの時系列
公開直後に議論になったのは、ベースモデルを名指ししなかった点でした。ここはコミットログで時系列を確定できます。Hugging Faceが返す時刻はUTCで、リポジトリの履歴は2026年3月16日12時42分(UTC)のinitial commit、同日15時20分の重みアップロード、15時29分のテンプレート改名と続き、翌3月17日4時32分に「Update MODEL Card」、4時45分に「Create NOTICE」、4時52分に「Add the permission notice」が入っています。プレスリリースが出たのは3月17日です。
NOTICEの中身は「Copyright (c) 2023 DeepSeek」で始まるMITライセンスの条文そのものです。現在のモデルカードのタグにも DeepSeek-V3 と Mistral が並んでいます。つまり、外部から指摘を受けてから慌てて権利表示を足した、という筋書きはコミットログからは支持できません。NOTICEはリリース当日、最初のコミットから丸1日以内に作られています。
それでも説明として不十分だった点は残ります。プレスリリースの本文もモデルカードの説明文も、散文の中でDeepSeekの名を出していません。読み手がタグ一覧かNOTICEファイル、あるいは config.json を自分で開かない限り、ベースモデルにたどり着けない書き方でした。批判が当たるのはこの一点で、権利処理そのものではありません。オープンモデルを土台に追加学習する開発手法自体は、デジタル庁が選定した国産AI7モデルとは|源内で試用するソブリンLLMの比較・選定基準・活用事例で並ぶ各社モデルにも共通する標準的な進め方です。比較表に載るGPT-OSS-Swallow-120B-RL-v0.1自体、OpenAIのgpt-oss-120bを土台にした派生モデルです。
公式ベンチマーク表の3月18日更新と現在値
性能を語る前に押さえるべき事実があります。楽天のプレスリリースに載る比較表は、公開翌日に差し替えられました。表の直下には「※GPT-OSS-Swallow-120B-RL-v0.1とABEJA-QwQ32b-Reasoning-Japanese-v1.0について、MMLU-ProXおよびMATH-100のスコアを更新しました(2026年3月18日10:00時点)。」と注記されています。公開当日の数値を引用した記事は、この改定を反映していません。現在の表は次のとおりです。
| モデル | JamC-QA | MMLU-ProX(日本語) | MATH-100(日本語) | M-IFEval(日本語) |
|---|---|---|---|---|
| Rakuten AI 3.0 | 76.9 | 71.7 | 86.9 | 72.1 |
| gpt-4o | 74.7 | 64.9 | 75.8 | 67.3 |
| GPT-OSS-Swallow-120B-RL-v0.1 | 63.0 | 77.5 | 96.0 | 69.5 |
| Stockmark-2-100B-Instruct | 61.1 | 41.7 | 55.6 | 45.6 |
| ABEJA-QwQ32b-Reasoning-v1.0 | 61.1 | 71.2 | 89.9 | 61.9 |
gpt-4oに対しては4指標すべてで上回ります。一方、GPT-OSS-Swallow-120B-RL-v0.1との比較は2勝2敗。MMLU-ProXで71.7対77.5、MATH-100で86.9対96.0と負けています。競技数学では32BのABEJA-QwQ32bにも89.9対86.9で及びません。671Bというパラメータ規模が日本語の推論力や数学力にそのまま比例していないことを、楽天自身の比較表が示しています。
3.0が明確に強いのはJamC-QAです。日本固有の文化・歴史知識を問うこのベンチマーク(Oka et al., 2025)で76.9を取り、2位のgpt-4oに2.2ポイント、Swallowの63.0には13.9ポイント差をつけました。楽天独自のバイリンガルデータによる追加学習の効果が最も出ている領域がここだと読めます。指示追従を測るM-IFEvalの72.1も全モデル中で最高です。
選定の判断はこう分かれます。日本語の商習慣・固有名詞・文化的文脈を外さないことが要件なら3.0が第一候補。数学的推論やコード生成の精度を最優先するなら、120BクラスのSwallow系のほうが軽くて強く、運用コストも桁違いに低く収まります。Swallowシリーズの構成はSwallowとは?Llama 3.3 Swallowの特徴・日本語性能・商用利用を解説にまとめました。なお表の値は楽天が公表した比較表のもので、測定条件は楽天側に依存します。原典はMMLU-ProXがarXiv:2503.10497、MATH-100がMCLM(Son et al., 2025、arXiv:2502.17407)、M-IFEvalがarXiv:2502.04688です。プロンプト設計や正解判定の条件が変われば数値は動きます。
Apache 2.0とMIT併存下の商用利用条件
ライセンス構成は、Apache 2.0の配布物の中にMITの権利表示が同居する形です。MITは著作権表示とライセンス条文を残すことを条件に、再配布・改変・サブライセンスを認めています。楽天はNOTICEでDeepSeekの表示を保持したうえで、配布物全体にApache 2.0を適用しました。矛盾はありません。商用利用も派生モデルの公開も可能です。
派生モデルを再配布する場合は、Apache 2.0のLICENSEとNOTICEの両方を引き継ぎます。NOTICEを落とすとMIT側の条件を満たさなくなるため、ここだけは機械的に確認してください。Apache 2.0が持つ特許不行使の条項が働くのは楽天の寄与部分で、DeepSeek由来の部分はMITのまま、つまり特許条項なしという理解が正確です。
採用を見送るべき場面もはっきりしています。調達要件で中国由来の学習済み重みを排除している組織では、Apache 2.0と「国内最大規模」という表記だけを根拠に社内審査を通すと、後から覆ります。審査で提出を求められる根拠資料は、まさに config.json の model_type とNOTICEです。先に開示して議論したほうが手戻りは少なくなります。
ローカル実行の実サイズとGPU要件
公式リポジトリの重みは、FP8(e4m3、ブロックサイズ128×128)で量子化済みのsafetensorsが163シャード、合計673.2GB(626.9GiB)です。モデルカードは推奨Dockerイメージとして lmsysorg/sglang:v0.5.6.post2 を挙げ、起動コマンドを次のように案内しています。
python -m sglang.launch_server \
--model-path Rakuten/RakutenAI-3.0 \
--tp 8 \
--mem-fraction-static 0.85 \
--trust-remote-code \
--show-time-cost
ここで数字を確かめてください。--mem-fraction-static はSGLangのヘルプが「モデル重みとKVキャッシュのメモリプールを含む静的確保に使うメモリの割合」と説明するオプションで、0.85なら各GPUメモリの85%しか使いません。公称80GBのH100を8基そろえても、静的プールとして確保できるのは540〜580GB程度にとどまり、673.2GBの重みは載らない計算です。公称容量を1GiB単位で解釈しても10進で解釈しても結論は変わりません。8基という数字だけを見てH100ノードに投げると、ロード段階でメモリ不足になります。公称141GBのH200を8基なら合計約1,128GB、0.85でも950GB超を確保でき、重みを載せたうえでKVキャッシュの余地が残ります。公式の推奨構成はH200クラス以上が前提と読むのが正しい理解です。
手元がH100 8基までなら、4bit量子化版が現実的な選択肢になります。rakuten-junliu/RakutenAI-3.0-W4A16 は2026年8月30日に公開され、重み合計402.1GB(374.5GiB)まで縮みました。同じアカウントからW4A8とNVFP4も出ており、直近30日のダウンロードはW4A16の403件が最多です。ほかに mmnga-o/RakutenAI-3.0-gguf のGGUF版、mlx-community/RakutenAI-3.0-MLX-4bit もあります。いずれも楽天の組織アカウントではなく個人・コミュニティによる配布で、公式のサポート対象ではありません。
本体リポジトリの直近30日のダウンロードは110件です。673GBという配布サイズを考えれば妥当な数字で、実利用の入り口は事実上、量子化版へ移っています。GPUを持たない検証段階なら、まずgpt-oss-120bの性能とは?20bとの違い・ベンチマーク・必要GPUを徹底比較【OpenAI公式】のような120Bクラスで要件を詰めてから、671Bに投資する価値があるかを判断する順序を勧めます。
よくある質問
Rakuten AI 3.0は中国製のAIですか?
ベースになった重みは中国のDeepSeek社が公開したDeepSeek-V3です。config.jsonの model_type が deepseek_v3 で、tokenizer.jsonはDeepSeek-V3とバイト単位で同一。その上に楽天が独自のバイリンガルデータで追加学習を施したものが3.0にあたります。学習の実行環境について、楽天は2025年12月18日のプレスリリースで「本モデルの学習は楽天が設計した社内マルチノードGPUクラスタ上で実行されました。楽天の隔離された安全なクラウド環境に展開しているため、データが外部に送信されることはありません」と説明しています。重みをローカルに置けば外部通信なしで動かせるため、「中国のサーバーにデータが送られる」という性質のものではありません。
Rakuten AI 3.0のベースモデルは何ですか?
DeepSeek-V3です。楽天のプレスリリースとモデルカードの説明文は「オープンソースコミュニティ上の最良なモデル」という表現にとどめていますが、モデルカードのタグには DeepSeek-V3 が入り、NOTICEにはDeepSeekの著作権表示とMIT条文が置かれています。設定ファイルを開けば、アーキテクチャに関わる値はすべてDeepSeek-V3と一致します。
Rakuten AI 3.0のAPIは公開されていますか?
外部向けの公開APIはありません。楽天が案内する提供形態は、Hugging Faceからの重みの無償ダウンロードです。プレスリリースに登場する「Rakuten AIゲートウェイ」は、2025年12月18日の注記で「生成AI APIを統合した楽天従業員向けのプラットフォーム」と定義されており、社外の開発者が契約して叩けるサービスではありません。API経由で使いたい場合は、自前でGPUを用意してSGLang等で推論サーバーを立てるか、量子化版を推論ホスティング事業者に載せる形になります。
GGUF版やOllamaで動かせますか?
GGUF版は mmnga-o/RakutenAI-3.0-gguf がHugging Faceで公開されており、フォーマット上はOllamaやllama.cppで読み込めます。問題はサイズです。同リポジトリの実測で、最も軽いQ2_Kでも244.1GB(227.4GiB)、実用的なQ4_K_Mで404.5GB(376.7GiB)、Q6_Kは550.9GB(513.1GiB)あります。単体GPUの搭載メモリはもちろん、一般的なワークステーションの本体メモリにも収まりません。Apple Silicon向けには mlx-community/RakutenAI-3.0-MLX-4bit もありますが、必要メモリの桁は同じです。個人のPCで気軽に動かせる規模のモデルではないと考えてください。
Rakuten AI 2.0や7Bとは何が違いますか?
系譜が切り替わっています。Rakuten AI 7BはMistral-7B-v0.1ベースで語彙を32,000から48,000へ拡張、Rakuten AI 2.0はMixtralアーキテクチャの8x7B(約470億パラメータ)で語彙は48,000でした。どちらもMistral系を土台に日本語向けトークナイザを作り込む方針です。3.0はベースをDeepSeek-V3へ移し、語彙は129,280のまま手を加えていません。規模は約470億から約7,000億へ14倍あまりに伸びた一方、日本語トークナイザの最適化という以前の強みは引き継がれていません。