MiMo-V2.6は、Xiaomiの開発チームXiaomi MiMoが日本時間2026年9月22日に公開したLLMシリーズです。上位のMiMo-V2.6-Pro、軽量のMiMo-V2.6-Flashの重みがMITライセンスでHugging Faceに置かれ、商用利用と自社サーバーでの実行の両方が可能です。この記事では、各モデルの構成とアーキテクチャをモデルカードの記載から整理し、vLLMで自社ホスティングするときのGPU要件と起動コマンド、APIで呼ぶ場合の単価と月額試算までを実装者の目線で並べます。そのうえで「重みが手に入るなら自前で動かすべきか」を、条件付きで判断します。数値は2026年10月11日時点の公開情報です。
まとめ:MiMo-V2.6はMIT公開の1T級MoE、まずAPIで試すのが筋
MiMo-V2.6-Proは総パラメータ1.02T・1トークンあたり42B活性のMoEで、100万トークンの文脈とテキスト・画像・動画・音声の入力を扱います。Flashは309B・15B活性の軽量版です。前世代のMiMo-V2-Proは重みが非公開でしたが、V2.6では同じ規模帯の重みがMITライセンスで公開されました。
実装判断の結論は単純です。費用だけで比べると、APIのほうが圧倒的に安く済みます。Proは100万トークンあたり入力0.435ドル・出力0.87ドルで呼べる一方、自社ホスティングにはH200を8基、合計680GB以上のVRAMが必要です。自前で動かす理由になるのは、データを社外へ出せない業務、または応答遅延と稼働率を自社で握りたい基盤用途に限られます。それ以外はAPIで精度を確かめ、Flashで足りるかを先に見るのが手堅い順序です。
MiMo-V2.6の用途別比較:Pro・Flash・UltraSpeed・9B蒸留版の違い
V2.6の名前を持つモデルは、重みが公開された3種とAPI専用の1種に分かれます。用途に合わないものを最初に外すと、検討範囲がかなり絞れます。
重み公開の3モデルとAPI専用のPro-UltraSpeedを並べた比較表
| モデル | 総パラメータ/活性 | 重み | 主な用途 |
|---|---|---|---|
| MiMo-V2.6-Pro | 1.02T/42B(MoE) | MIT公開 | 難度の高いエージェント処理・コード改修 |
| MiMo-V2.6-Flash | 309B/15B(MoE) | MIT公開 | 量の多い処理・費用を抑えたい本番運用 |
| MiMo-V2.6-Pro-UltraSpeed | Proと同一チェックポイント | 非公開(API専用) | 応答速度を優先する対話・リアルタイム処理 |
| MiMo-V2.6-Distill-Qwen-9B | 9B(Dense) | MIT公開 | 強化学習研究の出発点・小型GPUでの検証 |
表のうちProとFlashの数値は、Hugging FaceのMiMo-V2.6-ProのモデルカードとMiMo-V2.6-Flashのモデルカードの記載です。Pro-UltraSpeedは、OpenRouterの説明文で「同じ1TのPro チェックポイントから作られ、品質を保ったまま高速化した版」とされ、提供元はXiaomiの1社だけでした。
9B蒸留版はQwen3.5-9BベースのSFTモデルで本番向けではない
MiMo-V2.6-Distill-Qwen-9Bは、Qwen3.5-9BにMiMoが生成したデータで教師ありファインチューニングをかけたモデルです。モデルカードでは、エージェント型強化学習の研究の出発点として公開したSFTチェックポイントと位置づけています。BF16で9Bなら重みだけで約18GB(9B×2バイトの計算値)となり、24GBクラスのGPU1枚でも試せる大きさです。ただしPro・Flashと同じ性能を期待する用途ではありません。社内PoCで「MiMo系の出力の癖」を手元で確かめる道具として扱うのが妥当です。
MOPD版とRL版の違い:エージェント用途はMOPDを選ぶ理由
Hugging Faceには、Pro・FlashそれぞれにRL版とMOPD版の2つのチェックポイントがあります。モデルカードの説明では、MOPD版はRL版を土台に、分野ごとに特化した複数の教師モデルをオンポリシーで1つに蒸留した改良版です。エージェント環境でツール呼び出しが同じ内容を繰り返す現象を、RL段階より減らしたと記載されています。
vLLM Recipesも既定の推奨をMOPD版にしており、RL版は「以前の実行結果を再現する場合のみ」の扱いです。公開直後の解説記事にはRL版のモデル名で手順を書いたものが残っているため、これから組むならモデル名をXiaomiMiMo/MiMo-V2.6-Pro-MOPDのようにMOPD版へ置き換えてください。
MiMo-V2.6のアーキテクチャ:SWA混在の注意機構と1Mトークン文脈の仕様
ホスティング要件や速度を見積もるには、層構成と注意機構の作りを知っておく必要があります。数値はいずれもモデルカードの表から取っています。
Pro 70層・Flash 48層のSWAとグローバル注意の比率と効き方
Proは全70層のうち60層がSliding Window Attention(SWA、窓幅128)、10層がグローバル注意(GA)です。Flashは48層中39層がSWA、9層がGAという配分です。大半の層が直近128トークンだけを見るため、100万トークンの文脈でもKVキャッシュの膨張を抑えられます。全体を見渡す役目は少数のGA層が担う設計です。
MoEのルーティングは、Proが384エキスパート中8、Flashが256エキスパート中8を活性化させます。共有エキスパートはありません。推論1トークンあたりの計算量は活性パラメータ(Pro 42B・Flash 15B)で決まり、総パラメータの大きさはそのままVRAMの必要量に効いてきます。
マルチモーダル入力の構成とMTP層による投機的デコーディング
入力はテキスト・画像・動画・音声の4種です。Flashのモデルカードによると、681M・28層の視覚エンコーダと、308MのAudioTokenizer+127Mの音声パッチからなる音声系エンコーダを本体に組み合わせています。出力はテキストです。
もう1つの特徴は、5層のMTP(Multi-Token Prediction)モジュールを同梱している点です。SGLangの推奨コマンドではこれをEAGLE方式の投機的デコーディングに使い、1ステップで複数トークンを先読みさせます。仕組みはSpeculative Decodingの解説で扱った方式と同系統で、出力の多いエージェント処理ほど待ち時間の短縮が効きます。
vLLMでMiMo-V2.6を自社ホスティングする手順とGPU・VRAMの必要量
重みが公開されたことで、自社のGPUサーバーやクラウドのGPUインスタンスでMiMo-V2.6を動かせます。ここで示すのは、vLLMを使う場合に必要なハードウェアと具体的な起動手順です。vLLM自体の仕組みはvLLMの解説記事にまとめています。
ProはH200を8基・Flashは4基、VRAM合計の下限と必要バージョン
vLLM RecipesのMiMo-V2.6-Proのページは、ProにNVIDIA H200を8基(テンソル並列8)、AMDならMI355Xを4基、またはVRAM合計680GB以上を求めています。FlashのページではH200を4基、またはVRAM合計208GB以上です。
見落としやすいのはvLLMのバージョンです。Recipesはv0.31.0以上を必須とし、理由をmxfp4形式で格納された重みの読み込みに対応した最初の安定版だからと説明しています。モデルカードに載っているDockerイメージvllm/vllm-openai:mimov25-cu129について、Recipesは本モデルには使わないよう明記しています。AMDのMI300X・MI325XでFlashを動かす場合は、2026年9月30日以降のnightlyビルドが必要です。
Flash-MOPDをH200 4基で起動するvllm serveのコマンド例
Recipesに掲載されたFlash-MOPDの起動コマンドです。ProはモデルIDをXiaomiMiMo/MiMo-V2.6-Pro-MOPDに、--tensor-parallel-sizeを8に変えれば同じ形で動きます。
vllm serve XiaomiMiMo/MiMo-V2.6-Flash-MOPD \
--tensor-parallel-size 4 \
--trust-remote-code \
--gpu-memory-utilization 0.95 \
--max-model-len auto \
--reasoning-parser mimo \
--tool-call-parser mimo \
--enable-auto-tool-choice \
--generation-config vllm
--reasoning-parser mimoは思考過程の出力を本文と分けて返すため、--tool-call-parser mimoと--enable-auto-tool-choiceはOpenAI互換のtools指定でツール呼び出しを受けるための指定です。--max-model-len autoにすると、VRAMに収まる範囲で最大1,048,576トークンまで文脈長が自動で決まります。--trust-remote-codeはリポジトリ同梱のPythonコードを実行するので、社内環境では取得したリビジョンを固定し、中身を確認してから本番に載せてください。
起動後にOpenAI互換APIで思考モードを切り替えるリクエスト例
vLLMはOpenAI互換のエンドポイントを立てるので、既存のOpenAI SDKのコードから接続先を変えるだけで呼べます。推奨サンプリングはtemperature 1.0・top_p 0.95です。思考モードはchat_template_kwargsのenable_thinkingで切り替えます。
from openai import OpenAI
# 自社ホスティングのvLLMに接続(APIキーは任意の文字列でよい)
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
resp = client.chat.completions.create(
model="XiaomiMiMo/MiMo-V2.6-Flash-MOPD",
messages=[{"role": "user", "content": "この請求書データから支払期日の一覧を作って"}],
temperature=1.0,
top_p=0.95,
extra_body={"chat_template_kwargs": {"enable_thinking": False}},
)
print(resp.choices[0].message.content)
定型の抽出や分類のように推論を深める必要がない処理ではenable_thinkingをFalseにすると、思考トークンのぶん応答が速く、出力トークンも減ります。設計判断やコード修正のように手順を踏ませたい処理だけTrueに切り替える使い分けが現実的です。
APIでMiMo-V2.6を使う場合の単価と自社ホスティングとの費用比較
自社ホスティングの検討は、API単価を知ってからでないと判断を誤ります。ここではOpenRouter上のXiaomi直営エンドポイントの単価で試算します。
Pro・Flash・UltraSpeedの100万トークン単価とキャッシュ読み取り
2026年10月11日時点で、OpenRouterのMiMo-V2.6-ProはXiaomi直営の単価が100万トークンあたり入力0.435ドル・出力0.87ドル・キャッシュ読み取り0.0036ドルです。Flashは入力0.14ドル・出力0.28ドル、Pro-UltraSpeedは入力4.35ドル・出力8.70ドルでした。UltraSpeedは速度と引き換えにProのちょうど10倍の単価です。
前世代のMiMo-V2-Proは、256Kトークンまでの区分で入力1ドル・出力3ドルでした(MiMo-V2-Proの解説で整理)。V2.6-Proは同じ42B活性の規模帯で、入力は半額以下、出力は3割以下の単価に下がっています。Xiaomi自身のAPIはMiMo API Open Platformでも提供されています。
月1億トークン処理での試算とGPU常時稼働の損益分岐の考え方
月に入力1億トークン・出力2,000万トークンを処理する業務で試算すると、Proは入力43.5ドル+出力17.4ドルで約61ドル、Flashは入力14ドル+出力5.6ドルで約20ドルです。社内の問い合わせ対応や文書要約を全社で回しても、多くの企業はこの桁に収まります。
一方、Proを自前で動かすH200 8基のサーバーは、購入でもクラウド借用でも、上の月額を桁違いに上回ります。費用だけで自社ホスティングが逆転する条件は、GPUを24時間ほぼ埋め続けるだけのトークン量があることです。2.4兆MoEを例に同じ構図でVRAMを試算したQwen3.8-MaxのVRAM試算も、判断の物差しとして参考になります。
MiMo-V2.6を業務に組み込む条件と自社ホスティングを見送る場面
ここまでの数字を踏まえ、MiMo-V2.6を採る条件と、重みが手元にあっても自前運用を選ばない場面を言い切ります。
機密データを外部へ送信できない業務で自社ホスティングを選ぶ条件
自社ホスティングを選ぶのは、次のどれかに当てはまる場合です。顧客の個人情報や設計図面など、契約や社内規程で外部APIに送れないデータを扱う業務。閉域網の中でしか動かせない工場・医療・金融の基盤。応答遅延とモデルの版を自社で固定し、提供元の都合で挙動が変わる事態を避けたい長期運用のシステムです。MITライセンスは商用利用と改変を認めるため、ファインチューニングした派生モデルを社内に抱える選択も取れます。
この場合でも、最初からProを載せる必要はありません。Flashは4基構成で動き、ベンダー公表のDeepSWE v1.1でPro 71.9に対し67.9と差が小さい値が出ています。まずFlashで要件を満たすかを測り、足りない処理だけProに回す構成が、GPU投資を半分に抑える近道です。どの処理を外部APIに出し、どこを閉域に残すかの線引きから設計する場合は、私たちの生成AI導入支援で、データ区分の整理からモデル選定・検証環境の構築までを受託で進めています。
APIで十分な用途と、公表ベンチマークだけで採否を決めない理由
社外に出してよいデータを扱い、処理量が月数億トークンに届かない業務なら、自社ホスティングは見送るべきです。前節の試算どおり、APIの月額はGPUサーバーの維持費に遠く及びません。運用担当者の手間、vLLMの版上げ、GPU障害への備えまで含めると差はさらに開きます。
もう1つの注意は、性能の数値がベンダー公表値だという点です。モデルカードの比較表では、Terminal Bench 2.1でPro 89.9とClaude Opus 5の89.1を上回る一方、Terminal Bench 4.0では34.9対49.0と大きく離されています。同じ系統の評価でも版によって順位が逆転するため、採否は自社の業務データで正答率と出力トークン数を測ってから決めてください。同じ1T級のオープンウェイトとしては、Kimi K3も比較候補に入ります。
よくある質問
MiMo-V2.6の導入を検討する段階で出やすい質問に、2026年10月11日時点の公開情報をもとに答えます。
MiMo-V2.6は無料で商用利用できますか?
重みはMITライセンスで公開されており、商用利用・改変・再配布が認められています。Hugging Faceからのダウンロードに費用はかかりません。ただし動かすためのGPU費用は自社負担で、Proなら合計680GB以上のVRAMが要ります。APIで使う場合は、OpenRouterのXiaomi直営エンドポイントでProが100万トークンあたり入力0.435ドル・出力0.87ドルの従量課金です。
MiMo-V2.6-ProとFlashはどちらを選べばよいですか?
迷ったらFlashから始めるのが無難です。Flashは309B・15B活性で、H200 4基またはVRAM合計208GB以上で動き、API単価もProの約3分の1です。モデルカードのDeepSWE v1.1ではPro 71.9に対してFlash 67.9と差は小さく、Flashで精度が足りない処理を特定してからProを足す順序のほうが費用を抑えられます。
MiMo-V2.6をローカルPCやGPU1枚で動かせますか?
Pro・Flashの公式手順はいずれも複数のデータセンター向けGPUを前提にしており、一般的なPCやGPU1枚では動きません。手元で試したい場合は、9BのDenseモデルであるMiMo-V2.6-Distill-Qwen-9Bが候補です。BF16で重みは約18GBなので、24GBクラスのGPUに収まります。ただし性能はPro・Flashと別物と考えてください。
MiMo-V2-Proとの違いは何ですか?
最大の違いは重みの公開です。V2-Proは重み非公開のAPI専用モデルでしたが、V2.6のPro・FlashはMITライセンスで重みが公開されました。入力もテキスト中心から画像・動画・音声まで広がっています。API単価もV2-Proの入力1ドル・出力3ドルから、V2.6-Proは入力0.435ドル・出力0.87ドルへ下がりました。
RL版とMOPD版のどちらをダウンロードすべきですか?
新規に組むならMOPD版です。MOPD版はRL版を土台に複数の教師モデルから蒸留した改良版で、エージェント処理でツール呼び出しが繰り返される現象を抑えたとされています。vLLM Recipesも既定の推奨をMOPD版にしており、RL版は以前の実行結果を再現したい場合に限って使う扱いです。
関連記事
- Hunter Alphaの正体はシャオミMiMo-V2-Pro|判明の経緯と提供終了後の後継モデル:V2.6の前世代にあたる重み非公開のV2-Proの仕様・料金と、提供終了の経緯を整理しています。
- vLLMとは?PagedAttentionの仕組み・使い方とOllama・TensorRT-LLMとの違い:MiMo-V2.6の自社ホスティングで使う推論サーバーの仕組みと設定の基礎です。
- Qwen3.8-Maxとは|2.4兆MoEのVRAM試算と移行判断:巨大MoEを自前で動かす場合のVRAMの見積もり方を、別のモデルで試算した記事です。
- Kimi K3とは?Moonshot AIの2.8兆パラメータMoEの性能・料金:同じ中国発のオープンウェイト系フロンティアモデルで、比較候補として読めます。
- Speculative Decoding(投機的デコーディング)とは?仕組みと速くなる条件:MiMo-V2.6が同梱するMTP層を使った高速化の仕組みを解説しています。