LLM・RAG

Mercury 2とは?拡散型LLM(dLLM)の仕組み・料金・APIの使い方とMercury 2.5との違い

Mercury 2とは?拡散型LLM(dLLM)の仕組み・料金・APIの使い方とMercury 2.5との違い

Mercury 2は、米Inceptionが2026年2月24日に発表した拡散型の推論LLMです。1トークンずつ左から書く従来のLLMと違い、回答全体の下書きを並列に直していく方式で、公式発表では毎秒1,009トークンを出します。

この記事では、dLLM(拡散型大規模言語モデル)という言葉の意味から、Mercury 2の仕様・料金、OpenAI互換APIでの呼び出し方、2026年9月8日に出た後継Mercury 2.5やコード編集用のMercury Edit 2との違いまでを、公式ドキュメントの記載に沿って整理します。数値は2026年9月16日に確認したものです。

まとめ:Mercury 2の要点

  • 開発元はStanford・UCLA・Cornellの研究者が創業したInception。CEOのStefano Ermonは画像生成で使われる拡散手法の共同発明者です。
  • dLLMは、マスクやノイズの入った出力全体を複数回の反復で並列に精製してテキストを作るLLMを指します。自己回帰型の「1トークン確定→次へ」という逐次処理を回避できる点が速さの源です。
  • 仕様はコンテキスト128K、最大出力50,000トークン、入力はテキストのみ。ツール呼び出しと構造化出力(JSON Schema)に対応します。
  • 料金は100万トークンあたり入力$0.25・キャッシュ入力$0.025・出力$0.75。推論トークンも出力単価で課金されます。
  • 速度は公式値で毎秒1,009トークン(NVIDIA Blackwell)。第三者のArtificial Analysisでは毎秒714トークン、最初のトークンまで4.46秒と計測されています。
  • 公式ドキュメント上、Mercury 2は「前世代」の扱いです。新規開発なら、コンテキスト260K・通常価格でも入力が安いMercury 2.5を先に検討するのが妥当です。

Mercury 2の発表時期と開発元Inception

2026年2月24日発表の提供範囲

InceptionはBusiness Wireで2026年2月24日にMercury 2を発表し、同日からInception APIで利用可能にしました。ブラウザで試せるInception Chat(chat.inceptionlabs.ai)も用意されています。

クラウド経由では、Inception公式ブログがMicrosoft Foundry(旧Azure AI Foundry)での提供を告知しています。こちらはソフトウェアライセンスの時間課金とAzureのコンピュート料金が別建てで、提供リージョンは米国とカナダです。APIの従量課金とは料金体系が異なるため、見積もりを取るときは経路を分けて考えてください。

創業陣の研究とMercuryシリーズの系譜

発表文によると、InceptionはStanford・UCLA・Cornellの研究者が創業し、Menlo Ventures、Mayfield、M12(Microsoftのベンチャーファンド)、Snowflake Ventures、Databricks Venturesに加え、Andrew NgやAndrej Karpathyが出資しています。

技術の土台になっているのは、Ermonらが2023年10月にarXivへ投稿した離散拡散の論文(Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution)です。自然言語のような離散データに拡散モデルを適用する際の壁を、スコアエントロピーという損失で越えようとした研究でした。

その後、Inceptionは2025年6月に技術報告「Mercury: Ultra-Fast Language Models Based on Diffusion」(arXiv 2506.17298)を出し、コード向けのMercury Coder MiniとSmallがNVIDIA H100上で毎秒1,109トークンと737トークンを出したと報告しています。Mercury 2はこの系譜を、推論(reasoning)付きの汎用モデルへ広げた位置づけです。

dLLMの意味と自己回帰型LLMとの生成方式の違い

自己回帰型が抱える逐次生成の待ち時間

GPTやClaude、Geminiなど主流のLLMは自己回帰型で、直前までのトークンを入力に次の1トークンを予測し、確定したら次へ進みます。通常のデコードでは、500トークンの回答を作るのにモデルの評価が500回、順番に走ります。GPUを増やしても1本の回答の中では並列化しにくい、という制約がここにあります。

同じ制約に別の角度から挑む手法として、小さなモデルに先読みさせて大きなモデルで検証するSpeculative Decoding(投機的デコーディング)や、専用チップで1回の評価を速くするGroqのLPU推論があります。投機的デコーディングは大きなモデルの1回の評価で複数トークンをまとめて検証できますが、どちらも出力を左から順に確定していく自己回帰の枠組み自体は変えていません。

出力全体を並列に精製する拡散生成

dLLMは、画像生成の拡散モデルと同じ発想をテキストに持ち込みます。まだ決まっていない位置を含む出力列全体を用意し、1回のネット評価で複数位置をまとめて予測し直す処理を、少ない反復回数で繰り返して仕上げます。前の位置が確定するのを待たないため、1回の評価で進む量が自己回帰型より大きくなります。

もう一つの特徴は、途中で出したトークンを後の反復で書き換えられることです。自己回帰型では一度出したトークンは取り消せません。Inceptionは、この書き直しの余地を、JSONのような形式が決まった出力を安定させる根拠として挙げています。

ストリーミングがブロック単位になる実装上の影響

公式ドキュメントでは、stream: true の応答は1トークンずつではなく、精製が終わった「ブロック」単位で届くと説明されています。文字が1字ずつ流れる前提で作ったチャットUIに組み込むと、表示がまとまって跳ぶように見えます。

拡散の途中経過を見せたい場合は diffusing: true を併用します。この場合、各チャンクには差分ではなく「その時点の全文」が入るので、クライアント側は追記ではなく表示の上書きで処理する必要があります。OpenAI互換のストリーム処理をそのまま流用すると、同じ文章が何度も連結されて表示される原因になります。

Mercury 2の仕様と料金(公式ドキュメント基準)

項目 Mercury 2(mercury-2)
エンドポイント v1/chat/completions
コンテキスト長 128K
最大出力 50,000トークン
出力上限の既定値 16,384トークン
入力形式 テキストのみ
対応機能 ツール呼び出し・構造化出力
temperature 0.5〜1(既定0.75)
入力単価(100万トークン) $0.25
キャッシュ入力単価 $0.025
出力単価(100万トークン) $0.75

APIリファレンスでは、temperatureに範囲外の値を渡すと0.75に戻され、応答に警告が付くとされています。テストで出力を固定したくて0を指定しても効かない点は、OpenAIのモデルから移行するときに見落としやすい差です。

推論トークンも出力単価で課金される点

公式FAQによると、completion_tokens には推論に使ったトークンが含まれ、その全量が出力単価で課金されます。内訳は completion_tokens_details.reasoning_tokens で確認できます。画面に出た回答が短くても、推論量が多ければ請求は増えます。

試算として、1回あたり入力2,000トークン・出力1,000トークン(推論込み)の呼び出しを月10万回行うと、Mercury 2は入力$50+出力$75で月$125です。キャッシュが効く共通プロンプトが長い構成なら、その部分は1/10の単価になります。

無料枠1億トークンとレート制限

新規アカウントには1回限り、全モデル共通で1億トークンの無料クレジットが付きます。1分あたりのレート制限は次のとおりで、429や503が返ったら指数バックオフで再試行するよう公式FAQが案内しています。

1分あたり Free Pay As You Go Enterprise
リクエスト数 1,000 3,000 個別
入力トークン 1,000,000 3,000,000 個別
出力トークン 100,000 300,000 個別

速度とベンチマーク:公式発表値と第三者計測の差

発表文が示した速度と6種のベンチマーク

2月24日の発表文は、Mercury 2の出力スループットを毎秒約1,000トークンとし、比較対象としてClaude 4.5 Haiku(Reasoning)の毎秒約89トークン、GPT-5 Miniの毎秒約71トークンを挙げています。公式ブログでは、NVIDIA Blackwell GPU上で毎秒1,009トークンとしています。

品質面のスコアは、AIME 2025が91.1、GPQAが73.6、IFBenchが71.3、LiveCodeBenchが67.3、SciCodeが38.4、Tau2が52.9です。Inception自身は比較相手をClaude HaikuやGemini Flashクラスの速度重視モデルに置いており、最上位のフロンティアモデルと同格とは主張していません。

Artificial Analysisの計測値と読み方

第三者のArtificial Analysisでは、2026年9月16日時点でMercury 2の出力速度が毎秒714.0トークン、最初のトークンが返るまでの時間(TTFT)が4.46秒と表示されています。同サイトの総合指標Intelligence Index(v4.3)は12で、同サイトは同価格帯の推論モデルと比べて平均以下と評価しています(比較群の中央値も12)。指標の評価には1億トークンの出力を要したとされています。

ここから読み取れるのは、「生成が始まってからは速いが、始まるまでに数秒かかる」という性質です。公式の1,009トークン/秒は特定GPUでの値で、API経由の実効値はそれより低く出ています。TTFTが効く1往復の短い応答では、後述の reasoning_effort を下げたときの体感を自分のプロンプトで測ってから判断してください。

Mercury 2.5・Mercury Edit 2との違いと選び方

2026年9月時点で公式ドキュメントのモデル一覧に載っているのは、Mercury 2.5・Mercury 2・Mercury Edit 2の3つです。

項目 Mercury 2.5 Mercury 2 Mercury Edit 2
モデルID mercury-2.5 mercury-2 mercury-edit-2
用途 チャット・エージェント チャット 補完・次の編集予測
エンドポイント v1/chat/completions v1/chat/completions v1/fim・v1/edit
コンテキスト長 260K 128K 32K
最大出力 65,536 50,000 8,192
入力単価(通常) $0.20 $0.25 $0.25
出力単価(通常) $0.75 $0.75 $0.75

Mercury 2.5の知能指標・コンテキスト・料金の変更点

Mercury 2.5は2026年9月8日に発表され、Inception API・OpenRouter・Basetenで提供が始まりました。発表文ではMercury 2から知能指標が10ポイント上がったとし、公式ブログでは毎秒1,107トークン、コンテキストは128Kから260Kへ拡大と説明しています。

料金は通常価格で入力$0.20・出力$0.75に下がり、公開時点では80%引きの入力$0.04・出力$0.15で提供されています。前章と同じ月10万回の試算では、通常価格で月$115、割引価格なら月$23です。割引の終了時期は公式サイトで確認してください。

Mercury 2を使い続ける理由が残る場面

公式ドキュメントはMercury 2を「前世代の推論モデル」と説明しています。入力単価とコンテキスト長で2.5が上回り(出力単価は同額)、発表文では知能指標も10ポイント高いとされています。これから作るシステムでMercury 2を選ぶ理由はほとんどありません。

残るのは次の2つです。1つは、Mercury 2でプロンプトと出力形式の検証を済ませて本番運用している場合で、モデルを替えると出力傾向が変わるため、2.5への切り替えは回帰テストを通してから行うべきです。もう1つはMicrosoft Foundry経由で使う場合で、2.5の発表文が挙げる提供先にFoundryは含まれていません。なお2.5ではtemperatureの既定値が1に変わるので、既定値任せのコードは移行時に出力のばらつきが増えることがあります。

Mercury Edit 2の役割(FIMとNext Edit)

Mercury Edit 2はチャット用ではなく、エディタの補完専用モデルです。カーソル前後のコードから間を埋めるFIM(v1/fim/completions)と、直近の編集履歴から次に書き換える箇所を予測するNext Edit(v1/edit/completions)の2つのエンドポイントを持ちます。

公式ブログでは、前モデルより編集提案が48%多く採用され、表示する提案の選別も27%厳しくなった(27% more selective)とし、的を絞った邪魔になりにくい提案になったと説明しています。ZedとProxyAIから使えるほか、APIで自作のエディタ拡張に組み込むこともできます。名前は似ていますが、Mercury 2の後継ではなく、エディタ補完を担う別系統のモデルです。

Mercury 2 APIの使い方(OpenAI互換)

APIキーの発行と環境変数

platform.inceptionlabs.aiでアカウントを作成し、ダッシュボードのAPI Keysでキーを発行します。公式SDKとコード例は、環境変数 INCEPTION_API_KEY からキーを読み込む前提になっています。

export INCEPTION_API_KEY="発行したAPIキー"
pip install openai

OpenAI SDKのbase_urlを差し替える呼び出し例

APIはOpenAI互換なので、既存のOpenAI SDKは base_url を https://api.inceptionlabs.ai/v1 に向けるだけで使えます。公式のPython SDK(pip install inceptionai)もありますが、既存コードからの移行ならOpenAI SDKのままが手早い方法です。

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["INCEPTION_API_KEY"],
    base_url="https://api.inceptionlabs.ai/v1",
)

resp = client.chat.completions.create(
    model="mercury-2",
    messages=[{"role": "user", "content": "次の文から社名と日付をJSONで抜き出してください:一創は2026年9月16日に発表した。"}],
    reasoning_effort="low",
    max_completion_tokens=1024,
    response_format={"type": "json_object"},
    extra_body={"realtime": True},
)
print(resp.choices[0].message.content)
print(resp.usage.completion_tokens, resp.usage.completion_tokens_details.reasoning_tokens)

このコードは、openai 3.14.0で手元のモックサーバーに向けて実行し、送信されるリクエスト本文に reasoning_effort・max_completion_tokens・response_format がそのまま入り、extra_body の realtime がトップレベルへ展開されることを確認しています。max_tokens は非推奨で、両方指定すると max_completion_tokens が優先されます。

reasoning_effortとrealtime・diffusingの使い分け

reasoning_effort は instant・low・medium・high の4段階で、省略時は medium です。公式の目安は、音声やリアルタイムの応答に instant、遅延に敏感なチャットとツール呼び出しに low、複雑な多段推論に high です。

realtime はTTFTを下げたい用途向けのフラグ、diffusing は前述の途中経過表示用のフラグで、どちらもOpenAIの標準パラメータにはないためOpenAI SDKでは extra_body に入れて渡します。MCP専用のサーバーは用意されていませんが、OpenAI形式のツール定義が使えるため、OpenAI互換のバックエンドを設定できるエージェント基盤なら接続できます。

Mercury 2の採用判断:向く処理と向かない処理

速度が成果に直結する多段処理

Mercury 2が生きるのは、1件あたりの応答時間が積み上がる処理です。エージェントが1タスクで数十回モデルを呼ぶ構成、音声対話のように無音時間が体験を壊す構成、検索結果の要約をページ表示内に返す構成がこれに当たります。公式ブログには、ブラウザ自動化のSkyvernが「GPT-5.2より少なくとも2倍速い」、リアルタイム会話アバターのHappyverse AIが「速く一貫したテキスト生成で、会話を自然に保てるようになった」とコメントを寄せています。

ツール引数やJSON抽出のように形式が決まっていて、長い思考より往復回数が支配的な処理は、最初に置き換えを試す対象として適しています。

Mercury 2を採用すべきでない場面

次の条件に当てはまるなら、Mercury 2を主力にするのは避けるべきです。

  • 画像やPDFの画像ページを読ませる必要がある。公式FAQでMercury 2.5・2・Edit 2はいずれもテキスト入力のみと明記されています。
  • 1回の回答品質が成果を決め、呼び出し回数が少ない。Intelligence Indexが同価格帯の平均を下回る以上、難問は上位モデルに回した方が手戻りが減ります。
  • 重みを取得して自社環境で動かす必要がある。Mercuryシリーズは重みが公開されていません。拡散型をローカルで動かしたいなら、Apache 2.0で配布されているGoogleのDiffusionGemmaが選択肢になります。
  • テストのためにtemperature 0で出力を固定したい。前述のとおり0.5未満は受け付けません。

現実的な構成は、Mercury 2(新規なら2.5)を高頻度・低遅延の下位処理に置き、判断の重い工程だけ別モデルへ振り分ける二層構成です。自前でモデルを配信する場合の選択肢はLLM Servingのフレームワーク比較で整理しています。

よくある質問

dLLMとはどういう意味ですか?

Diffusion Large Language Model(拡散型大規模言語モデル)の略です。1トークンずつ順に確定する自己回帰型と違い、出力全体を複数回の反復で並列に精製してテキストを生成します。Inceptionは自社のMercuryシリーズをこの名前で呼んでいます。

Mercury 2はオープンソースですか?

オープンソースではありません。重みは公開されておらず、Inception API、Inception Chat、Microsoft Foundryなどの提供経路を通じて使います。技術の概要はarXivの技術報告(2506.17298)で公開されています。

Mercury 2はチャット画面で試せますか?

Inception Chat(chat.inceptionlabs.ai)でブラウザから試せます。APIで試す場合は、新規アカウントに付く1億トークンの無料クレジットの範囲で、料金をかけずに検証できます。

Mercury 1とMercury 2の違いは何ですか?

2025年6月の技術報告で示された初代系列はコード生成向けのMercury Coder(MiniとSmall)が中心でした。Mercury 2は推論機能と4段階の推論量調整、128Kコンテキスト、ツール呼び出し、構造化出力を備えた汎用の推論モデルとして発表されています。

Mercury 2からMercury 2.5へ移行すべきですか?

新規開発なら最初から2.5を使うのが妥当です。既存の本番システムは、2.5でもJSON形式やツール呼び出しの結果が変わらないかを回帰テストで確かめ、temperatureを明示してから切り替えてください。Microsoft Foundry経由で使っている場合は、2.5の提供経路が揃うかも事前に確認が必要です。

関連記事

お気に入りに入れた記事の一覧

資料請求

RELATED POSTS 関連記事

目次