AI

日本語最大規模LLMとして登場したRakuten AI 3.0の開発背景とGENIACプロジェクトの位置づけ

日本語最大規模LLMとして登場したRakuten AI 3.0の開発背景とGENIACプロジェクトの位置づけ

2026年3月17日、楽天グループは日本語に特化した大規模言語モデル「Rakuten AI 3.0」の一般公開を開始しました。約7000億パラメータという国内最大規模を誇るこのモデルは、経済産業省とNEDO(新エネルギー・産業技術総合開発機構)が推進する「GENIAC(Generative AI Accelerator Challenge)プロジェクト」の成果物として開発されたものです。Apache 2.0ライセンスのもとで無償公開されており、国内のAI開発を加速させる基盤として注目を集めています。ここでは、Rakuten AI 3.0がどのような背景と戦略のもとで誕生したのかを解説します。

経産省・NEDO主導のGENIAC第3期で採択された楽天の研究開発テーマと支援内容

GENIACプロジェクトは、日本の生成AI開発力を国家戦略として強化する目的で経産省とNEDOが立ち上げた施策です。楽天は2025年7月15日にこのプロジェクトの第3期公募に採択されました。採択された研究テーマは「長期記憶メカニズムと対話型学習を融合した最先端の生成AI基盤モデルの研究開発」で、LLMのメモリ機能を拡張し、より長く複雑な日本語文脈に対応する次世代モデルの開発を目指す内容です。

GENIACからの支援は、主に学習に必要な計算資源のコスト補助という形で提供されています。楽天の公式発表によれば、Rakuten AI 3.0の学習費用の一部はGENIACプロジェクトから支援を受けています。7000億パラメータ級のモデルを学習させるには膨大なGPU計算量が必要であり、この費用を部分的にプロジェクトが負担することで、大規模開発の推進が後押しされました。GENIAC第3期では楽天以外にも野村総合研究所やリコーなど計24件のテーマが採択されており、日本全体の生成AI基盤技術の底上げを目指す国家的な取り組みとして意義のある枠組みです。

国内最大7000億パラメータを実現した計算資源確保とGENIACによる開発加速の経緯

Rakuten AI 3.0の開発を時系列で整理すると、2025年7月のGENIAC第3期採択、同年8月からのGENIAC研究開発の正式開始、12月18日の公式発表、そして2026年3月17日のオープンソース公開という流れです。ただし、楽天は2024年3月からLLM開発に取り組んでおり、Rakuten AI 3.0の構想や基礎的な開発はGENIAC採択以前から進行していたと考えられます。GENIACの計算資源支援が加わったことで、7000億パラメータ規模への大幅なスケールアップが加速したという位置づけです。

この規模の開発を推進できた背景には、Rakuten AI 7BやRakuten AI 2.0での技術蓄積が大きく貢献しています。MoEアーキテクチャに関する知見やバイリンガルデータの整備など、過去の開発で得られたノウハウを土台として活用することで、開発効率を高めることに成功しました。学習は楽天が設計した自社マルチノードGPUクラスタで実施されており、隔離されたクラウド環境内でデータの外部流出を防ぎながら進められています。

2025年7月の採択から2026年3月公開までの主要マイルストーンと段階的リリース計画

Rakuten AI 3.0の開発は、複数の明確なマイルストーンを経て進行しました。まず2025年7月15日にGENIAC第3期への採択が決定し、同年8月からGENIACの支援を受けた研究開発が正式に開始されています。続く12月18日には、楽天グループが公式にRakuten AI 3.0の存在を発表し、社内プラットフォーム「Rakuten AI Gateway」を通じたサービス展開を開始しました。この時点ではオープンウェイトモデルとしての外部公開は2026年春を予定としていました。

その後、2026年3月17日にはファインチューニングを経た改良版がApache 2.0ライセンスでHugging Faceリポジトリから一般公開されました。この段階的リリース計画には明確な意図があります。まず社内環境で実運用テストを行い、品質を検証したうえで外部公開するという二段構えにより、モデルの信頼性を担保しつつオープンソースコミュニティへの貢献を実現しています。楽天はこのモデルをRakuten AIエージェントプラットフォーム経由で各サービスに順次統合する計画も進めています。

楽天CAIDO ティン・ツァイ氏が掲げる「高品質・低コスト・オープン」3原則の戦略意図

Rakuten AI 3.0の開発を統括する楽天グループのChief AI & Data Officer(CAIDO)ティン・ツァイ氏は、「高品質で費用対効果の高いモデルを開発し、企業とユーザーの双方をエンパワーメントする」と表明しています。この発言が示すのは、楽天のAI戦略が「高品質」「低コスト」「オープン」という3つの原則に集約されるという点です。

「高品質」は、日本語ベンチマークでトップクラスの性能を実現することを意味します。「低コスト」は、他社フロンティアモデルと比較して最大90%のコスト削減を試験的に達成したという実績に裏打ちされています。そして「オープン」は、Apache 2.0ライセンスでの無償公開を通じて、国内AI開発コミュニティの育成に貢献する姿勢を指しています。この3原則は、楽天が自社エコシステム内での活用だけでなく、日本全体のAI産業の底上げを視野に入れていることを示す重要な方針です。

海外フロンティアモデル依存から脱却するために国産LLMが果たす3つの構造的役割

日本企業の多くは現在、OpenAIやGoogleなど海外企業の大規模言語モデルに依存する形で生成AIサービスを構築しています。しかし、この構造には以下に挙げる3つの根本的な課題が存在しています。

  • コスト面の制約:APIの利用料金が海外事業者の価格設定や為替変動に左右され、日本企業側でのコントロールが難しい状況が続いている
  • データ主権の問題:企業の機密データを海外クラウドに送信することが、セキュリティポリシーやコンプライアンス上の障壁となるケースが増加している
  • 日本語品質の課題:海外モデルは多言語対応を前提としているため、敬語表現や文化的文脈の理解で日本語特化モデルに及ばない場面が少なくない

Rakuten AI 3.0のような国産LLMは、これら3つの課題を同時に解決しうる選択肢として、企業のAI戦略に新たな可能性を提供しています。特にデータを国内で完結させたい企業にとって、自社環境にデプロイ可能な国産モデルの存在は大きな意味を持ちます。

7000億パラメータとMoEアーキテクチャが両立させる計算効率と日本語処理精度の設計思想

Rakuten AI 3.0の技術的な核心は、約7000億パラメータという国内最大規模のモデルでありながら、推論時に活性化するパラメータを約400億に抑えるMixture of Experts(MoE)アーキテクチャにあります。この設計により、巨大モデルの知識量と小型モデルの計算効率を同時に実現しています。本章では、MoEの仕組みと楽天が施した設計上の工夫を技術面から掘り下げます。

総パラメータ約7000億のうちトークンごとに約400億だけ活性化するMoEの動作原理

MoE(Mixture of Experts)アーキテクチャとは、モデル全体を「エキスパート」と呼ばれる複数のサブモデルに分割し、入力に応じて一部のエキスパートだけを選択的に活性化する手法です。Rakuten AI 3.0では、総パラメータ約7000億のうち、1つのトークンを処理する際に活性化されるパラメータは約400億にとどまります。

この仕組みにより、モデルは7000億パラメータ分の「知識」を内部に保持しながら、実際の計算コストは400億パラメータ相当に抑えられます。たとえば、料理に関する質問には料理分野に強いエキスパートが、法律に関する質問には法律分野に強いエキスパートが自動的に選択されるイメージです。これにより、単一の巨大なDenseモデルと比較して推論速度と消費電力の両面で大きな優位性を持つ構造となっています。MoE方式は近年のLLM開発においてトレンドとなっており、海外のフロンティアモデルでも広く採用されているアーキテクチャです。

共有エキスパート1つと専門エキスパート8つで構成されるルーティング設計の技術的特徴

Rakuten AI 3.0のMoE層は、常に活性化される「共有エキスパート」1つと、入力に応じて選択される「専門エキスパート」8つで構成されています。共有エキスパートはすべてのトークン処理に関与し、言語の基本構造や汎用的な知識を担当します。一方、専門エキスパートはルーティング機構によってトークンごとに動的に割り当てられ、特定の分野や文脈に特化した処理を行います。

このルーティング設計の特徴は、共有エキスパートが常にベースラインの品質を維持しつつ、専門エキスパートが文脈に応じた高精度な応答を生成できる点にあります。日本語処理において、敬語の使い分けや文化的な背景知識が求められる場面では、該当分野を得意とするエキスパートが選択されることで、汎用モデルでは実現しにくい自然な日本語表現が可能になっています。この共有・専門の二層構造は、応答品質の安定性と専門性を同時に確保するうえで非常に合理的な設計方針といえます。

密な層3つとエキスパート層を組み合わせたアクティブパラメータ構成の計算効率上の利点

Rakuten AI 3.0のアクティブパラメータ(約400億)は、3つの密な層(Dense層)とエキスパートコンポーネントの組み合わせで構成されています。Dense層はすべてのトークンに対して一律に処理を行う部分であり、入力の埋め込み表現や最終的な出力の生成など、モデル全体で共通する処理を担っています。

このハイブリッド構成には明確な利点があります。Dense層がモデルの基盤的な言語理解能力を担保する一方、エキスパート層が専門的な知識処理を分担することで、計算資源の無駄を最小限に抑えながら高い精度を維持できます。仮にすべてのパラメータを常時活性化するDenseモデルとして同等の性能を実現しようとした場合、必要な計算コストは数倍以上に膨れ上がることになります。MoEの採用により、限られたGPUリソースでも実用的な推論速度を確保できる設計が実現されている点は、運用コストの面からも大きなメリットです。

従来型Denseモデルとの比較で理解するMoEアーキテクチャの推論速度とメモリ消費の差

従来型のDenseモデルでは、すべてのパラメータが各トークンの処理に関与するため、パラメータ数の増加がそのまま計算量とメモリ消費の増大に直結します。たとえば7000億パラメータのDenseモデルを推論するには、パラメータだけでFP16精度で約1.4TBのGPUメモリが必要となり、現実的な運用は極めて困難です。

一方、MoEアーキテクチャを採用したRakuten AI 3.0では、推論時に活性化するパラメータが約400億に限定されるため、実効的な計算量は400億パラメータのDenseモデルに近い水準にとどまります。ただし注意が必要なのは、モデル全体のパラメータ(約7000億)はGPUメモリ上にロードする必要がある点です。そのため、メモリ消費量はDenseモデルの400億パラメータ版よりも大幅に大きくなります。推論速度とメモリ消費のバランスを考慮した環境設計が、MoEモデルの実運用における鍵となります。

楽天独自バイリンガルデータを用いた事前学習で日本語ニュアンスを捉える仕組みの概要

Rakuten AI 3.0の日本語性能を支える重要な要素が、楽天独自の高品質なバイリンガルデータです。楽天は国内最大級のECプラットフォームを運営しており、商品レビュー、カスタマーサポートの問い合わせ履歴、ニュースコンテンツなど、多様なジャンルにわたる大量の日本語テキストデータを保有しています。これらのデータをもとに事前学習が行われています。

バイリンガルデータの活用は、日本語と英語の双方を学習に組み込むことで、翻訳タスクや多言語での知識転移の面でも効果を発揮します。さらに、オープンソースコミュニティで公開されている優良なモデルを基盤として活用し、楽天独自のデータと技術で追加学習を施すアプローチを採っています。この手法により、ゼロからの学習と比較して効率的に日本語の文化的ニュアンスや商慣習への理解を深めたモデルが構築されています。結果として、日本語の自然さと英語での知識獲得を高い水準で両立するバイリンガルモデルに仕上がっています。

日本語MT-Benchで8.88を記録したRakuten AI 3.0の性能評価と主要モデルとの差

LLMの性能を客観的に把握するには、標準化されたベンチマークによる比較が不可欠です。Rakuten AI 3.0は、日本語版MT-Benchをはじめとする複数の評価指標で高いスコアを記録しており、gpt-4oを含む主要モデルと比較しても優位性を示しています。本章では各ベンチマークの内容とスコアの意味を具体的に解説します。

MT-Bench日本語版8分野80問で測定されるペルソナ維持・推論・数学・コード生成の評価基準

MT-Bench日本語版は、LLMの多面的な能力を測定するために設計されたベンチマークです。具体的には、ライティング、ロールプレイ(ペルソナ維持)、推論、数学、コーディング、情報抽出、STEM(科学・技術・工学・数学)、人文科学の8分野にわたる合計80問のオープンエンド形式の質問で構成されています。

評価はGPT-4(gpt-4o-2024-08-06)がジャッジモデルとして各回答をスコアリングする方式で行われ、公開リーダーボードと同一の評価設定が用いられています。この仕組みにより、異なるモデル間の比較が公平かつ透明に行える点が特徴です。単なるテキスト生成能力だけでなく、ペルソナの一貫性を保った対話や、論理的な推論、正確なコード出力など、実務で求められる多様なスキルが総合的に評価される設計となっています。マルチターン(複数回のやり取り)での応答品質も採点対象に含まれるため、実際のチャット利用に近い条件での実力が測定されます。

2025年12月評価でスコア8.88を記録したMT-Benchと前モデル7.08との具体的な数値差

2025年12月の発表時点で、Rakuten AI 3.0は日本語版MT-Benchにおいて8.88というスコアを記録しています。これに対し、前モデルであるRakuten AI 2.0のインストラクションチューニング済みモデルのスコアは7.08でした(ジャッジモデルのバージョン変更に伴い更新済みの数値)。1世代の進化で約1.8ポイントの向上を達成しており、大幅な性能改善が数値として裏付けられています。

さらに注目すべきは、このスコアがgpt-4oを上回っている点です。楽天の公式発表では、主要な日本語特化モデルやgpt-4oと比較して高い性能を発揮したことが報告されています。ただし、MT-Benchは特定の条件下での対話能力を測るベンチマークであるため、このスコアだけでモデルの全体的な優劣を断定することはできません。タスクの種類や入力の複雑さによって結果が変動する可能性もあるため、用途ごとの実際の出力品質を確認することが導入判断においては重要です。

2026年3月公開版で追加評価されたJamC-QA・MMLU-ProX等4ベンチマークの総合力

2026年3月のオープンソース公開にあたり、ファインチューニング後の改良版Rakuten AI 3.0は、MT-Benchとは別の4つのベンチマークで追加評価が行われました。JamC-QAは日本固有の文化的知識や歴史に関する質問応答能力を測定するベンチマークで、日本語LLMにとって重要な評価軸です。MMLU-ProXは、大学院レベルを含む幅広い知識分野での推論能力を多言語で評価する指標として知られています。

MCLM MATH-100は競技数学レベルの高度な数学的推論を評価するベンチマークであり、M-IFEvalは指示遵守能力、つまりユーザーの指示にどれだけ正確に従えるかを測定します。楽天の公式発表によれば、Rakuten AI 3.0はこれら4つのベンチマークすべてにおいてgpt-4oなどの主要モデルと比較して優れたスコアを示しました。12月時点のMT-Benchだけでは見えなかった文化的理解力、論理的推論力、指示追従能力といった多角的な能力が高い水準にあることを、これらの指標が補完的に裏付けています。

日本固有の文化的知識・大学院レベル推論・競技数学の3領域で高得点を出せた要因分析

Rakuten AI 3.0がこれら3つの領域で高いスコアを獲得できた背景には、複合的な要因があります。まず日本固有の文化的知識については、楽天が保有する大量の日本語テキストデータに加え、文化・歴史に関するデータセットを意図的に学習データに組み込んだことが大きいと考えられます。海外モデルでは手薄になりがちな日本の慣習や暦、地域固有の表現などに対する理解が強化されています。

大学院レベルの推論能力については、MoEアーキテクチャによる専門エキスパートの分業が寄与しています。特定の学術分野に特化したエキスパートが適切に活性化されることで、専門性の高い問いに対しても的確な回答を生成できます。競技数学については、ファインチューニング段階で数学的推論に関するデータセットを強化した成果と見られます。これら3領域での高得点は、単一の要因ではなく、データ・アーキテクチャ・チューニング手法の総合的な最適化の結果です。

ベンチマーク数値だけでは見えない実務適用時の注意点とハルシネーション対策の現状

ベンチマークスコアは客観的な性能比較に有用ですが、実際の業務で利用する際にはスコアだけでは判断できない課題が存在します。代表的なものがハルシネーション(事実と異なる情報の生成)の問題です。Hugging Faceの公式モデルカードでも、Rakuten AI 3.0が偏った情報や不正確な出力、安全でない内容を生成する可能性があることが明記されています。

実務適用においては、モデルの出力を人間がレビューする体制の構築が不可欠です。特に法務・医療・金融など正確性が重視される領域では、ファクトチェックの仕組みをワークフローに組み込む必要があります。また、ベンチマークでは測定しにくい長文生成時の文脈一貫性や、複雑な条件を含む指示への対応力なども、PoC(概念実証)の段階で十分に検証すべきポイントです。高いベンチマークスコアを記録しているモデルであっても、利用領域や業務要件ごとの実地テストは必ず実施してください。

他社比最大90%のコスト削減を支える楽天独自データと自社クラウド基盤の運用設計

Rakuten AI 3.0の大きな特長のひとつが、楽天エコシステムのサービスを支える試験において、他社の同規模フロンティアモデルと比較して最大90%のコスト削減を実現したという点です。このコスト優位性は、モデルアーキテクチャの効率性だけでなく、楽天独自のデータ戦略とインフラ設計の組み合わせによって達成されています。

フロンティアモデル比90%コスト削減を実現したトークン単価最適化の試算と検証条件

楽天が公表している「最大90%のコスト削減」は、楽天エコシステム内のサービスにRakuten AI 3.0を導入した試験運用での結果です。比較対象はサードパーティのフロンティアAIモデルであり、トークン単位の入出力コストをベースに算出されています。自社で開発したモデルを自社が管理するインフラ上で運用することで、外部APIの課金体系に依存しない構造を実現しており、この点がコスト削減の根本的な要因です。

ただし、この90%という数値を評価する際には、その検証条件を正しく理解する必要があります。楽天エコシステムに特化したファインチューニングが施されているため、楽天のサービス上での処理タスクに最適化されたモデルと汎用フロンティアモデルを直接比較している点を考慮すべきです。自社の業務にRakuten AI 3.0を導入する場合は、タスク特性やリクエスト量に応じた独自のコスト試算を行うことが推奨されます。

楽天エコシステム3兆件超のデータ資産を学習に活かすファインチューニング戦略の特徴

楽天グループは、楽天市場・楽天トラベル・楽天証券・楽天モバイルなど70以上のサービスを展開しており、蓄積された利用者データは3兆件を超えるとされています。Rakuten AI 3.0は、この膨大なデータ資産のうち、日本市場と楽天のビジネスニーズに最適化された高品質な独自データを用いてファインチューニングが施されています。

このファインチューニング戦略のポイントは、汎用的な言語能力を持つ基盤モデルの上に、楽天固有のドメイン知識を重ね合わせるという多層的な構造にあります。ECサイトでの商品説明文の理解、旅行プランの提案、金融商品に関する質疑応答など、楽天サービスで頻繁に発生するタスクに対して高い精度を発揮できるよう調整されています。汎用モデルでは難しい「楽天ポイント」や「SPU(スーパーポイントアップ)」といった楽天固有の概念に対する正確な理解も、このファインチューニング工程の成果として実現しています。

社内マルチノードGPUクラスタ設計と隔離クラウド環境でデータ外部送信を防ぐ安全設計

Rakuten AI 3.0の学習および推論環境は、楽天が設計した社内マルチノードGPUクラスタ上で稼働しています。このクラスタは隔離されたセキュアなクラウド環境に配置されており、処理されるデータが外部に送信されない設計が徹底されています。企業がLLMを導入する際に最も懸念される情報漏洩リスクに対し、インフラレベルでの対策が講じられている形です。

この設計は、楽天自身のサービス運用だけでなく、Rakuten AI 3.0をオンプレミスやプライベートクラウドに導入する企業にとっても参考になるモデルケースです。外部APIにデータを送信する必要がないため、機密性の高い社内文書の処理や個人情報を含むカスタマーサポートへの適用においても、データガバナンスの観点から大きな優位性があります。セキュリティ要件の厳しい金融機関や行政機関でのAI導入検討において、この隔離型の安全設計は特に重要な評価ポイントとなるでしょう。

日本市場向け独自データで精度向上を図るドメイン特化型チューニングの具体的プロセス

ドメイン特化型チューニングとは、特定の業界や用途に最適化するためにモデルを追加学習させるプロセスです。Rakuten AI 3.0の場合、まずオープンソースコミュニティの優良モデルを基盤として事前学習が行われ、その上に楽天独自のバイリンガルデータで継続事前学習が実施されています。さらに、会話能力と指示追従能力を高めるためのインストラクションチューニングが施されています。

このプロセスで重要なのは、データの品質管理です。学習データにノイズや偏りが含まれると、モデルの出力品質に直接影響します。楽天は自社サービスから収集したデータに対して、品質フィルタリングとアノテーションを行ったうえで学習に使用しています。また、日本語と英語のバランスを適切に調整することで、日本語の精度を最大化しつつ英語タスクへの対応力も維持しています。こうした多段階のチューニングプロセスが、ベンチマークでの高スコアと実務での使いやすさを両立させる鍵となっています。

コスト削減効果を自社検証する際に必要なトークン消費量・レイテンシ測定の5つの指標

Rakuten AI 3.0のコスト削減効果を自社環境で検証するには、以下の5つの指標を測定することが推奨されます。第1に「トークン単価」です。入力トークンと出力トークンそれぞれのコストを、現在利用中の外部APIと比較します。第2に「レイテンシ(応答時間)」で、最初のトークン生成までの時間(TTFT)と全体の応答完了時間を測定します。

第3は「スループット(単位時間あたり処理トークン数)」で、同時リクエスト数を変化させながら測定することで、実運用時の負荷耐性を把握できます。第4に「GPU利用率」を監視し、計算資源がどの程度効率的に使われているかを確認します。第5は「出力品質スコア」で、自社のタスクに対する正答率やユーザー満足度を定量的に計測します。コスト削減と品質維持のバランスを客観的に評価するには、これら5つの指標を組み合わせた総合的な判断が欠かせません。いずれの指標も単独では全体像を捉えきれないため、複数の視点から検証を行うことが重要です。

Rakuten AI 7Bから3.0へ3世代の進化で変わった日本語対応力とモデル規模の変遷

楽天のAIモデル開発は、2024年3月のRakuten AI 7B公開から始まり、わずか2年足らずの間に3世代の進化を遂げました。パラメータ規模は7Bから7000億へと約100倍に拡大し、性能面でも飛躍的な向上を見せています。この章では、各世代のモデルがどのような技術的挑戦を経て現在のRakuten AI 3.0に至ったのかを時系列で整理します。

2024年3月公開のRakuten AI 7Bが切り開いた国産オープンLLMの初期戦略と評価

Rakuten AI 7Bは、2024年3月に楽天が初めて公開した大規模言語モデルです。約70億パラメータのDenseモデルで、日本語に最適化されたオープンソースLLMとして、Apache 2.0ライセンスでHugging Faceから公開されました。当時、国内企業がオープンソースで日本語特化LLMを公開する動きはまだ少なく、先駆的な取り組みとして注目を集めました。

7Bモデルの性能は、当然ながら海外の大規模モデルと正面から比較できるレベルではありませんでした。しかし、このモデルの最大の意義は性能そのものよりも、楽天が「国産LLMのオープン公開」という方針を明確に示した点にあります。オープンソースでの公開により、国内の研究者や開発者がモデルをベースにした研究やファインチューニングを自由に行える環境が整備され、後続モデルの改善にもコミュニティからのフィードバックが活用される好循環が生まれました。

2025年2月公開のRakuten AI 2.0で初採用されたMoE構造8×7B設計の技術的意義

Rakuten AI 2.0は2025年2月に公開された楽天初のMoEアーキテクチャ採用モデルです。7Bパラメータのエキスパートモデル8つを組み合わせた構造で、総パラメータは約470億(8×7B)、推論時にはタスクに応じて適切なエキスパートが選択される仕組みとなっています。公開直後に日本語性能で「ベスト・イン・クラス」の評価を得ました。

このモデルの技術的意義は、楽天がDenseアーキテクチャからMoEへの転換を成功させた点にあります。MoEは計算効率の面で大きな利点がある一方、学習の安定性やエキスパート間の負荷バランスなど、独自の技術的課題を伴います。Rakuten AI 2.0でこれらの課題を解決する知見を蓄積したことが、3.0での7000億パラメータへのスケールアップを可能にした技術的な土台となっています。MoEの運用ノウハウを段階的に積み上げてきた開発戦略が、結果的に国内最大規模モデルの実現につながりました。

1.5BパラメータのRakuten AI 2.0 miniが示した小規模モデルの実用性と限界

Rakuten AI 2.0と同時に公開されたRakuten AI 2.0 miniは、約15億パラメータの小規模言語モデル(SLM)です。楽天が初めて開発したSLMであり、スマートフォンやエッジデバイスなどリソースが限られた環境での動作を想定して設計されています。将来的にはRakuten Linkアプリを通じたオンデバイスAI機能への搭載も視野に入れた製品です。

実際に利用したユーザーの評価では、1.5Bという小規模さにもかかわらず基本的な日本語処理能力は一定の水準を確保しているとの報告があります。一方で、複雑な推論タスクや長文生成においてはChatGPTやClaudeといった大規模モデルとの差が顕著になるとの指摘もあります。miniモデルは「すべてのタスクを高精度でこなす」ためのものではなく、軽量さを活かしたFAQ応答や定型文生成など、特定用途に限定して活用するのが現実的な運用方法です。

7B→47B→7000億と100倍規模で拡大した3世代のパラメータ数推移と性能向上率

楽天のAIモデル開発を世代別に整理すると、パラメータ規模の拡大は劇的なものです。初代のRakuten AI 7Bが約70億パラメータ、第2世代のRakuten AI 2.0が約470億パラメータ(MoE総パラメータ)、そして第3世代のRakuten AI 3.0が約7000億パラメータと、各世代で約10倍ずつ、累計では100倍の規模拡大を達成しています。

モデル名 公開時期 総パラメータ数 アーキテクチャ MT-Benchスコア
Rakuten AI 7B 2024年3月 約70億 Dense 非公開
Rakuten AI 2.0 2025年2月 約470億(8×7B) MoE 7.08
Rakuten AI 3.0 2026年3月 約7000億 MoE 8.88

MT-Benchのスコアで見ると、Rakuten AI 2.0の7.08からRakuten AI 3.0の8.88へ約25%の向上を達成しています。パラメータ数の増大がそのまま性能向上に反映されているわけではなく、データ品質の改善やファインチューニング手法の進化など、複合的な要因がスコア上昇に貢献しています。

Rakuten AI各世代のライセンス・公開方針の変遷から読む楽天のオープン戦略の一貫性

Rakuten AI 7Bから3.0に至るまで、楽天は一貫してApache 2.0ライセンスでのオープン公開を採用しています。Apache 2.0は、商用利用・改変・再配布を幅広く許容するライセンスであり、企業が自社サービスに組み込む際にもライセンス上の障壁が低い点が特徴です。この方針は3世代を通じて変更されていません。

この一貫性は、楽天のAI戦略が「自社囲い込み」ではなく「エコシステム拡大」にあることを示しています。モデルを無償公開することで、国内外の開発者がRakuten AIベースのアプリケーションやファインチューニング済みモデルを構築し、結果的に楽天のAIプラットフォーム全体の価値が向上するという好循環を狙った戦略です。実際にHugging Face上では、コミュニティメンバーによるGGUF形式への量子化変換なども行われており、オープン公開の恩恵が具体的な形で広がりを見せています。こうしたコミュニティの活動が楽天モデルの普及を後押しする構図が定着しつつあります。

Apache 2.0ライセンスで無償利用できるRakuten AI 3.0の導入手順と推論環境の構築要件

Rakuten AI 3.0はApache 2.0ライセンスで無償公開されており、Hugging Faceの公式リポジトリからダウンロードして利用できます。しかし、7000億パラメータのMoEモデルを実際に動かすには相応のハードウェアと環境構築が必要です。本章では、導入の具体的な手順と構築時に知っておくべき要件を実務目線で解説します。

Hugging Face公式リポジトリからモデルをダウンロードする際の手順と必要アカウント設定

Rakuten AI 3.0は、楽天グループの公式Hugging Faceリポジトリ(https://huggingface.co/Rakuten)から入手できます。ダウンロードにはHugging Faceのアカウントが必要です。アカウント作成後、リポジトリページにアクセスし、モデルファイルをダウンロードします。モデルのサイズが非常に大きいため、安定した高速回線と十分なストレージ容量を事前に確保してください。

プログラムからダウンロードする場合は、Hugging Face Hubライブラリを使用するのが便利です。huggingface-hubパッケージをインストールし、アクセストークンを設定したうえで、snapshot_download関数などを使ってモデル一式をローカルに取得します。7000億パラメータのモデルファイルはFP16精度で合計約1.4TB程度になるため、ダウンロード時間とストレージ容量を事前に見積もっておくことが重要です。

SGLangを使った推論サーバ起動時のtp 8・mem-fraction-static 0.85の推奨パラメータ解説

Rakuten AI 3.0のHugging Face公式モデルカードでは、推論フレームワークとしてSGLangが推奨されています。起動コマンドの例として以下が示されています。

python -m sglang.launch_server --model-path Rakuten/RakutenAI-3.0 --tp 8 --mem-fraction-static 0.85 --trust-remote-code --show-time-cost

各パラメータの意味を説明します。--tp 8はテンソル並列度を8に設定するもので、8枚のGPUにモデルを分割して配置します。--mem-fraction-static 0.85は、GPU メモリの85%を静的に確保する設定で、推論時のメモリ確保を安定させる効果があります。--trust-remote-codeはモデル固有のカスタムコードの実行を許可するオプションです。これらの設定を適切に行うことで、大規模MoEモデルの推論を安定的に実行できる環境が構築されます。

7000億パラメータMoEモデルを動かすために最低限必要なGPUメモリとマルチノード構成

Rakuten AI 3.0をフル精度(FP16)で推論するには、モデルパラメータだけで約1.4TBのGPUメモリが必要です。これに加えてKVキャッシュやアクティベーション用のメモリも必要となるため、実用的には合計で1.5TB以上のGPUメモリを確保する必要があります。NVIDIA H100(80GB)を使用する場合、最低でも8枚をテンソル並列で使用する構成(合計640GB)では不足するため、複数ノードにまたがるパイプライン並列やFP8量子化の活用が現実的な選択肢となります。

FP8量子化を適用すれば、必要なメモリ量を約半分に削減できる可能性があり、H100 8枚構成でも動作が見込めます。SGLangではFP8オンライン量子化のオプションも提供されており、スループットの30〜50%向上とメモリ使用量の50%削減が期待できるとされています。導入を検討する際は、精度と効率のトレードオフを踏まえて最適な量子化レベルを選定することが推奨されます。

Apache 2.0ライセンスの商用利用条件と派生モデル作成時に守るべき3つの表示義務

Apache 2.0ライセンスは、オープンソースライセンスの中でも商用利用に対して寛容なライセンスのひとつです。Rakuten AI 3.0をベースにした商用サービスの構築、モデルの改変、派生モデルの作成と再配布がすべて許可されています。ライセンス料は不要であり、企業規模を問わず自由に利用できます。

ただし、Apache 2.0ライセンスには守るべき3つの表示義務があります。第1に、ライセンス全文のコピーを配布物に含めること。第2に、元のソースコードから変更を加えた場合、その変更箇所を明示すること。第3に、オリジナルの著作権表示とライセンス表示を保持すること。これらの義務は比較的軽微ですが、企業の法務部門が確認すべきポイントです。なお、Apache 2.0は特許権に関する条項も含まれており、コントリビューターからの特許ライセンスが自動的に付与される点も、商用利用時の安心材料となっています。

導入直後に発生しやすいメモリ不足・依存パッケージ競合の5大エラーと対処手順

Rakuten AI 3.0の導入時に発生しやすいエラーとその対処法を5つ紹介します。第1は「CUDA Out of Memory」エラーです。GPUメモリが不足している場合に発生し、テンソル並列度の調整やFP8量子化の適用が解決策となります。第2は「FlashInferのビルドエラー」で、キャッシュの不整合が原因であることが多く、rm -rf ~/.cache/flashinferでキャッシュを削除することで解消できます。

第3は「outlines-coreのバージョン競合」で、SGLangが依存するoutlinesパッケージとの互換性問題です。Rustのアップデートとoutlines-coreの再インストールが対処法となります。第4は「trust-remote-code未指定エラー」で、モデル固有のコードが実行できない場合に発生します。起動コマンドに--trust-remote-codeオプションを追加してください。第5は「transformersバージョン非対応」で、モデルが要求するバージョンと環境にインストールされたバージョンが一致しない場合に発生します。公式リポジトリで推奨されるバージョンに揃えることで解決します。

楽天エコシステム全体へ拡大するAIエージェント連携とRakuten AI Gatewayの展開計画

Rakuten AI 3.0は単独のLLMとしてだけでなく、楽天エコシステム全体を横断するAIプラットフォームの中核として位置づけられています。社内向けのRakuten AI Gatewayから消費者向けのRakuten AIエージェントまで、多層的な展開が進行中です。本章では、その全体像と今後のロードマップを解説します。

Rakuten AI Gatewayが提供する生成AI API群の構成と社内開発者向け機能の全体像

Rakuten AI Gatewayは、楽天グループの社内開発者向けに提供されるプラットフォームで、生成AI APIを統合的に利用できる環境です。Rakuten AI 3.0をはじめとする複数のAIモデルにAPIを通じてアクセスでき、実験・開発・本番運用に必要な機能が一元的に提供されています。

このプラットフォームを通じて、楽天の各事業部門の開発者は高度なAIエージェントを用いたコーディングタスクや非コーディングタスクの効率化を実現できます。具体的には、社内文書の要約・分析、カスタマーサポートの自動応答文生成、商品説明文の作成支援など、多岐にわたるユースケースがカバーされています。Rakuten AI Gatewayの存在により、個々の開発者がモデルのデプロイやインフラ構築に時間を費やすことなく、API呼び出しだけでAI機能を自社サービスに組み込める環境が整備されています。この仕組みは社内のAI活用を加速する基盤として重要な役割を果たしています。

Rakuten AIエージェントが楽天市場・トラベル・証券の3サービスを横断する仕組みの実例

Rakuten AIは、楽天エコシステムの各サービスをシームレスに連携させるエージェント型AIツールとして展開されています。このツールの特徴は、ショッピング・金融・旅行・エンターテインメントなど複数のサービスをまたいだ横断的な提案が可能な点にあります。

具体的な利用例として、ユーザーが「楽天ポイントが3倍になるキャンペーン中の商品で、レビュー評価4以上の家電製品を教えて」と質問すれば、楽天市場の商品データとキャンペーン情報を組み合わせた回答が得られます。また、「来月の沖縄旅行の予算に合わせて、楽天トラベルの宿泊プランと楽天カードの支払いスケジュールを提案して」といった複合的なリクエストにも対応できます。こうしたサービス横断型の提案は、単一サービスに閉じたAIでは実現が難しく、楽天エコシステム全体のデータにアクセスできるRakuten AIならではの強みです。複数サービスの情報を横断的に活用することで、ユーザーの意思決定を総合的にサポートする体験が実現されています。

Rakuten Linkアプリ経由のAIチャット機能とモバイル回線契約者向け提供条件の整理

Rakuten AIは、楽天モバイルのコミュニケーションアプリ「Rakuten Link」を通じて利用可能です。アプリのホーム画面に表示されるRakuten AIアイコンをタップするだけで、テキスト入力による質問のほか、音声入力や画像検索にも対応したAIチャット機能を利用できます。

ただし、利用にはいくつかの条件があります。まず、Rakuten AIの利用には楽天モバイル回線の契約が必要です。Rakuten Linkアプリを最新バージョンにアップデートしたうえで、楽天IDでログインすることで機能が有効化されます。なお、AIチャットの回数には上限が設けられている点にも注意が必要です。機種やOSのバージョンによって利用可能な機能が異なる場合もあるため、最新の対応状況を楽天モバイルの公式サイトで確認することをおすすめします。楽天モバイル回線を契約していないユーザーは現時点では利用できないため、今後の提供範囲の拡大動向にも注目しておくとよいでしょう。

HP製PCへのオンデバイスAI搭載で実現するオフライン推論と端末要件の技術的制約

楽天はHPとの協業により、HP製PCにRakuten AIのオンデバイスAI機能を搭載する取り組みを進めています。これは、クラウドを介さずに端末上で直接AI推論を実行する技術であり、インターネット接続がない環境でもAI機能を利用できることが最大のメリットです。

オンデバイスAIで動作するのは、Rakuten AI 3.0そのものではなく、Rakuten AI 2.0 miniのような軽量モデルが想定されています。7000億パラメータのモデルをPC上で動作させることは現在の技術では非現実的であり、端末のメモリや演算能力に見合った小規模モデルの搭載が前提となります。この技術的制約から、オンデバイスで実現できるタスクはテキスト補完や簡易的な質問応答など比較的軽量な処理に限定されます。高度な推論や長文生成が必要な場合は、クラウド上のRakuten AI 3.0にリクエストを送る併用パターンが現実的な運用形態です。

2026年以降に予定される楽天モバイルAIアシスタント3.0への統合と顧客体験向上の展望

楽天は2025年にRakuten Mobile AI Assistant 2.0を開発し、チャットベースのカスタマーサポートサービスとして第43回IT賞(カスタマーエクスペリエンス革新分野)を受賞しています。この実績を踏まえ、Rakuten AI 3.0を基盤とした次世代のAIアシスタントの展開が見込まれています。

AIアシスタントの進化で期待される改善点は、対話の自然さと問題解決能力の向上です。Rakuten AI 3.0の高い日本語処理能力と指示追従能力が組み合わさることで、複雑な契約内容の説明や料金プランの比較提案など、従来は人間のオペレーターが対応していた高度な問い合わせにもAIが対応できるようになる可能性があります。また、楽天エコシステム全体のサービスと連携したパーソナライズド提案により、顧客一人ひとりの利用状況に最適化されたサポート体験の実現も見据えています。こうした顧客接点の高度化は、楽天のサービス全体の競争力向上に直結する重要な施策です。

国産LLM導入を検討する企業・開発者が押さえるべき評価軸と活用判断の実務指針

Rakuten AI 3.0の登場により、国産LLMの選択肢はさらに広がりました。しかし、選択肢が増えるほど「どのモデルを選ぶべきか」という判断は複雑になります。本章では、Rakuten AI 3.0を含む国産LLMの中から自社に最適なモデルを選定するための評価軸と、導入から運用までの実務的な指針を提供します。

Rakuten AI 3.0・tsuzumi・Sarashina2を含む国産LLM主要7モデルの特徴比較

2026年現在、国産LLMの主要プレーヤーとそのモデルは多様化しています。楽天のRakuten AI 3.0、NTTデータのtsuzumi 2、ソフトバンク(SB Intuitions)のSarashina2 mini、NECのcotomi v3、富士通のTakane 32B、KDDI・ELYZAのLlama-3.1-ELYZA-JP-70B、Preferred NetworksのPLaMo 2.0 Primeが主なモデルです。

モデル名 開発元 パラメータ規模 主な特徴
Rakuten AI 3.0 楽天 約7000億(MoE) 国内最大規模、Apache 2.0、日本語ベンチマーク最高水準
tsuzumi 2 NTTデータ 小〜中規模 軽量・チューニング容易、業種特化に強み
Sarashina2 mini ソフトバンク 中規模 1兆パラメータ構想の派生モデル
cotomi v3 NEC 中規模 企業向けセキュリティに注力
Takane 32B 富士通 320億 富岳での学習実績
Llama-3.1-ELYZA-JP-70B KDDI・ELYZA 700億 Llama派生の日本語最適化
PLaMo 2.0 Prime PFN 中〜大規模 独自アーキテクチャ、研究開発志向

各モデルは規模も設計思想も異なるため、一概に優劣をつけることはできません。導入目的や運用環境に応じて、最適なモデルは変わります。この比較表を出発点として、自社の要件に照らし合わせた詳細な評価を行うことが重要です。

デジタル庁ガバメントAI選定基準から学ぶ国産LLM評価時に確認すべき5つの要件

デジタル庁は2026年3月、ガバメントAI「源内」で試用する国産LLMの選定結果を公表しました。15件の応募から7件を選定したこの審査プロセスでは、国産LLM評価の模範となる明確な基準が設けられています。この基準は、企業が自社導入用にLLMを選定する際にも有用な参考指標です。

選定基準の5つの要件を整理すると、第1に「行政実務において実用可能な性能」で、ベンチマークテスト結果が海外主要LLMと比較して優秀であること。第2に「安全性の取り組み」で、ハルシネーション・バイアス・有害コンテンツ生成への対策が説明可能であること。第3に「学習データの法令遵守」、第4に「セキュリティ確保」でガバメントクラウド上での動作要件を満たすこと。第5に「技術支援体制」で、最適な性能発揮のための情報提供やカスタマイズ支援が行えることです。企業での導入評価においても、この5要件をフレームワークとして活用することで、網羅的で偏りのない評価が実施できます。

日本語精度・コスト・セキュリティ・ライセンスの4軸で自社要件に最適なモデルを選ぶ方法

国産LLMの選定において、最も実務的なアプローチは「日本語精度」「コスト」「セキュリティ」「ライセンス」の4軸で自社の優先順位を明確にすることです。日本語精度を最優先する場合は、MT-Benchや各種日本語ベンチマークで高スコアを記録しているRakuten AI 3.0が有力候補となります。

コストを重視する場合は、モデルの運用に必要なGPUインフラの費用も含めた総保有コスト(TCO)で比較する必要があります。7000億パラメータのモデルは推論コストも高くなるため、タスクの性質によってはtsuzumiやTakane 32Bのような小中規模モデルが適切な場合もあります。セキュリティ面では、自社クラウド内でのデプロイが可能かどうかが重要な判断基準です。ライセンスについては、Apache 2.0のように商用利用が明確に許可されているかを確認してください。これら4軸に自社の重みづけを設定し、スコアリングすることで、客観的な比較が可能になります。

PoC開始から本番運用までの3段階ロードマップと各段階で検証すべき評価ポイント

国産LLMの導入は、一般的に以下の3段階のロードマップで進行します。

  1. 技術検証(PoC):期間は1〜2カ月が目安。モデルのダウンロードと推論環境の構築、自社タスクでの出力品質の定性評価、レイテンシとスループットの初期計測を行う
  2. パイロット運用:2〜3カ月を目安に限定された業務範囲で実運用テストを実施。実際のユーザーフィードバックの収集、ファインチューニングの効果検証、コストとROIの定量評価が中心
  3. 本番運用への移行:可用性の確保(冗長構成の設計)、モニタリングとアラート体制の構築、継続的なモデル更新の運用フローの確立が主要タスク

各段階で明確な判断基準(Go/No-Go基準)を事前に定めておくことで、プロジェクトの進行可否を客観的に判断できます。段階を飛ばしていきなり本番投入するケースは失敗リスクが極めて高いため、この3段階を忠実に踏むことが成功の鍵となります。特にPoC段階での十分な検証が後工程の手戻りを大幅に削減します。

国産LLM導入で失敗する典型パターン3選と事前に回避するためのチェックリスト

国産LLM導入で陥りがちな失敗パターンの第1は「ベンチマークスコアだけで選定してしまう」ケースです。ベンチマークで高スコアを出しているモデルが、自社の特定タスクで最高の性能を発揮するとは限りません。必ず自社のユースケースでの実地テストを行ったうえで判断する必要があります。

第2の失敗パターンは「インフラコストの過小見積もり」です。7000億パラメータ級のモデルを運用するには高性能なGPUが複数枚必要であり、電力コストや冷却設備のコストも無視できません。モデルのライセンスが無料であっても、インフラ費用を含めたTCOで採算が合うかを事前に試算すべきです。第3の失敗パターンは「ファインチューニングなしでの本番投入」で、汎用モデルをそのまま自社業務に適用しても期待した精度が出ないケースが多発します。自社固有のデータで追加学習を行うことを前提としたプロジェクト計画を策定してください。これら3つの失敗パターンを事前に認識し、それぞれに対する検証項目をチェックリスト化しておくことで、導入プロジェクトの成功確率を大幅に高めることができます。

資料請求

RELATED POSTS 関連記事