AI

1bit LLM「Bonsai」とは?三値量子化でスマホ動作するローカルLLMの仕組みと実装判断を解説【2026年】

1bit LLM「Bonsai」とは、PrismMLが公開した、重みを1bit相当または三値(-1・0・+1)まで圧縮して端末内で動かせるようにした軽量な大規模言語モデルの系列です。27Bクラスのモデルを3.9GBまで小さくし、iPhoneやノートPC単体での動作を狙う点が話題になりました。本記事では、三値量子化(1.58bit)の仕組み、1bit系とTernary系の違い、8B・27Bのモデルサイズやスマホでのトークン毎秒、ベンチマークの精度保持率までを一次情報の実測値で整理し、業務システムに組み込む際の採用条件と見送るべき場面を実装者の視点で示します。

まとめ:Bonsaiの位置づけと実装判断の結論

Bonsaiは「重みを三値または1bit相当に落として容量とメモリ消費を1桁減らし、GPUサーバーなしでLLMを動かす」ことに振り切ったモデル系列です。従来は数十GBのVRAMが要る27B級のモデルを、Ternary版で5.9GB・1bit版で3.9GBまで縮め、スマートフォンでの実行例まで公開されています(2026年7月時点)。土台は新規に学習し直したモデルではなく、既存のQwen3.6-27Bを低ビット表現に変換したものと説明されています。

実装の判断軸はシンプルです。通信させたくない機密データ、オフライン前提の端末、スマホアプリへの同梱といった「端末内で完結させたい」要件があるならBonsaiは有力な選択肢になります。逆に、精度が売上や安全性に直結する処理、すでにGPUサーバーがある環境、最新APIの機能や巨大コンテキストが前提の用途では、量子化前のモデルやマネージドAPIを選ぶほうが結局は安く済みます。この線引きは後半の章で条件付きに整理しました。

1bit LLM「Bonsai」とは何か:PrismMLが公開した超低ビットモデル

大規模言語モデルそのものの仕組みや生成AIとの違いはLLMの仕組み・生成AIとの違いと企業導入の判断基準で扱っています。本記事はその中でも「極端に軽量化して端末で動かす」方向のモデルであるBonsaiに絞って掘り下げます。

定義:重みを三値・1bit相当まで圧縮した端末内動作向けのLLM

一般的なLLMは、各重みを16bit(FP16/BF16)の小数で保持します。Bonsaiはこの重みを、三値の{-1, 0, +1}あるいは1bit相当まで削り、1つの重みあたりの情報量を大幅に減らしたモデルです。重みが軽くなるぶんファイル容量と実行時のメモリ消費が下がり、データセンターのGPUではなく手元のスマホやノートPCで推論を回せる、というのが最大の狙いです。テキスト生成に加えて画像入力・ツール呼び出し・複数ステップのエージェント動作まで端末内で扱えるとされています。

提供元PrismMLと2つの系列:1bit BonsaiとTernary Bonsai

Bonsaiを公開しているのはPrismMLです。系列は大きく2つに分かれます。先行して出た「1bit Bonsai」と、2026年4月に発表された「Ternary Bonsai(三値・1.58bit)」です。Ternary系はまず8B・4B・1.7Bの3サイズで登場し、2026年7月にはQwen3.6-27Bを土台とする27B版が加わりました。いずれもApache 2.0ライセンスで、重みはHuggingFace(prism-ml配下)で配布されています。

混同しやすいのは、同じ「Bonsai」でも1bit版とTernary版で容量も精度も違う点です。おおまかには、1bit版のほうが小さく速い代わりに精度の目減りが大きく、Ternary版はやや大きい代わりに精度を保ちやすい、という関係にあります。

なぜ1桁小さくなるのか:三値{-1,0,+1}と1.58bitの内訳

Ternary Bonsaiは、各重みを{-1, 0, +1}の3状態に制約し、それを1重みあたり1.58bit(3状態を表すのに必要な情報量、log2(3)≒1.58)で符号化したうえで、共有のFP16スケール係数を掛けて元の大きさに戻す構造をとります。16bitを1.58bitへ落とすため、単純計算で重み1つあたりの情報量は約10分の1になります。PrismMLは、Ternary Bonsai 8Bのメモリ消費を標準的な16bitモデルの約9分の1と説明しました。

掛け算が「重み×入力」の乗算から「符号の反転と足し引き」に近い演算へ置き換わるため、対応するランタイム上では計算そのものも軽くなります。極端な低ビット化は本来、精度を大きく損ないやすい領域ですが、Bonsaiは三値と共有スケールの組み合わせで精度低下を抑え込もうとした設計だと言えます。

Bonsaiのスペックと実測性能:モデルサイズ・速度・精度保持率

採用可否を判断するには、容量と速度と精度をセットで見る必要があります。ここでは公開されている数値(2026年7月時点)を系列・サイズ別に整理します。

モデルサイズ一覧:8B・27Bと1bit/Ternaryの容量差

同じパラメータ数でも、1bit版とTernary版で容量が変わります。代表的な公開値は次の通りです。

モデル 系列 おおよその容量 備考
Bonsai 8B 1bit 約1.15GB Ternary系と同時期に容量比較として提示
Bonsai 8B Ternary(1.58bit) 約1.75GB 16bit比で約9分の1のメモリ
Bonsai 27B 1bit 約3.9GB FP16比で約14.2倍のメモリ削減
Bonsai 27B Ternary(1.58bit) 約5.9GB FP16比約9.4倍・262Kコンテキスト

27B版はQwen3.6-27Bを土台とするため、コンテキスト長は262,144トークンを引き継ぎます。数十GBのVRAMを要する27B級を、1bit版なら4GB弱で持ち運べるところが、この系列のインパクトの中心です。

スループット実測:スマホとノートPCで動かした際のトークン毎秒

速度は動かすハードウェアで大きく変わるため、単一の数字では語れません。PrismMLが公開した実測の一部を挙げます。Ternary Bonsai 8Bは、AppleのM4 Proでおよそ82トークン毎秒、iPhone 17 Pro Maxでおよそ27トークン毎秒とされています。27Bの1bit版はiPhone 17 Pro Max上でおよそ11トークン毎秒(tg128条件)という値が示されました。

体感の目安として、10トークン毎秒を超えていれば人が読む速度に対して待たされ感は小さくなります。8B級を新しめのスマホで動かす用途なら実用域に入りますが、27Bをスマホで回す構成は「動く」ことに意義がある段階で、レスポンス速度を売りにするサービスにそのまま載せる水準ではない、と読むのが実務的です。

精度保持率:27Bで94.6%、1bit版で89.5%を保つ実力

低ビット化で気になるのは精度の目減りです。Bonsai 27Bについては、Ternary版がFP16ベースラインの94.6%、1bit版が89.5%の性能を保つと報告されています。8B級のTernary Bonsaiでは、MMLU Redux・MuSR・GSM8K・HumanEval+・IFEval・BFCLv3を合わせた平均で75.5というスコアが示されました。

Ternary版が9割台半ばを保つのに対し、1bit版は約1割落ちる、という差は用途選定に直結します。おおまかな下書きや分類なら1bit版の速さと軽さが効き、文章の正確さやコード生成の妥当性が問われる処理ではTernary版、精度が最優先なら量子化前のモデル、という順に検討するのが素直です。

既存の量子化・ローカルLLMとの関係:Bonsaiは何が違うのか

「軽いLLM」という括りでは、量子化・SLM・ローカルLLM・エッジAIといった近い概念が並びます。Bonsaiがそれらのどこに位置するのかを整理すると、採用場面の判断がしやすくなります。

量子化との関係:一般手法の極端な一形態としての1bit/三値

重みのビット数を減らして軽くするアプローチは量子化と呼ばれ、通常は16bitを8bitや4bitへ落とす方式が主流です。Bonsaiはこれをさらに推し進め、三値(実質1.58bit)や1bit相当まで削った極端な一形態にあたります。方式ごとの特性やGPTQ・AWQ・GGUFの違い、精度とのトレードオフの一般論はLLM量子化の仕組みと方式の違い・採用判断で個別に整理しているため、本記事ではBonsai固有の判断に絞ります。

一般的な4bit量子化が「精度をほぼ保ちつつ容量を半分〜4分の1に」を狙うのに対し、Bonsaiは「精度の目減りを許容してでも1桁小さくし、GPUなしで動かす」ことを優先した設計です。同じ量子化でも狙う地点が違うため、比較は容量だけでなく前述の精度保持率とセットで行う必要があります。

ローカルLLM・エッジAI・SLMとの住み分けと使い分けの指針

Bonsaiは「端末内で動く軽量モデル」という点で、ローカルLLMやエッジAI、SLMと重なります。ただし、重なる領域と切り口は別物です。クラウド型との違いや必要スペック、Ollamaでの構築手順といった端末内実行の全体像はローカルLLMの構築手順とクラウド型との違いで扱っており、Bonsaiはその中で「27B級を三値化してスマホ級ハードに載せる」という具体的な手段の一つになります。

整理すると、SLMは「最初から小さく作ったモデル」、Bonsaiは「大きいモデルを三値化で小さく見せるモデル」で、出発点が逆です。用途によっては両者を比較検討する価値があります。端末側でAI推論を回す構成そのものの判断基準はエッジAIとクラウドAIの違いと実装の判断基準を土台にすると設計しやすくなります。

業務システムにBonsaiを組み込む判断:採用条件と見送る場面

ここからは、Bonsaiを実務に載せるかどうかの判断を条件付きで言い切ります。話題性ではなく、要件との適合で決めるべき領域です。

採用に向く条件:オフライン運用・機密データ・スマホ同梱の3要件

次のいずれかに当てはまるなら、Bonsaiは具体的に検討する価値があります。第一に、データを社外へ送れない機密要件がある場合。端末内で推論が完結するため、プロンプトも生成結果もネットワークに出ません。第二に、通信が不安定・不可のオフライン環境で動かす必要がある場合。第三に、スマホアプリやオフライン端末にモデルを同梱し、サーバー費用をかけずに一定水準の応答を返したい場合です。

特に「1台あたりのGPUコストを積み上げたくないが、外部APIにも出したくない」という板挟みの現場で、3.9GBで動く27B級という選択肢は効いてきます。

見送るべき場面:精度優先・既存GPU資産・最新機能前提の用途

逆に、次のケースではBonsaiを第一候補にしないほうが無難です。1つ目は、出力の正確さが売上や法的リスクに直結する処理。1bit版で約1割の精度低下がある以上、金融審査や医療関連の判断補助のような領域では、量子化前のモデルやマネージドAPIを選ぶべきです。2つ目は、すでにGPUサーバーが遊んでいる環境。この場合は無理に三値化せず、通常の4bit量子化のほうが精度と速度のバランスで有利になります。

3つ目は、頻繁に更新される最新API機能や、巨大な外部知識との連携が前提の用途です。端末内モデルは更新も配布も自前で回す必要があり、運用負荷が見合いません。自社の要件が「端末内で完結させるべきか、サーバー側で回すべきか」の切り分けに迷う段階であれば、モデル選定から実装・運用までを生成AI開発・AI受託開発で一緒に設計するところから始めると、精度要件とコストの両にらみで判断を固めやすくなります。

試験導入のステップ:重みの取得から端末での動作確認までの流れ

Bonsaiの検証は、小さいサイズから段階的に進めると手戻りが減ります。

  1. 用途に対する精度許容度を決め、まず8B級のTernary版で試す(1bit版は速度検証用と割り切る)。
  2. HuggingFaceのprism-ml配下から対象の重みを取得する。
  3. Apple端末ならMLX系、汎用環境ならGGUF対応ランタイムなど、動かす端末に合う実行系を選ぶ。
  4. 自社の代表的なプロンプトで精度と速度を実測し、量子化前モデルやマネージドAPIと同一条件で比較する。
  5. 要件を満たせば対象端末へ配布し、満たせなければサイズ・系列(1bit/Ternary)を切り替えて再測する。

推論そのものの速度は端末性能に強く依存するため、KVキャッシュやバッチングを含む推論全体の考え方はLLM推論の仕組みと高速化の手法を押さえたうえで、端末内実行という制約の中で何を落とすかを決めていく流れになります。

よくある質問

Bonsaiの導入検討でよく挙がる疑問に、実装の観点から簡潔に答えます。

Bonsaiは無料で商用利用できますか?

公開されているBonsaiの重みはApache 2.0ライセンスで配布されており、商用利用を含めて幅広く使える条件です。ただしライセンス条項や再配布時の表記義務は、導入時点でHuggingFaceの配布ページと同梱ライセンスファイルを必ず自分で確認してください。土台にした基盤モデル側の条件が別途関わる可能性もあるため、業務利用では法務チェックを挟むのが安全です。

1bit版とTernary版はどちらを選べばよいですか?

速度と軽さを最優先し、下書き生成や分類のように多少の精度低下を許せる用途なら1bit版が向きます。文章やコードの正確さが問われる処理には、精度保持率の高いTernary版(27Bで94.6%)が無難です。まずTernary版で精度の基準を作り、速度が足りなければ1bit版へ落とす、という順で試すと判断を誤りにくくなります。

Bonsaiは普通のPCやスマホだけで動きますか?

8B級であれば新しめのスマホやノートPC単体で実用的な速度が出る例が公開されています。一方、27B版はスマホでも「動作する」段階で、iPhone 17 Pro Max上の1bit版でおよそ11トークン毎秒という水準です。快適な応答速度を求めるなら、27B級はノートPCやミニPCなどメモリに余裕のある環境で動かす前提で考えるほうが現実的です。

ChatGPTのような外部APIと比べて精度は落ちますか?

Bonsaiは容量とメモリを1桁削ったモデルのため、最上位のクラウドLLMと同等の精度を期待する使い方には向きません。強みは精度の絶対値ではなく、通信させず端末内で完結できる点にあります。精度が最優先の処理はクラウドAPI、機密性やオフライン性が最優先の処理はBonsai、と役割で使い分けるのが実務的な設計です。

既存の量子化モデルとの違いは何ですか?

一般的な量子化は16bitを8bitや4bitへ落として精度をほぼ保つ方式が主流ですが、Bonsaiは三値(1.58bit)や1bit相当まで削り、精度低下を許容してでも端末内動作を優先した極端な一形態です。「精度をほぼ保ちたい」なら通常の4bit量子化、「GPUなしで動かしたい」ならBonsai、と目的で選び分けます。

関連記事

資料請求

RELATED POSTS 関連記事