アーキテクチャ

BDH(ドラゴン・ハッチリング)とは?Transformerとの違いと実測性能・動かし方

BDH(ドラゴン・ハッチリング)とは?Transformerとの違いと実測性能・動かし方

BDH(Dragon Hatchling、ドラゴン・ハッチリング)は、米カリフォルニア州パロアルトのAI研究企業Pathwayが2025年9月30日にarXivへ公開した言語モデルのアーキテクチャです(arXiv:2509.26507、論文名は「The Dragon Hatchling: The Missing Link between the Transformer and Models of the Brain」)。脳のように局所的につながったニューロンの集まりとして言語モデルを組み直した点、そして推論しながらシナプス結合が書き換わる点がTransformerと違います。

公開から11か月が経ち、話題は論文から実測値へ移りました。この記事では論文本文・公式リポジトリのコード・Pathwayの発表資料を突き合わせ、設計、公開済みベンチマーク、動かす手順、本番採用を勧められない条件までを整理します。数値は2026年9月6日時点のものです。

まとめ:2026年9月時点のBDHの到達点

  • パラメータはニューロン数nと低ランク次元dの積で決まり、3nd本の重みだけで構成されます。
  • 論文が実測したのは25M〜800Mの6サイズで、拡張版がGPT-2系ベースライン(TransformerXL方式の状態持ち回りを足した「GPTXL」)に並びました。要旨の「10M〜1B」はこれより広い丸め表現です。
  • 2026年3月にSudoku Extremeで正答率97.4%、8月にARC-AGI-1で150MのBDH-CQが29.5%・1タスク0.0007ドルを記録。ただし前者は社内実装で、公開リポジトリでは再現しません。
  • 公式実装はMITライセンスで依存はPyTorchのみ。ただしtorch.nn.Bufferを使うためPyTorch 2.5以上が必要で、学習済み重みは配布されていません。
  • 「BDHはTransformerより省メモリ」は誤りです。論文は再帰状態を「総パラメータ数に匹敵する大きさ」と明記しています。

BDHの正体:Pathwayが公開したポストTransformerアーキテクチャ

著者はAdrian Kosowski、Przemysław Uznański、Jan Chorowski、Zuzanna Stamirowska、Michał Bartoszkiewiczの5名で、所属はいずれもPathwayです。論文はBDHを、テンソル計算に基づくTransformerと脳の分散グラフモデルをつなぐ「欠けた環(missing link)」と位置づけます。生物模倣そのものではなく、注意機構が神経とシナプスの局所的な相互作用として閉じた形で書けることを示した点が主張の中心です。

論文にはグラフとして定義されたBDHと、GPUで回せるようテンソル形式に書き直したBDH-GPUの2つが登場し、実装・実験・公開コードで扱われるのは後者です。以降、実装の話はBDH-GPUを指します。

名称「Dragon Hatchling」と消えた「Baby」表記

Hatchlingは孵化したばかりの幼体を指す語です。ただし略称のBが何を指すかを論文は説明しておらず、公式表記は「BDH(Dragon Hatchling)」に統一されています。呼称の揺れとその経緯はよくある質問で扱います。

開発元Pathwayの体制と2026年8月の資金調達

PathwayはCEOのZuzanna Stamirowska、CTOのJan Chorowski(元Google Brain)、CSOのAdrian Kosowskiが率いる組織です。2026年8月には評価額5億ドルで追加調達を行い、シードラウンドの累計調達額は3,000万ドルになりました。出資者にはDatabricksのJonathan Frankle氏らが並び、Transformer論文の共著者Łukasz Kaiser氏がアドバイザーに就いています。論文発のアーキテクチャとしては、資金と外部の検証体制が揃っている点が例外的です。

BDHの設計:ニューロン数nと低ランク次元dだけで決まるパラメータ3nd

BDH-GPUはTransformerと比べて部品が少なく、設計思想は「大きいほうの次元nに全部を寄せる」ことに尽きます。

nだけを伸ばすスケーリングと3ndというパラメータ式

BDH-GPUは概念空間(ニューロン空間)の次元nと、低ランクなシナプス次元d(d≪n)の2つで決まります。重みはE、Dx、Dyという3本のn×d行列にほぼ全て収まり、パラメータ数は正確に(3+o(1))ndです。論文は25M規模の妥当な設定としてd=256、n=32768を挙げており、1ニューロンあたり3d=768個のスカラーを持つ計算です。層はUniversal Transformerと同じく全層で重みを共有します(論文4.1の例示はL=10、実験は8層、公開実装の既定は6層)。ヘッドの役割はn次元を分割し、パラメータを持たないLayerNormを掛けることだけで、学習パラメータは一切ありません。典型値は4とTransformerより少なめです。

ニューロンに紐づく状態ρとコンテキスト長の不在

各層はρという状態行列を持ち、その次元はn×d、つまり重み行列と同じ大きさです。状態のうちd個分が各ニューロンに割り当てられ、トークンを処理するたびに一部が更新されます。状態空間モデルであるためコンテキストウィンドウの概念が無く、入力長の上限が構造的に存在しません。ただし論文は、ρが保持できる値ベクトルも線形注意で区別できる事実の数も漸近的にニューロン数nのオーダーだとしており、無制限に覚えられるわけではありません。

この設計は省メモリの逆です。論文は「BDH-GPUは総パラメータ数に匹敵する大きさの再帰状態を保持する」と書いています。KVキャッシュとは増え方が違うだけで、絶対量が小さいわけではありません。KVキャッシュ削減が目的なら、グループ化クエリアテンションとは?GQAの仕組みとKVキャッシュ削減・実装判断を解説で扱う手法のほうが直結します。

ヘブ学習でその場で書き換わるシナプス=推論中の作業記憶

BDHの作業記憶は、外付けのメモリではなくシナプスの可塑性そのものに宿ります。ニューロンが発火すると、同時に活性化した相手との結合をヘブ則で強める更新が推論のたびに走ります。論文はこの保持スケールを「脳でいえば数分、トークンでいえば数百トークンまで」と表現しました。学習済み重みが恒久的に書き換わるのではなく、更新されるのは推論セッション内の状態ρです。

活性化率およそ5%という疎で正の活性

BDHの活性化ベクトルはReLUを通るため全要素が非負で、学習が進むと急速に疎になります。論文は典型的な学習で非ゼロ要素がおよそ5%と報告しました。合成タスクでは、第2層の活性化が事実を覚え込む局面で非ゼロ4.0〜7.5%、同じ文字列を繰り返すだけの局面では約2.5%まで落ちました。予測しやすい入力ではニューロンが黙るわけです。疎な活性はTransformer側にも波及しており、論文が比較に挙げるSpark Transformerは8%の活性化率です。注意の疎化という近い話題はスパースアテンションとは?疎なAttentionの仕組みとNSA・DSAの実装判断を解説で整理しています。

Transformerとの相違点:共通する注意機構と、分かれる状態の置き場所

BDHはTransformerを否定していません。注意に基づく系列処理という骨格は共有し、注意を行列演算で明示的に組む代わりにニューロン間の局所的な再重みづけから生じさせます。主な差分は次のとおりです。

観点 Transformer(GPT-2系) BDH-GPU
主な重み行列 Q・K・V・出力・MLP E・Dx・Dyの3本
スケールの軸 層数と埋め込み次元 ニューロン数n
層間の重み 層ごとに別 全層で共有
状態 KVキャッシュ(トークン数に比例) ρ行列(n×d×層数で固定)
コンテキスト長 上限あり 概念なし
注意 ソフトマックス 線形(高次元で実行)
活性化 正負の実数 非負・約5%が非ゼロ

Transformer側の前提はTransformerとは?自己注意の仕組みとBERT・GPTの違いを実装目線で解説で確認すると差分が掴みやすくなります。なお論文が示す速度の指標は1トークンあたりの理論FLOPs O(ndL)までで、推論レイテンシやスループットの実測比較は載っていません。「BDHは低レイテンシ」という説明にも論文上の根拠はありません。

公開された実測値:GPT-2系との比較・Sudoku・ARC-AGI-1

BDHの数値は3つの時点に分かれ、出所と再現条件が違います。混ぜて読むと実力を過大評価します。

Europarl翻訳での25M〜800M比較(2025年9月の論文)

論文のスケーリング実験は、欧州議会議事録の対訳コーパスEuroparlを使った英語とポーランド語・英語とチェコ語の翻訳兼言語モデリングタスクです。全モデルがUTF-8バイト列を生で読み、合計1.2Bトークン(約3エポック)を学習しました。ベースラインはnanoGPT実装を元にしたGPT-2構成に、TransformerXL方式で直前4096件のKVキャッシュを持ち回らせALiBiを入れた「GPTXL」で、25M〜800Mの6サイズです。

BDH側は8層・d=256で固定し、nを32,768から1,048,576まで倍々にするだけで25M〜800Mを作っています。結果として、xLSTM風のゲート機構を足し全層の次トークン予測をマージした拡張版BDH-GPU′が、評価した全サイズでGPTXLに並びました。素のBDH-GPUについて論文が使うのは「おおむね遜色ない(generally compares favorably)」という定性表現にとどまり、サイズごとの一致までは主張していません。「BDHはGPT-2と同等」という一文が独り歩きしていますが、正確には「TransformerXL相当の強化を施したベースラインに拡張版が並んだ」です。データ1トークンあたりの損失の下がり方はBDH側が速い傾向が報告され、論文はデータの乏しい学習に向くとしています。

Sudoku Extremeの正答率97.4%(2026年3月・社内実装)

2026年3月17日、PathwayはSudoku Extremeという難問データセットの約25万問で、BDHが正答率97.4%に達したと公表しました。思考の連鎖(Chain-of-Thought)もバックトラッキングも外部ツールも使わず、コストは比較対象の10分の1としています。同じベンチマークでo3-mini、DeepSeek R1、Claude 3.7はほぼ0%で、この数値はPathwayが別論文(arXiv:2506.21734)から引用したものです。ただしREADMEには、この97.4%が社内実装によるもので公開リポジトリのコードでは再現しない、という但し書きが付いています。

ARC-AGI-1のBDH-CQ 29.5%・1タスク0.0007ドル(2026年8月)

2026年8月11日には、BDH上に構築した150MパラメータのモデルBDH-CQが、ARC-AGI-1の公開評価セットでpass@2の29.5%を記録したと発表されました。推論コストは1タスクあたり0.0007ドル、1セントの10分の1未満です。比較対象のGPT 5.6 Luna(Low)は34.2%とわずかに高いものの、OpenAIが7月30日に実施した80%の値下げを反映してもBDH-CQの約11倍のコストがかかるとしています。学習にはAmazon SageMaker HyperPodが使われました。

この結果はTransformer論文の共著者Łukasz Kaiser氏とNYUの研究者Richard Zhong氏が追試しています。一方でコストの比較条件は非対称です。Pathwayは自社の数値を実測ハードウェア時間から算出し、比較対象には2026年7月時点のARC Prize Foundationのリーダーボードに報告された値(Pathway自身がAPI価格ベースの可能性に言及)を使っています。同一条件の実測比較ではありません。次の目標には数学推論、ARC-AGI-2と3への拡張、1B〜600B規模の事前学習が挙がっています。潜在空間で推論を回す発想では、OpenMythosとは?Claude Mythosを再現するオープンソース実装の仕組みと使い方で扱う反復深度型が近い立ち位置です。

論文の実験が示した中身:概念シナプスの特定とモデル連結

BDHの解釈可能性と合成可能性を支えているのが、統計量や損失の数値まで示された次の2つの実験です。

通貨シナプスの統計的裏付けと言語をまたぐ一致

BDH-GPUが保持するのはn×dのρですが、論文はそこからニューロン間の結合を表すn×nのシナプス行列σを式(16)で復元し、通貨名や国名が文中に現れたときだけ値が上がるシナプスを特定しました。同じシナプスが英語の「British Pound」でもフランス語の「livre sterling」でも反応します。言語をまたいで同じ概念に結びついているわけです。選択性の検証にはChatGPTで生成した通貨に言及する50文と、欧州政治を扱うが通貨に触れない50文を使い、片側マン・ホイットニーのU検定でU=2368(最大2500)、p<10のマイナス14乗、順位双列相関0.86が得られました。対象モデルはd=256、n=49152、4ヘッド、8層です。

19Mモデル2本を38Mへ連結したときの利得と劣化

もう1つが、学習済みモデルを足し算する実験です。英西で学習したn=24576の19Mモデルを複製して片方を英仏、もう片方を英葡で追加学習させ、nの軸方向にテンソルを連結してn=49152の38Mモデルを作ります。追加学習なしで評価すると、スペイン語・フランス語・ポルトガル語から英語への翻訳損失は0.43/0.40/0.39と揃い、連結だけで3言語を扱えました。ただし逆方向は崩れます。英語から各言語への損失は1.45/0.77/0.86に留まり、生成文は3言語が混ざります。モデルを部品として合成できる可能性と、それが無条件には成立しないことを同時に示しました。

公式実装で動かす手順:MITライセンスのbdh.pyとtrain.py

公式リポジトリはgithub.com/pathwaycom/bdh、ライセンスはMITです。2026年9月6日時点でスター数3,546、最終更新は5月16日。中身はbdh.py(約5KB)とtrain.py(約3.7KB)だけで、Karpathy氏のnanoGPTとtiny Shakespeareを土台にしたデモです。

依存はtorchのみ/必要なPyTorchは2.5以上

git clone https://github.com/pathwaycom/bdh.git
cd bdh
pip install -r requirements.txt
python train.py

requirements.txtはtorch・numpy・requestsの3行だけで、バージョン指定がありません。ところがbdh.pyはtorch.nn.Bufferを使っており、これはPyTorch 2.5.0で追加された記法です(v2.4.0のtorch/nn/parameter.pyにBufferクラスはありません)。2.2.2で読み込むとAttributeError: module 'torch.nn' has no attribute 'Buffer'で停止します。古い環境ではpip install "torch>=2.5"と明示してください。train.pyはCUDAが無ければCPUへ落ちますが、既定のMAX_ITERS=3000・BATCH_SIZE=32・BLOCK_SIZE=512は約4,900万トークンを回すGPU前提の設定です。手元で挙動を見るだけならMAX_ITERSを下げてください。

既定設定の内訳はニューロン32,768・約2,530万パラメータ

既定のBDHConfigはn_layer=6、n_embd=256、n_head=4、mlp_internal_dim_multiplier=128、vocab_size=256、dropout=0.1。ヘッドあたりのニューロン数は128×256÷4=8192、4ヘッドで合計32,768となり、論文が25M規模の例に挙げたd=256・n=32768と一致します。数えた結果が次です。

N per head = 8192 | total neurons n = 32768
decoder      (32768, 256) 8,388,608
encoder      (4, 256, 8192) 8,388,608
encoder_v    (4, 256, 8192) 8,388,608
lm_head      (256, 256) 65,536
embed.weight (256, 256) 65,536
TOTAL PARAMS: 25,296,896
3*n*d = 25,165,824

3本のn×d行列で25,165,824、埋め込みと出力ヘッドの65,536ずつを足して25,296,896。論文の3ndがそのまま実装に出ています。forwardは同じself.encoderとself.decoderを6層分ループで使い回しており、層間の重み共有もコードで読めます。

for level in range(C.n_layer):
    x_latent = x @ self.encoder
    x_sparse = F.relu(x_latent)  # B, nh, T, N
    yKV = self.attn(Q=x_sparse, K=x_sparse, V=x)
    yKV = self.ln(yKV)
    y_latent = yKV @ self.encoder_v
    y_sparse = F.relu(y_latent)
    xy_sparse = x_sparse * y_sparse  # B, nh, T, N
    xy_sparse = self.drop(xy_sparse)
    yMLP = (
        xy_sparse.transpose(1, 2).reshape(B, 1, T, N * nh) @ self.decoder
    )  # B, 1, T, D
    y = self.ln(yMLP)
    x = self.ln(x + y)

参照実装で再現できない範囲

この参照実装に状態空間カーネルによる再帰実行は含まれていません。Attention.forwardはT×Tのスコア行列を対角を除く下三角でマスクする並列版で、generateは1トークンごとに全プレフィックスを渡し直します。長い系列の生成コストは、コンテキスト長の上限が無いという特徴とは裏腹に、KVキャッシュを持つTransformerより重く、毎ステップ系列長の二乗で効きます。学習済み重みも公開されておらず、GitHubのリリースにもHugging Faceのpathwaycom名義にも配布物はありません。ただし公式READMEはBurn移植やMLX移植などコミュニティ実装5件を掲載しています。

採用判断:BDHを本番のTransformer置き換えに使わない条件

2026年9月時点で、本番のTransformerをBDHへ差し替える判断は勧められません。理由は成熟度の一般論ではなく次の3点です。

  • 公開実装で再現できるのはtiny Shakespeareの文字レベル生成までで、SudokuやARC-AGIの成績は別実装・別モデルの結果です。
  • 学習済み重みが無いため、評価するには事前学習を自前で回す必要があります。
  • 参照実装の生成は毎ステップ全プレフィックスを再計算するため、長文生成のコスト特性はTransformerと変わりません。

いま試す価値がある目的は限られます。まず解釈可能性の研究。個々のシナプスが概念に対応し統計的にも検証されている性質は、既存のLLMでは得にくい観測点になります。次に少データ環境での学習で、論文はデータ1トークンあたりの学習効率がTransformerを上回る傾向を報告しています。潜在空間で推論を回すアプローチの追試も候補でしょう。

判断材料が揃うのは、Pathwayが予告した1B〜600B規模の事前学習結果が出て、社内実装の公開範囲が広がったときです。それまでは検証環境での評価に留めるのが妥当です。

よくある質問

BDHは何の略ですか?

論文はアーキテクチャ名を「Dragon Hatchling」とし、略称としてBDHを使っていますが、Bが何を指すかを本文で説明していません。海外メディアでは「Baby Dragon Hatchling」という呼称が広まったものの、論文本文に「Baby」は一度も登場しません。Pathwayは2026年5月12日のコミットで公式READMEからこの表記を削除しており、現在の公式な書き方は「BDH(Dragon Hatchling)」です。日本語では中黒を入れずに「ドラゴンハッチリング」とも書かれます。

BDHはGPT-5などの最新LLMより高性能ですか?

汎用的な言語性能で上回るという結果は公表されていません。論文が実測した比較対象は25M〜800MのGPT-2系ベースラインで、最新の大規模モデルとは規模が2桁以上違います。特定タスクでは差が出ており、Sudoku Extremeは97.4%対ほぼ0%、ARC-AGI-1では150MのBDH-CQが29.5%で、34.2%のGPT 5.6 Luna(Low)に対しコストが約11分の1でした。得意分野が限定された結果として読んでください。

BDHはTransformerより省メモリですか?

いいえ。ではBDHのメモリ特性の利点はどこかというと、入力が伸びても状態量が増えない点にあります。ρの大きさはn×d×層数で固定されるため、長文を読ませても消費量が変わりません。短い入力ではKVキャッシュ方式のほうが軽く、長い入力になるほど逆転する、という読み方が実態に合います。常駐メモリの削減そのものを目的にした置き換えには向きません。

BDHを商用利用できますか?

公式リポジトリgithub.com/pathwaycom/bdhのライセンスはMITで、著作権表示を残せば商用利用も改変も可能です。ただし配布されているのは論文どおりのベースライン実装のみで、学習済み重みは含まれません。ベンチマークの数値をそのまま期待して導入すると食い違うため、自前の事前学習を前提に計画してください。

「BDH」にAI以外の意味はありますか?

あります。医療・生化学の分野では、ヒト遺伝子BDH1(3-hydroxybutyrate dehydrogenase 1、NCBI Gene ID 622)の別名としてBDHが使われます。試薬の世界では、1908年にロンドンでBritish Drug Housesとして創業し現在はAvantorが扱うラボ試薬ブランドの名前です。この記事が扱うのは言語モデルアーキテクチャとしてのBDHだけなので、他分野を探している場合は分野名を添えて検索し直してください。

関連記事

お気に入りに入れた記事の一覧

資料請求

今日のトレンド記事 直近 24 時間で、いつもより多く読まれている記事

  1. 2026.09.28 テックブログ タイムズカーの不正アクセスと約660万件の流出|免許証画像を退会者まで残さない保管設計
  2. 2026.09.25 コラム 最低賃金引き上げ【令和8年度】47都道府県の改定額・発効日と企業の対応手順
  3. 2026.09.25 コラム 障害者雇用の助成金一覧:月いくら・支給要件と申請書類を勤怠データで揃える方法
  4. 2026.09.05 コラム 犯罪収益移転防止法の本人確認:2027年4月の対面IC読み取り義務化と改修要件
  5. 2026.09.28 テックブログ anthropic skillsとは?公式19スキルの中身とClaude Code・APIでの導入手順

RELATED POSTS 関連記事

目次