Heron(ヘロン)は、自動運転開発のTuring株式会社が公開している日本語向け視覚言語モデル(VLM)の総称です。英単語としてのheronは鳥のサギを、数学の「ヘロンの公式」は古代の数学者ヘロンを指しますが、この記事で扱うのはAIのHeronだけです。やっかいなのは、AIのHeronも指すものが一つではないという点で、GitHubの学習ライブラリ、Hugging Faceで配布されるモデル群、日本語VLMの評価ベンチマークの3つが同じ名前を共有しています。しかも中心だったGitHubリポジトリは2024年6月13日を最後に更新が止まっており、現行モデルはそのリポジトリを使いません。
まとめ:Heronの現在地
- 「Heron」は3つの対象を指します。学習ライブラリ
turingmotors/heron、現行モデル群 Heron-NVILA-Lite、評価データセット Japanese Heron-Bench です。 - GitHubリポジトリは最終コミットが2024年6月13日、タグもリリースも0件です。ここで動くのは2023〜2024年のGIT/BLIP系モデルまでで、現行のHeron-NVILA-Liteは対象外です。
- いま使うべきは2025年10月17日に公開された
-hf版4種です。transformers.AutoModelForImageTextToTextに対応しました。ただし読み込み時のtrust_remote_code=Trueは引き続き必要です。 - モデルサイズは1B・2B・15B・33Bの4系統で、Heron-NVILA-Liteシリーズに700億パラメータのモデルはありません。70B表記のモデルは2023年に予備公開されたLlama 2ベースの別系統で、ライセンスも異なります。
- Heron-NVILA-Liteの重みはApache License 2.0です。ただしGPT-4生成の合成データを含むため、OpenAIの利用規約にも従う必要があります。
「Heron」が指す3つの対象
検索で「heron github」「heronとは」と入力したときに出てくる情報が噛み合わないのは、3つの異なる成果物が同じ名前で呼ばれているためです。まず対象を確定させます。
turingmotors/heron:2023年8月公開のV&L学習ライブラリ
GitHubの turingmotors/heron は2023年8月22日に作成された、Vision and Language/Video and Languageモデルを組み合わせて学習するためのライブラリです。設定ファイルでVision Encoder・Adapter・LLMを差し替えられる構成で、READMEが対応LLMモジュールとして挙げるのはLlama-2、MPT、OPT、GPT-NeoX、Japanese StableLM、ELYZA-japanese-Llama-2の6系統。動作確認環境としてUbuntu 20.04とCUDA 11.7が明記されています。ライセンスはApache License 2.0、スター数は2026年9月16日時点で178です。
Heron-NVILA-Lite:2025年5月発表の現行モデル群
Turingが2025年5月12日に発表したのがHeron-NVILA-Liteシリーズです。NVIDIA Labs(NVlabs)が公開したNVILA(arXiv:2412.04468)のLite構成をベースに日本語向けに学習したVLMで、Hugging Faceの turing-motors 配下に1B・2B・15B・33Bの4サイズが並んでいます。名前にHeronが付いていますが、学習コードは上記ライブラリではなくNVILAの系譜です。この点が「GitHubを見にいったのに現行モデルの情報がない」という食い違いの正体です。
Japanese Heron-Bench:日本語VLMの評価データセット
「heron bench」で検索される Japanese Heron-Bench は、モデルではなく評価用のデータセットです。日本に関連する画像21枚に対し、Conversation・Detail・Complexの3カテゴリで質問を用意した計102問で構成され、各画像にはanime・art・culture・food・landscape・landmark・transportationの7サブカテゴリのいずれかが割り当てられています。画像はパブリックドメインまたはCC BY 1.0/2.0のものだけを収集しており、論文は arXiv:2404.07824(2024年4月11日投稿、著者はInoue・Sasaki・Ochi・Fujii・Tanahashi・Yamaguchi)です。
GitHubリポジトリと配布物の稼働状況
「heron github」で着地する人がまず知りたいのは、どこが現役でどこが止まっているかです。2026年9月16日時点の公開状況は次のとおりです。
| 配布物 | 所在 | 状態 | 最終更新 |
|---|---|---|---|
| 学習ライブラリ | GitHub turingmotors/heron | 公開・更新停止 | 2024-06-13 |
| Heron-NVILA-Lite 通常版4種 | Hugging Face | 公開・現役 | 2025-10-20 |
| Heron-NVILA-Lite -hf版4種 | Hugging Face | 公開・推奨 | 2025-11-07 |
| Japanese Heron-Bench | Hugging Face datasets | 公開 | 2024-04-12 |
| デモサイト | heron-demo.turing-motors.com | 接続不可 | – |
| iOSアプリ | App Store id6745646268 | 404 | – |
旧Heronリポジトリの対応モデル:GIT/BLIP系
リポジトリのmainブランチは44コミットで止まっており、タグもGitHub Releasesも発行されていません。READMEの推論サンプルが読み込むのは turing-motors/heron-chat-git-ja-stablelm-base-7b-v1 で、Hugging Face上の同系列には heron-chat-blip-ja-stablelm-base-7b-v1 や heron-chat-git-ELYZA-fast-7b-v0 が並びます。いずれも2023年から2024年前半の公開で、ベースLLMはJapanese StableLMやELYZA-japanese-Llama-2です。学習の仕組みを読む教材としては今も有効ですが、新規にHeron-NVILA-Liteを導入する用途では、この旧ライブラリは選定対象から外してください。READMEが案内するデモサイトも、DNSは解決するもののHTTPS接続がタイムアウトして開けない状態です。
Heron-NVILA-Lite -hf版の読み込みと最小実行
Heron-NVILA-Liteの通常版は trust_remote_code=True と transformers==4.45.0 前後の固定、加えて scaling_on_scales の別途インストールを要求します。これを解消したのが2025年10月17日から公開された -hf 版で、標準の AutoModelForImageTextToText で読み込めます。まず試すなら2Bが手軽です。
pip install "transformers[torch]==4.57.1" pillow
from PIL import Image
from transformers import AutoModelForImageTextToText, AutoProcessor
MODEL_NAME = "turing-motors/Heron-NVILA-Lite-2B-hf"
model = AutoModelForImageTextToText.from_pretrained(
MODEL_NAME, trust_remote_code=True, device_map="auto"
)
processor = AutoProcessor.from_pretrained(MODEL_NAME, trust_remote_code=True)
image = Image.open("sample.jpg").convert("RGB")
conversation = [{"role": "user", "content": "<image>\n画像を説明してください。"}]
text = processor.apply_chat_template(conversation, add_generation_prompt=True, tokenize=False)
encoding = processor(text=text, images=[image], return_tensors="pt").to(model.device)
output = model.generate(**encoding, max_new_tokens=512)
print(processor.decode(output[0, len(encoding["input_ids"][0]):], skip_special_tokens=True))
モデルカードが動作確認済みと明記するのは transformers==4.57.1 です。他のバージョンでも動く可能性はあるが未検証、という書き方になっているので、検証環境ではここを固定しておくと再現性で困りません。
Heron-NVILA-Lite 4サイズの構成と選び分け
4サイズはパラメータ数だけでなくVision Encoderも異なります。33Bだけがsiglip2系に切り替わっている点は、精度を比べるときに押さえておく必要があります。
| モデル | ベースLLM | カード上のLLMサイズ | Vision Encoder | Projector |
|---|---|---|---|---|
| Heron-NVILA-Lite-1B | Qwen2.5-0.5B-Instruct | 0.5B | paligemma-siglip-so400m-patch14-448 | mlp_downsample_2x2_fix |
| Heron-NVILA-Lite-2B | Qwen2.5-1.5B-Instruct | 1.5B | paligemma-siglip-so400m-patch14-448 | mlp_downsample_2x2_fix |
| Heron-NVILA-Lite-15B | Qwen2.5-14B-Instruct | 14B | paligemma-siglip-so400m-patch14-448 | mlp_downsample_3x3_fix |
| Heron-NVILA-Lite-33B | Qwen2.5-32B-Instruct | 32B | siglip2-so400m-patch16-512 | mlp_downsample_2x2_fix |
モデル名の数字は視覚エンコーダを含めた全体規模で、モデルカードが「LLM Size」として示す値とはずれます。1Bと名乗るモデルの言語側は0.5B、2Bは1.5Bです。必要なGPUメモリは、LLMと視覚エンコーダとProjectorを合わせた重み全体に、数値精度・画像の分割数・入力長・KVキャッシュを加えて見積もる必要があります。小型化の考え方そのものはSLMとは?小規模言語モデルの仕組み・LLMとの違いと実装判断を解説で整理しています。15Bの詳細な位置づけはHeron-NVILA-Lite-15Bとは?概要と注目される理由を徹底解説で個別に扱っています。
なお「Heronの700億パラメータ級モデル」という記述をまれに見かけますが、Heron-NVILA-Liteの最大は33Bです。70B表記で実在するのは heron-preliminary-git-Llama-2-70b-v0 で、モデルカード自身が「予備学習版で精度・性能は検証中、保証はしない」と断っており、ライセンスもApache 2.0ではなくLlama 2ライセンスです。現行シリーズと同列に扱うと選定を誤ります。
Heron-Benchのスコアで見る実力とGPT-4oとの差
Heron-NVILA-Liteのモデルカードは、llm-jp-eval-mmを使い gpt-4o-2024-05-13 をLLM-as-a-judgeとして評価した結果を掲載しています。Heron-NVILA-Lite以外のスコアは2025年3月時点のllm-jp-eval-mmリーダーボードとAsagiのサイトから引用された値です。
| モデル | LLMサイズ | Heron-Bench overall (%) | JA-VLM-Bench-In-the-Wild (/5.0) | JA-VG-VQA-500 (/5.0) |
|---|---|---|---|---|
| Heron-NVILA-Lite-1B | 0.5B | 45.9 | 2.92 | 3.16 |
| Heron-NVILA-Lite-2B | 1.5B | 52.8 | 3.52 | 3.50 |
| Heron-NVILA-Lite-15B | 14B | 59.6 | 4.2 | 3.82 |
| Heron-NVILA-Lite-33B | 32B | 61.1 | 4.0 | 3.85 |
| VILA-jp | 13B | 57.2 | 3.69 | 3.62 |
| Asagi-14B | 13B | 55.8 | 3.44 | 3.84 |
| Qwen2-VL 7B Instruct | 7B | 55.5 | 3.61 | 3.60 |
| LLaVA-CALM2-SigLIP | 7B | 43.3 | 3.15 | 3.21 |
| Llama-3-EvoVLM-JP-v2 | 8B | 39.3 | 2.92 | 2.96 |
| GPT-4o | – | 87.6 | 3.85 | 3.58 |
読み方を間違えないでほしいのは、Heronが「既存モデルを凌駕した」わけではないという点です。Heron-Bench overallではGPT-4oの87.6に対し33Bが61.1で、26ポイント以上離れています。一方JA-VLM-Bench-In-the-Wildでは15Bが4.2、33Bが4.0でGPT-4oの3.85を上回りました。この表から言えるのはこの2点だけで、用途全般の優劣に一般化することはできません。同じ14B級の比較対象であるSarashina2-Vision-14Bは50.9で、これはTuringがHeronと同じジャッジで再評価した値です。ただしSB Intuitionsの公式ブログは別バージョンのジャッジで評価しているため、モデルカードは参考値扱いと明記しています。日本語モデルの選択肢はSarashinaとは?モデル一覧(TTS・OCR・Vision)と使い方・ライセンス・API提供形態と併せて比べると見通しが立ちます。
2024年のHeron-Bench論文は、当時のベースラインVLMとGPT-4Vの間に大きな能力差があることを示し、その差を埋めるための評価基盤として本ベンチマークを提案しました。上の表とは評価実行もジャッジモデルも別なので、論文中の数値と表の数値を直接引き算しないでください。
MOMIJIとSTRIDE-QA:Heronの学習データと別系統の運転データ
Heron-NVILA-Liteの学習段階で使われているのがMOMIJIです。STRIDE-QAはHeron-NVILA-Liteの学習には使われておらず、Turingが別途公開している自動運転向けのデータセットです。混同されやすいので分けて説明します。
MOMIJI:56M文書規模の日本語インターリーブデータ
MOMIJIの正式名称は Modern Open Multimodal Japanese filtered Dataset です。2024年2月から2025年1月までのCommon Crawlから構築され、公開時点で56,119,639文書、109,980,725,957文字、249,745,953件の画像参照という規模を持ちます。「インターリーブ」とは、文書内で文章と画像が現れた順序を保ったまま対応付けることで、画像位置は <image1> のようなプレースホルダーで表現されます。
実務上いちばん重要なのは、Hugging Faceで配布されているのが画像本体でも元ページの全文でもない、という点です。配布物はフィルタを通過した文書と画像を特定するための公開レコード(ページURL、画像URL、画像サイズなどのメタデータ、約14.7GB)で、本文は momiji_generator で実行時点のWebページから生成し直す設計になっています。Webページは更新も削除もされるため、構築当時と同じデータは再現できません。ライセンスのCC BY 4.0も、Turingが権利を持つデータセットカード・統計表・形式説明などに適用されるもので、リンク先の本文や画像の権利は各権利者に残ります。社内で学習に使うなら、この再取得と権利処理の工数を最初に見積もっておくべきです。
STRIDE-QA:東京の走行データから作った時空間推論VQA
STRIDE-QAは日本語の質問応答データセットではありません。論文(arXiv:2508.10427、2025年8月14日投稿、AAAI 2026にOral採択)が示すとおり、東京で収集した100時間のマルチセンサー走行データから構築された、自動運転の時空間推論を対象とする英語のVQAデータセットです。270,000フレーム、268,000の固有オブジェクトペアに対して16,000,000のQAペアを持ち、3Dバウンディングボックス・セグメンテーションマスク・マルチオブジェクトトラッキングの密なアノテーションで裏付けられています。
タスクは3種類で、周囲の物体どうしの空間関係を問うObject-centric Spatial QA、自車と周囲物体の関係を問うEgo-centric Spatial QA、4フレームの文脈から1〜3秒先の距離・方位・速度を予測させるEgo-centric Spatiotemporal QAに分かれます。評価用の STRIDE-QA-Bench は409のシーングループ、5,317問です。論文は既存VLMが予測の一貫性でほぼゼロ点にとどまることを報告しており、Web由来の静止画像とテキストのペアだけでは運転シーンの推論が身につかないという主張の根拠になっています。ライセンスはSTRIDE-QA・STRIDE-QA-Benchとも CC BY-NC-SA 4.0 で、Apache License 2.0のHeron-NVILA-LiteやCC BY 4.0のMOMIJIと違い商用利用ができません。センサー側の前提はLiDARとは?仕組み・ToF方式・点群処理を実装目線で解説する技術ガイドを参照してください。
商用利用の可否とライセンスの落とし穴
Heronは名前が共通でも、配布物ごとにライセンスが異なります。「Heronは非商用」「商用は個別契約」といった一括りの説明は誤りですが、逆に全部が商用可というわけでもありません。モデル・データセット単位で確認する必要があります。
| 対象 | ライセンス | 商用利用 | 注意点 |
|---|---|---|---|
| turingmotors/heron | Apache-2.0 | 可 | 更新停止済み |
| Heron-NVILA-Lite 1B/2B/15B/33B | Apache-2.0 | 可 | OpenAI利用規約の遵守が必要 |
| Heron-NVILA-Lite -hf版4種 | Apache-2.0 | 可 | 同上 |
| heron-preliminary-git-Llama-2-70b-v0 | Llama 2 | 条件付き | 予備学習版・性能は無保証 |
| Llama-3-heron-brain-70B-v0.3 | Meta Llama 3 | 条件付き | VLMではなく言語モデル |
| MOMIJI | CC BY 4.0 | 可 | リンク先Web本文・画像は対象外 |
| STRIDE-QA/STRIDE-QA-Bench | CC BY-NC-SA 4.0 | 不可 | 非商用・継承条件あり |
見落としやすいのが2行目の但し書きです。Heron-NVILA-Liteの重み自体はApache License 2.0で配布されますが、学習データにGPT-4が生成した合成データが含まれるため、モデルカードは利用者がOpenAIの利用規約にも従うことを求めています。OpenAIの規約は自社の競合モデル開発への出力利用を制限しているため、「Apache 2.0だから無条件に何でもできる」と判断すると前提が崩れます。競合LLMの学習素材として使う計画がある場合は、ここが実質的な制約になります。
モデルカードは倫理・法令面のキャリブレーションを経ていない実験的なモデルであるとも明記しています。人物の判定や医療情報の生成など、誤りが直接不利益につながる用途にそのまま載せる設計は避けてください。なおHeron-NVILA-LiteはNEDOの助成事業JPNP20017の成果に基づくもので、モデルカードは開発者をTuring Inc.と記載しています。
もう一点、2025年5月12日の発表文はHeron-NVILA-Lite-2Bについて「20億パラメータの2BモデルはiPhone上で完全ローカルかつ高速に推論可能です」と述べ、これを「Heron App for iOS」として後日App Storeに公開すると告知しました。ただしApp Storeの該当ページ(id6745646268)は2026年9月16日時点で日本・米国ストアともHTTP 404を返します。オンデバイス利用を検討している場合、既製アプリに頼る前提は立てず、自前で組み込む工数を見込んでおくほうが安全です。
よくある質問
Heronの読み方は?
「ヘロン」と読みます。英単語のheronは鳥のサギを指し、そちらの意味で検索されることも多い語です。AIの文脈ではTuringが公開する日本語視覚言語モデルの総称を指します。
HeronのGitHubリポジトリはどこにありますか?
github.com/turingmotors/heron です。2023年8月22日作成、Apache License 2.0、2026年9月16日時点でスター178件。ただし最終コミットは2024年6月13日で、現行のHeron-NVILA-Liteはこのリポジトリでは動きません。
Heron-Benchとは何ですか?
Turingが公開した日本語VLM評価用のベンチマークです。Hugging Face上のデータセット名は Japanese-Heron-Bench で、日本に関連する画像21枚に対する102問で構成されます。論文は arXiv:2404.07824 です。
Heronは商用利用できますか?
Heron-NVILA-Liteシリーズの重みはApache License 2.0で、商用利用が可能です。ただしGPT-4生成の合成データを含むため、OpenAIの利用規約にも従う必要があります。70B表記のモデルはLlama系ライセンスなので、同じ条件では扱えません。
Heron-NVILA-Liteはどのサイズを選べばよいですか?
精度優先なら33B(Heron-Bench 61.1)、必要なGPUメモリを確保できJA-VLM-Bench-In-the-Wildの成績を重視するなら15B(4.2)が基準になります。端末内や小型GPUでの実行が前提なら2B、動作確認だけなら1Bで足ります。いずれも -hf 版のほうが依存関係の固定が緩く扱いやすい構成です。