AI

FPGAによるAI推論とは?量子化・推論IP実装とGPUとの使い分けを実装視点で解説【2026年版】

AIエンジン開発における主なサービス内容

推論をFPGAに載せるかどうかは、たいてい「速いか遅いか」では決まりません。決め手になるのは、筐体に何ワットまで入るのか、最悪応答時間を何マイクロ秒で握る必要があるのか、そしてRTLを書ける人がチームにいるのか、という三つです。この記事では、学習済みモデルをFPGA上で動かすまでの実装像を、量子化と固定小数点化、推論IP(DPU)を載せる方式とHDLで直接書く方式の分かれ目、メモリ帯域を軸にしたデータフロー設計の順に並べました。そのうえで、GPU・CPU・NPU搭載SoCとの使い分けを三つの軸で判断できるところまで持っていきます。FPGAそのものの内部構造やLUTの仕組みはFPGAの定義と基本原理を解説した記事に譲り、ここでは推論を回す側に絞りました。

まとめ|FPGA推論の勝ち筋はバッチ1のレイテンシと電力・設計の重心はメモリ帯域

先に結論を三つ置きます。ひとつ目は勝ち筋の位置。FPGAはスループット競争でGPUに勝てる場面が限られる一方、バッチサイズ1での応答時間と、そのばらつきの小ささでは他のデバイスと明確に差がつきます。1枚の画像が来てから答えを返すまでを詰める用途こそが本命です。

ふたつ目は設計の重心。演算器(DSPブロック)が足りずに遅くなる案件は少なく、実際は外部DRAMから重みと中間特徴マップを読み書きする帯域で頭打ちになります。レイヤ融合とタイル分割でオンチップメモリに閉じ込められた分だけ速くなる、と考えたほうが実態に合います。

三つ目は入口の作法。モデルを決めてからツールを選ぶのではなく、使うツールチェーンの版を先に固定し、その版が受け付ける演算子の範囲でモデルを選び直す順序にします。順番を逆にすると、サポート外の層でCPU側へ処理が戻り、そこだけでレイテンシが数倍に跳ねかねません。実装手順と判断軸は以下で順に扱います。

FPGAでAI推論を回すとは|回路として実装する意味と二つの方式

FPGAで推論を回すという言い方には、ずいぶん幅があります。既製の推論IPを載せてモデルを流し込む構成と、モデル専用の回路をHDLで書き下ろす構成とでは、必要な人材も期間も一桁違う。まずはこの前提を揃えます。

学習ではなく推論に絞る理由|FPGAが得意とする処理の性質と範囲

学習と推論では計算の性質が違います。学習は勾配を逆伝播させて重みを更新し続けるため、浮動小数点の精度が要り、計算グラフも試行のたびに書き換わる。演算器の数で押すGPUが向く領域です。

推論は逆に、学習が終わった時点で計算グラフも重みも固定されます。同じ演算を、同じ順序で、同じデータ型で繰り返すだけになる。固定した処理を回路として焼き込めるFPGAの土俵は、まさにここにあります。エッジ側に推論だけを置くという構成そのものの判断材料は、エッジAIとクラウドAIの違いと実装の判断基準をまとめた記事で扱っています。

命令フェッチを持たない実行モデル|データフローで推論を回す仕組み

CPUやGPUは、命令を読み込み、解釈し、演算器に投げる手順を毎サイクル踏みます。FPGAにその手順はありません。畳み込みも活性化関数もプーリングも専用の回路として配置され、データが回路を通過すると結果が出ます。

この違いが効くのはパイプライン化したときです。レイヤごとに回路を割り当てて数珠つなぎにすると、1枚目の画像が2層目を処理している間に、2枚目が1層目へ入れます。演算器を埋めるためにデータをまとめる必要がなく、単発の入力でも回路が遊びません。

推論IPを載せる方式とHDLで直接書く方式|二つの実装ルートの違い

実務のルートは大きく二つに割れます。ひとつは、ベンダが提供する推論IPをFPGA上に配置し、学習済みモデルを専用コンパイラで変換して流し込む方式。AMDのVitis AIが備えるDPU(専用命令セットを持つカスタムプロセッサとして定義されています)や、AlteraのFPGA AI Suiteが生成するIPコアがこれにあたります。回路側は既製品なので、担当者の作業はモデル変換とホスト側のアプリ実装が中心になります。

もうひとつは、対象モデル専用の回路をHDLや高位合成(HLS)で記述する方式です。重みを1ビットや2ビットまで削った極端な量子化と組み合わせると、既製IPでは届かない電力効率とレイテンシに到達できます。ただし論理設計・検証・タイミング詰めの工数がまるごと乗るため、着手前に体制を確認しておく必要があります。工程ごとの工数配分はFPGA設計の流れを七工程で整理した記事にまとめました。

判断の目安はシンプルです。標準的なCNNを動かすなら推論IP方式で始め、そこで電力もレイテンシも要件に届かなかったときにだけ、専用回路の検討へ進みます。最初から専用回路を選ぶ理由になるのは、既製IPが対応しない極端なビット幅を使うと決まっている場合くらいです。

実装の第一関門|量子化と固定小数点化で精度をどこまで保てるかの見極め

学習済みモデルは通常、32ビット浮動小数点で保存されています。この形のままFPGAに載ることはまずありません。整数演算へ落とす工程が、実装で最初につまずく場所です。

INT8化で変わること|精度・回路規模・メモリ帯域への三つの影響

FPGAのLUTとDSPブロックは整数演算と相性が良く、実務の標準線は8ビット整数(INT8)に置かれます。Vitis AIのドキュメントでも、量子化は16ビットまたは8ビットの整数表現で実装されると説明されています。

32ビットから8ビットへ落とすと、重みのデータ量が4分の1になります。効くのは容量だけではありません。外部メモリから読み出す量が4分の1になるため、帯域律速の設計では、そのまま処理時間の短縮につながります。乗算器1個あたりの回路規模も小さくなるので、同じデバイスに載せられる演算器の数が増える。三方向から効いてくるわけです。

代償は精度です。落ち幅はモデルと層の構造で変わり、事前に読み切れません。回路の作り込みへ進む前にPC上で測る、という順序が要ります。

PTQとQATの使い分け|どちらから先に試すかを決める判断順序

量子化の手法は、学習後に変換するPTQと、量子化を織り込んで再学習するQATの二系統に分かれます。着手はPTQからです。数十から数百枚程度の校正データを通してスケール係数を決めるだけなので、半日から数日で結果が出ます。

PTQで許容範囲に収まらなかったときに、はじめてQATを検討します。QATは学習パイプラインと学習データを手元に持っていることが前提になるため、学習をベンダに委託していた場合はそこで詰まる。着手前に、再学習できる状態にあるかを確認しておいてください。手法そのものの仕組みと違いは量子化の仕組みとPTQ・QATの違いを解説した記事で詳しく扱っています。

PTQの中でも、スケール係数をテンソル単位で持つか、出力チャネル単位で持つかで結果が変わります。チャネルごとに重みの分布が偏るモデルでは、チャネル単位に切り替えるだけで精度が戻ることも多い。QATへ進む前に試す価値はあります。

精度劣化を確認する手順|層ごとの誤差を追って原因を絞り込む流れ

最終的な正解率だけを見ていても、どこで壊れたかは分かりません。量子化前後で層ごとの出力を突き合わせ、誤差が跳ねた層を特定する進め方に切り替えます。信号対量子化雑音比やコサイン類似度を層ごとに並べると、原因の層はたいてい一目で浮かびます。

崩れやすい層には傾向があります。チャネルごとに独立して畳み込むdepthwise畳み込みは、チャネル間で重みの尺度が揃わず量子化誤差を拾いやすい。入力の分布が広い最初の層と、確率へ変換する直前の最終層も同様です。こうした層だけ16ビットのまま残す混合精度の構成を採れるかどうかは、使う推論IPの仕様で決まります。

推論IPを使う実装の流れ|ツールチェーンとモデル変換・配置の手順

推論IP方式を選んだ場合、作業の中身はハードウェア設計というよりソフトウェア寄りになります。ただし版差の影響を強く受けるため、進め方には固有の作法があります。

ツールチェーンの現況|Vitis AIとFPGA AI Suiteの版

AMD側はVitis AIが窓口です。GitHubで公開されている系列は5.0系(2025年2月公開・2026年8月時点)で、ランタイムはXRT 2025.1をベースに更新されています。ONNX Runtimeの実行プロバイダ経由でモデルを流す構成が整備され、ONNX Runtime 1.16.0・opset 18に対応しました。対応先はZynq UltraScale+ MPSoCとVersalのエッジ・コア系列、評価用途ではKria K26 SOM、データセンタ側ではAlveoカードとなっています。ツール本体のVitisソフトウェアプラットフォームは2026.1系です。

Altera側はFPGA AI Suiteが対応し、系列は2026.1.1(2026年8月時点)。OpenVINOツールキットの中間表現を経由してグラフを受け取る構成で、推論IPをQuartusのプロジェクトに組み込む流れになります。

どちらの陣営でも、版ごとに対応フレームワークと対応演算子の一覧が入れ替わります。実装前に使う版のドキュメントで対応表を確認し、その版を固定してから作業を始めてください。途中で版を上げると、通っていたモデルが通らなくなることがあります。

モデル変換からデプロイまで|コンパイル前後で詰まりやすい三箇所

手順そのものは定型です。学習済みモデルを中間表現へ変換し、校正データで量子化し、ターゲットのIP構成へコンパイルして実行ファイルを生成し、ボード上のランタイムから呼び出します。

詰まる場所も定型で、三箇所に集中します。ひとつ目は変換前のモデル整形で、学習フレームワーク固有の記述が中間表現に落ちない場合。ふたつ目は量子化時の校正データ選びで、本番と分布がずれたデータを使うと精度が出ません。三つ目はコンパイル時のIP構成指定で、演算器数やオンチップメモリ量の設定が実際に合成した回路と食い違うと、そもそも動きません。

対応演算子という壁|サポート外の層を切り分けて逃がす三つの手立て

推論IP方式で最大の制約が、対応演算子の範囲です。IPが解釈できない層があると、コンパイラはそこでグラフを分割し、該当部分をホストのCPUへ回します。境界をまたぐたびにデータ転送が起き、そこだけで全体の処理時間を食い潰します。

逃がし方は三つあります。第一に、モデル側を差し替える手。対応演算子だけで組める同等の構造へ置き換えれば、境界そのものが消えます。第二に、サポート外の層をグラフの端へ寄せ、前処理・後処理としてホスト側にまとめる手。境界の回数を1回に減らせば、往復のコストは抑えられます。第三に、高位合成で独自の層を回路として書き、IPの脇に並べる手。効果は大きい一方、専用回路方式に近い工数を覚悟することになります。

データフロー設計|スループットを決めるのはメモリ帯域とレイヤ融合

推論IPを載せて動いた、というところから先は設計の話になります。ここで効いてくるのは演算器の数ではなく、データの流し方です。

レイヤ融合とオンチップメモリ|外部メモリの往復回数を減らす設計

層をひとつずつ律儀に処理する構成では、中間特徴マップを毎回外部DRAMへ書き出し、次の層で読み戻すことになります。畳み込み、バッチ正規化、活性化関数という連なりを一続きの回路として融合すると、この往復が丸ごと消えます。

もうひとつの手がタイル分割です。特徴マップ全体をオンチップに置けないなら、空間方向やチャネル方向に切り分け、断片単位でブロックRAMやウルトラRAMに収めて処理します。切り分けの粒度は、デバイスのオンチップ容量から逆算して決めます。

バッチサイズ1で効くレイテンシ設計|GPUと差がつく理由と条件

GPUは数千の演算器を埋めるために、複数の入力をまとめて処理する前提で設計されています。1枚だけ処理する場合、演算器の大半が遊ぶ。結果として、1枚あたりの処理時間はバッチをまとめたときより悪化します。

FPGAのパイプライン構成には、この落ち込みがありません。入力が1枚でも回路の各段は順に埋まり、投入から結果までの時間が短く保たれます。生産ラインで1個ずつ流れてくる製品を判定する、制御ループの中に判定を挟む、といった用途で差が出るのはこの性質によるものです。逆に、大量の画像をまとめて夜間にさばく処理では、この利点は出ません。

前処理をFPGA側へ寄せる判断|カメラ入力を直結する構成の効き

推論そのものを詰めても、前処理がCPU側に残っていると全体の応答時間は縮みません。カメラの映像信号をFPGAへ直結し、切り出し・拡縮・正規化までを回路で済ませてから推論IPへ渡す構成にすると、CPUを経由するメモリコピーが消えます。

この構成を採るかどうかは、基板設計の初期段階で決める必要があります。カメラをどこに接続するかがピン配置に直結し、後から変えると基板の作り直しになるためです。推論の載せ方を決める前に、入力経路の物理設計を握っておいてください。

GPU・ASIC・CPUとの使い分け|三つの軸で採用可否を決める

ここからが判断の本題です。推論を載せる先はFPGAだけではありません。三つの軸に分けて、どこでFPGAが残り、どこで落ちるかを言い切ります。

判断軸 FPGA GPU NPU搭載SoC
バッチ1の応答 短く安定 演算器が遊ぶ 短いが構成固定
応答のばらつき サイクル単位で確定 スケジューラ依存 ドライバ依存
電力あたり性能 高い 低い 最上位
対応モデルの幅 IPの対応表次第 ほぼ制限なし チップ仕様で固定
必要な人材 RTLまたはHLS ソフト技術者 ソフト技術者
回路の変更 後から書き換え可 該当なし 変更できない

電力あたり性能で判断が決まる場面|筐体と電源の制約が先にある案件

装置の筐体寸法、供給できる電力、冷却方式が先に決まっている案件では、選べるデバイスがそこで絞られます。ファンを置けない、DINレールに収める、バッテリで動かす、といった条件が付くと、GPUモジュールは物理的に候補から外れることが少なくありません。

ただし、FPGAが自動的に残るわけではない点は押さえておいてください。同じ電力枠にはNPUを内蔵したSoCも入ってきます。標準的なCNNを固定して動かすだけなら、そちらのほうが単価も開発工数も低く済みます。FPGAが残るのは、推論の前後に信号処理や独自プロトコルの処理が必要で、それも同じチップに載せたい場合です。エッジ側へ処理を寄せる判断の全体像はエッジコンピューティングの仕組みと導入判断を解説した記事にまとめています。

レイテンシの確定性で決まる場面|ジッタを許容できない制御系の要件

平均応答時間ではなく、最悪応答時間を握れるかで決まる領域があります。制御ループの中に推論を挟む場合、たまに10ミリ秒待たされる構成では成立しません。汎用OSのスケジューリングやGPUドライバのキュー待ちは、この「たまに」を作ります。

FPGAは回路として動くため、処理時間がクロックサイクル単位で確定します。設計時に見積もった時間が、そのまま実行時の保証値になる。高速取引の判定、産業機械の異常停止、車載の安全系といった用途でFPGAが選ばれ続けているのは、この確定性が理由です。逆に言えば、応答が数百ミリ秒揺れても困らない用途では、この軸は判断材料になりません。

開発コストと人材で覆る判断|RTL技術者の確保が前提条件になる

技術的にFPGAが向いていても、体制で覆ることがあります。推論IP方式ならソフト寄りの作業で進められますが、それでも周辺回路の設計、基板、電源、熱設計、ボードサポートパッケージの整備は残る。専用回路方式に踏み込めば、論理設計と検証の専任者が要ります。

加えて、開発の反復速度がソフトウェアとは別物です。配置配線に数十分から数時間かかるため、1日に試せる回数が限られます。この時間感覚を織り込まない計画は、ほぼ確実に遅れます。期間と体制の見積り方は設計工程の記事に譲りますが、着手判断の段階では「RTLを書ける人を確保できるか」を先に確認してください。

FPGAを見送るべき場面|GPUや専用チップへ寄せるべき三つの条件

採用しないほうがよい条件を明示します。第一に、モデルを頻繁に差し替える計画がある場合。四半期ごとに構造ごと入れ替えるなら、そのたびに量子化と再コンパイル、場合によっては回路の作り直しが発生します。GPUで回したほうが総コストは下がります。

第二に、要件がスループットだけの場合。まとめて処理できる業務なら、演算器の物量で勝るGPUに分があります。第三に、機能が固定で量産数が万台規模に達する場合。この規模ではNPU搭載SoCや専用チップの単価優位が効き、FPGAのデバイス単価では追いつきません。台数から採否を判断する計算手順はFPGAの価格とコスト構造|単価だけで決まらない総額の内訳とASICとの分岐点にまとめました。

大規模言語モデルの推論をFPGAへ載せる話も同様です。パラメータを保持するメモリ容量が壁になり、現時点の実務ではGPU側の基盤を採るほうが現実的でしょう。この領域の選択肢はLLM推論の仕組みと推論基盤の選び方を扱った記事で整理しています。

PoCの組み立て方|検証する順序と見送りを判断する三つのライン

採用に傾いたら、次はPoCの設計です。順序を間違えると、回路を作り込んだ後で精度が足りないと判明する、という最悪の展開を招きます。

PoCで先に潰す検証順序|精度・スループット・消費電力という三点

検証は必ずこの順で並べます。最初にPC上で量子化後の精度を測る。ここで要件に届かなければ、FPGAどころかエッジ推論そのものを見直す話になり、回路には一切触れずに判断できます。

次に評価ボードで実測スループットを取ります。Kria K26 SOMのような、ツールチェーンの対応表に載っている評価ボードを使ってください。対応表にないボードを持ち込むと、ボードサポートの整備だけで数週間を溶かします。最後に消費電力と発熱を、実際の筐体に近い条件で測る。この三点が揃ってから、量産設計の話に進みます。

体制と外注の分界点|モデル側と回路側で担当をどこで切り分けるか

PoCの体制で失敗しやすいのが、モデル側と回路側を別々の会社に分けてしまう構成です。精度が出ないとき、量子化の詰めが甘いのか、回路側の実装で誤差が入ったのかを切り分けられなくなり、双方が相手側の問題だと主張して止まります。

分けるなら、精度に責任を持つ範囲は一本化してください。学習・量子化・変換・ボード上での精度確認までを同じチームに通し、基板設計や筐体・電源はその外側で分担する形が動きます。エッジ機器へ推論を載せる構成の検討や、PoCから量産までの進め方については、AI・IoTソリューションの開発支援で相談を受け付けています。

よくある質問

FPGAはGPUよりAI推論が速いのですか?

一概に速いとは言えません。まとめて処理したときの総処理量では、演算器の物量で勝るGPUが上回る場面が多くあります。FPGAが上回るのは、入力1件あたりの応答時間と、そのばらつきの小ささ、そして消費電力あたりの処理量です。どの指標で比べるかを決めないまま「速い・遅い」を議論しても結論は出ません。

HDLが書けなくてもFPGAでAI推論を動かせますか?

推論IPとツールチェーンを使う構成なら、作業の中心はモデル変換とホスト側のアプリ実装になり、HDLを書かずに評価ボード上で動かすところまで到達できます。ただし量産機に載せる段階では、基板設計、電源、熱、ピン配置の確定といったハードウェア側の作業が残ります。評価と量産で必要な体制が変わる点は見込んでおいてください。

量子化はどのビット幅から始めるべきですか?

8ビット整数のPTQから始めてください。多くの推論IPが8ビットを前提に設計されており、ツールチェーンの標準経路にも乗ります。精度が足りない場合は、スケール係数をチャネル単位へ切り替える、崩れやすい層だけ16ビットで残す、それでも届かなければQATへ進む、という順で手を打ちます。

大規模言語モデルをFPGAで推論させられますか?

研究や検証の事例はありますが、実務で選ぶ場面は限られます。パラメータを保持するメモリ容量と帯域が壁になり、扱えるモデル規模が絞られるためです。小規模モデルを機器内で完結させたい要件でないかぎり、GPUベースの推論基盤が現実的です。

評価ボードはどう選べばよいですか?

ツールチェーンの対応表に載っているボードから選ぶのが原則です。対応外のボードでは、ボードサポートパッケージの整備やドライバの調整に時間を取られ、精度と性能の測定に入る前に期間を使い切ります。まず版を固定し、その対応ボード一覧から選んでください。

関連記事

お気に入りに入れた記事の一覧

この記事は以下の記事からリンクされています

資料請求

今日のトレンド記事 直近 24 時間で、いつもより多く読まれている記事

  1. 2026.10.06 テックブログ 大和証券の不正アクセスと約11万人分の口座番号:問い合わせ管理の委託先に残さない設計
  2. 2026.10.06 テックブログ 焼肉きんぐの不正アクセスと1,078万件の会員情報|全件規模の流出を防ぐAPIとログの点検
  3. 2026.10.06 テックブログ 原子力研究開発機構の不正アクセスと身分証画像の漏えい|研究支援サイトのファイル保管を点検する手順
  4. 2026.10.04 テックブログ デジタル庁GSSの不正アクセスと約24.6万件|CVSS中のVPN脆弱性を何で優先するか
  5. 2026.10.01 テックブログ AWS VPN Clientの使い方:6.x系のインストールとCLI・接続できない時の確認先

RELATED POSTS 関連記事

目次