10 人が閲覧(直近 30 日) AI

CAEを機械学習で高速化する仕組み|サロゲートモデルの学習データ設計と適用限界

CAEを機械学習で高速化する仕組み|サロゲートモデルの学習データ設計と適用限界

CAEの解析が1本あたり数時間かかると、設計案を1つ変えるたびにその時間が積み上がります。この繰り返しを機械学習で短くする手立てが、サロゲートモデル(代理モデル)です。この記事では、CAE解析のどこを代理モデルへ置き換えられるのか、学習データを何本そろえる必要があるのかを実装の粒度で整理します。手法の選び分けを決めるのは、手元のデータ量と形状がどこまで変わるかの二点です。外挿域で予測が崩れたときにソルバーへ差し戻す設計と、組み込み前の採用条件までを扱いました。CAEの定義や解析種別の分類は親記事へ譲ります。

まとめ:CAEに機械学習を入れる判断は解析1本の時間とサンプル数の積で決まる

サロゲートモデルは、ソルバーが解いていた入力と出力の関係を、事前に集めた解析結果から学んだ関数で置き換える手法です。推論は数ミリ秒から数秒で返るため、設計案を数千通り振って絞り込む使い方に向きます。ただし学習データはCAEで作るしかなく、ここが判断の分かれ目になります。解析結果をデジタルツイン側の学習データへ混ぜる場合の比率と評価データの切り方は、デジタルツインとAIの連携で整理しました。

費用の計算は単純です。解析1本の所要時間に必要サンプル数を掛けたものが初期コストで、これを「削れる解析回数」が上回らなければ成立しません。1本30分の解析で300ケースなら150時間、並列8本でも実時間で20時間ほどかかります。設計変更のたびに20回解析を回す部署なら前払い分を取り戻せますが、年に2回の部署では回収できません。解析の回転数から内製と受託の線を引く考え方はCAE導入の進め方|内製と解析受託の分かれ目・体制づくりと費用対効果で扱っています。

手法は、手元のデータ量と形状の可変性で決まります。設計変数が数十以下で解析ケースが数百点ならガウス過程回帰が扱いやすく、予測の分散をそのまま信頼度に使えるからです。形状そのものが変わり、応力や圧力を面で予測したいなら、MeshGraphNetやDoMINOのような点群ベースのモデルへ移ります。NVIDIAが公開するDoMINOのサンプルは、DrivAerノッチバックを形状変形させた500ケースのDrivAerMLで学習する構成でした(2026年8月時点)。

そして、外挿への備えを先に設計してください。代理モデルは学習した設計空間の外でも平然と数値を返し、外れていることを自分では申告しません。差し戻しの境界を作らないと、速くなった分だけ誤りが早く下流へ流れます。

サロゲートモデルが置き換える範囲と、CAE解析側に残る計算の線引き

「CAEをAIで置き換える」という言い方は範囲が広すぎて、実装の判断には使えません。何を入力に取り何を出力に返すかを決めた時点で、置き換えられる部分とソルバーに残る部分が分かれます。

ソルバーを呼ばずに応答値を返す代理モデル、入力と出力の決め方

代理モデルの入力は、設計者が実際に動かす量に限定します。板厚、リブの本数、フィレット半径、材料定数、荷重値、流入速度といった、設計変更の対象になるパラメータです。出力は、最大ミーゼス応力や抗力係数のような代表値と、面や体積に分布する場の値とで扱いが分かれます。

ここで境界を引き違えると、あとの工程がすべてずれます。メッシュ生成の設定値やソルバーの収束判定パラメータを入力に混ぜてはいけません。同じ設計に対して解析担当者が変える運用側の値だからです。混ぜれば、モデルは「解き方の違い」を「設計の違い」として学習します。CAEの解析種別の分類や読み方はCAEとは?読み方と定義・解析種別の分類とCADやCAMの役割分担で扱っています。

置き換えが利く解析と外れる解析、非線形と接触で崩れる予測の境界

線形静解析や定常熱伝導のように、入力を少し変えると出力も滑らかに変わる問題は相性が良好で、数百点のサンプルでも間を埋められます。崩れるのは、応答が不連続に飛ぶ領域を含む問題です。接触の有無が切り替わる、座屈モードが乗り換わる、乱流の剥離位置が急に移る、樹脂の充填が途中で止まる。こうした場面では、設計変数をわずかに動かしただけで出力が段差を作り、サンプル点の間で大きく外れた値が返ってきます。

対処は二つに一つです。段差の位置を先に特定して設計空間を分割し領域ごとに別のモデルを当てるか、その領域を守備範囲から外してソルバーに残すかになります。分割の境界が事前に分からない問題は、後者を選んでください。

代表値だけを返すか場全体を返すか、出力粒度で変わる実装の重さ

出力を代表値の数個に絞れば、実装は一般的な回帰問題に落ちます。入力が数十次元、出力が数次元のテーブルデータであり、scikit-learnの範囲で組めて学習も数分で終わります。

場を丸ごと予測する場合は前提が変わります。メッシュ節点が数十万から数百万あり、ケースごとに節点数も接続関係も異なるため、固定長ベクトルとしては扱えません。ここからGNNや点群ベースのモデルの領分になり、GPUと学習データの容量が要求されます。

実務では、代表値の代理モデルから始めてください。軽いモデルで設計探索を回し、絞り込んだ数案だけをソルバーで解いて場を確認する。この二段構えなら、場の予測モデルを組まずに繰り返し回数を削れます。場の予測が要るのは、応力集中の位置そのものが設計判断の対象になる場合だけです。

学習データの調達設計、解析結果の蓄積とサンプリングで決まる精度の上限

代理モデルの精度は、モデルの選択より先に、どこへ何点の解析を配ったかで頭打ちが決まります。過去案件のCAE結果をそのまま使える例は、ほとんどありません。

解析1本あたりの所要時間と必要サンプル数から見積もる初期コスト

過去の解析結果が使えない理由は三つあります。設計案が良さそうな領域に偏り、設計空間を覆っていないこと。案件ごとにメッシュの切り方や材料モデルが違うこと。入力パラメータの値がモデルファイルに埋もれ、表形式で残っていないことです。

学習データはたいてい新規に回すことになります。必要点数は、設計変数の数をdとして、代表値の回帰なら10dから20d、場の予測なら数百ケース以上が初期の目安です。設計変数が8個なら80点から160点、1本30分の解析であれば40時間から80時間かかります。

大規模な場の予測に踏み込むと桁が変わります。NVIDIAがDoMINOのサンプルで用いるDrivAerMLは、DrivAerノッチバックを形状変形させた500ケースを高忠実度CFDで解いたCC-BY-SAの公開データセットです。学習側も軽くはなく、同サンプルのREADMEには単一H100ノードで数日規模、8基のH100で約5日から4時間強へ短縮したと記載がありました(2026年8月時点)。同等のことをやるなら、解析クラスタとGPUの両方を見積もりに入れてください。

ラテン超方格と直交配列、scipyのqmcで設計点を配る手順

設計点の配り方は、格子状の総当たりを避けるところから始まります。変数8個を各3水準で振ると6,561ケースになり、解析時間が先に破綻するためです。少ない点数で覆うには、ラテン超方格サンプリング(LHS)を使います。SciPyの scipy.stats.qmc による手順は次のとおりです。

  1. 設計変数の下限と上限を決め、次元数dを確定する
  2. LatinHypercube(d=d, scramble=True) で発生器を作る
  3. 2次元の射影まで均等にしたい場合は strength=2 を指定する
  4. 点の偏りを抑えるなら optimization に random-cd か lloyd を渡す
  5. random(n) で0から1の点を得て、変数ごとの実寸へ線形に写す
  6. 各点をCAEの入力ファイルへ流し込み、バッチで解析を投入する

注意したいのは strength=2 の制約です。SciPy公式ドキュメントによると、この指定では素数pに対して n が p の2乗の点数しか取れず、次元数dも p+1 以下に制限されます。d が9なら p は11以上、点数は121点からです。合わない場合は strength=1 のまま optimization で偏りを抑えます。乱数の配り方そのものはモンテカルロ法とは?乱数で解く仕組みと円周率・リスク評価での使い方で整理しています。

メッシュ依存を切る前処理と、形状パラメータや場データの正規化

解析結果をそのまま学習データにすると、モデルはメッシュの切り方を覚えます。節点数や節点順が案件ごとに違えば、同じ形状でも別のデータに見えるためです。代表値だけなら影響は出ませんが、場を予測するなら前処理が必須です。

定石は、解析結果を一度メッシュから切り離すことです。表面形状はSTLなどの三角形メッシュへ統一し、場の値は空間座標に紐づく点群として持ち直します。DoMINOが点群ベースなのも、ケースごとにメッシュが変わる前提に合わせるためでした。体積場なら、対象を囲む直方体に格子を張って値を写す方法もあります。

正規化は入力と出力の両方に掛けます。板厚のミリメートルと荷重のニュートンでは桁が3つ違い、桁の大きい変数が損失を支配してしまうためです。出力側も圧力と壁面せん断応力で2桁前後の差が出るため、量ごとに標準化してから学習させ、推論後に逆変換します。前処理と特徴量設計の一般論は特徴量とは?機械学習での意味と作り方・重要度の見方にまとめました。

手法の選び分け、ガウス過程からニューラルオペレータまでのデータ量の目安

手法の候補は多く見えますが、選択を決める軸は二つです。手元にそろう学習ケース数と、形状が変わるかどうかで切ると、候補はほぼ一意に絞れます。

数十から数百点で効くガウス過程回帰、分散が使える代わりの制約

解析ケースが数百点までで、出力が代表値なら、ガウス過程回帰(クリギング)が第一候補になります。少ない点数から滑らかな応答曲面を作れることに加え、予測値と一緒に標準偏差が出るためです。この標準偏差は、次にどこを解析すべきかを決める指標にそのまま使えます。

手法 データ量の目安 向く問題 不確かさの扱い
ガウス過程回帰 数十から数百点 設計変数が数十以下 分散を直接出せる
勾配ブースティング木 数百から数千点 代表値の回帰 分位点回帰で近似
全結合ニューラルネット 数千点以上 固定メッシュの場予測 アンサンブルで推定
MeshGraphNet 数百ケース以上 形状が変わる場予測 アンサンブルで推定
FNOやDoMINO 数百ケース以上 大規模な場の予測 アンサンブルで推定
PINN 少量と支配方程式 方程式が既知の問題 残差で間接的に確認

制約も明確です。scikit-learn公式ドキュメントは、ガウス過程の計算量が学習点数の三乗で増えること、実装が疎でないため特徴量が数十を超えると効率が落ちることを明記しています。数千点を超えると学習が現実的な時間に収まらなくなるため、そこが木モデルやニューラルネットへ移る境目です。観測ノイズを表す alpha はチコノフ正則化として共分散行列の対角へ加算される実装で、小さな値を入れておくと数値的な不安定さも抑えられます。

形状が変わる問題に向くGNNとニューラルオペレータの学習実績

設計変数がパラメータではなく形状そのものになると、固定長の入力ベクトルが作れず、グラフや点群を直接受け取るモデルが要ります。MeshGraphNetは節点をノード、要素の辺をエッジとして扱い、近傍とのメッセージ交換を繰り返して場を予測する構造です。DoMINOは点群ベースで、STL形状から表面の圧力・壁面せん断応力と周囲の速度場・圧力を返します。

実装の土台には、NVIDIAのPhysicsNeMoが現実的な選択肢になります。PyPIの nvidia-physicsnemo は2026年6月8日公開の2.1.1が最新で、対応Pythonは3.11以上3.14未満でした。モデル群にはFNO、DeepONet、DoMINO、MeshGraphNet、Transolver、PINNが含まれます。GNNのバックエンドは同時点でDGLですが、PyTorch Geometricへの移行が予告されているため、グラフ処理部分は薄く包んでおくと移行時の書き換えが局所で済みます。

支配方程式を損失に入れるPINN、データが不足する場面での使い道

PINN(物理情報ニューラルネットワーク)は、支配方程式の残差を損失関数へ足し込み、教師データが少なくても物理的に破綻しない解を得ようとする手法です。CAEの代理モデルという文脈では、解析ケースをそろえられない場面の候補になります。

ただし、汎用の置き換えとして期待すると外します。方程式が明示的に書ける問題に限られること、境界条件によって学習が収束しないこと、条件を変えるたびに再学習が要りがちなことが理由です。設計案を数千通り振る目的なら、ニューラルオペレータ側が投資に見合います。

精度検証の組み方、外挿域での破綻を検知して解析へ差し戻す設計

検証で最も多い失敗は、テストデータでの決定係数が0.99だったのに、実際の設計検討で外れることです。原因は手法ではなく、検証の切り方にあります。

無作為分割で過大評価される精度、設計空間を分けた検証の作り方

LHSで配った点を無作為に8対2で分けると、テスト点は必ず学習点に囲まれた位置に来ます。内挿だけを測るため、数値は当然良く出ます。しかし設計者が使いたいのは既存案から離れた条件、つまり外挿の領域です。

検証は設計空間で切ってください。影響が大きい設計変数を1つか2つ選び、その値が上位20パーセントに入る点をすべてテスト側へ寄せます。板厚1.0から3.0ミリで学習し、2.6ミリ以上を検証に回すという分け方です。ここで誤差が跳ね上がるなら、その方向への外挿は使えないと判定できます。変数を1つずつ抜いた分割も回すと、どの方向で先に崩れるかが差し戻し条件の根拠になります。

決定係数だけでは足りない誤差評価、代表値と場での指標の分け方

代表値の予測では、決定係数に加えて誤差の絶対量を設計公差と並べて見ます。抗力係数の予測で決定係数が0.98でも、平均絶対誤差が0.005カウントか0.05カウントかで、使えるかどうかが変わるためです。判定基準は統計量ではなく、設計側が許せる差から決めます。

場の予測は指標を分けます。全節点の二乗平均平方根誤差は、面積の大半を占める平坦な領域の当たり具合に引きずられ、応力集中部の外れを覆い隠すからです。実務で見るべきは、最大値の位置がずれていないか、上位1パーセントの高応力領域での誤差がどれだけか、面で積分した合計値が合っているかの3点です。設計探索の用途に限れば、絶対値の精度より順位相関を優先しても機能します。

予測を出さない判定を先に作る、不確かさでソルバーへ戻す境界値

外挿域の予測を止める仕組みは、代理モデルの外側に置きます。実装は三層で考えると整理できます。

一層目は入力の範囲チェックです。学習データの各変数の最小値と最大値を保存しておき、それを外れた入力は無条件で拒否します。実装は数行で済み、これだけで事故の大半を防げるはずです。二層目は学習点群からのマハラノビス距離や最近傍距離がしきい値を超えたら警告を返す層で、範囲内でも学習点が疎な穴に落ちた入力を捕まえます。

三層目が不確かさによる判定です。ガウス過程なら予測分散、ニューラルネットなら初期値を変えた5個ほどのアンサンブルのばらつきを使い、しきい値を超えた入力はソルバーへ差し戻します。しきい値は、検証データで不確かさと実誤差の対応表を作って読み取ります。差し戻された条件の解析結果は、次の再学習の教師データに回してください。この逐次追加はベイズ的な逐次探索と同じ考え方で、打ち切り条件の設計はハイパーパラメータ探索とは?手法の選び方と打ち切り設計の枠組みがそのまま使えます。

設計プロセスへの組み込み判断、採用する三条件と見送る場面の切り分け

ここまでの内容を導入判断に落とします。PoCで精度が出たかどうかは材料の一部でしかなく、設計プロセスに組み込んで元が取れるかは別の条件で決まります。

採用してよい三条件、解析時間と繰り返し回数と設計空間の固定度

次の3つがそろったときに採用してください。逆に、1つでも欠けるなら見送りが妥当です。

  • 解析1本が30分以上かかり、設計検討のたびに待ち時間が発生している
  • 同じ種類の解析を年に50回以上、条件を変えながら繰り返している
  • 設計変数の顔ぶれが案件をまたいで安定し、範囲も見通せている

3つ目が最も見落とされます。代理モデルは学習した設計空間の中でしか使えないため、案件ごとに変数の顔ぶれが入れ替わる領域では、作るそばから使えなくなるからです。逆に、部品の系列が決まっていて板厚と形状パラメータだけが動く量産設計は、条件がそろいやすい典型です。学習データの整備からモデル実装、社内システムへの組み込みまでを外部に任せる段階なら、機械学習モデル開発の受託で扱える範囲と進め方を先に確認してください。

見送るべき場面、単発設計とトポロジーが毎回変わる案件の切り分け

見送るべき条件を先に言い切ります。一品受注の単発設計では、代理モデルを作りません。学習データを集める解析回数が、設計に使う解析回数を上回るためです。100点集めて1案を決めるなら、素直に1案を解けば終わります。

形状のトポロジーが毎回変わる案件も外します。穴の数やリブの本数といった位相が変わると、パラメータの対応が付かず、形状を受け取るGNNでも学習分布から外れるからです。法規や規格の判定値を出す用途にも使いません。代理モデルの出力は近似値であり、認証や審査の根拠にはソルバーの解析結果が要ります。

判断に迷う中間帯は、解析回数が年10回から50回の範囲です。この帯では、代表値だけを予測する軽いモデルを既存の解析結果から作り、一次スクリーニングに限って使う形に留めてください。場の予測やGPU学習まで踏み込むと回収できません。

運用開始後の再学習、設計変更を検知してモデルを更新する仕組み

組み込んだあとに効いてくるのは、モデルを更新し続ける仕組みです。材料の変更、荷重条件の見直し、解析ソルバーのバージョン更新。どれも学習データと現実のずれを生みます。

運用側に用意するのは3点です。差し戻された入力とソルバーの解析結果を対で蓄積する置き場。検証セットの誤差を定期的に測り、しきい値を超えたら通知する仕組み。再学習してモデルを差し替える手順の文書化になります。ソルバーのバージョンが上がったら、検証セットを解き直してから比較してください。

体制としては、解析担当と機械学習担当を分けたままにしないでください。入力パラメータの意味づけと外挿域の判断は解析側の知識で決まり、サンプリング設計と検証の切り方は機械学習側の知識が要るからです。代理モデルを実機の計測値と結び付けて運用するなら、デジタルツインとは?意味・仕組み・事例と導入の判断基準で扱った突き合わせの設計も併せて検討してください。

よくある質問

CAEに機械学習を入れる検討でよく挙がる質問を、実装の判断に必要な範囲で答えます。

CAEの解析結果は何本あればサロゲートモデルを学習できますか?

予測する対象で桁が変わります。代表値の回帰であれば、設計変数の数をdとして10dから20d、変数8個なら80点から160点が初期の目安です。分布を面で予測するなら数百ケース以上が必要で、NVIDIAがDoMINOのサンプルで用いるDrivAerMLは500ケース構成でした。まずは代表値のモデルを少数点で作り、検証誤差を見ながら点を追加してください。

サロゲートモデルとROM(低次元モデル)は何が違うのですか?

出発点が違います。ROMは、解析結果の空間から主要な成分を抽出して次元を落とし、元の方程式構造を保ったまま小さく解き直す考え方です。サロゲートモデルは方程式の構造を持たず、入力と出力の対応だけをデータから学びます。物理的な整合を保ちたいならROM寄り、関係が複雑で方程式に落としにくいならデータ駆動の代理モデル寄りです。両者を組み合わせ、ROMの低次元係数を機械学習で予測する構成も採られます。

サロゲートモデルを入れるとCAEソフトのライセンスは減らせますか?

減りません。学習データを作る段階でソルバーを大量に回すため、むしろ一時的に同時実行数が増えます。差し戻された条件の再解析でも継続的に使います。効果が出るのは、設計者が結果を待つ時間と解析部門への依頼件数のほうです。ライセンス費用の削減を掲げると評価がずれるため、手戻り回数や検討期間で測ってください。

サロゲートモデルの予測値は設計審査の根拠として使えますか?

一次スクリーニングまでに留め、審査の根拠にはソルバーの解析結果を使ってください。代理モデルは学習データの分布に依存した近似であり、外挿域では誤差を自己申告しません。実務では、数百案を代理モデルで絞り込み、残った数案をソルバーで解き直して審査へ出します。この場合も検証条件と誤差の実測値を記録に残すと、絞り込み過程の妥当性を後から説明できます。

PINNを使えば学習データが少なくても精度は確保できますか?

条件付きです。支配方程式が明示的に書ける問題で境界条件が素直な場合には、少ないデータでも物理的に整合した解が得られます。一方で、条件を変えるたびに再学習が要る構成になりやすく、設計案を数千通り振る用途では実行時間が見合いません。この用途は、条件をまたいで学習するニューラルオペレータ側が向きます。PINNの出番は、未知の物性値を逆問題として推定する場面です。

関連記事

お気に入りに入れた記事の一覧

この記事は以下の記事からリンクされています

資料請求

今日のトレンド記事 直近 24 時間で、いつもより多く読まれている記事

  1. 2026.10.06 テックブログ 大和証券の不正アクセスと約11万人分の口座番号:問い合わせ管理の委託先に残さない設計
  2. 2026.10.06 テックブログ 焼肉きんぐの不正アクセスと1,078万件の会員情報|全件規模の流出を防ぐAPIとログの点検
  3. 2026.10.06 テックブログ 原子力研究開発機構の不正アクセスと身分証画像の漏えい|研究支援サイトのファイル保管を点検する手順
  4. 2026.10.04 テックブログ デジタル庁GSSの不正アクセスと約24.6万件|CVSS中のVPN脆弱性を何で優先するか
  5. 2026.10.01 テックブログ AWS VPN Clientの使い方:6.x系のインストールとCLI・接続できない時の確認先

RELATED POSTS 関連記事

目次