Gemini

Gemini 3.7 Flashとは?3.6 Flashとの差分・thinking_levelの制約と切り替え手順【2026年8月】

Gemini 3.7 Flashとは?3.6 Flashとの差分・thinking_levelの制約と切り替え手順【2026年8月】

Googleは2026年8月13日、Gemini 3.7 Flash(モデルID gemini-3.7-flash)を一般提供(GA)として公開しました。前版の Gemini 3.6 Flash が同年7月21日にGAとなってから、わずか3週間での世代交代です。基盤モデルの入れ替えではなくアルゴリズム側の改善による更新と説明されており、コンテキスト長や出力上限といった基本スペックは前版と同値に据え置かれました。

本記事は「3.6 Flashから何が変わり、動いている実装をどう切り替えるか」だけに絞ります。Flash系の系譜、Flash-Lite や Pro との役割分担、Gemini 3 世代の基本スペックの全体像はGemini 3.6 Flashとは?料金・ベンチマーク・3.5 Flashとの違いを実装目線で解説に譲り、ここでは差分と移行判断に集中します。数値は2026年8月24日時点の公表値です。なお後継のGemini 3.8 Flashとは?3.7からの差分・料金・移行コードを実装目線で解説が2026年9月2日にGAとなりました。これから移行するなら3.8 Flash を前提にしてください。

まとめ:3.7 Flashは精度で選び、minimalが要る処理は3.6に残す

  • 提供開始は2026年8月13日、モデルIDは gemini-3.7-flash。GA扱いなので本番利用に載せられます。
  • 料金は100万トークンあたり入力0.75ドル・出力3.75ドル(2026年12月31日まで)。2027年1月1日から入力1.50ドル・出力7.50ドルへ切り替わります。
  • 公式価格表では3.6 Flashも同じ単価が記載されています。つまり「単価が下がるから移行する」という理由は成り立ちません。
  • 伸びたのはコード生成とエージェント実行の領域です。DeepSWE v1.1 で65.3%対49.0%、AutomationBench で30.4%対17.0%と差が出ています。
  • thinking_level の対応は low・medium・high の3段で、3.6 Flash にあった minimal が公式のモデル別対応表に載っていません。
  • 判断は二分します。コード生成・エージェント実行が主用途なら即切り替え、thinking_level に minimal を指定した大量バッチ処理は3.6 Flash に残します。

Gemini 3.7 Flashの提供状況とモデルID・提供チャネル

Gemini API の変更履歴には、2026年8月13日付で「Gemini 3.7 Flash generally available (GA)」と記載されています。プレビュー段階を挟まずGAで登場した点が、実装側にとっては扱いやすい部分でしょう。モデルIDに -preview や日付サフィックスが付かないため、後からIDを差し替える手間も発生しません。

日本語版のGoogle公式ブログは8月14日付で公開されており、そこでは提供先として Google AI Studio、Android Studio の Gemini API、Google Antigravity、Gemini Enterprise Agent Platform、Gemini Enterprise、Gemini アプリ(Spark)が挙げられています。Google Cloud 側のリリース情報では global・us・eu の3リージョンで提供が始まったと案内されました。

ここで注意したいのが転送構成の変更です。Vertex AI の Gemini モデル解説ページは、2026年8月24日時点で Gemini Enterprise Agent Platform 配下のドキュメントへ転送される構成に変わっています。社内Wikiやオンボーディング資料に旧URLを貼っている場合は、リンク切れではなく転送先の確認が必要になります。

項目 3.7 Flash 3.6 Flash
モデルID gemini-3.7-flash gemini-3.6-flash
GA日 2026年8月13日 2026年7月21日
入力コンテキスト 1,048,576トークン 1,048,576トークン
出力上限 65,536トークン 65,536トークン
thinking_level low・medium・high minimal含む4段
既定のthinking_level medium medium
入力単価 0.75ドル(導入価格) 0.75ドル(導入価格)
出力単価 3.75ドル(導入価格) 3.75ドル(導入価格)

表のとおり、器の大きさは変わっていません。入力100万トークン・出力65,536トークンという上限が同値なので、長文を分割して投げるチャンク分割ロジックやリトライ設計は、そのまま流用できます。移行作業の実質はモデルIDの差し替えと、後述する thinking_level の棚卸しに収まります。

検証をどのチャネルで始めるかは、後の本番運用の形で決めるのが筋です。Google AI Studio と API キーの組み合わせは着手が速い反面、監査ログやIAMによる権限分離は入りません。Google Cloud 側の経路であれば、OAuth と IAM、監査ログ、リージョンを固定したエンドポイントが最初から使えます。個人情報や社内文書を入力に含める検証では、後者から始めたほうが手戻りが出ません。

もう一点、Gemini アプリ側の提供と API 側の提供は分けて扱ってください。アプリで3.7 Flash が選べることは、API 側の挙動やレスポンス形式を保証しません。実装の判断材料は、あくまで API へ同一入力を投げた結果に置きます。

3.6 Flashからのベンチマーク差分をタスク別に読み解く

公式ブログが3.6 Flash との対比で示したスコアは5本です。数字の並びを見ると、伸びた領域が特定のタスク群に偏っていることが分かります。汎用的な会話品質ではなく、コードとエージェント実行に投資した世代だと読み取れます。

ベンチマーク 3.7 Flash 3.6 Flash
FrontierCode 1.1 Main 43.6% 34.4%
DeepSWE v1.1 65.3% 49.0%
WebDev Arena(Elo) 1588 1538
GDP.pdf 34.0% 22.0%
AutomationBench 30.4% 17.0%

実装判断に効くのは AutomationBench の17.0%から30.4%という動きです。業務手順を多段で実行させる用途では、成功率が1.7倍前後になった計算になります。エージェントは1ステップの失敗が後続を巻き込むため、素点の差以上に完走率へ跳ね返ります。

DeepSWE v1.1 の49.0%から65.3%も同じ性質を持ちます。差分パッチを当てて通す形式のベンチマークなので、手戻り、つまり再試行の回数に直結する指標だと考えてよいでしょう。再試行が減れば消費トークンも減るため、単価が同じでも1タスクあたりの実コストは下がり得ます。

WebDev Arena の 1538 から 1588 という Elo 50点差は、少し慎重に読む必要があります。Elo で50点の開きは、対戦形式の評価で勝率がおおむね57%前後になる程度の差です。人が見比べて明確に優劣を感じる水準ではないため、Web画面の生成品質を理由に移行を決めるのは弱い根拠になります。

FrontierCode 1.1 Main の34.4%から43.6%も、絶対値では半分に届いていません。難易度の高い課題集では、依然として人のレビューを前提に置く設計が必要です。ベンチマークの伸びは「レビュー1回あたりの修正量が減る」程度の期待値に読み替えて、工数見積りへ反映させるのが現実的でしょう。

逆に、これらのスコアが自社の用途を代表していない場合、乗り換えの根拠は薄くなります。長期の保守性まで見るならSWE-CIとは?AIエージェントのコード長期保守性を測るCI型ベンチマークのような別軸の指標も併読し、自前の評価セットで測り直す前提を置いてください。公表ベンチマークは選定の入口にすぎません。

料金は3.6 Flashと同額:導入価格と標準価格の切り替え時期

Gemini API の価格表によると、3.7 Flash の単価は100万トークンあたり入力0.75ドル・出力3.75ドルです。これは2026年12月31日までの導入価格で、2027年1月1日からは入力1.50ドル・出力7.50ドルへ倍になります。コンテキストキャッシュは0.075ドルから0.15ドルへ、キャッシュ保存は100万トークン毎時0.50ドルから1.00ドルへ、同じタイミングで切り替わる旨が記載されています。

ここで見落としやすい事実があります。2026年8月24日時点の同じ価格表には、3.6 Flash についても入力0.75ドル・出力3.75ドルという同一の単価が並んでいます。第三者記事では「3週間で半額」という表現が目立ちますが、これは標準価格に対する導入価格の割引を指すものです。3.6 Flash と3.7 Flash のあいだに単価差は見当たりません。

したがってコスト削減を目的に移行を起案すると、根拠が崩れます。判断軸は精度と再試行回数であり、単価ではありません。予算計画の側では逆に、2027年1月1日の標準価格を織り込んでいるかを確認してください。導入価格のまま年間予算を組むと、翌年に倍額の請求と向き合うことになります。

もう一点、思考トークンの課金を忘れないでください。公式ドキュメントでは、応答側の課金は出力トークンと思考トークンの合計という扱いです。返ってくるのは思考の要約であっても、内部で回った思考トークンは出力単価で計上されます。この性質が、次章の thinking_level の話とそのままつながります。

thinking_levelにminimalが無いことの実装への影響

Gemini 3 世代では、思考量の指定が thinking_budget の数値指定から thinking_level の文字列指定へ置き換わりました。公式ドキュメントのモデル別対応表を2026年8月24日時点で確認すると、gemini-3.7-flash の対応レベルは low・medium・high の3段、既定値は medium です。

一方、gemini-3.6-flash の行には minimal・low・medium・high の4段が並んでいます。同じ表には gemini-3.5-flash や gemini-3.5-flash-lite の minimal 対応も残っています。つまり3.7 Flash では、思考をほぼ切って最短で返す下限のレベルが選べません。

これは高頻度・低単価の処理で効いてきます。ログの分類、フォームの正規化、問い合わせの一次振り分けのような処理は、推論の深さより単価とレイテンシで設計されているはずです。minimal で回していたリクエストを low に上げると思考トークンが増え、出力単価で課金される分だけ請求が膨らみます。単価が同額である以上、この増分は純粋な上振れです。

from google import genai

client = genai.Client()

resp = client.models.generate_content(
    model="gemini-3.7-flash",
    contents="このログを3分類に振り分けてください",
    config={"thinking_level": "low"},
)

print(resp.text)

移行前に確認したいのは、コード中の thinking_level 指定の分布です。minimal が1箇所も無ければ影響はありません。使っている箇所があるなら、そのエンドポイントだけ3.6 Flash に残す構成が現実的でしょう。モデルを用途で振り分ける構えはモデルサービングとは?推論APIの構成とKServe・Triton・BentoMLの選定基準で整理した推論API層の設計とも噛み合います。

なお minimal の非対応は「廃止」として告知されたものではなく、モデル別対応表にその行が無いという事実として確認できるだけです。将来の追加を否定する材料もありません。設計時は、対応レベルを実行時の設定値として外に出しておき、モデルIDと一緒に切り替えられる形にしておくと後戻りが楽になります。

公式に数値が無いレイテンシを自分の環境で実測して判断する手順

レイテンシについて、Google公式の発表とドキュメントは具体的な数値を示していません。第三者の検証記事には応答時間が3割から4割短くなったという報告や、思考トークンが半分以下になったという実測もありますが、測定条件はそれぞれ異なります。自社の判断材料としてそのまま採るのは避けたほうがよいでしょう。

思考トークンの量は thinking_level とプロンプトの性質で大きく振れます。同じ medium でも、短い分類タスクと長文の仕様書読解では消費が桁で変わります。したがってレイテンシとコストは、モデル単体の属性ではなくワークロードとの組み合わせで決まる値として扱うのが妥当です。

実測の手順は素朴で構いません。本番で流れている代表プロンプトを30本ほど固定し、3.6 Flash と3.7 Flash に同一入力を投げて、初回トークンまでの時間、完了までの時間、入力トークン、出力トークン、思考トークンを記録します。thinking_level は現行設定と1段下の2条件で回し、精度評価も同じ入力セットで並行して取ります。

計測の条件でつまずきやすい点も挙げておきます。1本目のリクエストは接続確立やモデルの立ち上がりを含むため、必ず捨てて2本目以降を採ってください。ストリーミングを有効にしているかどうかで初回トークンまでの時間の意味が変わるので、本番と同じ設定に揃えます。時刻帯によっても振れるため、朝と夕方の2回に分けて取ると判断を誤りにくくなります。

この計測を済ませておくと、後の採用判断が数字で決まります。逆に計測を飛ばすと、公表ベンチマークの伸びだけを見て移行し、請求書で気づく流れになりがちです。ステートレス構成で運用している場合は、思考ブロックの署名(thought signatures)を再送する実装になっているかも同時に点検してください。

既存実装をgemini-3.7-flashへ切り替える6つの手順

3.6 Flash から3.7 Flash への移行は、同じ Gemini 3 系内の移動です。temperature・top_p・top_k といったサンプリング系の指定の除去や、candidate_count の非対応への対応は Gemini 3 系へ上がる時点で済んでいるはずなので、今回の作業には含まれません。3.5 以前から一気に上げる場合だけ、これらの整理が追加で必要になります。

  1. モデルIDを gemini-3.6-flash から gemini-3.7-flash へ差し替えます。リクエストスキーマの変更は伴いません。
  2. コードと設定ファイルを横断して thinking_level の指定箇所を洗い出し、minimal の使用有無を確定させます。
  3. minimal を使っていたエンドポイントは3.6 Flash のまま残し、モデルIDを環境変数か設定値として外部化します。
  4. 入力100万トークン・出力65,536トークンの上限は同値なので、チャンク分割と打ち切り処理は据え置きで問題ありません。
  5. 前章の計測を実施し、精度・所要時間・思考トークンを含む実コストを3.6 Flash と並べて比較します。
  6. 2027年1月1日以降の標準価格でコストを再計算し、切り戻し用のフラグを残したうえで段階的に切り替えます。

切り戻しの経路を残す点は省略しないでください。3.6 Flash には提供終了の告知が出ておらず、当面は併存させられます。フラグ1つで戻せる構成にしておけば、精度が想定に届かなかった場合の損失を1リリース分に抑えられます。

3.7 Flashを採用する条件と3.6 Flashに残す判断基準

ここまでの数字を踏まえて、条件を言い切ります。次の3つのいずれかに当てはまるなら、3.7 Flash へ切り替えてください。第一に、コード生成やコードレビューが主用途で、生成物を人が直す時間がコストの大半を占めている場合。第二に、多段の業務手順をエージェントに実行させており、途中失敗による巻き戻しが発生している場合。第三に、PDFや帳票の読解精度が業務要件に届いておらず、GDP.pdf の22.0%から34.0%という差が意味を持つ場合です。

逆に、3.6 Flash へ残す判断が正しい場面もあります。thinking_level に minimal を指定した大量バッチが動いている処理系は、そのまま置いてください。1リクエストあたりの単価が薄い処理では、思考トークンの増分がそのまま利益を削ります。会話の要約や定型文の生成のように、既に精度が要件を満たしている処理も、切り替える理由が見つかりません。

判断を保留すべき場面も明示しておきます。ステートレス構成で思考ブロックの署名を再送していない実装は、まずそこを直してから移行の議論に入ってください。導入価格を前提に年間コストを積んでいる計画も同様で、2027年1月1日の標準価格へ置き換えたうえで再評価する順序になります。

自社に評価セットが無く、精度の比較そのものが動かせないという段階であれば、評価基盤の設計から始める必要があります。既存業務のどこにLLMを差し込み、どの指標で合否を決めるかという設計は、モデル選定より前段の作業です。この工程を含めて外部に任せる選択肢としては、生成AI導入支援のように評価設計と実装をまとめて引き受ける形が扱いやすいでしょう。

よくある質問

Gemini 3.7 Flash はプレビューですか、本番で使えますか?

2026年8月13日の時点でGA(一般提供)として公開されており、公式ドキュメントも本番利用に対応した状態だと記載しています。モデルIDに -preview は付きません。

3.6 Flash より安くなったという説明は正しいですか?

2026年8月24日時点の公式価格表では、3.6 Flash と3.7 Flash の単価はどちらも100万トークンあたり入力0.75ドル・出力3.75ドルで同一です。「半額」という表現は、2027年1月1日から適用される標準価格に対する導入価格の割引を指しています。

thinking_level に minimal を渡すとどうなりますか?

公式のモデル別対応表に gemini-3.7-flash の minimal は載っていません。指定を残したまま切り替えるとリクエストが弾かれる可能性があるため、移行前に指定箇所を洗い出し、low へ引き上げるか当該処理を3.6 Flash に残すかを決めてください。

3.6 Flash はいつまで使えますか?

2026年8月24日時点で、3.6 Flash に非推奨化や提供終了日の告知は出ていません。ただし世代交代が3週間間隔で起きている状況なので、モデルIDを設定値として外部化し、差し替え可能な構成を保っておくのが安全です。

移行にあたってコードの書き換えはどの程度必要ですか?

3.6 Flash からの移行であれば、実質はモデルIDの差し替えと thinking_level の棚卸しです。3.5 以前から上げる場合は、サンプリング系パラメータの除去と candidate_count の非対応への対応が追加で必要になります。

関連記事

お気に入りに入れた記事の一覧

この記事は以下の記事からリンクされています

資料請求

今日のトレンド記事 直近 24 時間で、いつもより多く読まれている記事

  1. 2026.10.09 テックブログ IDCFクラウド(IDCフロンティア)不正アクセス・ランサムウェア:影響先・復旧・データは戻るか
  2. 2026.10.08 テックブログ 大阪公立大学のランサムウェア被害と仮想化基盤の停止|全授業休講に至った経緯とバックアップを守る設定
  3. 2024.11.08 テックブログ OpenAPI GeneratorでJavaコードを自動生成する方法|CLI導入からSpring・ライブラリ選択まで
  4. 2026.10.09 テックブログ ニッスイのサイバー攻撃で日水物流の入出荷停止|委託先クラウド障害に荷主が備える手順
  5. 2026.10.09 テックブログ 京王電鉄のランサムウェア被害とグループ共通基盤:決済・ポイント・予約が止まった範囲と遮断の初動

RELATED POSTS 関連記事

目次