Qwen3.8-Omni-Flashは、Alibabaが2026年9月18日に公開した、テキスト・画像・音声・動画をまとめて受け取り、テキストで答えるAPI専用のマルチモーダルモデルです。文脈長は100万トークンで、1リクエストに渡せる入力の上限は、動画が最大2時間、音声が最大3時間です。この記事では、東京リージョンでAPIを呼び出すコード、公式の換算式から計算した動画の長さ別トークン数と料金、Realtime版やQwen3.5-Omniとの使い分けを整理します。最後に、会議録画の要約や動画の検品にこのモデルを採用する条件と、見送るべき場面を判断します。
まとめ:Qwen3.8-Omni-Flashは東京で使える安価な音声・動画理解API
結論から書きます。録画済みの会議や研修動画を読ませて、要約・抽出・検品をテキストで返させる用途なら、2026年10月時点で有力な選択肢です。東京リージョンの入力単価は100万トークンあたり0.113ドルで、公式の換算式に当てはめると、1時間の720p動画は約18万トークン、入力費用は約0.021ドルに収まります。
一方で、返せるのはテキストだけです。音声で応答させたいなら、Realtime版かQwen3.5-Omniを使います。どちらも北京とシンガポールでしか提供されていません。
長い動画ほど1フレームあたりの解像度は下がります。約17分を超えると1フレームは544×288まで縮むため、スライドの細かい文字を読ませたい案件では動画を分割して渡す設計にしてください。
Qwen3.8-Omni-Flashの入出力仕様とQwen3.5-Omniとの役割の違い
Qwen公式の発表は、このモデルを「音声・映像を起点にエージェント的な作業をこなすネイティブのオムニモーダルモデル」と位置づけています。発表時点の提供形態はAPIのみで、オープンウェイトの公開には触れていません。
テキスト・画像・音声・動画を受けてテキストだけを返す入出力の範囲
Model StudioのQwen-Omni文書によると、モデルIDはqwen3.8-omni-flash、入力はテキスト・画像・音声・動画、出力はテキストです。呼び出せるAPIはChat CompletionsとResponsesの2種類。Function Callingとウェブ検索にも対応します。
| 項目 | Qwen3.8-Omni-Flashの値 |
|---|---|
| 文脈長 | 100万トークン |
| 動画の長さ上限 | 2時間(対応形式は表の直後に記載) |
| 音声の長さ上限 | 3時間(対応形式は表の直後に記載) |
| ファイルサイズ | 公開URLで最大2GB、Base64は10MB未満 |
| 音声入力の言語 | 113の言語・方言(日本語を含む) |
| 提供リージョン | 北京・東京など(全地域は表の直後に記載) |
表は2026-10-10時点の公式文書に基づく仕様です。対応形式は、動画がMP4・AVI・MKV・MOV・FLV・WMV、音声がAMR・WAV・3GP・3GPP・AAC・MP3です。提供リージョンは北京・シンガポール・香港・東京・フランクフルト・バージニアで、利用する地域を指定して呼び出します。
最大出力トークン数は、公式文書には記載がありません。131,072トークンとする第三者サイトもありますが、設計の前提にするなら自分の環境で上限を確かめてください。
音声で返すならQwen3.5-OmniかRealtime版を選ぶ分岐の条件
公式文書は、音声で応答を生成したい場合はQwen3.5-Omniを使うよう案内しています。Qwen3.5-Omniは音声出力・声のクローン・話速や感情の指示に対応する一方、提供は北京とシンガポールだけで、動画の上限は1時間です。
電話応対のように相手の発話を聞きながら音声で返す用途には、Qwen3.8-Omni-Flash-Realtimeがあります。Realtime版の文書に載っている接続先はWebSocketとWebRTCで、エンドポイントは北京とシンガポールのみです。東京リージョンで完結させたい案件では、録画をあとから読ませるバッチ型の処理に用途を絞ることになります。
公式ベンチマークでQwen3.5-Omni-Plus比25%超改善とされる中身
Alibaba Cloudの公式ブログは、29種類の評価の平均で上位モデルのQwen3.5-Omni-Plusを25%以上上回ったと公表しています。長尺動画の理解では、質問から逆算して必要な区間だけを段階的に見にいくエージェント方式を採り、OmniVideoBenchの正答率が63.4から67.8へ上がり、消費トークンは145,736から79,117へ約46%減ったとしています。
いずれも提供元の自己申告で、第三者の検証はまだ出ていません。日本語の会議音声での精度も個別には公表されていないため、自社の録画で評価セットを作って測る工程は省けません。
東京リージョンでQwen3.8-Omni-FlashのAPIを呼び出す実装手順
呼び出しはOpenAI互換です。OpenAIの公式SDKをそのまま使い、base_urlとモデルIDを差し替えます。
Model StudioのAPIキーとワークスペースIDを東京で揃える準備
APIキーはリージョンごとに別物です。東京で呼ぶなら、東京リージョンのワークスペースで発行したキーを使います。Chat Completionsの接続先一覧では、東京のbase_urlはhttps://{WorkspaceId}.ap-northeast-1.maas.aliyuncs.com/compatible-mode/v1です。{WorkspaceId}は自分のワークスペースIDに置き換えます。
文書は、選んだリージョンのキーを使うよう明記しています。開発・本番で別リージョンを使う構成なら、キーとエンドポイントを同じ環境変数の組で切り替える作りにしておくと事故が減ります。
動画URLを渡すChat Completions呼び出しのPythonコード例
会議の録画URLを渡し、決定事項を抜き出させる最小の例です。pip install openaiのあと、DASHSCOPE_API_KEYとVIDEO_URLを環境変数に入れて実行します。
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
# 東京リージョンのエンドポイント(<WorkspaceId>は自分のIDに置き換える)
base_url="https://<WorkspaceId>.ap-northeast-1.maas.aliyuncs.com/compatible-mode/v1",
)
stream = client.chat.completions.create(
model="qwen3.8-omni-flash",
messages=[{
"role": "user",
"content": [
{"type": "video_url", "video_url": {"url": os.environ["VIDEO_URL"]}},
{"type": "text", "text": "会議の決定事項・担当者・期限を箇条書きで出してください。"},
],
}],
modalities=["text"],
reasoning_effort="low", # 既定はxhigh。要約程度ならlowで足りる
stream=True,
stream_options={"include_usage": True},
)
for chunk in stream:
if chunk.choices:
print(chunk.choices[0].delta.content or "", end="")
elif chunk.usage:
# 最後のチャンクで消費トークンが返る
print("\n", chunk.usage)
音声ファイルだけを渡す場合は、video_urlの要素を{"type": "input_audio", "input_audio": {"data": "<音声URL>", "format": "wav"}}に替えます。stream_optionsを付けておくと、最後のチャンクで実際の消費トークンが取れるので、次章の見積もりと突き合わせられます。
reasoning_effortの既定xhighと思考をオフにする判断基準
Qwen3.8-Omni-Flashは思考モードが既定で有効で、reasoning_effortの既定値はxhighです。指定できる値はnone・low・medium・xhighで、互換のためminimalはlowに、highとmaxはxhighに読み替えられます。thinking_budgetと同時に指定するとエラーです。
判断の目安はこうです。決定事項の抽出や要約のように答えが動画の中にある処理はlowかnoneで十分です。複数の会議をまたいだ矛盾の指摘や、手順の抜けを推論させる処理だけmedium以上にします。思考の出力も課金対象になる前提で見積もってください。Qwen3.8-Maxなどの料金表は、思考と回答を合算して出力単価で数える扱いです。既定のまま大量に流すと出力費が膨らみます。
公開URLは2GB・Base64は10MB未満というファイル受け渡しの制約
1時間の会議録画は、ほぼ確実に10MBを超えます。つまり実務ではBase64で直接送れず、Model Studioから取得できるURLに動画を置く必要があります。社内のファイルサーバーにある録画をそのまま渡すことはできません。
現実的な構成は、オブジェクトストレージに一時的に置き、有効期限の短い署名付きURLを発行して渡す形です。期限は処理時間に合わせて数十分程度に絞り、処理が終わったらオブジェクトを消す後片付けまでをジョブに含めます。
動画の長さ別に公式式で計算したトークン数と解像度の落ち方・料金試算
Qwen-Omni文書の「Billing and rate limits」には、動画と音声をトークンに換算するPythonコードが載っています。この章の数値は、その式に長さと解像度を入れて計算したものです。実際の請求額は、API応答のusageで必ず確かめてください。
音声は1秒7トークン・動画は2fpsで最大2048フレームという換算式
音声は長さ(秒)×7トークンです。1時間なら25,200トークンになります。動画は映像と音声が別々に数えられ、映像側は毎秒2フレームを抜き出し、抜き出す枚数の上限は2048フレームです。1フレームの画素は32×32で1トークンとして数えます。
効いてくるのは2つの上限です。1フレームあたりの画素の上限に加えて、動画全体の画素の合計にも上限があり、枚数が増えるほど1枚あたりの解像度が下がります。さらに2048フレームに届くと、そこから先は抜き出す間隔そのものが広がります。毎秒2フレームで2048フレームに届くのは1,024秒、つまり約17分です。
長さを入れるだけで課金トークンを見積もるPythonスクリプト
公式の換算コードから、720p・30fpsの動画を想定して必要な部分だけを抜き出したものです。OpenCVを使わず、長さ(秒)を渡すだけで動きます。
import math
F = 32 # 1トークン=32×32画素
FPS, FRAME_FACTOR = 2, 2 # 抽出は毎秒2フレーム、2フレーム単位
MAX_FRAMES = 2048 # Qwen3.8-Omni-Flashの抽出上限
MIN_PIXELS = 64 * F * F
MAX_PIXELS = 640 * F * F
TOTAL_PIXELS = 180224 * F * F
def estimate(seconds, width=1280, height=720, fps=30):
total = seconds * fps
nframes = int(min(max(seconds * FPS, 2),
min(MAX_FRAMES, total) // FRAME_FACTOR * FRAME_FACTOR, total))
max_px = max(min(MAX_PIXELS, TOTAL_PIXELS / nframes * FRAME_FACTOR), int(MIN_PIXELS * 1.05))
h, w = round(height / F) * F, round(width / F) * F
if h * w > max_px:
beta = math.sqrt(height * width / max_px)
h, w = math.floor(height / beta / F) * F, math.floor(width / beta / F) * F
video = int(math.ceil(nframes / FPS) * (h // F) * (w // F)) + 2
audio = seconds * 7 # 音声は1秒あたり7トークン
return nframes, w, h, video, audio
for minutes in (1, 10, 30, 60, 120):
n, w, h, v, a = estimate(minutes * 60)
usd = (v + a) / 1_000_000 * 0.113 # 東京リージョンの入力単価(USD/100万トークン)
print(f"{minutes:>3}分 frames={n} {w}x{h} video={v:,} audio={a:,} 東京入力=${usd:.4f}")
1080pの動画を渡しても、結果は720pと同じになります。縮小後の解像度が上限で決まるためです。高画質で撮り直しても、モデルに届く情報量は増えません。
1分から2時間まで5パターンの入力トークンと東京・シンガポール料金
上のスクリプトの出力を表にまとめました。料金は入力分だけで、出力(思考を含む)は別にかかります。
| 動画の長さ | 抽出フレーム | 1フレームの解像度 | 映像トークン | 音声トークン | 入力費(東京) | 入力費(シンガポール) |
|---|---|---|---|---|---|---|
| 1分 | 120 | 1056×576 | 35,642 | 420 | 約0.0041ドル | 約0.0054ドル |
| 10分 | 1,200 | 736×384 | 165,602 | 4,200 | 約0.0192ドル | 約0.0255ドル |
| 30分 | 2,048 | 544×288 | 156,674 | 12,600 | 約0.0191ドル | 約0.0254ドル |
| 60分 | 2,048 | 544×288 | 156,674 | 25,200 | 約0.0206ドル | 約0.0273ドル |
| 120分 | 2,048 | 544×288 | 156,674 | 50,400 | 約0.0234ドル | 約0.0311ドル |
映像トークンは10分を超えたあたりで頭打ちになり、そこから先は音声トークンだけが伸びます。長い動画ほど1分あたりの単価は下がりますが、その分だけ映像の細部が落ちている、と読むのが正確です。
17分を超えると1フレームが544×288まで縮む画質低下の影響
544×288は、フルHDの約7.5%の画素数です。話者の表情や場面の切り替わりは追えても、画面共有されたスライドの本文や表の数値は読めない可能性が高い水準です。加えて2時間の動画なら、抜き出すのは約3.5秒に1枚になります。
スライドの文字や画面の操作手順を読ませたい案件では、動画を10分以下に分割して渡すか、場面の切り替わりで静止画を切り出して画像として送ります。画像は1枚あたり既定で最大1,280トークン、vl_high_resolution_imagesを有効にすると最大16,384トークンまで解像度を保てます。会話の中身だけが目的なら、映像を捨てて音声だけを送るのがいちばん安く、1時間で25,200トークンです。
東京リージョン単価とRealtime版・Qwen3.5-Omniの料金比較
Model Studioの料金表(2026年10月9日更新)から、関係するモデルを抜き出して並べます。
東京は入力0.113ドル・シンガポールは0.15ドルという地域差
| モデル | リージョン | 入力 | 音声入力 | キャッシュ入力 | テキスト出力 | 音声出力 |
|---|---|---|---|---|---|---|
| qwen3.8-omni-flash | 東京 | 0.113 | 入力と同額 | 0.014 | 0.382 | なし |
| qwen3.8-omni-flash | シンガポール | 0.15 | 入力と同額 | 0.016 | 0.47 | なし |
| Qwen3.8 Realtime(下記ID) | シンガポール | 0.23 | 0.93 | 記載なし | 0.70 | 1.87 |
| qwen3.5-omni-plus | シンガポール | 1.4 | 11 | 記載なし | 8.3 | 44 |
| qwen3.5-omni-flash | シンガポール | 0.4 | 3 | 記載なし | 2.2 | 11.9 |
表中のQwen3.8 Realtimeは、モデルID「qwen3.8-omni-flash-realtime」の略記です。
単位はいずれも100万トークンあたりのドルです。東京・香港・フランクフルト・バージニアは「Global」配備として同じ単価で、シンガポールの「International」配備より約25%安く設定されています。Qwen3.8-Omni-Flashには音声入力の別単価が無く、音声も映像も同じ入力単価で数えます。
無料枠には注意が要ります。料金表の無料枠(100万トークン・有効90日)はシンガポール限定で、Realtime版には付いていますが、Qwen3.8-Omni-Flash本体の行には記載がありません。東京で検証を始めると、最初の1回から課金されると考えてください。
思考トークンと出力単価が月額を左右する会議録画100本の要約試算
1時間の会議録画を月100本、東京リージョンで要約する場合を考えます。入力は1本あたり181,874トークンで、100本なら約1,819万トークン、費用は約2.06ドルです。
出力は使い方で大きく変わります。仮に1本あたり要約と思考を合わせて1万トークン出るとすると、100本で100万トークン、約0.38ドルです。reasoning_effortを既定のxhighのまま流して思考が数万トークンに膨らめば、出力費が入力費を上回ります。月額は数ドルの桁に収まるので、費用より先に、精度の評価と動画の受け渡し経路の設計に工数を割くほうが割に合います。
文字起こし専用APIとの費用比較は、文字起こしAPIの比較と選び方で各社の単価を並べています。逐語の文字起こしが目的なら、そちらの土俵で比べるのが筋です。
Qwen3.8-Omni-Flashを採用する業務条件と見送るべき場面
ここまでの仕様と単価を踏まえて、採用と見送りの線を引きます。
会議録画の要約や研修動画の検品を東京リージョンで安く回す採用条件
採用してよいのは、次の条件がそろう案件です。入力が録画済みのファイルであること、出力がテキストで足りること、処理をバッチで回せること。社内会議の議事要約、研修動画に禁止表現や古い手順が残っていないかの検品、コールセンター録音の分類などが当てはまります。
同じQwen3.8世代でも、長大な文書の読解やコード生成が主役ならQwen3.8-Maxの仕様とAPI料金の領域です。公式ブログはOmni-Flashのテキスト性能を「同規模のテキスト専用モデルと同等」と説明しており、フラッグシップのMaxと同列に置いてはいません。静止画の読み取りだけなら、Qwen3-VLの使い方で解説している視覚言語モデルのほうが自社運用まで視野に入ります。
音声応答・オンプレ運用・逐語の文字起こしが要件なら見送る判断
次のどれかに当たるなら、Qwen3.8-Omni-Flashは採用しません。
- 利用者に音声で応答する必要がある(API版は音声を返せず、音声を返せるモデルは東京で使えない)
- データを自社環境から出せない(オープンウェイトの公開は2026年10月10日時点の公式文書に記載が無い)
- 発言を一字一句残す逐語の議事録や、話者ごとのタイムスタンプが監査の証跡になる
最後の条件は見落とされがちです。オムニモデルは内容を理解して要約するのが得意な一方、逐語性を保証する仕組みはありません。証跡が必要なら、gpt-4o-transcribe-diarizeによる話者分離のような文字起こし専用モデルで逐語記録を残し、要約だけをオムニモデルに任せる2段構成にします。
社内動画をModel Studioへ送る前に情報管理部門と決める事項
会議録画には、顧客名や人事情報が普通に映り込みます。APIに送る前に、どのリージョンで処理するか、署名付きURLの有効期限と後片付けを誰が担うか、送信してよい会議の範囲をどう線引きするかを、情報管理部門と文書で決めておきます。Alibaba Cloudの利用規約とデータ処理条件も、法務の確認を経てから本番に入ってください。
録画の取り込みから要約、社内システムへの登録までを一連の仕組みにする段階で詰まりやすいのが、権限設計と精度評価の作り込みです。音声・動画を扱う業務システムの設計から相談したい場合は、AI音声認識システム開発のページで対応範囲を確認できます。
Qwen3.8-Omni-Flashの料金・公開状況・仕様についてよくある質問
検索されることの多い疑問に、2026年10月10日時点の公式情報で答えます。
Qwen3.8-Omni-Flashは無料で使えますか?
API版のQwen3.8-Omni-Flashについて、料金表に無料枠の記載はありません。Model Studioの無料枠(100万トークン・有効90日)はシンガポールリージョン限定で、Qwen3.8-Omni-Flash-Realtimeには付与されています。東京リージョンで呼ぶ場合は最初から従量課金です。ただし1時間の動画でも入力費は約0.02ドルなので、数本の検証で費用が問題になることはまずありません。
オープンウェイトは公開されていますか?
2026年10月10日時点で、Qwen公式の発表とModel Studioの文書にオープンウェイト公開の記載はありません。Hugging Faceなどに同名のファイルや非公式の配布物が出ていても、公式の配布元とは確認できないため使わないでください。自社環境で動かす前提の案件は、オープンウェイトが公開されているQwen系の別モデルを候補にします。
日本語の音声は認識できますか?
対応しています。Model Studioの文書では、音声入力は113の言語・方言に対応するとされ、公式ブログの対応言語一覧にも日本語が入っています。ただし日本語に限った精度の公式ベンチマークは出ていません。専門用語の多い社内会議では、録画10〜20本分を人手の議事録と照合して、固有名詞の取り違えがどの程度出るかを先に測ってください。
Qwen3-Omni-FlashやGemini Omni Flashとは何が違いますか?
Qwen3-Omni-Flashは一つ前の世代で、音声と動画の入力上限が150秒、思考の切り替えはenable_thinkingで行います。Qwen3.8-Omni-Flashは動画2時間・音声3時間まで受けられ、思考はreasoning_effortで調整します。Gemini Omni FlashはGoogleの動画生成モデルで、名前は似ていても役割が逆です。詳しくはGemini Omni Flashの解説を参照してください。
最大出力トークン数はいくつですか?
Model Studioの文書には、Qwen3.8-Omni-Flashの最大出力トークン数が明記されていません。131,072トークンとする第三者のモデル一覧もありますが、公式値として確認できない以上、それを前提に設計しないほうが安全です。長い議事録を一度に出させるより、議題ごとに区切って複数回に分けて生成させる設計にすれば、上限に当たる心配がなくなります。
関連記事
- Qwen3.8-Maxとは|2.4兆MoEのVRAM試算と移行判断:同じQwen3.8世代のフラッグシップ。テキスト推論の上位モデルを検討する場合に。
- Qwen3.6-Plusとは|1Mコンテキスト・階梯課金・3.7世代との選び分け:テキスト中心の処理で単価を比べる際の比較対象。
- Qwen3-VLとは?Alibaba製オープンソース視覚言語モデルの特徴・モデル一覧・使い方:静止画の読み取りを自社環境で動かしたい場合の入口。
- 文字起こしAPIの比較と選び方|主要7サービスの料金・日本語対応・使い方:逐語の文字起こしを専用APIで行う場合の比較。
- gpt-4o-transcribe-diarizeとは?話者分離の使い方・料金:話者ごとの逐語記録を残す2段構成の前段に。