---
title: "文字起こしアプリのおすすめは？無料・有料の選び方と用途別の使い分け"
url: "https://www.issoh.co.jp/column/details/13306/"
published: 2026-07-09
updated: 2026-09-04
categories: ["AI"]
publisher: "株式会社一創"
---

# 文字起こしアプリのおすすめは？無料・有料の選び方と用途別の使い分け

会議の議事録、インタビューの書き起こし、スマホに残した音声メモ。文字起こしアプリは用途によって向き不向きが分かれ、ランキング上位の一本を入れれば済む、という選び方ではうまくいきません。この記事では、無料枠と有料プランの実額比較、音声認識AIの仕組み、精度・対応端末・付加機能で見る選び方、議事録から動画字幕までの使い分けを整理します。そのうえで、市販アプリで足りる場面と受託開発で自社実装すべき業務の分岐点、録音データを外部に送るときの情報漏洩リスクと個人情報保護法上の扱いまで踏み込みました。

## まとめ：文字起こしアプリの選び方と用途別おすすめの結論

先に結論から。文字起こしアプリは「無料で十分な個人メモ」「議事録の会議」「長尺インタビュー」「動画字幕」で選ぶべきものが変わります。個人メモならGoogleドキュメントの音声入力、話者を分けたい会議ならNottaやLINE WORKS AiNote、動画ならVrewが向きます。まず自分の用途を一つ決め、そこに要る機能だけで絞り込むのが遠回りのない選び方です。なお、長く「無料の定番」として挙げられてきたCLOVA Noteβは[2025年7月31日でサービスを終了](https://clovanote.line.me/)し、正式版のLINE WORKS AiNoteへ引き継がれました。古い比較記事のまま名前で探すと行き先がありません。

判断の軸は四つに集約できます。日本語の変換精度、iPhoneやAndroidなど対応端末、AI要約や話者分離といった付加機能、そして録音データの保管先です。無料枠は月あたりの変換時間で上限が切られており、Nottaのフリーは月120分・1回3分まで、LINE WORKS AiNoteのフリーは月300分（いずれも2026年9月時点）。業務で長時間を回すと、この上限のほうが先に来ます。専門用語が多い、機密性が高い、基幹システムへつなぎたい、このいずれかに当てはまるなら、市販アプリの外側、Whisper系モデルの自前構築や受託開発の領域です。本文では、この切り分けを条件付きで示します。

## 主要な文字起こしアプリの無料枠と月額料金を実額で並べた比較表

「おすすめ」を探す段階でいちばん効くのは、機能一覧より無料枠の実数です。どのアプリも「無料で使える」と書いてありますが、月あたり何分まで回せるかで実用範囲が決まります。各社の公式料金ページで確認した数字を並べます（2026年9月時点・改定されるため契約前に公式で再確認してください）。

| アプリ・API           | 無料枠          | 有料の目安           | 話者分離     |
| ----------------- | ------------ | --------------- | -------- |
| Notta             | 月120分・1回3分まで | 月1,185円で月1,800分 | あり       |
| LINE WORKS AiNote | フリーで月300分    | 月19,800円で月100時間 | あり       |
| Googleドキュメント音声入力  | 時間の上限なし      | 有料プランなし         | なし       |
| OpenAI 音声API      | なし（従量課金）     | 1ファイル25MBまで     | 専用モデルで対応 |

表の出所は、[Nottaの料金プランページ](https://www.notta.ai/pricing)、[LINE WORKS AiNoteの公式サイト](https://line-works.com/ainote/)、[Googleドキュメントの音声入力ヘルプ](https://support.google.com/docs/answer/4492226)、そして[OpenAIの音声書き起こしガイド](https://developers.openai.com/api/docs/guides/speech-to-text)です。同じ「無料」でも中身の差は大きく、月120分と月300分では回せる会議の本数が二倍以上違ってきます。

### 無料プランで使える月あたりの時間と1回あたりの上限を実数で見る

見落としやすいのが「1回あたりの上限」です。Nottaのフリープランは月120分の残高があっても、1回の文字起こしは3分までに制限されます。30分の打ち合わせを丸ごと投げても途中で切れる、という設計。対してLINE WORKS AiNoteのフリーは月300分で、1時間の会議なら月に五回ほど。どちらも「試して精度を確かめる」には足りますが、定例会議を毎週回す用途では月内に枯れます。無料で業務を回すつもりなら、月の会議時間を先に足し算してから枠を選んでください。

Googleドキュメントの音声入力は変換時間の上限がない代わりに、制約が別のところにあります。公式ヘルプによれば動作するのはChrome・Edge・Safariの最新版で、マイクをオンにしたブラウザを開き続ける必要があり、音声コマンドはアカウントとドキュメントの言語が英語のときだけ有効。録音ファイルの読み込みには対応せず、その場で話した音を拾う方式に限られます。無料で無制限に見えても、録り溜めた音源の一括変換には使えないわけです。

### 有料プランへ切り替える損益分岐点を清書工数の時間単価から逆算

有料化を迷ったら、料金ではなく清書の工数で判断すると答えが出ます。1時間の会議を無料アプリで文字化し、話者が混ざった原稿を手で整えると、実務では30分から1時間の手直しが乗ります。時間単価3,000円の担当者が月四回やれば6,000円から12,000円ぶんの工数。話者分離とAI要約が入るだけでこの手直しは大きく減るため、月1,000円台のプランなら一回の会議で元が取れる計算です。

逆に、月に一度しか録らない、清書は自分の下書き用でよい、という使い方なら無料枠で十分。損益分岐点は「月の会議本数×清書時間×時間単価」と「プラン料金」の比較で出せます。法人でチーム全員に配る段階の比較軸は[議事録AIのおすすめは？法人向けの比較軸と選び方・内製との分岐点【2026年版】](https://www.issoh.co.jp/column/details/16419/)に、無料版と有料版の線引きは[議事録AIの無料と有料の違いは？無料版の限界と有料化の判断ライン【2026年版】](https://www.issoh.co.jp/column/details/16012/)にまとめてあります。

## 文字起こしアプリとは何か、音声認識AIが音声を文字に変換する仕組み

文字起こしアプリは、マイクや録音ファイルの音声を受け取り、音声認識AIで文字列に変換するソフトウェアです。仕組みを一段だけ理解しておくと、なぜアプリごとに精度が違うのかが見えてきます。音声認識そのものの原理と精度の考え方は[音声認識とは？AIの仕組み・精度の考え方・業務導入の判断基準を解説](https://www.issoh.co.jp/column/details/12929/)で掘り下げました。

### 音声認識AIが音の波形を言語モデルで文字列へ変換する処理の流れ

処理は大きく二段です。まず音の波形を解析し、どの音がどの発音に当たるかを推定します。次に言語モデルが「日本語として自然な並び」を選び、同音異義語や文脈を補って文字列へ整えるのがこの段の仕事。この後段の質が、固有名詞や専門用語の変換精度を分けます。今のアプリの多くはWhisperに代表される深層学習モデルか各社独自の音声認識エンジンを土台にしており、同じ音声でも結果が変わるのはこの推定の中身が違うためです。

### リアルタイム変換と録音ファイルの一括変換で異なる精度と使い勝手

入力の与え方で二つの方式に分かれます。リアルタイム変換は話しながら画面に文字が出る方式で、会議中のメモや音声入力に向く一方、言い直しや被り発話には弱いのが弱点。録音ファイルの一括変換は前後の文脈を使えるぶん精度を出しやすく、インタビューや長尺の書き起こしに向きます。急ぎで概要をつかむならリアルタイム、正確さを取るなら録音してから一括、と使い分けるのが実務的でしょう。

## 文字起こしアプリの選び方、精度・対応端末・用途で見る五つの軸

アプリ選びで迷う原因は、比較軸を決めずに機能一覧を眺めることにあります。次の軸を先に決めると、候補は自然に数個へ絞れます。

### 日本語の変換精度と、専門用語や固有名詞への対応力で比べる観点

最初に見るのは日本語の変換精度です。話し言葉では、はっきりした発話でも一定の誤変換が残り、業界用語・製品名・人名でその割合が上がります。判断材料になるのは、専門用語の辞書登録ができるか、変換後の修正がしやすい編集画面を持つか、の二点。医療や法律、製造の現場語のように語彙が偏る用途では、汎用アプリの初期状態だと固有名詞がほぼ通らないこともあります。無料枠で自分の実データを短く試してから決めると外しません。

### iPhone・Android・PCの対応端末と、録音方法の違いで選ぶ

使う端末によって候補が分かれる点に注意してください。iPhone専用アプリ、Android対応アプリ、ブラウザで動くPC向けサービスがあり、スマホの内蔵マイク録音か、会議システムの音声を直接取り込む方式かでも使い勝手が異なる点は選定条件です。オンライン会議を丸ごと文字化したいなら、ZoomやGoogle Meetと連携できるサービスだと手間が減ります。会議ツール側に内蔵された機能で足りる場合もあるため、[会議ツール別のAI議事録｜Zoom・Teams・Meet・Notionのプランと使い分け](https://www.issoh.co.jp/column/details/16624/)で自社の環境を先に確認すると、アプリを増やさずに済むことがあります。手元のスマホで対面の打ち合わせを録るだけなら、端末標準の録音と無料アプリの組み合わせで足りるはずです。

### AI要約・話者分離・多言語対応など付加機能で決まる作業の効率

変換後の作業を左右するのが付加機能です。実務で効くのは、発言者ごとに区切る話者分離、要点を短くまとめるAI要約、英語などを含む多言語対応の三つ。議事録なら前の二つがあるだけで清書の時間が目に見えて減り、逆に個人メモに要約は要りません。自分の後工程で実際に使うものだけを条件にすると、料金の割に使わない機能を抱え込まずに済みます。話者分離は実装の負荷が高く、OpenAIの音声APIでも通常の書き起こしモデルとは別に話者識別向けのモデルが用意されているほど。無料枠で提供されないことが多いのは、この処理コストの差が理由です。

## 用途別に見るおすすめ文字起こしアプリ、議事録から動画字幕まで

ここからは用途別に、どの系統のアプリが向くかを整理します。特定の一本を1位と断じるより、用途に対する適性で選ぶほうが失敗しません。料金・無料枠は2026年9月時点でも改定されるため、契約前に各公式で確認してください。

### 会議や議事録の作成に話者分離とAI要約を備えたアプリの選び方

会議用途では、NottaやLINE WORKS AiNote、議事録に特化したスマート書記系が候補です。話者分離で発言者を分け、AI要約で決定事項とToDoを抜き出せると、そのまま共有できる議事録に近づきます。仕組みと法人での選び方は[AI議事録・自動文字起こしとは？仕組み・精度・法人での選び方【2026年版】](https://www.issoh.co.jp/column/details/15434/)で解説しました。手持ちの生成AIで代替できる場面もあり、ChatGPTの録音機能を使う流れは[ChatGPTで録音・議事録作成する方法｜レコードモードの対応プラン・4時間上限と音声ファイル文字起こしの代替](https://www.issoh.co.jp/tech/details/10624/)、Google Meetの自動メモを使う手順は[Geminiで議事録を作る方法｜Meet自動メモ生成とAI Studioの手順・音声の上限と機密の線引き](https://www.issoh.co.jp/column/details/2261/)で扱っています。

### インタビューや長時間の録音の書き起こしに向いた高精度なツール

取材や研究インタビューのように正確さが要る用途では、録音ファイルを一括変換できる高精度なサービスが向きます。NottaやRimo Voice、日本語に特化したAmiVoiceなどが、長尺音声と修正編集を前提に作られています。コツは、リアルタイムに頼らず静かな環境で録った音源をまとめて変換すること。無料枠では1回3分といった上限に真っ先にぶつかるため、長尺を回すなら有料版を前提に見積もると現実的でしょう。

### 個人メモやスマホの録音を無料で文字化する定番アプリの実力と限界

思いついたことを口述メモにする、短い打ち合わせを記録する。この範囲なら無料で十分に回ります。GoogleドキュメントやGboardの音声入力はリアルタイム変換が無料で使え、iPhoneならSpeechyのような手軽なアプリも。かつて無料の代表格だったCLOVA Noteβは終了したため、後継のLINE WORKS AiNoteのフリープラン（月300分）が現在の受け皿です。限界が出るのは、長時間の連続録音や高い正確さを求めた瞬間。数分のメモでは気にならない誤変換も、一時間の会議では修正量が無視できなくなります。

### 動画字幕やYouTube向けに編集と文字起こしを兼ねるツール

動画の字幕付けが目的なら、文字起こしと動画編集を一体で扱えるVrewのようなツールが手数を減らします。音声を自動で字幕化し、不要な間や言い間違いをテキスト側から削れるため、テロップ入れと編集を別々に進める必要がありません。純粋な議事録用途とは求める機能が違うので、字幕を作るのか記録を残すのかで選ぶツールを分けてください。

## 無料で使える文字起こしアプリの実力と、無料枠でつまずく典型場面

無料アプリはどこまで戦えるのか。実力と限界の線引きを、費用をかける前に把握しておきましょう。

### 無料の文字起こしアプリで十分に足りる利用シーンと精度を保つ条件

無料アプリが向くのは、短時間・低機密・清書前提の三条件がそろう場面です。数分の音声メモ、社内の短い打ち合わせ、あとで自分が手直しする下書き用途なら、無料の範囲で足ります。精度を左右するのは、むしろ環境側。マイクを口に近づける、雑音の少ない部屋で録る、複数人が同時に話さない。この三つを守るだけで誤変換は目に見えて減り、無料でどこまで実用になるかはアプリの性能より録音環境で決まる部分が大きいのが実情です。

### 無料枠の時間制限や機能制限、精度の面でつまずきやすい典型場面

無料枠は月あたりの変換時間や1ファイルの長さに上限があり、話者分離やAI要約、エクスポート形式が有料限定のことも珍しくありません。長時間のインタビューを投げたら1回3分の上限で切れる、話者を分けられず誰の発言か追えない、書き出しがコピー&ペーストしかできず後工程で詰まる。こうしたつまずきは、無料で業務を回そうとした途端に現れるのが実情です。APIを直に叩く場合も上限は同じように存在し、OpenAIの音声書き起こしはmp3・mp4・m4a・wav・webmなどに対応する一方、1ファイル25MBまでという制限が公式ドキュメントに明記されています。1時間の会議音声はこの容量を超えることが多く、分割や圧縮の一手間が要ります。個人利用と業務利用の境目でつまずいたら、費用対効果で有料版へ切り替える判断でしょう。

## 市販アプリで足りる場面と、受託開発で自社実装すべき業務の分岐点

市販の文字起こしアプリは、汎用的な会議や個人利用の範囲でよくできています。ただ、そこには越えられない線があるのも事実です。どこからが自社実装の領域かを、条件で示します。

### 市販アプリで完結できる業務と、独自要件が絡んで限界が来る境目

市販アプリで完結するのは、汎用語彙・一般的な精度・手動での清書を許容できる業務です。逆に限界が来るのは、次のいずれかを求めた瞬間。基幹システムやCRMへ変換結果を自動で流し込みたい、大量の音声をバッチで処理して定型フォーマットに整えたい、業界特有の語彙を辞書として作り込みたい。こうした要件は既製アプリの設定画面では届かず、乗り換えを続けるより仕組みを一度作るほうが長期の運用コストで安く収まる分岐点があります。

### 基幹システムとの連携や機密音声の処理で受託開発を検討する条件

受託開発を検討すべき条件は、はっきりしています。第一に、外部クラウドに音声を送れない機密性の高い会議や顧客データを扱う場合。第二に、既存の業務システムへ文字起こし結果をAPIで自動連携したい場合。第三に、月間の処理量が大きく、アプリの従量課金では割に合わなくなった場合です。当社では、こうした要件に対して[議事録に対応したAI音声認識システムの開発](https://www.issoh.co.jp/service/ai/speech%5Frec/)を受託し、社内環境で完結する仕組みや基幹連携までを設計しています。市販アプリで運用しながら、上の三条件のどれかに当たったタイミングが、内製・受託の検討時期です。

### Whisper系モデルの自前構築とAPI組込みで精度を作り込む選択

自社実装の中核になるのが、OpenAIのWhisperに代表される音声認識モデルの自前構築です。オープンソースのモデルを自社サーバーやクラウドの管理下で動かせば、音声を外部サービスへ渡さずに処理でき、専門用語の辞書や後処理を業務に合わせて作り込めます。[公式リポジトリ](https://github.com/openai/whisper)が公開しているモデル表では、多言語版のlargeが約1,550Mパラメータで必要VRAM約10GB、軽量なturboが約809Mで約6GB・largeの約8倍の速度とされています（2026年9月時点）。日本語の会議音声なら、まずturboで速度と精度の当たりを見てから上位モデルへ上げる進め方が扱いやすいはずです。

### Whisperをローカルで動かしAPIへ切り替える手順とコード例

自前構築の入口は驚くほど短い手数です。Python環境にパッケージを入れ、音声ファイルとモデル名を渡すだけでテキストが出ます。

```
pip install -U openai-whisper
whisper kaigi.m4a --model turbo --language Japanese --output_format txt
```

この二行で、手元のマシンだけで完結する文字起こしが動きます。外部へ音声を出さないため、機密の会議音声を試す一次評価にも使えます。GPUを持たない端末では実時間より遅くなるので、まずは5分ほどの音源で速度を測ってから本番の長さを決めてください。実装の詰めどころは[WhisperをPyTorchで動かす音声認識実装ガイド｜openai-whisper・faster-whisper・Transformers](https://www.issoh.co.jp/tech/details/1541/)に整理しています。

自社サーバーを持たず、精度と運用のしやすさを取るならクラウドAPIへ切り替えます。OpenAIの音声書き起こしなら、リクエストは次の形。話者を分けたいときは、話者識別に対応したモデル名を指定します。

```
curl -X POST https://api.openai.com/v1/audio/transcriptions \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -F file=@kaigi.mp3 \
  -F model=gpt-4o-transcribe-diarize
```

公式ガイドでは汎用の書き起こしモデル、話者識別向けモデル、タイムスタンプや字幕・翻訳に対応するwhisper-1が使い分けとして示されています。字幕ファイルを作るのか、発言者を分けたいのかで指定を変える設計です。主要サービスの料金と日本語対応の横比較は[文字起こしAPIの比較と選び方｜主要7サービスの料金・日本語対応・使い方【2026年最新】](https://www.issoh.co.jp/tech/details/2981/)にまとめました。既製アプリでは触れない部分に手を入れられるのが、API組込みと自前構築の値打ちです。

## 文字起こしの音声データを外部に送る前に確認したい情報漏洩リスク

便利さの裏で見落とされやすいのが、音声データの扱いです。会議の中身は、そのまま社外秘であることが少なくありません。

### 録音した音声がクラウドへ送信され学習に使われる可能性の確認点

クラウド型の文字起こしアプリは、録音した音声を事業者のサーバーへ送って処理します。ここで確かめるのは、送った音声や変換結果がモデルの学習に使われないか、使われる場合にオプトアウトできるか、の二点。利用規約やプライバシーポリシーに、学習利用の有無と保存期間が書かれています。無料アプリほどデータ利用の条件が緩いことがあり、気づかないまま社外秘の会議を外部へ渡していた、という事態は避けたいところ。

### 社外秘の会議で確認すべき利用規約とデータ保管先のチェック項目

機密性の高い会議では、次のチェックを通してから使うかを決めます。

- 音声・テキストの保管先が国内か国外か、削除の可否と期間
- 学習利用の有無と、オプトアウトの手段があるか
- 通信と保存が暗号化されているか、アクセス権限の管理
- 取引先や個人情報を含む場合、社内規程やNDAに反しないか

この四点のどれかで引っかかるなら、外部送信のないオンプレミス型の仕組みへ切り替える判断になります。守るべき情報の重さと、アプリの手軽さを天秤にかけて選んでください。

### 個人情報保護法で見る委託先の監督と外国にある第三者への提供の線引き

チェック項目の法的な裏づけは、個人情報保護委員会の[個人情報の保護に関する法律についてのガイドライン（通則編）](https://www.ppc.go.jp/personalinfo/legal/guidelines%5Ftsusoku/)にあります。同ガイドラインは3-4-4で委託先の監督（法第25条関係）、3-6-4で外国にある第三者への提供の制限（法第28条関係）を定めており、平成28年11月の制定以降も改正が重ねられています（令和8年6月一部改正・2026年9月時点）。

実務への当てはめはこうです。氏名や取引先情報を含む会議音声を外部サービスへ渡す行為は、個人データの取扱いの委託にあたり得るため、委託先の選定と監督が自社の責任として残ります。さらに保管先サーバーが国外にある場合、法第28条の枠組みで本人への情報提供などの追加対応が必要になることも。「アプリの規約を読んだ」で終わらせず、保管国と委託の位置づけまで確認しておくと、後から止まらずに済みます。

## よくある質問

文字起こしアプリの選定でよく挙がる疑問に、実務の観点から簡潔に答えます。

### 文字起こしアプリの精度はどのくらい信頼できますか？

はっきりした発話で静かな環境なら、下書きとして十分に使える水準まで来ています。ただし専門用語・固有名詞・複数人の同時発話には弱く、そのまま完成原稿にはなりません。口元でマイクを取る、雑音を避ける、話者を重ねないという三点を守ると誤変換が減ります。清書は人の手が前提と考えておくと、期待値を外しません。

### 無料の文字起こしアプリだけで議事録は作れますか？

短時間で低機密の会議なら、無料アプリと手直しの組み合わせで作れます。ただしNottaのフリーは1回3分まで、LINE WORKS AiNoteのフリーは月300分までと上限があり、長時間の会議では枠が先に尽きます。清書の手間を金額換算すると有料版のほうが結果的に安く済むことが多いはず。まず無料で試し、手間が見合わなくなったら切り替える流れが現実的でしょう。

### AndroidとiPhoneで使える文字起こしアプリは違いますか？

iPhone専用のアプリがある一方、多くの主要サービスはAndroid・iPhone・PCのいずれにも対応し、ブラウザで動くサービスなら端末を選びません。ただしGoogleドキュメントの音声入力は公式ヘルプでChrome・Edge・Safariの最新版が条件とされ、音声コマンドは言語設定が英語のときだけ動きます。自分の使う端末と、どこの音を拾うかを先に決めれば候補が絞れます。

### 録音済みの音声ファイルもアプリで文字起こしできますか？

多くのアプリが録音ファイルの読み込みに対応し、MP3やWAV、M4Aといった形式をアップロードして一括変換できます。前後の文脈を使えるぶん、リアルタイム変換より精度を出しやすいのが利点。APIを使う場合も対応形式はmp3・mp4・mpeg・mpga・m4a・wav・webmで、OpenAIの公式ドキュメントでは1ファイル25MBまでと上限が示されています。無料枠では1ファイルの長さや月間の変換時間にも上限があるため、長尺を扱うなら形式と容量を先に確認してください。

### 機密性の高い会議の文字起こしはどう進めるべきですか？

まず、使おうとするアプリの規約で学習利用の有無とデータ保管先を確認します。社外秘や個人情報を含むなら、外部送信のあるクラウド型は避け、社内環境で完結する仕組みが安全です。個人データの取扱いを外部へ委ねる形になるため、委託先の監督や国外保管の扱いも併せて整理しておきましょう。処理量が多い、基幹システムへつなぎたいという要件が重なるなら、Whisper系モデルの自前構築や受託開発でオンプレミス型を用意する選択が向きます。

## 関連記事

- [AI議事録・自動文字起こしとは？仕組み・精度・法人での選び方【2026年版】](https://www.issoh.co.jp/column/details/15434/)：議事録づくり全体の仕組みを扱う上位記事。業務の流れから選びたい場合の土台。
- [音声認識とは？AIの仕組み・精度の考え方・業務導入の判断基準を解説](https://www.issoh.co.jp/column/details/12929/)：音声認識の原理と精度の見方。アプリごとの精度差の理由がつかめます。
- [文字起こしAPIの比較と選び方｜主要7サービスの料金・日本語対応・使い方【2026年最新】](https://www.issoh.co.jp/tech/details/2981/)：APIを組み込む場合の横比較。料金と日本語対応で候補を絞れます。
- [WhisperをPyTorchで動かす音声認識実装ガイド｜openai-whisper・faster-whisper・Transformers](https://www.issoh.co.jp/tech/details/1541/)：自前構築の実装手引き。オンプレミスで精度を作り込む場合の入口。
- [ChatGPTで録音・議事録作成する方法｜レコードモードの対応プラン・4時間上限と音声ファイル文字起こしの代替](https://www.issoh.co.jp/tech/details/10624/)：手持ちの生成AIで議事録を作る流れ。専用アプリを増やす前の代替案。

---

出典: [文字起こしアプリのおすすめは？無料・有料の選び方と用途別の使い分け](<https://www.issoh.co.jp/column/details/13306/>)（株式会社一創）
