音声文字起こし(AI) 無料ツール

録音・音声ファイルをAIが自動でテキストに変換。軽量/高精度モードを選択可能。すべての処理はブラウザ内で完結します。

AIモデルを選択

認識言語

音声ファイルをここにドロップ

またはクリックして選択(MP3 / WAV / M4A / AAC / WebM / OGG / FLAC)

音声文字起こしとは

音声文字起こしツールは、Whisperモデルをブラウザ内で動作させ、音声ファイルをテキストに変換します。軽量モード(whisper-small)と高精度モード(kotoba-whisper v2.2 q4f16・whisper large-v3の日本語蒸留版)の2種類から用途に合わせて選択可能。FreeToolの音声文字起こしはすべての処理がブラウザ内で完結するため、機密性の高い会議録音や個人情報を含む音声も安心してご利用いただけます。

なぜブラウザ完結が安全なのか

一般的な文字起こしサービスは音声をクラウドサーバーにアップロードして処理します。FreeToolは音声ファイルをサーバーに送信せず、AIモデルをあなたのデバイスで直接実行します。会議の内密な内容や個人情報が外部に漏れる心配がありません。

他のツールとの違い

AudiopenやOtterなどのサービスはサーバーへのアップロードが必須で、有料プランが必要な場合もあります。FreeToolは登録不要・完全無料で、音声データを外部に送信せずに文字起こしを実行できます。

対応形式と処理時間の目安

MP3・WAV・M4A・WebM・OGG・FLAC・AACの音声ファイルに対応しています。動画ファイル(MP4など)はそのままでは読み込めないため、「動画→MP3」ツールで音声を抽出してからご利用ください。処理時間はファイルの長さだけでなく、お使いの端末の性能(WebGPU対応の有無・CPU性能)に大きく依存します。長い音声は30秒ごとのチャンクに分割して順番に処理される仕組みです。

「文字起こしさん」など無料文字起こしサービスとの違い

多くの無料文字起こしサービスには、無料で使える時間や回数に制限があり、それを超えると有料プランへの案内が表示されることがあります。FreeToolの音声文字起こしはWhisperモデルをブラウザ内で実行する仕組みのため、サーバー側の処理時間や利用回数による制限を設けていません。音声ファイルもサーバーにアップロードされないため、会員登録やクレジットカード登録も不要です。

ファイル形式別の文字起こし

ICレコーダーやボイスレコーダーの録音で最も一般的なMP3ファイルについては、専用のMP3文字起こしページでビットレートと精度の関係・レコーダー別の使い方をまとめています。MP4などの動画ファイルは、先に動画→MP3変換で音声を抽出してから読み込ませてください。

業種・職種別の活用シーン

会議・打ち合わせの議事録作成

社内会議やオンライン商談の録音をAIが自動でテキスト化。録音後すぐにブラウザへドロップするだけで議事録の下書きが完成し、手動での書き起こし時間を大幅に削減できます。音声データがサーバーに送信されないため、社外秘の打ち合わせ録音も安心して処理できます。会議参加者への議事録配布もスピーディに行えます。

メディア・ライターの取材音声テキスト化

インタビュー音声をテキスト化して記事執筆に活用。1時間のインタビューも高精度モード(kotoba-whisper v2.2)なら従来モデル比 約2倍速でテキスト化でき、その後の編集・校正作業を大幅に効率化します。取材先のプライバシー保護にもブラウザ完結処理が有効で、音声データが第三者のサーバーに残ることはありません。

医療・介護現場での記録業務

診療録音やケアプラン説明の録音をテキスト化して記録作業の負担を軽減。医療専門用語も高精度モードなら認識率が高く、転記ミスを減らせます。患者の個人情報を含む音声のため、サーバー非送信のブラウザ完結型処理は病院・クリニックの個人情報保護方針に合致します。

教育・研修コンテンツの制作

セミナー・社内研修の録音をテキスト化して資料化。オンライン講義の教材テキスト化、マニュアル化、eラーニング教材の台本作成に活用できます。大学・ビジネススクール・企業研修部門でのコンテンツ制作効率化に貢献し、録音1本から複数のコンテンツ素材を生み出せます。

ポッドキャスト・動画のトランスクリプト作成

ポッドキャストや動画のトランスクリプト(全文テキスト)を作成。SEO効果のあるテキストコンテンツとしてブログや動画の概要欄に掲載することで、コンテンツの価値と検索流入を高められます。出力はタイムスタンプなしのプレーンテキストのため、SRT等の字幕ファイルとして使うには別途タイミング付けが必要です。

こんな場面で使えます

  • 会議・打ち合わせの録音を議事録テキストに変換
  • インタビュー音声をテキスト化して記事執筆に活用
  • オンライン講義・セミナーの内容をテキストで保存
  • ボイスメモの内容をすばやくテキスト化
  • 医療・法務の専門的な音声を高精度でテキスト化
  • 外国語の音声を文字起こしして翻訳に活用
音声文字起こし の画面例 — 音声ファイルをAIで自動文字起こし(無料・ブラウザ完結)
音声文字起こし の画面例 — 音声ファイルをAIで自動文字起こし(無料・ブラウザ完結)

使い方

1

音声ファイルをアップロード

2

モデルと言語を選択

3

テキストをコピー

トラブルシューティング

モデルのダウンロードが完了しない・途中で止まる

安定した回線でページを再読み込みしてください。高精度モードは約530MBあるため、低速回線では時間がかかる場合があります。ダウンロード中はブラウザタブを閉じないでください。ダウンロード完了後はキャッシュされるため2回目以降は即座に起動します。

文字起こしの精度が低い・聞き取れない部分が多い

軽量モード使用中は高精度モード(kotoba-whisper v2.2・日本語特化)に切り替えてください。録音環境のノイズが多い場合は、ノイズリダクション処理後の音声で試すとさらに改善します。マイクと話者の距離を近くして録音すると認識率が向上します。

長い音声ファイルの処理が途中で止まる

1時間以上の長時間音声は30秒チャンクで処理しますが、デバイスのメモリが不足すると止まることがあります。不要なタブを閉じるか、長い音声を30〜60分ごとに分割してから処理してください。

高精度モードで「WebGPUが利用できません」と警告が出る・処理が非常に遅い

Chrome 113以降またはEdge 113以降でWebGPUが利用可能です。アドレスバーに chrome://flags と入力してWebGPUを有効化するか、軽量モード(whisper-small)をご利用ください。

日本語の固有名詞・専門用語が誤認識される

文字起こし後のテキストを手動で修正してください。高精度モードでも固有名詞・業界専門用語の認識には限界があります。音声品質を上げること(雑音を減らし、明瞭に発音した録音)が認識率改善に最も効果的です。

機能比較:FreeTool 音声文字起こし vs Otter.ai

機能FreeToolOtter.ai
完全無料○ 無制限△ 月600分まで無料
登録不要○ 不要× 登録必須
サーバー送信なし(ブラウザ完結)あり(クラウド処理)
オフライン動作○(初回ロード後)×
日本語対応○(whisper)△ 精度が低い
高精度モードkotoba-whisper対応(日本語特化)独自モデル

関連ガイド

関連ツール

よくある質問

軽量モードと高精度モードの違いは何ですか?
軽量モード(whisper-small)は約90MBのモデルで、WebGPUなしでも高速に動作します。会議・インタビューなど一般的な日本語会話に適しています。高精度モード(kotoba-whisper v2.2)は約530MBで、whisper large-v3の日本語蒸留版のため日本語専門用語・医療・法務など高い精度が求められる場面に最適です(多言語混在の音声は軽量モードをご利用ください)。
初回に大きなデータをダウンロードする必要があるのはなぜですか?
AIの文字起こしはAIモデルをあなたのブラウザ内で実行するため、最初にモデルデータをダウンロードします。軽量モードは約90MB、高精度モードは約530MBです。ダウンロードしたモデルはブラウザにキャッシュされるため、2回目以降は即座に起動します。
対応している音声・動画形式は何ですか?
MP3・WAV・M4A・AAC・WebM・OGG・FLACなど主要な音声形式に対応しています。お使いのブラウザが対応している形式であれば処理できます。
長い音声ファイルも処理できますか?
長い音声は30秒ごとのチャンクに分割して処理します。1時間以上の音声も処理できますが、ファイルが長いほど時間がかかります。デバイスのメモリが十分であることをご確認ください。
音声ファイルはサーバーに送信されますか?
いいえ。AIモデルをブラウザ内で動作させるため、音声ファイルがサーバーに送信されることは一切ありません。会議録音・個人情報を含む音声も安心してご利用いただけます。
高精度モードにWebGPUが必要な理由は何ですか?
kotoba-whisper v2.2は従来モデル(whisper-large-v3-turbo)比で約2倍速ですが、それでも大規模なAIモデルのため、CPU(WASM)だけでは処理に時間がかかる場合があります。WebGPU(GPU加速)を使うことで数分〜数十秒に短縮できます。Chrome 113以降・Edge 113以降でWebGPUに対応しています。
音声ファイルを無料でテキストに変換できますか?
はい、FreeToolの音声文字起こしツールなら無料でテキスト化できます。MP3・WAV・M4Aなどの音声ファイルをドラッグ&ドロップするだけで、AIモデルがブラウザ内で自動的に文字起こしします。会員登録も不要で、回数制限もありません。
iPhoneのボイスメモの文字起こしが途中で止まってしまいます。FreeToolなら解決しますか?
多くの文字起こしアプリは、サーバー側の処理時間制限や無料プランの文字数上限によって長い録音が途中で止まることがあります。FreeToolはWhisperモデルをブラウザ内で実行し、音声を30秒ごとのチャンクに分割して順番に処理するため、サーバー側の制限を受けません。1時間を超えるボイスメモも最後まで処理できます(デバイスのメモリが十分にあることが前提です)。
長時間の音声でも無料でブラウザだけで文字起こしできますか?
はい。FreeToolは時間による課金や利用制限がなく、1時間を超える長時間の会議録音やインタビュー音声も無料でブラウザ完結で文字起こしできます。長い音声は30秒単位のチャンクに分割して順番に処理されます(デバイスのメモリが十分にあることが前提です)。