文字起こしの間違いの多くは、ソフトではなく音声から始まります。効果が大きいのは次の4つです。マイクを話す人の近くに置く、周りの音を減らす、一度に1人だけが話す、言語の設定を正しくする。そのうえで、一定の速さで文単位で話し、名前と数字をはっきり言い、使う前に一度読み直します。日本語ではさらに、読みが同じ別の言葉への誤変換に気をつけます。AI の書き直しで句読点やつなぎの言葉は整えられますが、聞き間違えた言葉や取り違えた漢字を正しく直せるとは限りません。
| 文字起こしの問題 | よくある原因 | 変えること |
|---|---|---|
| 言葉が抜ける、崩れる | マイクが遠い、周りがうるさい | スマホを近づける、静かな場所に移る |
| 文全体がおかしい | 言語の設定違い、2つの言語が混ざっている | 話す言語を設定する。1回の録音は1つの言語で |
| 同じ読みの別の言葉になる | 同音異義語(以上と異常など) | 単語ではなく文で話す。確認の段階で直す |
| 人名や社内の用語が違う | 珍しい言葉を想定していない | はっきり言う、一度説明する、あとで直す |
| 2人の声が混ざる | 話が重なっている | 交互に話す。答える前に一呼吸おく |
| 何も出てこない | 無音か、音がとても小さい | 入力の音量を確認し、短い音声で試す |
マイクと部屋
Google は、自社の音声認識サービス Cloud Speech-to-Text のベストプラクティスで、「特に背景に雑音がある場合は、マイクをできるだけ話す人の近くに置く」ようすすめています。実際には次のようにします。
- 音声入力では、スマホを口の近くに持ちます。 電話をするときくらいの距離が目安です。マイクの穴を指やケースでふさがないようにします。
- 静かな部屋を選びます。 音楽、テレビ、換気扇、エアコンの風の音を止めます。家具やカーテンのある小さな部屋は、キッチンや階段よりも響きにくくなります。
- 風を避けます。 屋外では風に背を向けるか、ヘッドセットのマイクを使います。
- 大声を出しません。 Google は音割れ(クリッピング)を避けるようにとも書いています。マイクの近くで普段より大きな声を出すと、音がひずみます。
- 会議はテーブルの真ん中で録音します。 端に置くと、遠い人の声が小さくなります。
話し方
- 文単位で、一定の速さで。 ゆっくり話す必要はありませんが、考えの区切りで短く間をおくと、途切れ途切れに話すよりきれいに文字になります。
- 1回の録音は1つの言語で。 日本語と英語を文の途中で切り替えると、多くのシステムが混乱します。英語を引用するなら短くします。
- 名前と数字ははっきり。 珍しい名前は一度ゆっくり言うか、漢字を説明します(「わたなべ、なべは難しいほうの邊です」)。数字は「じゅうご」と「ごじゅう」、「いちまん」と「いちおく」のように聞き違えやすいので、はっきり区切って言います。
- 交互に話します。 2人が同時に話すと、たいてい両方とも崩れます。
- 録音開始の直後と終了の直前に一呼吸おきます。 最初と最後の言葉が切れるのを防げます。
日本語ならではの誤変換への対策
日本語の音声認識では、音が正しく聞き取れていても、表記の選び方で間違いが起きます。
- 同音異義語。 「以上」と「異常」、「保証」と「保障」と「補償」、「対象」と「対照」と「対称」、「意外」と「以外」。単語だけを話すより、「品質を保証する」のように文で話すほうが、前後の言葉から正しい表記が選ばれやすくなります。
- 人名と地名。 同じ読みでも漢字が何通りもあります(「さいとう」なら斉藤、斎藤、齋藤など)。文字起こしのあとで必ず確認します。
- 数字の表記。 「10月3日」「十月三日」、「1万円」「10000円」など、表記がまちまちになることがあります。社内のルールがあれば、最後にそろえます。
- カタカナ語と英語。 製品名や専門用語は、カタカナになったり英字になったりします。大事な用語は確認の段階でそろえます。
大事な設定
- 話す言語を設定します。 Gboard の音声入力、WhatsApp の文字起こし、スマートフォンの録音アプリには、それぞれ言語の設定があります。設定が違うと結果は崩れます。WhatsApp の設定は WhatsApp の文字起こしは日本語に対応している?で説明しています。
- 名前や用語を登録します。 ツールに単語やフレーズの登録機能があれば使います。Google のドキュメントも、名前や用語を語彙に加えるためにヒントを使うことをすすめています。
- 元のファイルを使います。 録音し直したり、再圧縮したりするたびに情報が失われます。スピーカーで流した音を録り直すのではなく、録音アプリが作ったファイルをそのまま文字起こしします。Google は自社のサービスについて、可逆圧縮の形式(FLAC や LINEAR16)と 16,000 Hz のサンプリングレートをすすめています。
- あとからノイズ除去をかけません。 Google は自社のサービスについて、自動ゲイン調整やノイズ除去を使わないようにすすめ、認識エンジンは余計なノイズキャンセルなしで背景の声や雑音を無視するように作られていると書いています。
聞き取りにくい録音の場合
すでに録音があって、聞き取りにくいときは次のようにします。
- 一度ファイル全体を文字起こしして、どこが崩れたかを見ます。
- 崩れた部分をゆっくり再生し、ヘッドホンで聞きながら自分で書きます。
- 聞き取れない部分は[聞き取れず]と書き、推測で埋めません。引用や議事録で推測した言葉は、空欄より悪い結果になります。
- 遠すぎる声には期待しすぎないことです。 人の耳でやっと聞こえる声は、ソフトでも確実には拾えません。
精度を自分で測る方法
音声認識の精度は、英語では単語誤り率(WER)で表すのが一般的です。WER =(S + D + I)÷ N で、S は置き換わった単語の数、D は抜けた単語の数、I は余分に入った単語の数、N は正しい原稿の単語数です。低いほど正確です。
日本語は単語の間にスペースがないので、自宅で試すときは文字単位で数えるのが簡単です。5分でできます。
- 名前や数字を少し含む、200字ほどの文章を選びます。
- いつもの環境で、その文章をツールに向かって読みます。
- 間違った文字、抜けた文字、余分な文字を数え、元の文章の文字数で割ります。
- 1つだけ条件を変えて(距離、部屋、言語の設定)、もう一度試します。
この数字は、あなたの声、スマートフォン、部屋で何が効くかを教えてくれます。ツール同士を一般的に比べるものではありません。公表されている精度の数字も、測ったときの音声にしか当てはまりません。
AI の書き直しで直ること、直らないこと
Retexta は、クラウドで処理する Android 向けの音声文字起こし・AI ライティングアプリです。まず文字起こしをして、そのあと文章を書き直せます。書き直しでは、生の文字起こしを読みにくくしている次のような点が整います。
- 句読点と段落
- 「えー」「あの」「なんか」などのつなぎの言葉、言い直し
- 繰り返しや、途中で切れた文
文字起こしを整えるだけなら、More templates の Clean up a text が使えます。アプリの説明では、文を保ったまま文法、句読点、流れを直す目的です。Write a message や Take notes などの目的は、さらに話した内容を組み立て直します。
一方で、書き直しでは「斎藤」が「斉藤」になったことや、「保証」が「保障」になったことに気づけるとは限りません。聞き間違えた言葉が、自然な文に組み込まれて正しそうに見えることもあります。名前、数字、日付、金額は録音と照らし合わせてください。Retexta の結果には「AI-generated. Check important details.」と表示されます。
精度に関わる Retexta の特徴を2つ挙げます。Retexta は話されている言語を自動で判別するので、単語1つより、最初に日本語の文をひとつ言うほうが判別の手がかりが増えます。また、録音が無音かとても小さい場合は、文字を返さずにそのことを表示します(「Transcription finished, but no text was produced.」)。アプリのメニューは英語です。
Retexta は無料で試せます。新規ユーザーは Pro の結果をいくつか無料でアプリ内に表示でき、それを使い切った後は Transcript only にも Retexta Pro またはクレジットが必要です。書き直しの目的と Import audio は Retexta Pro の機能で、結果のコピー、共有、エクスポートには Retexta Pro またはクレジットが必要です。
あわせて読みたい
ボイスメモの録音なら Android でボイスメモを文字起こしする方法、打つ代わりに話すなら Android でメールを音声入力する方法、2人の声が入る録音なら インタビューを文字起こしする方法、ファイル形式は MP3 を文字起こしする方法をご覧ください。アプリについては Retexta:AI 文字起こしアプリへ。
出典
FLAME Apps が 2026年9月25日に確認しました。
- Google Cloud「Best practices, Cloud Speech-to-Text」(英語、2026年9月18日更新):マイクの位置、音割れ、サンプリングレート、可逆圧縮、ゲイン調整とノイズ除去を使わないこと、単語やフレーズのヒント。Google 自身のサービス向けのすすめです。
- Wikipedia「Word error rate」(英語):WER =(S + D + I)÷ N の定義。
- Retexta のアプリコード(Android、バージョン 2026.1.23):言語の自動判別(
RecordScreen.kt、TranscriptionLanguageCatalog.kt)、Clean up a text の説明とエラーメッセージ(アプリの文字列)。 - 日本語の誤変換の例と、文字単位で数える自宅テスト:FLAME Apps がこのページのために作成しました。
