本文へ移動

AI文字起こしの精度は実際どれくらいなのか

1 min read 1 views 最終更新: 8月 2, 2026
A studio microphone on a boom arm over an empty chair in a room with acoustic panels

キーポイント

精度を示す単一の数字は存在しない。目にした数字は、ある一つのシステムを一つの録音で測定した結果にすぎない。クリアな一人語りの音声と、雑音の多いグループの会話とでは結果の差が大きすぎて、一つの割合ではとても言い表せない。結果を左右するのは録音そのものだ――マイクとの距離、周囲の雑音、話者の発言の重なり、アクセントのカバー範囲。エラーは均等に散らばるわけではなく、文字起こしの大部分は問題なく読めるが、人名や専門用語、数字、複数人が同時に話す場面でミスが集中する。何かを探すだけならそれで十分だが、引用するなら一行ずつ音声と照らし合わせて確認する必要がある。

文字起こしツールに何%という数字が添えられているのを見たことがあるはずだ。それは何かを実際に測定した結果ではある。ただ、あなたの録音を入れたときに何が起こるかを測ったものではない。それを約束のように受け取ってしまうと、一番困るタイミングで裏切られることになる。

本当に問いたいのは、自動文字起こしが一般にどれくらい正確かではない。手元に返ってくる文字起こしが、自分がやりたいことに使える精度かどうかだ。この二つは別の問いであり、答えも別々になる。同じファイルでも、目的の箇所を探すには十分使えるのに、そのまま引用するにはまったく使えない、ということが普通に起こる。

精度の数字は、システム全体ではなく一つの録音を測ったもの

精度に関する主張はどれも、特定のシステムを特定の音声に対して動かした結果だ。音声が変われば数字も変わる。これは測定の欠陥ではなく、そもそもその測定が意味するものだ。

両極端を想像してみてほしい。一人の話者がマイクの近くにいて、静かな部屋で、広く学習データに含まれているアクセントで、ごく普通の話題を話している。この場合はとてもきれいに文字起こしされる。次に、エアコンが動いている部屋で4人がテーブルを囲み、互いの発言に重なり合いながら、自分たちの業界特有の言い回しを使い、2人はスマートフォンから1.5メートルほど離れて座っている場面を思い浮かべてほしい。こちらはずっと結果が悪くなる。どちらも同じシステムに対する正直な測定結果だ。一つの数字で両方を説明することはできず、その差はあまりに大きいので平均を取ることにも意味がない。

だから、どんな音声で測定したのかが示されていない数字を見たら、抜けている情報こそが重要なのだと考えてほしい。そこから本当に分かるのは「誰かが何かをテストした」ということだけだ。あなたにとって意味のある基準は、あなた自身の素材だ。実際に自分が扱っているものに近い数分間の録音を用意し、実際に文字起こしにかけて、音声と比べながら結果を読んでみる。それは公表されている数字よりもずっと参考になるし、比較記事を読むより短い時間で済む。

結果を左右するのは、ソフトよりも録音そのもの

多くの人はツールを比較することで精度を選ぼうとする。しかし、たいていの録音にとってそれは的外れなアプローチだ。録音時の条件は、エンジンの選択よりもはるかに結果を左右する。

  • マイクとの距離。距離が離れるほど、部屋の音は増え、声の成分は減る。二人の間のテーブルに置かれたスマートフォンと、一人の目の前に置かれたスマートフォンとでは、まったく別の録音になる。
  • 周囲の雑音。交通音、カフェの喧騒、換気扇、キーボードの音。雑音は発言の背後にただ存在するのではなく、発言と競合する。負けるのは、文末の小さな声だ。
  • 発言の重なり。二人が同時に話すと、書き取るべきクリアな音声信号がそもそも存在しない。何かは書き取られるが、それは両者の発言が混ざったものになりがちだ。
  • アクセントのカバー範囲。あるアクセントは、システムの学習データの中で他よりもはるかに手厚く扱われている。手薄なアクセントは、同じくらいクリアな音声でも結果が悪くなる。

ツールごとに実際に差はあるので、自分の素材が一貫してある種の難しさを持っているなら、いくつか試してみる価値はある。ただ、同じ音声に対する二つの実用的なツールの差は、たいてい同じツールに対する良い音声と悪い音声の差よりも小さい。マイクを近づけるほうが、製品を切り替えるよりも効果がある。ソフトが渡された音声に対して何をしているのかを理解したいなら、AI文字起こしの仕組みを見れば、こうした条件がなぜ重要なのかが分かる。

エラーはファイル全体に均等に散らばるわけではない

ここが人を油断させるポイントで、見出しの数字よりも重要だ。エラーは集中して発生する。文字起こしの大部分はきれいに仕上がり、失敗はいくつかの決まった場所に集中する――固有名詞、専門用語、数字、そして誰かが誰かの発言に被せて話した瞬間だ。

これが読む側にとって何を意味するか考えてみてほしい。普通の会話のページはきれいに文字起こしされ、すらすら読める。そこに姓が出てきたり、製品名が出てきたり、数字が出てきたりすると、そこだけ間違っている。ページ上には何の違いも示されない。間違った単語は正しい単語とまったく同じ体裁で並び、周囲は正しい文で埋まっているため、まさにその間違いを本物らしく見せてしまう。文字起こしは見た目上とても読みやすく仕上がっていながら、まさに自分が使おうとしている箇所だけ間違っている、ということが起こる。

この種の失敗が起きる理由がある。普通の単語は周囲の文脈に制約されているので、一度聞き間違えてもシステムは文脈から立て直せる。人名にはそうした制約がなく、ほとんどどんな音でも誰かの名前として通用してしまうため、文法上、間違った推測を排除する手立てがない。専門用語も同じ問題を抱えており、さらに、ごく普通の単語がその専門用語と似た響きを持つせいで、置き換えられてしまうことが多い。数字はもっとも極端なケースで、わずかな音の違いがまったく別の値を生み出し、しかもどちらの数字でも文としては違和感なく読めてしまう。

句読点は、文がどこで終わるかについての推測にすぎない

自動的な句読点付けは文字起こしそのものではない。休止や語調、リズムから、一つの考えがどこで終わり次がどこで始まるかを推測しているだけだ。多くの場合その推測は正しいし、誰も気づかないほど十分正しい。

推測が外れると、意味そのものがずれる。句の途中に句点が置かれてしまうと、条件や補足がそれが修飾していたはずのものから切り離され、控えめな発言が断定的な発言に変わったり、条件付きの発言が事実の主張に変わったりする。単語一つ一つは正しくても、話者が言っていないことを文が語ってしまうことがある。この種のミスはページの上では見えない。見て気づけるものが何もないからだ。文字起こしを読み返すだけでは直せない。音声だけがそれを決着させられる。

話者ラベルにも似た弱点がある。一人が話し続けている間はたいてい正しいが、話者が切り替わる瞬間の信頼性が最も低く、短い一言が別の人物に振られてしまうことがある。話者交代の直後から引用を取るなら、その一行は聞き直したほうがいい。

基準は「文字起こしが何のためにあるか」から決める

問うべきは「文字起こしが正確かどうか」ではない。「その用途に対して十分に正確か」であり、用途は思っているよりも大きく変わる。

何かを探すために文字起こしを使うなら、散発的なミスは問題にならない。ある単語で検索して、だいたいその分の場所に辿り着いて、そこから音声を再生する。3行上の名前がめちゃくちゃになっていても、文字起こしは仕事をしている。1時間の録音をざっと読んで、どの20分に注目すべきか判断する場合も同じだし、録音した音声をテキストに変換して、聞くより速く読むために使う場合も同じだ。

文字起こしを引用したり、公開したり、正式な記録として保管したり、その場にいなかった人がそれをもとに判断するような場合は、基準が変わり、その基準は譲れない。使う予定の一行はすべて、個別に音声と照らし合わせて確認する。文書全体を通しで読むのではなく、引用する箇所を狙って聞き直す。これまで挙げた失敗のパターンは、通しの読み返しでは見つからないものだからだ。数字や名前が文の要となっている箇所には、これが特に重要になる。

作業用の文書であれば、アプリを使うのが現実的な選択だ。iOS、Android、macOSに対応するSozAIは、録音や音声・動画ファイル、YouTubeのリンクを、話者ラベル、要約、99以上の言語への翻訳付きでテキストに変換してくれる。それでも引用箇所は音声と照らし合わせて確認する。これはどんな自動出力についても同じだ。

文字起こしそのものが最終的な提出物になる場合は、人による文字起こしサービスが適した答えになる。料金が高いのは、人が実際に座って聞くからで、それこそが対価だ。名前を聞き取って正しく書ける人、文がどこで終わったかを判断できる人、本当に聞き取れなかった箇所を推測せずにその通りフラグを立てられる人。クライアントや裁判所、資料保管機関、出版物がその文書を受け取るなら、その費用は本物の価値を買っていることになる。文字起こしが、音声にすばやくアクセスするために自分だけが使う道具なら、その費用は不要なものを買っていることになる。

もう一回録音するほうが、1時間かけて直すより早い

録音そのものを改善するほうが、出力結果を直すより、たいていはるかに安く済む。マイクを移動し、窓を閉め、換気扇を止め、一人ずつ話してもらうよう頼む――これに10分かければ、あとで文章を直す1時間分の作業を減らせるし、直した結果よりも良い仕上がりになる。修正後の文字起こしの質は、最終的には自分がどこまで根気よく直せたかに左右されるからだ。

繰り返し発生することに対しては、これが最も実行しやすい。同じ種類の会話を定期的に録音しているなら、録音環境に一度気を配るだけで、その後録音するものすべてが改善される。これはインタビューで特に重要になる。素材が二度と取り直せないことが多く、引用こそが目的そのものだからだ。インタビューの文字起こしで気をつけるべき実務的なポイントは、その多くが録音時の実務的なポイントでもある。

二度目のチャンスがまったくない場合もある。会話は一度きりで、スマートフォンはポケットの中にあり、それが手元にある音声だ。その場合、正直な対応は、ソフトに救出を期待するのをやめて、代わりに修正の時間を確保するか、人に依頼することだ。難しい音声は、自分が必要としているからといって簡単になるわけではない。

ファイルを開いたときに想定しておくべきこと

すらすら読める滑らかな文章の中に、間違った名詞がいくつか混じっていると想定しておくこと。複数人が同時に話した箇所は薄く、意味不明になっているか、静かに欠落していると想定しておくこと。自分なら選ばないような句読点の打ち方、大まかには合っているが切り替わりの瞬間だけ信頼できない話者ラベルを想定しておくこと。フラグも、ハイライトも、不確かさを示す印も一切ないと想定しておくこと。文書は全体を通して同じくらい自信満々な見た目をしているが、全体を通して同じくらい正しいわけではない。

録音がどれだけクリアであっても、人名や専門用語には確認が必要だと想定しておくこと。良い音声でも間違いは起こる、頻度が少ないだけだ。

そして、音声そのものは残しておくこと。自動生成された文字起こしは自分自身を検証できず、重要な確認作業はすべて「聞く」という行為を伴う。音声が残っている文字起こしは信頼できる作業道具になる。音声を消してしまった文字起こしは、誰にも――自分自身にも――確認できない文書になる。

回答

Frequently Asked Questions

文字起こしの精度を示す割合(%)は、実際には何を意味しているのか

それは、ある一つのシステムが、ある一つの録音に対して出した結果を意味している。精度とは特定の音声に対してシステムを測定した結果であり、ソフト自体が持つ固定的な性質ではない。クリアな一人語りの音声と、雑音の多いグループの会話とでは結果の差が大きすぎて、一つの数字ではとても両方を説明できない。何を対象に測定したかが分からない数字からは、自分の録音がどうなるかについてほとんど何も分からない。

自動文字起こしが間違える主な原因は何か

多くの場合、原因はソフトではなく録音そのものにある。マイクとの距離、周囲の雑音、発言の重なり、アクセントがどれだけ学習データに含まれているかといった要素は、ツールを切り替えるよりもずっと大きく結果を左右する。二人の声が重なると、そもそも書き取るべきクリアな信号が存在しないため、両者が混ざったものが書き取られてしまう。録音そのものを改善するほうが、たいていツールを変えるより効果がある。

AI文字起こしは法律関係や医療関係の用途に使えるほど正確か

それだけでは十分ではない。そうした用途では、文字起こしが作業用の道具ではなく、そのまま信頼される記録として扱われるからだ。エラーは人名、数字、専門用語に集中して発生し、これらはまさにそうした場面で重要になる部分であり、しかもエラーだと示す印は一切付かない。使う予定のある行すべてを音声と照らし合わせて確認するか、実際に聞いて起こす人に依頼するかのどちらかが必要になる。

人名や専門用語がよく間違えられるのはなぜか

文脈による訂正が働かないからだ。普通の単語は周囲の文にある文脈によって制約されているため、聞き間違えても立て直せる。人名にはそうした制約がなく、ほとんどどんな音でも誰かの名前として成立してしまう。専門用語も同じ問題を抱えており、さらにその専門用語と似た響きを持つ普通の単語に置き換えられてしまうことが多い、という点で悪化しやすい。

自動文字起こしでも見直し(プルーフリーディング)は必要か

何に使うかによる。録音の中から目的の箇所を探すだけなら、散発的なミスは問題にならない。引用や公開、他の人が判断材料として使う場合は、引用する行を一つずつ音声と照らし合わせて確認する必要がある。単に読み返すだけでは不十分で、単語一つ一つは正しくても、句読点の打ち方の違いだけで意味がずれてしまうことがあるからだ。

人による文字起こしサービスに料金を払う価値があるのはどんなときか

文字起こし自体が最終的な提出物であり、音声にすばやくアクセスするための道具ではない場合だ。人が実際に聞くので、名前が正しく書かれ、文の区切りが実際に話された内容を反映し、本当に聞き取れなかった箇所は推測せずにフラグが立てられる。クライアントや裁判所、資料保管機関、出版物にその文書を渡すのであれば、その追加コストは本物の価値を買っていることになる。

Merey Tleugazin

SozAIの創業者。世界中のプロに向けて、音声をテキスト化するツールを開発中。

SozAI
SozAI — 無料ダウンロード音声・動画をすぐに文字起こし
アプリを入手