本文へ移動

「誰が何を話したか」がわかる文字起こしの作り方

1 min read 1 views 最終更新: 8月 2, 2026
A round table seen from above with four coffee cups around it and a phone in the centre

要点

文字起こしは、言葉自体は一字一句正確でも、それを誰の発言として記録するかを間違えることがあります。これは、音声を認識する処理と、それを話者に割り当てる処理が、そもそも別の作業だからです。話者の識別は声の特徴を手がかりに行われるため、はっきりと違う声の人が少数いて、1つのマイクで同じくらいの音量で録れている場合に最も精度が高くなります。逆に、発言が重なり合う場面や、声が小さい人、途中から参加した人には弱く、実名を自動で当ててくれることは決してありません——それは後から自分で行う作業です。

グループでの会話を文字起こししてみたら、発言の半分近くが違う人の名前で記録されていた、という経験はないでしょうか。その場合、言葉そのものの認識はたいてい正しくできています。問題が起きているのはもう一段上の処理、つまり「誰が話したか」を判断する部分です。この処理は文字起こしとは違う情報を使い、違う理由で失敗します。そして、それがうまく機能するかどうかを決めるのは、ソフトウェアに音声ファイルを通す前の、録音時の条件がほとんどすべてです。

これから取材や座談会、家族の会話などを録音しようとしていて、「何が話されたか」だけでなく「誰が話したか」まで知りたい場合、この仕組みを理解しておく価値があります。ポイントの一つはマイクをどこに置くかです。もう一つは、どんなソフトを使っても、きれいに話者分けできない状況があると割り切っておくことです。

2つの別の作業が、1つの文字起こしになる

言葉を認識する作業と、それを誰が話したかを判断する作業は、最終的に同じ文書に収まるとしても、別の作業です。前者は音を聞いて言語として処理します——誰の声かにはほとんど関心を持ちません。後者は同じ音を聞きながら、まったく別の問いを立てます。「この声は2文前の声と同じ人物か、それとも新しい話者か」。この問いに答えるのは、言葉の内容ではなく、声の特徴——高さ、トーン、話すリズムといった、その人の声の指紋のようなものです。

だからこそ、文字起こしの内容は一語一句正確でも、発言者の割り当てだけが間違っているということが起こります。認識処理は成功していても、話者分離は失敗しているのです。この2つは独立して失敗しうるので、誰かが「この文字起こしは間違っている」と言うときは、どちらの処理が実際に失敗したのかを確認する価値があります。原因によって対処法が変わるからです。

話者分離がうまく働く条件

話者分離が最も得意とするのは、はっきりと違う声を持つ人が少人数いて、全員がほぼ同じ音量で1つのマイク位置に録れている状況です。これが理想形です。2〜3人、それぞれ声の違いが明確、録音機器は部屋全体を均等に聞き取れる場所に1台置かれている——という状態です。

この理想形から外れるほど、代償が発生します。話者が増えれば、2つの声が似すぎて混同される可能性も増えます。似た声——たとえば年齢もアクセントも近い2人——は、低い声と高い声のように違いが大きい2人よりも区別が難しくなります。そして、ある人だけ他の人よりずっと大きな音量で録れている場合、システムは音量の違いを話者の違いだと誤解し始めてしまいます。実際にはそうではないのに。

これらはどれも特別な話ではありません。人間が目を閉じてただ耳で聞いた場合に感じることと、そう遠くないはずです。ソフトウェアが優れている点は、1時間分の音声に対しても集中力が切れず、一貫した判断を続けられることであって、人間の耳にはない特別な感覚を持っているわけではありません。

うまくいかない場面:発言が重なるとき

どれだけ良い環境で録音しても、確実に話者分けを崩す状況が一つあります。それは、2人が本当に同時に話している、いわゆる発言の重なりです。重なっている間は、どちらか一方の声だけを取り出せるきれいな信号は存在しません。音声は両者の声が混ざったものであり、どちらかにきれいに割り当てる手段自体がないのです。よくあるのは、片方の発言がもう片方の発言に取り込まれてしまい、文字起こし上では実際には2人が同時に話していたのに、1人が続けて話したかのような1つの発言として表示されることです。

これは後で修正できる不具合ではありません。問題の性質そのものに組み込まれた限界です——重なった2つの声を、後からきれいに2本の音声に分離することは、信頼できる形では不可能です。現実的な期待値としては、本当に発言が重なっている部分は人の手で確認して直す必要があるか、そのままシステムの推測どおりの割り当てで残るか、どちらかだと考えておくべきです。もし会話の中で発言が重なる場面が多い——激しい議論になる座談会や、言い合いになりがちな家族の食事の席など——であれば、その部分は手作業での修正が必要になると想定しておき、その一部分だけを見てツール全体を評価しないようにしましょう。

マイクの性能よりも、置く場所の方が重要

マイクまでの距離は、マイクそのものの性能よりも話者分離に大きく影響します。テーブルの真ん中に置かれたスマートフォンの方が、たまたま1人の近くに置かれた高性能なマイクよりも、良い話者分離結果を出すことがよくあります。なぜなら、声が小さく、マイクから遠い参加者こそ、システムが最初に見失う相手だからです。ある人がマイクから遠いせいで他の人よりずっと声が小さく録れている場合、その音量差は、機材の違いよりも話者分離に大きな影響を与えることがあります。

複数人の会話であれば、これはシンプルな原則につながります。録音機器は「都合の良い場所」ではなく「中心になる場所」に置くことです。主催者に一番近い端ではなく、テーブルの真ん中です。参加者が近くに座らず、部屋のあちこちに散らばっている場合は、機材が何であっても難しいケースになりますので、それは事前に知っておいた方が、後から気づくよりずっと良いです。

「Speaker 1」「Speaker 2」を実名に変える

音声そのものには、誰の名前かを教えてくれる情報は一切含まれていません。システムは「2種類の異なる声がある」ことは判断できますが、片方がPriya、もう片方がTomだと知る手段はありません。そのため、出力は匿名の識別子——Speaker 1、Speaker 2、といった形——でラベル付けされます。これを実名に変える作業は手作業であり、文字起こしの冒頭で、各ラベルを名前に対応づける作業を一度行えば済みます。

この作業を面倒なものではなく簡単なものにする一番の方法は、録音の冒頭で全員に名前を声に出して言ってもらうことです。かかる時間は10秒程度で、それだけで明確な手がかりが得られます。冒頭で「これはTomです」と言っている声が、文書全体を通してTomとラベル付けすべき声だと分かるからです。これを省略すると、記憶や会話の内容を頼りに声と名前を後から突き合わせることになり、それでも作業自体は可能ですが、話者が増えるほど時間がかかり、間違いも増えます。

特に取材の録音をする場合は、この習慣をセッションの最初から組み込んでおく価値があります。最初の1分間からうまく設定する方法についてはインタビューの文字起こしについての解説を参照してください。録音が済んだあとにラベル付きのテキストへ変換する部分については、音声のテキスト化が実際の変換手順を扱っています。また、SozAIの文字起こしアプリのようなアプリを使えば、録音データから話者ラベル、要約、そして幅広い言語への翻訳までを一度に生成できます。ただし、話者に実名を付ける作業自体は依然として自分で行う必要があります——とはいえ、それは全体の中でも早く終わる部分です。

現実的に期待できること

環境を整えて録音しても、いくつかの状況では結果が予測どおりに完璧にはなりません。これらは失敗と捉えるのではなく、事前に知っておくべきこととして扱う方がよいでしょう。

  • 録音の途中から加わった話者は、システムがすでに声のプロファイルを固めてしまった後に参加することになるため、新しいラベルを与えられず、既存の話者に統合されてしまうことがよくあります。
  • 録音全体を通して数語しか話さない人——短い相づちや、一言だけの質問など——は、その人の声だけで独立したプロファイルを作るには情報が足りないため、周りで話している人の発言に取り込まれてしまうことがよくあります。
  • 前述の、本当に発言が重なる場面は、どちらか一方の話者の発言としてまとめられてしまう傾向があります。
  • 似た声を持つ人が多い大人数のグループは、声がはっきり違う小人数のグループよりも、ラベル付けの間違いが多くなります。単純に混同が起きる可能性が増えるためです。

これらはどれも、難しい録音の文字起こしを避ける理由にはなりません。むしろ、こうした状況が発生した部分については短い手作業での修正を想定しておき、文書全体を一から見直す必要があると思い込まないための知識だと考えてください。こうした複雑さが予想される録音をする場合は、全部の言葉を文字起こしする必要があるのか、それともラベル付けされた要点だけでよいのかを、事前に決めておく価値もあります。すべてを文字起こしすることが常に有用な選択とは限りません。特に長時間の録音で、主に「誰が何にコミットしたか」だけを知りたい場合は、録音を議事録に変換するという使い方の対象になります。また、長いファイルに取り組む前に、ある録音がどうラベル付けされるかを試してみたい場合は、ダウンロードページからアプリを入手し、まず短いサンプルで試してみると、どんな一般的なアドバイスよりも多くのことが分かります。

実際に効果があること

ここまでの内容から一つだけ持ち帰るなら、ソフトウェアよりも録音そのものの方が重要だということです。中心に置かれたマイク、はっきりと違う少人数の声、冒頭で全員が名乗ること、そして発言が重なる部分は手作業での確認が必要だと受け入れること——この組み合わせは、後からどんな設定や機能を選ぶよりも、良い結果に近づけてくれます。話者ラベル付けの処理自体はきちんと仕事をしていますが、それはあくまで与えられた録音データの中で最善を尽くしているにすぎません。話者分離を意識して録られた録音は、後で何を使って文字起こししても、意識せずに録られた録音より必ず良い結果になります。

回答

Frequently Asked Questions

文字起こしソフトは、話者を自動で区別できますか?

はい、音の高さやトーンといった声の特徴を手がかりに区別しています。話した内容そのものは使っていません。はっきりと違う声が少人数いて、1つのマイクで同じくらいの音量で録れている場合に最も精度が高くなり、話者が増えたり声が似てくるほど精度は下がります。

文字起こしで、2人の発言が1人のラベルにまとめられてしまったのはなぜですか?

よくある原因は、その人が録音の途中から参加した、発言がごく少なかった、あるいはマイクから遠くて他の人より声が小さく録れていた、というケースです。システムがその人だけの声のプロファイルを作るのに十分な情報が得られなかったためです。

何人までなら話者のラベル付けは信頼できますか?

決まった人数はありませんが、人数が増えるほど精度は下がります。特に声が似ている場合はその傾向が強くなります。声がはっきり違う2〜3人の少人数のほうが、似た声が複数いる大人数のグループよりずっと安定して分かれます。

複数人での会話を録音するとき、スマートフォンや録音機はどこに置くべきですか?

1人の近くではなく、テーブルの真ん中など中心になる場所に置いてください。マイクまでの距離は、マイクの性能よりも重要です。声が小さい人や遠くにいる人ほど、聞き取れなくなったり別の人と混同されたりしやすいためです。

文字起こしで「Speaker 1」「Speaker 2」ではなく、実際の名前を表示させることはできますか?

自動ではできません。音声そのものには、誰の実名かを示す情報が含まれていないためです。文字起こしの冒頭で、各ラベルに名前を手作業で対応づける必要があります。録音の最初に全員が名前を声に出して言っておくと、この作業がかなり楽になります。

2人が同時に話した場合、文字起こしはどうなりますか?

本当に発言が重なっている間は、どちらの声にもきれいに割り当てられる信号がないため、通常は片方の発言がもう片方の発言に取り込まれてしまいます。これは設定で直せる問題ではなく、処理そのものの限界であり、たいていは手作業での修正が必要になります。

Merey Tleugazin

SozAIの創業者。世界中のプロに向けて、音声をテキスト化するツールを開発中。

SozAI
SozAI — 無料ダウンロード音声・動画をすぐに文字起こし
アプリを入手