重要ポイント
一語も打ち始める前に、逐語のレベルを決めてください。完全な逐語起こしは「えー」や言い直しをすべて残し、クリーンな逐語起こしはフィラーを除いて意味を保ち、編集済みの文字起こしは読みやすいように文法を整えます。間、発言の重なり、聞き取れない箇所の表記法を選んで、文書の冒頭に凡例として書き、話者ラベルは一貫して付けてください。手作業での目安として、Texas Tech University Libraries のオーラルヒストリー・ガイドは、録音1時間につき入力6時間という比率を挙げ、Cornell University の授業ガイドは4〜6時間としています。自動の文字起こしなら数分で最初の下書きができ、人の作業は入力から、録音と照らした確認に移ります。
録音は手元にあります。そこで誰かが、引用でき、コーディングでき、提出できる文字起こしを求めてきます。最初の問いは、どのアプリを使うかではなく、発話のどこまでを残すかです。
フィラーや言い直しは、会話分析や一部の法的な場面では重要ですが、それ以外ではノイズです。この記事では、3つの逐語レベル、間や発言の重なりを示す表記法、手作業にかかる時間、そして実際の録音で自動の文字起こしが何を正しく、何を間違えるかを順に見ていきます。
インタビューを文字起こしする最も簡単な方法は?
まず録音を音声認識エンジンにかけ、そのあと名前を直し、音声と照らして抜き取りで確認し、プロジェクトに必要な表記を足します。白紙から打ち込むより速く、多くの人が「簡単」と呼ぶのは実際これです。1時間分の発話を最初から一語ずつ打ち込むのは、簡単な入り口ではなく、遅い入り口です。
短いクリップなら、当サイトのブラウザツールインタビューをオンラインで文字起こしが、アカウントなしでその最初の一次処理をします。録音をアップロードすると、最初の5分間を文字起こしし、発言ごとにタイムスタンプ付きで Speaker A、Speaker B などとラベルを付け、99言語の中から言語を自動で判別します。25 MBまでのファイルはそのまま処理され、それより長い録音は、何かを送信する前にブラウザ内で5分に切り詰められます。音声と文字起こしは、結果が返ってきた時点でプロバイダ側で削除され、プレビューは1日に1台あたり3回までです。
これで、その録音にそのツールを使う価値があるかどうかは分かります。インタビュー全体を一度に処理し、発言を最後までラベル付けして、すべての文字起こしをあとで検索できるライブラリに残すには、SozAIアプリが対応しており、最初の30分は無料です。全体像はインタビュー文字起こしのしくみで、アプリはダウンロードのページで確認できます。
逐語起こしとクリーンな逐語起こしの違いは?
完全な逐語起こしは、話されたとおりに一語残らず残します。「えー」、言い直し、繰り返された語、どもり、聞こえる笑いです。クリーンな逐語起こしは、話者の言葉と意味を保ちつつ、フィラー、言い直し、うっかりした繰り返しを省きます。編集済みの文字起こしはさらに進んで、読みやすいように文法や文の順序を整えます。まさにそれが理由で、実際に何が言われたかの証拠としては使えなくなります。
- 完全な逐語起こし:会話分析、一部の法的・証拠としての作業。
- クリーンな逐語起こし:大半の質的研究、ジャーナリズム、ユーザーリサーチ。
- 編集済み:公開される質疑応答形式の記事。
| レベル | 残すもの | 主な用途 |
|---|---|---|
| 完全な逐語起こし | 話されたとおりのすべての語:フィラー、言い直し、繰り返し、どもり、聞こえる音 | 会話分析、一部の法的・証拠としての作業 |
| クリーンな逐語起こし | 話者の言葉と意味。フィラーと言い直しは省く | 大半の質的研究、ジャーナリズム、ユーザーリサーチ |
| 編集済み | 読みやすいように整えた文法と文の順序 | 公開される質疑応答形式の記事 |
文字起こしを公開する記事ではなく研究プロジェクトに使うなら、5回目のインタビューのあとではなく、最初のインタビューの前にこれを決めてください。途中でレベルを変えると、それまでの文字起こしをやり直して合わせることになります。同意、匿名化、保管といった研究特有の面は、研究のためのインタビュー文字起こしで扱っています。
インタビューの文字起こしはどう書く?
まず凡例から始めます。逐語のレベル、使う記号、話者のラベル付けの方法を、発話の最初の行より前の、文書の冒頭に書きます。あとでその文字起こしをコーディングしたり引用したりする人にはこの凡例が必要で、数週間後に (.) が何を意味していたか忘れたときには、あなたにも必要になります。
詳細な文字起こしで最もよく知られた方式は Gail Jefferson によるもので、Glossary of transcript symbols with an introduction(2004)で示されています。Clift、Kendrick、Raymond、Robinson(2024)の要約によれば、左の角括弧は重なった発話が始まる位置を示し、等号は間なしにつながる発話を結び、(0.5) のような括弧内の数字は秒単位で計った沈黙で、(.) は計るには短すぎる間を示します。マイクロポーズがどのくらい短いのかについては資料によって意見が分かれるため、凡例で (.) を使うなら、それが何を意味するかを明記してください。
ほとんどのインタビュー・プロジェクトは、そこまでの詳細を必要とせず、それがないほうが読みやすくなります。実際に出てくる事柄は、括弧による表記で足ります。聞き取れない箇所には、あとで探せるようタイムスタンプ付きの [inaudible 00:12:31]、2人が同時に話すところには [crosstalk]、笑いなどの発話以外の出来事には角括弧の [laughs]、そして発言のたびに先頭に付ける話者ラベルです。
| 記号 | 意味 | 方式 |
|---|---|---|
| [ | 重なった発話が始まる位置 | Jefferson方式 |
| = | 間なしにつながる発話(ラッチング) | Jefferson方式 |
| (0.5) | 秒単位で計った沈黙 | Jefferson方式 |
| (.) | 計るには短すぎる間 | Jefferson方式 |
| [inaudible 00:12:31] | 聞き取れない箇所(タイムスタンプ付き) | 括弧方式 |
| [crosstalk] | 2人が同時に話している | 括弧方式 |
| [laughs] | 発話以外の音 | 括弧方式 |
表記のほかに、UK Data Service の文字起こしに関するガイダンスは、文字起こしには固有の識別子を付け、プロジェクト全体で統一したレイアウトを使い、発言の交代には話者タグを使い、改行を残すべきだとしています。小さなことですが、これがあるから、すべてを読み直さなくても、あとで文字起こしを見つけて比較できます。
話者ラベルは、文字起こしソフトが知り得ない名前です。Speaker A と Speaker B が出てくるので、誰が誰か分かったら手作業で名前に直します。話者ラベルを一貫させるでは、プロジェクト全体で、ファイルごとに名前がぶれないようにする方法を説明しています。
匿名化は、あとからではなく、進めながら行ってください。名前や識別できる詳細を、[Participant 2] や [city] のような一貫したプレースホルダーに置き換えるのを、文字起こしの中でその場でやり、プレースホルダーと実名の対応表は別のファイルに保管します。人を録音するには、ほとんどどこでも本人の同意が必要で、研究倫理委員会は通常、その同意を書面で求めます。録音を文字起こしすることで、その要件が変わることはありません。
インタビューの文字起こしにはどのくらいかかる?
手作業なら、分ではなく時間で計画してください。Texas Tech University Libraries のオーラルヒストリー・ガイドは、経験豊富な文字起こし担当者でも、音声1時間につき入力6時間で作業するのが通常だとしています。Cornell University の授業ガイドはそれより低く、録音1時間につき4〜6時間としており、その差は、おもに音声がどれだけきれいか、途中でどれだけ表記を加えるかによります。
自動の文字起こしは、時間が消えるのではなく、時間のかかる場所を変えます。下書きは数分で返ってきて、残るのは、録音と照らして聞き通すこと、名前や専門用語を直すこと、ラベルが入れ違った箇所で誰が何を言ったかを訂正すること、プロジェクトに必要な表記を足すことです。1時間のインタビューなら、それでも本物の作業ですが、種類が違うだけです。文字起こしに実際どのくらいかかるかで、さらに詳しく内訳を示しています。
ChatGPTでインタビューを文字起こしできる?
チャットボットが音声ファイルをテキストにできるかどうかは、製品によります。ただ、インタビューの文字起こしに必要なのはテキストだけではなく、あとで戻れるタイムスタンプと、信頼できる発言の区切りで、それこそが文字起こしエンジンが作るように作られているものです。チャットボットが力を発揮するのは、その次の段階で、すでにある文字起こしを整えたり、要約したり、形を変えたりするときです。
どちらにせよ、自動で得たテキストは、引用する前に録音と照らして確認する必要があり、その確認は、どのツールも取り除けない部分です。
どのくらい確認が必要かは、エンジンによってかなり違います。AI文字起こしの精度で、何を期待でき、誤りがどこに集中しやすいかを説明しています。
実際の自動文字起こしが間違えること
自動の文字起こしは下書きです。それが何を意味するかを最もはっきり知る方法は、1つ実行して、録音と照らして読むことです。2026年10月2日に、まさにそれをやってみました。この記事と照らして誰でも確認できる、公開されている録音の最初の5分間でです。
SozAIのインタビューツールの裏にあるエンジンを、NASAジョンソン宇宙センターのポッドキャスト Houston We Have a Podcast のエピソード180「Artemis Mission Management」(ホストは Gary Jordan、ゲストは Mike Sarafin)の最初の5分間(300秒)にかけました。NASAの作品なので、著作権で保護されていません。結果は778語で、英語を検出し、話者は2人と判定しました。エンジンが出力した冒頭の行は次のとおりです。
[00:00] Speaker A: Houston, we have a podcast. Welcome to the official podcast of the NASA Johnson Space Center, episode 180, Artemis Mission Management. I'm Gary Jordan, and I'll be your host today. [01:19] Speaker B: T-minus five seconds and counting. Mark. [01:22] Speaker A: Launch commit lights are correct. There she goes. Houston. We have a podcast. Mike Serafin, thanks for coming on Houston, We Have a Podcast today. [01:36] Speaker B: Thank you. It's a pleasure to be here to talk about these exciting Artemis missions we have ahead of us. Yeah, right? [01:43] Speaker A: Returning to the Moon. Not a bad thing to be a part of.
この5つの発言だけでも、人の手による確認が必要なものが3つありました。01:19のカウントダウンと、01:22の「Launch commit lights are correct. There she goes.」は、ポッドキャストに挿入された打ち上げの記録音声で、ホストでもゲストでもありません。それでもエンジンは、それらを Speaker B と Speaker A とラベル付けしました。01:36の発言の最後にある「Yeah, right?」は、実際にはホストが会話を引き取った言葉で、ゲストの発言の最後ではなく、次の発言の冒頭に属します。そして、ゲストの姓は、ここでは Serafin と出力されていますが、エピソード自体のクレジットでは Sarafin と綴られています。
あとの発言を見ると、クリーンな逐語起こしの役割が分かります。02:51のエンジンの出力はこうです。「Yes, so you’re, you’re right in that I lived in the operations realm for 22 of my 27 years in, in my NASA career.」クリーンな逐語起こしにすると、「You’re right in that I lived in the operations realm for 22 of my 27 years in my NASA career.」になります。完全な逐語起こしなら、繰り返しをそのまま残します。エンジンは、どちらかといえば残す方向に傾いており、ファイル全体で、繰り返しや言い直しの大半を保っていました(「you’re, you’re right」、「in, in my NASA career」、「That’s, that’s quite a number of」)。つまり出力は、クリーンな逐語起こしより、完全な逐語起こしに近いのです。プロジェクトでクリーンな逐語起こしが必要なら、どのエンジンが下書きを作るかにかかわらず、編集作業の時間を見込んでください。

