本文へ移動

音声をどこにもアップロードせずに文字起こしすることはできるか

1 min read 1 views 最終更新: 8月 2, 2026
A phone lying face down on a desk beside a closed notebook and coiled earphones

要点

可能ではありますが、宣伝文句が示すほど一般的ではありません。デバイス上で動く文字起こしとサーバー上で動く文字起こしは、切り替えられる設定ではなく、まったく別の作り方の話です。そしてほとんどのアプリはサーバー型です。ローカルで動くモデルはストレージを消費し、古いハードウェアでは動作が遅くなるからです。「通信は暗号化されている」というプライバシーポリシーの一文は、通信経路について述べているだけで、データの行き先については何も語っていません。どのツールを使うにしても、次の3点を確認してください。音声はデバイスの外に出るのか、どれくらいの期間保存されるのか、そして何かの学習に使われるのか。

セラピーの録音、弁護士との電話、外に出すつもりのなかった会議の録音を手元に持っているなら、この問いは机上の空論ではありません。ファイルをテキストに変換する際に、そのコピーが他人のハードウェアに残るかどうかを知りたいはずです。答えはちゃんと存在しますが、多くの製品ページが匂わせるよりも、もっと具体的な話です。

ここからは、その実態を率直に説明します。何がローカルで動き、何がそうでないのか、なぜそのような分かれ方になるのか、そして取り返しのつかない音声データを預ける前に何を確認すべきか、という話です。

デバイス内処理とサーバー処理は、そもそも別の作り

最初に理解しておくべき最も重要な点は、これがアプリが与えてくれる「プライバシーの好み」ではないということです。スマートフォンやパソコンの中で行われる文字起こしと、遠隔のマシンで行われる文字起こしは、アーキテクチャそのものが違います。アプリはどちらか一方の作り方で作られています。設定の奥深くに、処理をサーバーからデバイスへ移すようなスイッチは存在しません。ローカル処理に必要な部品は、アプリに最初から組み込まれているか、組み込まれていないかのどちらかだからです。

ローカルでの文字起こしとは、音声認識モデルがデバイスの中に存在するということです。音声はその場でモデルに渡され、その場でテキストが出てきます。どこにも移動する必要がありません。サーバーでの文字起こしとは、音声がどこかに送られ、自分の管理下にないハードウェアで処理され、テキストが送り返されてくるということです。どちらの方式もきちんと作られている場合もあれば、粗雑に作られている場合もあります。しかし、音声を自分の手元に留めておけるのはどちらか一方だけであり、どちらを使っているかはソフトウェアそのものの事実であって、設定をどれだけ丁寧に行ったかとは関係ありません。

ほとんどのアプリがサーバー方式を採用している理由は、無関心だからではありません。ローカルのモデルはデバイス上に保存しなければならず、それには実際のストレージ容量がかかります。処理はデバイスが搭載しているプロセッサ上で動くため、古いハードウェアでは遅くなり、長いファイルではさらに遅くなります。この2つの制約だけで、ほとんどの製品はサーバー方式に押し流されます。サーバー上ならモデルを大きくできますし、ハードウェアも高速にできますし、ダウンロードも不要です。この取引こそが、プライベートな選択肢がなぜ珍しいのか、という話のすべてです。

「通信の暗号化」が説明しているのは道であって、行き先ではない

ここで多くの人が誤った安心感を抱いてしまいます。プライバシーポリシーには「データは通信中に暗号化されます」と書かれています。この一文はほぼ間違いなく本当です。しかし、それはあなたの音声がサーバー上で処理されるのか、その後もそこに保存され続けるのかについては、何も語っていません。

通信の暗号化とは、デバイスとサービスの間の接続が、データが移動している最中に保護されているという意味です。これは道についての説明です。あなたの音声がサーバーに到着し、そこで処理され、保持期間のルールが許す限りずっと保存され続けることと、完全に両立します。むしろ、通信の暗号化についての約束は、何かが実際に通信されているという静かな証拠でもあります。デバイスから一度も出ていかない音声には、保護された接続など必要ありません。旅をしていないからです。

だからセキュリティに関するページを読むときは、それぞれの主張を分けて考えてください。通信の保護は一つの主張です。処理がどこで行われるかは別の主張です。音声がどれくらい保存されるかは三つ目の主張です。あるページが最初の点については徹底的に誠実で、残りの二点については単に何も書いていない、ということはあり得ます。そしてあなたは、そのページが一度も言っていないことを、いつの間にか信じてしまうことになります。

ブラウザだけでファイルを送らずにできること

ファイルの処理を完全にブラウザ内で行うツールというカテゴリーは、実際に存在します。ページを開き、ファイルを選ぶと、作業はそのタブの中で行われます。何もアップロードされません。これは宣伝の言い回しではなく、実際の作りそのものです。つまりファイルは一度もあなたのマシンから出ていきません。

問題は、こうしたツールが何をできるか、です。ブラウザ内でのローカル処理は、モデルを必要としない作業に向いています。字幕のフォーマット変換、再編集した動画に合わせて字幕タイミングをずらす作業、すでに手元にある文字起こしの文字数や単語数を数える作業などです。これらはテキストとタイミングデータの変換であり、小さく決定的な処理で、ファイル自体以外には何も必要としません。

音声をテキストに変換することは、そういう種類の作業ではありません。音声認識モデルが必要で、モデルは大きなものであり、どこかから取得して、どこかに置いておかなければなりません。「音声を文字起こしします」と提案してくるWebページは、実際には、その音声をサーバーに送って処理しているのです。そのページはインターフェースであり、作業自体は別の場所で行われています。ブラウザ上のツールが文字起こしをするなら、アップロードされていると考えて、安心させる言葉ではなく、保存期間に関するポリシーを探してください。

宣伝文句と本当の答えを見分ける3つの質問

誰かのインフラを監査する必要はありません。必要なのは3つの答えであり、その全部が必要です。一つの質問への良い答えが、別の質問への悪い答えを覆い隠してしまうことがあるからです。

  • 音声はデバイスの外に出るのか。「安全か」でも「暗号化されているか」でもなく、実際に移動するかどうかです。サーバー上で処理するサービスなら、そのことをはっきり書いているはずです。
  • どれくらいの期間保存されるのか。音声がどこかに送られるなら、少なくとも一時的にはどこかに保存されます。問題は、それが数分なのか、数日なのか、削除を依頼するまでずっとなのか、です。
  • 何かの学習に使われるのか。音声を処理することと、音声から学習することは別の用途です。サービスは前者について誠実でありながら、後者については曖昧なままでいることができます。

あるページが最初の質問にしか答えていないなら、全体像の3分の1しか手にしていません。どの質問にも答えず、代わりに暗号化についての言葉を並べているなら、それ自体を一つの答えとして受け止めてください。保存期間についての曖昧さは、めったに偶然ではありません。

この基準をここで当てはめると、SozAIの文字起こしアプリはサーバー上で動作します。つまり録音またはアップロードした音声は処理のために送信され、保存や取り扱いの詳細はセキュリティとデータ取り扱いのページに記載されています。一方、ウェブサイト上の無料の字幕・文字数カウントツールは完全にブラウザ内で動作する部分であり、文字起こしは行いません。

文字起こしの削除は、音声データの削除とは違う

これは、他のすべてを正しくやった人でも引っかかる落とし穴です。デリケートな録音の作業を終え、アプリから文字起こしを削除すると、その項目はリストから消えます。それで終わったように感じられます。

文字起こしと音声データは、通常それぞれ別の保存ルールに従っています。アプリから文字起こしを削除しても、それはあなたの目に見える範囲から削除されただけです。その文字起こしの元になった音声は、処理を行ったサービス側に、そのサービスが運用している保存ポリシーのもとで残っている可能性があります。そして、そのポリシーはテキストの削除ボタンを押したことでは起動しないかもしれません。この2つの削除は別々の行為であり、目の前で確認できるのはそのうちの一つだけです。

だから音声データが重要な場合は、プライバシーポリシーや、サービスがそれを文書化している場所で、保存期間についての答えを具体的に探してください。明記された期間か、出力結果だけでなく元の音声ファイルの削除を依頼できる仕組みを探してください。どちらも見つからないなら、あなたが心配している内容をカバーするポリシーはまだ見つかっていないことになります。

ローカル処理にこだわることで諦めなければならないもの

何があっても外に出さない、と決めるのは十分に理にかなった立場ですが、それには代償が伴います。契約する前にその代償をはっきり理解しておいてください。落胆は後になって、長いファイルの処理の途中でやってくることが多いからです。

モデルはデバイスの中に置かなければならないので、ストレージ容量というコストを払います。デバイス上で動かさなければならないので、時間というコストを払います。そしてそのコストは古いハードウェアや長い録音になるほど大きくなります。2時間の会議は、数年前のスマートフォンでは2分で終わる作業ではありません。ローカルのアーキテクチャの中でこれをお金で解決する方法はありません。速いマシンを介さないことこそが、この方式のそもそもの要点だからです。

精度については、どちらの方向にも一般論を鵜呑みにしないほうがいいです。確実に言えるのは、ローカル方式はデバイスに収まる大きさとデバイスが計算できる範囲に縛られており、サーバー方式にはそうした制約がないということです。それが実際の文字起こし結果に影響するかどうかは、モデル、録音内容、話者のアクセント、背景の雑音、言語によって変わります。誠実なテストは一つしかありません。大事な用途で頼る前に、検討しているツールで、自分自身の音声を使って試すことです。

そして見落とされがちな中間の道もあります。すべての録音が同じ扱いを必要とするわけではありません。セラピーの録音と定例会議の録音は、同一の取り扱いを必要としません。ほとんどの作業にはサーバー型のツールを使い、一部の録音だけは完全にそこから外して、手作業で文字起こしするか、あるいは文字起こし自体をしない、という判断も十分に理にかなっています。あるファイルをどちらの山に入れるかを決めることのほうが、すべてのケースを満たす一つのツールを探すよりも、たいてい早く安心にたどり着けます。

回答

Frequently Asked Questions

文字起こしソフトは音声をアップロードするのか

ほとんどのソフトはアップロードします。サーバー上で動く文字起こしとデバイス上で動く文字起こしはアーキテクチャそのものが異なり、アプリが作られた時点で決まっています。サーバー方式のほうがはるかに一般的です。ローカルのモデルはストレージを消費し、古いハードウェアでは動作が遅くなるからです。インターフェースを見ただけでは判別できず、それを変更する設定も存在しないため、処理がどこで行われるかについてサービスが文書化している内容を確認する必要があります。

デバイス内での文字起こしは、クラウドでの文字起こしと同じくらい正確なのか

信頼できる一般論はないので、決める前に自分自身の音声で両方を試してください。確実に言えるのは、ローカル方式はデバイスに縛られるということです。モデルはストレージに収まり、手元のハードウェアで動かなければならないため、古いマシンでは遅くなります。サーバーにはそうした上限がありません。その差が実際の文字起こし結果に表れるかどうかは、録音内容、言語、モデルによって変わります。

プライバシーポリシーにある「暗号化」は実際に何をカバーしているのか

通常は通信経路だけです。通信の暗号化とは、データがデバイスとサービスの間を移動している間、保護されているという意味であり、あなたの音声がサーバー上で処理されるのか、その後も保存され続けるのかについては何も語りません。両方のケースと完全に両立します。ポリシーが、処理がどこで行われるか、音声がどれくらい保存されるかに答える代わりに暗号化についての言葉を並べているなら、それは道について説明されているだけで、行き先については説明されていないということです。

Webサイトは音声をサーバーに送らずに文字起こしできるのか

できません。ファイルをローカルで処理するブラウザ上のツールは実在し、本当に何もアップロードしません。しかし、それらができるのはモデルを必要としない作業だけです。字幕フォーマットの変換、字幕タイミングのずらし、すでにあるテキストの単語数を数える、といった作業です。音声をテキストに変換するには音声認識モデルが必要で、モデルはどこかに置いておかなければなりません。Webページが音声を文字起こしするなら、そのファイルはどこかに送られて処理されていると考えてください。

文字起こしを削除したら、音声データも削除されるのか

必ずしもそうではありません。文字起こしと元の音声データは通常別々の保存ルールに従っているため、アプリから文字起こしを削除しても、それはあなたの目に見える範囲から削除されただけで、音声データは処理を行ったサービス側に残っている場合があります。一方の削除が両方をカバーすると思い込まず、音声データについて明記された保存期間や、元のファイルの削除を依頼する方法を具体的に探してください。

デリケートな音声を使う前に、文字起こしサービスに何を確認すべきか

3つのことを確認し、そのすべてに答えてもらう必要があります。音声はデバイスの外に出るのか。出るならどれくらいの期間保存されるのか。何かの学習に使われるのか。サービスは最初の質問には誠実に答えながら、残りの2つには何も語らないことがあり、それでは全体像の3分の1しか分かりません。特に保存期間についての曖昧さはめったに偶然ではなく、それを理由に利用を見送るのは十分に理にかなった判断です。

Merey Tleugazin

SozAIの創業者。世界中のプロに向けて、音声をテキスト化するツールを開発中。

SozAI
SozAI — 無料ダウンロード音声・動画をすぐに文字起こし
アプリを入手