**访谈转录怎么做：逐字稿级别与标注符号**
Source: https://sozai.app/zh/how-to-transcribe-an-interview/

[教程](https://sozai.app/zh/category/jiaocheng/)

# 如何转录访谈：逐字稿级别、说话人标签与标注符号

10 月 2, 2026  • 2 min read • 11 views  • 最后更新： 10 月 2, 2026

![Two chairs facing each other at a small table by a window, a phone recording between them next to a notebook](https://sozai.app/wp-content/uploads/post-how-to-transcribe-an-interview-1280x720.webp)

> ### 要点速览
>
>
>
> 在打下第一个字之前，先决定逐字稿的级别：完整逐字稿保留每一个“嗯”和重新开头，净化逐字稿保留意思而去掉口头语，编辑稿则为了便于阅读而整理语法。选定一套标注停顿、重叠和听不清片段的符号，把它写成文档顶部的说明，并始终如一地标注说话人。手工转录时，Texas Tech University Libraries 的口述历史指南给出的比例是每小时录音六小时打字；Cornell University 的一份课程指南说是四到六小时。自动转录几分钟内就能给你一份初稿；人工的工作从打字转向对照录音检查。

你有了录音。现在有人想要一份可以引用、编码或提交的文字稿，而第一个问题不是用哪个应用——而是你要保留多少原话。

口头语和重新开头在会话分析和某些法律场合很重要；在其他地方则是噪音。本文依次讲解三种逐字稿级别、标记停顿和重叠的符号、手工完成这项工作要花多长时间，以及自动转录在一段真实录音上哪些对、哪些错。

## 转录访谈最简单的方法是什么？

先让语音转文字引擎处理录音，然后修正人名，对照音频抽查，再加上你的项目需要的任何标注——这比从一张白纸开始打字更快，也是大多数人说“最简单”时真正想要的。把整整一小时的语音从头一字一字地打出来，是缓慢的入门方式，而不是简单的。

对于一小段录音，我们的浏览器工具 [在线转录访谈](https://sozai.app/zh/tools/transcribe-interview/) 无需账号就能完成这第一遍：上传一段录音，它会转录前 5 分钟，用 Speaker A、Speaker B 等给每次发言加上标签和时间戳，并在 99 种语言中自动检测语言。最大 25 MB 的文件原样处理；更长的录音在发送任何内容之前，会先在浏览器中裁剪到 5 分钟。结果返回后，音频和文字稿会在服务提供方处被删除，每台设备每天可以做三次预览。

这足够你判断一个工具是否值得用于某段录音。若要一次处理整场访谈，全程标注发言人，并在之后把每份文字稿保存在可搜索的文库里，SozAI 应用可以做到——前 30 分钟免费。完整情况请看 [访谈转录是怎么回事](https://sozai.app/zh/interview-transcription/) ，或者 [下载应用](https://sozai.app/zh/download/) 。

## 逐字稿和净化逐字稿有什么区别？

完整逐字稿保留每一个说出口的词：嗯、重新开头、重复的词、结巴和听得见的笑声。净化逐字稿保留说话人的话和意思，但去掉口头语、重新开头和无意的重复。编辑稿则更进一步，整理语法和句子顺序，使其读起来流畅——这恰恰是它不能再作为实际所说内容的证据的原因。

- 完整逐字稿：会话分析，某些法律和证据类工作。
- 净化逐字稿：大多数定性研究、新闻报道、用户研究。
- 编辑稿：发表的问答类文章。

| 级别 | 保留什么 | 典型用途 |
| --- | --- | --- |
| 完整逐字稿 | 每个说出口的词：口头语、重新开头、重复、结巴、听得见的声音 | 会话分析，某些法律和证据类工作 |
| 净化逐字稿 | 说话人的话和意思，去掉口头语和重新开头 | 大多数定性研究、新闻报道、用户研究 |
| 编辑稿 | 为便于阅读而整理的语法和句子顺序 | 发表的问答类文章 |

如果文字稿要用于研究项目而不是发表的文章，请在第一次访谈之前就决定，而不是在第五次之后——中途切换级别意味着要重做之前的文字稿来保持一致。与研究相关的方面，同意、匿名化和存储，在 [为研究转录访谈](https://sozai.app/zh/interview-transcript-for-research/) 中有说明。

## 访谈的文字稿怎么写？

先写一份说明：逐字稿的级别、你使用的符号，以及说话人如何标注，写在文档顶部、第一句话之前。之后任何要编码或引用这份文字稿的人都需要这份说明，几周之后你自己也需要，那时你已经忘了 (.) 是什么意思。

最知名的详细文字稿体系来自 Gail Jefferson，载于她的 [Glossary of transcript symbols with an introduction](https://doi.org/10.1075/pbns.125.02jef) （2004）。据 [Clift、Kendrick、Raymond 和 Robinson（2024）](https://eprints.whiterose.ac.uk/id/eprint/237652/1/Clift_Kendrick_Raymond_Robinson._2024_-_Jeffersonian_Transcription_conventions.pdf) 的概述，左方括号标记重叠说话开始的位置，等号连接中间没有间隔的说话，括号中的数字如 (0.5) 是以秒计的计时静默，(.) 则标记短到无法计时的停顿。各种资料对微停顿究竟多短说法不一，所以如果你的说明里用了 (.)，就应当写清它是什么意思。

大多数访谈项目不需要这么细的程度，没有它反而更易读。一套带方括号的约定就涵盖了实际会遇到的情况：用 [inaudible 00:12:31] 表示听不清的片段，并附时间戳以便再次找到；用 [crosstalk] 表示两人同时说话；用 [laughs] 和方括号中的其他非语言事件；并在每次发言开头写上说话人标签。

| 符号 | 含义 | 体系 |
| --- | --- | --- |
| [ | 重叠说话开始的位置 | 杰斐逊 |
| = | 没有间隔而连接的说话（紧接） | 杰斐逊 |
| (0.5) | 计时静默，以秒计 | 杰斐逊 |
| (.) | 短到无法计时的停顿 | 杰斐逊 |
| [inaudible 00:12:31] | 听不清的片段，附时间戳 | 方括号 |
| [crosstalk] | 两人同时说话 | 方括号 |
| [laughs] | 非语言声音 | 方括号 |

除了标注符号， [UK Data Service 的转录指南](https://dam.ukdataservice.ac.uk/media/187730/transcriptiondm25april2013.pdf) 说，文字稿应带有唯一标识符，在整个项目中使用统一的版式，用说话人标记表示轮流发言，并保留换行——都是小事，但正是它们让你以后能查找和比较文字稿，而不必重读全部。

说话人标签是转录软件无从知道的名字——预期会得到 Speaker A 和 Speaker B，等你弄清谁是谁之后再手动改名。 [始终如一地标注说话人](https://sozai.app/zh/who-said-what-transcript/) 讲解了如何在整个项目中做到这一点，而不让名字在文件之间漂移。

边做边匿名，而不是事后：在文字稿里直接把姓名和可识别的细节替换成一致的占位符，如 [Participant 2] 或 [city]，并把占位符与真实姓名对应的说明另存为单独的文件。几乎在所有地方，录制一个人都需要他的同意，研究伦理委员会通常会要求书面同意；转录录音并不改变这一要求。

## 转录一段访谈要多长时间？

手工的话，要按小时而不是分钟计划。 [Texas Tech University Libraries 的口述历史指南](https://guides.library.ttu.edu/c.php?g=1275281&p=9356352) 说，即使是有经验的转录员，通常也是每小时音频要六小时打字。 [Cornell University 的一份课程指南](https://courses2.cit.cornell.edu/fit117/CP_T.htm) 给得更低，是每小时录音四到六小时——差距主要取决于音频有多清晰，以及过程中添加了多少标注。

自动转录改变的是时间花在哪里，而不是让它消失。初稿几分钟内就返回；剩下的是对照录音听一遍，修正人名和专业术语，在标签弄混的地方更正谁说了什么，并加上项目需要的任何标注。对一小时的访谈来说，这仍是实实在在的工作，只是换了一种—— [转录实际要多长时间](https://sozai.app/zh/how-long-will-transcription-take/) 对此有更详细的拆解。

## ChatGPT 能转录访谈吗？

聊天机器人能否把音频文件变成文字取决于产品，但访谈文字稿需要的不只是文字：还需要你可以回溯的时间戳和你能信赖的说话人切换，而这正是转录引擎被设计出来要产出的。聊天机器人在那一步之后才有用武之地，用来整理、总结或重新排版你已有的文字稿。

无论哪种方式，自动生成的文字在你引用之前都必须对照录音检查，而这一检查，没有哪个工具能免掉。

某个引擎需要多少检查，差别相当大。 [AI 转录有多准确](https://sozai.app/zh/how-accurate-is-ai-transcription/) 讲了应有的预期，以及错误往往集中在哪里。

## 真实的自动转录会错在哪里

自动转录是一份初稿，要看清这意味着什么，最清楚的办法是跑一次，再对照录音读一遍。2026 年 10 月 2 日我们就是这样做的，对象是一段公开录音的前 5 分钟，任何人都可以对照本文核实。

我们用 SozAI 访谈工具背后的引擎处理了 NASA Johnson Space Center 播客 Houston We Have a Podcast 第 180 期“Artemis Mission Management”的前 5 分钟（300 秒），主持人是 Gary Jordan，嘉宾是 Mike Sarafin——这是 NASA 的作品，因此不受版权保护。它返回了 778 个词，检测到英语，并发现 2 位说话人。开头几行，按引擎的呈现如下：

[00:00] Speaker A: Houston, we have a podcast. Welcome to the official podcast of the NASA Johnson Space Center, episode 180, Artemis Mission Management. I'm Gary Jordan, and I'll be your host today.
[01:19] Speaker B: T-minus five seconds and counting. Mark.
[01:22] Speaker A: Launch commit lights are correct. There she goes. Houston. We have a podcast. Mike Serafin, thanks for coming on Houston, We Have a Podcast today.
[01:36] Speaker B: Thank you. It's a pleasure to be here to talk about these exciting Artemis missions we have ahead of us. Yeah, right?
[01:43] Speaker A: Returning to the Moon. Not a bad thing to be a part of.

仅这五次发言中，就有三处需要人工过一遍。01:19 的发射倒计时和 01:22 的“Launch commit lights are correct. There she goes.”是剪进播客里的发射存档音频，不是主持人或嘉宾在说话——引擎还是把它们标成了 Speaker B 和 Speaker A。01:36 那次发言末尾的“Yeah, right?”其实是主持人重新接过话头；它属于下一次发言的开头，而不是嘉宾发言的结尾。而嘉宾的姓氏在这里成了 Serafin，尽管本期节目自己的字幕署名拼的是 Sarafin。

稍后的一次发言展示了净化逐字稿的用处。引擎在 02:51 的输出是：“Yes, so you’re, you’re right in that I lived in the operations realm for 22 of my 27 years in, in my NASA career.”净化逐字稿处理会把它变成：“You’re right in that I lived in the operations realm for 22 of my 27 years in my NASA career.”完整逐字稿则会原样保留这些重复；如果说有什么倾向，引擎更倾向于保留它们——它在整个文件中保留了大部分重复和重新开头（“you’re, you’re right”、“in, in my NASA career”、“That’s, that’s quite a number of”），这使它的输出更接近逐字稿，而不是净化逐字稿。如果项目需要净化逐字稿，无论哪个引擎生成初稿，都要为一遍编辑留出预算。

答案

## Frequently Asked Questions

转录访谈最简单的方法是什么？

先让语音转文字引擎处理录音，得到初稿，然后对照音频检查并修正说话人姓名和听不清的词——从零开始手打只会更慢，而不是更简单。像 SozAI 的访谈转录器这样的浏览器工具，无需账号就能生成前 5 分钟带标签、带时间戳的初稿，足够你判断是否值得处理整个文件。

一份完成的访谈文字稿应该是什么样子？

开头是一份简短的说明，写明逐字稿级别、所用的标注符号以及说话人的标注方式，随后是带标签的发言，如 Speaker A，并附时间戳。UK Data Service 的转录指南还补充说，它应当带有唯一标识符、统一的版式、说话人标记和换行，这样以后才能查找和比较，而不必重读全部内容。

ChatGPT 能转录访谈吗？

这取决于具体产品，而且它不适合做第一步。访谈文字稿需要你能信赖的时间戳和说话人切换，这正是转录引擎的产出。聊天机器人在之后才派得上用场，用来整理、总结或重新排版你已有的文字稿，而任何自动生成的文字仍然必须对照录音检查。

应该用逐字稿还是净化逐字稿？

做会话分析或法律、证据类工作时用完整逐字稿，因为每个“嗯”、重新开头和重复都很重要；大多数定性研究、新闻报道和用户研究用净化逐字稿，因为意思比口误更重要。请在第一次访谈之前决定，因为中途切换意味着要重做之前的文字稿。

文字稿中如何标记听不清的部分？

写上 [inaudible] 并附时间戳，如 [inaudible 00:12:31]，这样你或任何其他人以后都能在录音中重新找到那个位置。重叠的说话用 [crosstalk]，笑声之类的非语言声音用 [laughs]——全都放在方括号里，并在文字稿顶部的说明里解释一次。

转录一小时的访谈要多长时间？

手工转录的话，Texas Tech University Libraries 的口述历史指南给出的是每小时音频约六小时的打字时间；Cornell University 的一份课程指南估计是四到六小时。自动转录几分钟内就能返回初稿，把剩下的时间转移到对照录音检查上，而不是打字。

![Merey Tleugazin](https://sozai.app/wp-content/themes/sozai/assets/images/merey-tleugazin.webp)

[Merey Tleugazin](https://sozai.app/about/merey/)

SozAI 创始人。正在为全球专业人士打造将语音转为文本的工具。

- [Instagram](https://instagram.com/mereytleugazin)
- [X](https://x.com/mereytleugazin)

## 相关文章

- [8 月 2 1 min ### 两小时的录音,转录成文字要花多长时间?](https://sozai.app/zh/how-long-will-transcription-take/)
- [7 月 19 1 min ### 如何将音频转成文字：真正有效的免费方法](https://sozai.app/zh/how-to-transcribe-audio-to-text/)
- [8 月 2 1 min ### 音频转文字,真的可以做到完全不上传吗?](https://sozai.app/zh/transcribe-audio-without-uploading-it/)

[![SozAI](https://sozai.app/wp-content/themes/sozai/assets/images/appicon.png) SozAI — 免费下载 即时转录音频和视频 获取 App](https://sozai.app/zh/download/)


---
This is the markdown twin of https://sozai.app/zh/how-to-transcribe-an-interview/ — the same content, without the markup.
Published by SozAI (https://sozai.app). Reuse and quotation are allowed with attribution and a link back.
Machine-readable index: https://sozai.app/llms.txt · data API: https://sozai.app/api/
