跳到内容

如何转录访谈:逐字稿级别、说话人标签与标注符号

•2 min read• 10 views •最后更新: 10 月 2, 2026
Two chairs facing each other at a small table by a window, a phone recording between them next to a notebook

要点速览

在打下第一个字之前,先决定逐字稿的级别:完整逐字稿保留每一个“嗯”和重新开头,净化逐字稿保留意思而去掉口头语,编辑稿则为了便于阅读而整理语法。选定一套标注停顿、重叠和听不清片段的符号,把它写成文档顶部的说明,并始终如一地标注说话人。手工转录时,Texas Tech University Libraries 的口述历史指南给出的比例是每小时录音六小时打字;Cornell University 的一份课程指南说是四到六小时。自动转录几分钟内就能给你一份初稿;人工的工作从打字转向对照录音检查。

你有了录音。现在有人想要一份可以引用、编码或提交的文字稿,而第一个问题不是用哪个应用——而是你要保留多少原话。

口头语和重新开头在会话分析和某些法律场合很重要;在其他地方则是噪音。本文依次讲解三种逐字稿级别、标记停顿和重叠的符号、手工完成这项工作要花多长时间,以及自动转录在一段真实录音上哪些对、哪些错。

转录访谈最简单的方法是什么?

先让语音转文字引擎处理录音,然后修正人名,对照音频抽查,再加上你的项目需要的任何标注——这比从一张白纸开始打字更快,也是大多数人说“最简单”时真正想要的。把整整一小时的语音从头一字一字地打出来,是缓慢的入门方式,而不是简单的。

对于一小段录音,我们的浏览器工具在线转录访谈无需账号就能完成这第一遍:上传一段录音,它会转录前 5 分钟,用 Speaker A、Speaker B 等给每次发言加上标签和时间戳,并在 99 种语言中自动检测语言。最大 25 MB 的文件原样处理;更长的录音在发送任何内容之前,会先在浏览器中裁剪到 5 分钟。结果返回后,音频和文字稿会在服务提供方处被删除,每台设备每天可以做三次预览。

这足够你判断一个工具是否值得用于某段录音。若要一次处理整场访谈,全程标注发言人,并在之后把每份文字稿保存在可搜索的文库里,SozAI 应用可以做到——前 30 分钟免费。完整情况请看访谈转录是怎么回事,或者下载应用。

逐字稿和净化逐字稿有什么区别?

完整逐字稿保留每一个说出口的词:嗯、重新开头、重复的词、结巴和听得见的笑声。净化逐字稿保留说话人的话和意思,但去掉口头语、重新开头和无意的重复。编辑稿则更进一步,整理语法和句子顺序,使其读起来流畅——这恰恰是它不能再作为实际所说内容的证据的原因。

  • 完整逐字稿:会话分析,某些法律和证据类工作。
  • 净化逐字稿:大多数定性研究、新闻报道、用户研究。
  • 编辑稿:发表的问答类文章。
三种逐字稿级别及各自保留的内容
级别保留什么典型用途
完整逐字稿每个说出口的词:口头语、重新开头、重复、结巴、听得见的声音会话分析,某些法律和证据类工作
净化逐字稿说话人的话和意思,去掉口头语和重新开头大多数定性研究、新闻报道、用户研究
编辑稿为便于阅读而整理的语法和句子顺序发表的问答类文章

如果文字稿要用于研究项目而不是发表的文章,请在第一次访谈之前就决定,而不是在第五次之后——中途切换级别意味着要重做之前的文字稿来保持一致。与研究相关的方面,同意、匿名化和存储,在为研究转录访谈中有说明。

访谈的文字稿怎么写?

先写一份说明:逐字稿的级别、你使用的符号,以及说话人如何标注,写在文档顶部、第一句话之前。之后任何要编码或引用这份文字稿的人都需要这份说明,几周之后你自己也需要,那时你已经忘了 (.) 是什么意思。

最知名的详细文字稿体系来自 Gail Jefferson,载于她的 Glossary of transcript symbols with an introduction(2004)。据 Clift、Kendrick、Raymond 和 Robinson(2024)的概述,左方括号标记重叠说话开始的位置,等号连接中间没有间隔的说话,括号中的数字如 (0.5) 是以秒计的计时静默,(.) 则标记短到无法计时的停顿。各种资料对微停顿究竟多短说法不一,所以如果你的说明里用了 (.),就应当写清它是什么意思。

大多数访谈项目不需要这么细的程度,没有它反而更易读。一套带方括号的约定就涵盖了实际会遇到的情况:用 [inaudible 00:12:31] 表示听不清的片段,并附时间戳以便再次找到;用 [crosstalk] 表示两人同时说话;用 [laughs] 和方括号中的其他非语言事件;并在每次发言开头写上说话人标签。

文字稿标注:杰斐逊符号和较简洁的方括号约定
符号含义体系
[重叠说话开始的位置杰斐逊
=没有间隔而连接的说话(紧接)杰斐逊
(0.5)计时静默,以秒计杰斐逊
(.)短到无法计时的停顿杰斐逊
[inaudible 00:12:31]听不清的片段,附时间戳方括号
[crosstalk]两人同时说话方括号
[laughs]非语言声音方括号

除了标注符号,UK Data Service 的转录指南说,文字稿应带有唯一标识符,在整个项目中使用统一的版式,用说话人标记表示轮流发言,并保留换行——都是小事,但正是它们让你以后能查找和比较文字稿,而不必重读全部。

说话人标签是转录软件无从知道的名字——预期会得到 Speaker A 和 Speaker B,等你弄清谁是谁之后再手动改名。始终如一地标注说话人讲解了如何在整个项目中做到这一点,而不让名字在文件之间漂移。

边做边匿名,而不是事后:在文字稿里直接把姓名和可识别的细节替换成一致的占位符,如 [Participant 2] 或 [city],并把占位符与真实姓名对应的说明另存为单独的文件。几乎在所有地方,录制一个人都需要他的同意,研究伦理委员会通常会要求书面同意;转录录音并不改变这一要求。

转录一段访谈要多长时间?

手工的话,要按小时而不是分钟计划。Texas Tech University Libraries 的口述历史指南说,即使是有经验的转录员,通常也是每小时音频要六小时打字。Cornell University 的一份课程指南给得更低,是每小时录音四到六小时——差距主要取决于音频有多清晰,以及过程中添加了多少标注。

自动转录改变的是时间花在哪里,而不是让它消失。初稿几分钟内就返回;剩下的是对照录音听一遍,修正人名和专业术语,在标签弄混的地方更正谁说了什么,并加上项目需要的任何标注。对一小时的访谈来说,这仍是实实在在的工作,只是换了一种——转录实际要多长时间对此有更详细的拆解。

ChatGPT 能转录访谈吗?

聊天机器人能否把音频文件变成文字取决于产品,但访谈文字稿需要的不只是文字:还需要你可以回溯的时间戳和你能信赖的说话人切换,而这正是转录引擎被设计出来要产出的。聊天机器人在那一步之后才有用武之地,用来整理、总结或重新排版你已有的文字稿。

无论哪种方式,自动生成的文字在你引用之前都必须对照录音检查,而这一检查,没有哪个工具能免掉。

某个引擎需要多少检查,差别相当大。AI 转录有多准确讲了应有的预期,以及错误往往集中在哪里。

真实的自动转录会错在哪里

自动转录是一份初稿,要看清这意味着什么,最清楚的办法是跑一次,再对照录音读一遍。2026 年 10 月 2 日我们就是这样做的,对象是一段公开录音的前 5 分钟,任何人都可以对照本文核实。

我们用 SozAI 访谈工具背后的引擎处理了 NASA Johnson Space Center 播客 Houston We Have a Podcast 第 180 期“Artemis Mission Management”的前 5 分钟(300 秒),主持人是 Gary Jordan,嘉宾是 Mike Sarafin——这是 NASA 的作品,因此不受版权保护。它返回了 778 个词,检测到英语,并发现 2 位说话人。开头几行,按引擎的呈现如下:

[00:00] Speaker A: Houston, we have a podcast. Welcome to the official podcast of the NASA Johnson Space Center, episode 180, Artemis Mission Management. I'm Gary Jordan, and I'll be your host today.
[01:19] Speaker B: T-minus five seconds and counting. Mark.
[01:22] Speaker A: Launch commit lights are correct. There she goes. Houston. We have a podcast. Mike Serafin, thanks for coming on Houston, We Have a Podcast today.
[01:36] Speaker B: Thank you. It's a pleasure to be here to talk about these exciting Artemis missions we have ahead of us. Yeah, right?
[01:43] Speaker A: Returning to the Moon. Not a bad thing to be a part of.

仅这五次发言中,就有三处需要人工过一遍。01:19 的发射倒计时和 01:22 的“Launch commit lights are correct. There she goes.”是剪进播客里的发射存档音频,不是主持人或嘉宾在说话——引擎还是把它们标成了 Speaker B 和 Speaker A。01:36 那次发言末尾的“Yeah, right?”其实是主持人重新接过话头;它属于下一次发言的开头,而不是嘉宾发言的结尾。而嘉宾的姓氏在这里成了 Serafin,尽管本期节目自己的字幕署名拼的是 Sarafin。

稍后的一次发言展示了净化逐字稿的用处。引擎在 02:51 的输出是:“Yes, so you’re, you’re right in that I lived in the operations realm for 22 of my 27 years in, in my NASA career.”净化逐字稿处理会把它变成:“You’re right in that I lived in the operations realm for 22 of my 27 years in my NASA career.”完整逐字稿则会原样保留这些重复;如果说有什么倾向,引擎更倾向于保留它们——它在整个文件中保留了大部分重复和重新开头(“you’re, you’re right”、“in, in my NASA career”、“That’s, that’s quite a number of”),这使它的输出更接近逐字稿,而不是净化逐字稿。如果项目需要净化逐字稿,无论哪个引擎生成初稿,都要为一遍编辑留出预算。

答案

Frequently Asked Questions

转录访谈最简单的方法是什么?

先让语音转文字引擎处理录音,得到初稿,然后对照音频检查并修正说话人姓名和听不清的词——从零开始手打只会更慢,而不是更简单。像 SozAI 的访谈转录器这样的浏览器工具,无需账号就能生成前 5 分钟带标签、带时间戳的初稿,足够你判断是否值得处理整个文件。

一份完成的访谈文字稿应该是什么样子?

开头是一份简短的说明,写明逐字稿级别、所用的标注符号以及说话人的标注方式,随后是带标签的发言,如 Speaker A,并附时间戳。UK Data Service 的转录指南还补充说,它应当带有唯一标识符、统一的版式、说话人标记和换行,这样以后才能查找和比较,而不必重读全部内容。

ChatGPT 能转录访谈吗?

这取决于具体产品,而且它不适合做第一步。访谈文字稿需要你能信赖的时间戳和说话人切换,这正是转录引擎的产出。聊天机器人在之后才派得上用场,用来整理、总结或重新排版你已有的文字稿,而任何自动生成的文字仍然必须对照录音检查。

应该用逐字稿还是净化逐字稿?

做会话分析或法律、证据类工作时用完整逐字稿,因为每个“嗯”、重新开头和重复都很重要;大多数定性研究、新闻报道和用户研究用净化逐字稿,因为意思比口误更重要。请在第一次访谈之前决定,因为中途切换意味着要重做之前的文字稿。

文字稿中如何标记听不清的部分?

写上 [inaudible] 并附时间戳,如 [inaudible 00:12:31],这样你或任何其他人以后都能在录音中重新找到那个位置。重叠的说话用 [crosstalk],笑声之类的非语言声音用 [laughs]——全都放在方括号里,并在文字稿顶部的说明里解释一次。

转录一小时的访谈要多长时间?

手工转录的话,Texas Tech University Libraries 的口述历史指南给出的是每小时音频约六小时的打字时间;Cornell University 的一份课程指南估计是四到六小时。自动转录几分钟内就能返回初稿,把剩下的时间转移到对照录音检查上,而不是打字。

Merey Tleugazin

SozAI 创始人。正在为全球专业人士打造将语音转为文本的工具。

SozAI
SozAI — 免费下载即时转录音频和视频
获取 App