跳到内容

让转录文本准确标注发言人

1 min read 1 views 最后更新: 8 月 2, 2026
A round table seen from above with four coffee cups around it and a phone in the centre

核心要点

转录文本可能把每一个字都听对了,却还是安到了错的人头上——因为“识别说的是什么”和“判断是谁在说”本来就是两件不同的事。说话人标注靠的是声音特征来区分,所以最擅长应对的是:几个声音明显不同的人,用同一个麦克风、以差不多的音量录下来。它最怕的是大家抢着说话、有人说话声音小或者中途才加入,而且它永远不会自己给你真实姓名——那一步得你自己来补上。

如果你打开一份多人对话的转录文本,发现里面一半内容都安到了错的人身上,那大概不是文字本身出了问题。问题出在流程中更靠前的一环——判断“谁在说话”,而不是“说了什么”。这一环用的是完全不同的信息,出错的方式也不一样,而且决定它能不能做好的因素,几乎都在录音那一刻就定下来了,软件还没碰到这份文件之前就已经决定了。

如果你正准备录一段采访、一场座谈,或者一次家庭聚会的对话,而且你真正在意的是谁说了什么、而不只是说了什么内容,这部分内容就值得好好了解一下。这里面一部分是关于麦克风该放在哪儿,另一部分则是要接受——不管你用什么工具处理,有些场景就是没法标得干净。

两个不同的活儿,却挤进同一份文本

识别文字和判断是谁说的,其实是两项不同的工作,只是最后都落在同一份文档里。第一项工作听的是声音,判断的是语言内容——它基本不在乎这个声音是谁的。第二项工作听的是同一段声音,问的却是另一个问题:这个声音跟两句话之前的是同一个人吗,还是换了个新的说话人?这个问题的答案来自声音本身的特征——音高、音色、说话的节奏,也就是一个人说话时独有的“声纹”——而不是靠说的内容来判断。

这就是为什么一份转录文本可能逐字逐句都对,却还是把台词安错了人。识别文字这一步成功了,区分说话人这一步没成功。这两件事可以各自独立地出错,所以有人跟你说转录“错了”的时候,值得先弄清楚到底是哪一步出了问题,因为解决办法完全不一样。

什么情况下说话人区分做得好

说话人区分表现最好的情况是:说话人数量不多,声音彼此听起来差异明显,而且都是同一个麦克风位置录下来的,音量也差不多。理想情况就是这样——两三个人,声音各有特点,一台录音设备放在能均匀听到全场的地方。

偏离这个理想状态,每一步都要付出代价。人数越多,两个声音听起来相似、混在一起的可能性就越大。声音相近的人——比如年龄相仿、口音相似的两个人——比一个低音一个高音的组合更难分开。而如果某个人被录得比别人明显大声,系统就会把音量的差异当成说话人的差异来处理,可实际上这两者根本不是一回事。

这些都不是什么高深的东西。换成一个人闭上眼睛去听,大概也会注意到同样的情况。软件的优势在于能在一小时的音频里保持耐心和一致性,而不是拥有什么听众没有的“超能力”。

最容易崩的地方:大家抢着说话

有一种情况几乎百分百会打乱说话人标注,而且再怎么把录音条件做好都救不回来:真正意义上的“抢话”,也就是两个人同时在说话。重叠的那一刻,没有哪一段声音是干干净净属于某一个人的——音频本身就是两个人声音的混合体,根本没法干净地分给谁。通常的结果是,一个人说的话会被并进另一个人的发言里,转录文本上看起来像是一个人连续说了一整段,其实那段时间是两个人同时在说话。

这不是以后可以打补丁修好的漏洞,而是这类问题本身自带的极限——事后想把两个混在一起的声音干干净净地拆成两条独立的音轨,做不到,至少不可靠。比较现实的期待是:录音里真正重叠的那些片段,需要人工再过一遍才能理清谁说了什么,不然就只能保留系统猜测的结果。如果你的对话里经常有人抢话——比如一场火药味很浓的座谈,或者一场吵得热闹的家庭聚餐——就要提前料到那一部分转录文本会需要手动修正,别因为那一段就否定整个工具。

麦克风放在哪儿,比麦克风本身是什么更重要

麦克风离说话人的距离,对说话人标注的影响比麦克风本身的好坏更大。一台手机放在桌子中间,通常比一支质量更好但恰好放在某一个人旁边的麦克风,能给出更好的说话人区分效果,因为声音小、离得远的参与者恰恰是系统最先“听丢”的对象。如果有个人因为离麦克风最远,说话声音一直明显比别人小,这种音量差距对说话人标注的影响,可能比任何设备上的差异都更大。

对于多人对话来说,这就指向一个简单的原则:把录音设备放在中心位置,而不是放在方便的地方。放桌子中间,而不是放在离主持人最近的那一端。如果大家坐得比较分散,而不是紧挨着围坐在一起,那不管用什么设备都会更难处理,提前知道这一点,总比事后才发现要好。

让转录文本显示真实姓名,而不是“说话人1”“说话人2”

音频本身没法告诉转录系统任何人的名字——它能分辨出这是两个不同的声音,但没办法知道其中一个叫小陈,另一个叫小李。所以输出结果一开始都是匿名标签:说话人1、说话人2,依此类推。把这些标签换成真实姓名是一个手动步骤,而且只需要在转录文本开头做一次,把每个标签对应到一个名字上就行。

让这一步变得轻松而不是麻烦的诀窍,是让每个人在录音刚开始的时候都大声说一下自己的名字。这只花大概十秒钟,却能给你一个清晰的参照点——你知道开头那句“我是小李”的声音,接下来整份文档里都该标成小李。省了这一步,你就只能靠记忆或者上下文去把声音和名字对上号,这样也行,但更费时间,说话人越多、出错的概率也越大。

如果你专门是在录一场采访,这个习惯值得写进你每次开录的固定流程里——更多关于怎么从第一分钟就把这件事做好的内容,可以看看采访录音转文字这篇。至于怎么把录好的音频变成标注好说话人的文字,音频转文字这篇讲了具体的转换步骤;而像SozAI推出的转录app,拿到录音之后就能生成说话人标注、摘要,还能在多种语言之间做翻译——事后给说话人填上真实姓名仍然要你自己来做,但那一步会很快。

现实一点:该有什么预期

即便录音条件已经很好,还是有几种情况会稳定地产生不完美的结果,提前了解这些情况,把它们当作正常现象而不是工具的失败,会更划算。

  • 如果有人是在录音进行到一半才加入的,这时系统已经根据前面的声音建好了各自的“声音档案”,这位新加入的人往往会被并进已有的某个说话人标签里,而不会单独给一个新标签。
  • 如果有人在整段录音里只说了几句话——比如简单应一声、问一句话——常常会被归并到旁边那个人的发言里,因为系统手里这个人的声音样本太少,不够单独建一个档案。
  • 真正的重叠发言,就像前面说的那样,往往会被合并成某一个人的一整段发言。
  • 人数多、声音又相似的大群体,比声音各有特色的小群体,会产生更多的标注错误,原因很简单——出错的机会更多了。

这些都不是说难处理的录音就不值得转录了——它们只是提醒你,这些片段大概需要人工再核对一遍,而不是整份文档都要重新检查一遍。如果你知道自己要录的东西本来就比较复杂,也值得提前想清楚:你到底需要逐字逐句的全部转录,还是只需要标好说话人的重点内容?把每个字都转录出来并不总是最有用的做法,尤其是对长录音来说,你其实主要想知道的是谁在什么事情上表了态——这类用法可以参考把录音变成会议记录这篇。另外,如果你想在处理长文件之前,先测试一下某段录音的标注效果,可以去下载页拿到这个app,先跑一小段样本试试,这比任何笼统的建议都更能告诉你实际结果。

真正起作用的是什么

如果这篇文章只让你记住一件事,那就是:录音本身比软件更重要。麦克风放在中心位置、说话人数量不多且声音各不相同、每个人一开始都说一下自己的名字,再加上接受重叠发言需要人工核对——这套组合带来的效果,会比事后调什么设置、选什么功能都更明显。标注这一步确实在做实实在在的工作,但它能做到什么程度,取决于录音本身给了它什么素材;一段从一开始就考虑到说话人区分的录音,标注效果永远会比没考虑这一点的录音更好,不管后面用什么软件来转录,都是这样。

答案

Frequently Asked Questions

转录软件真的能自己分清不同的说话人吗?

能,但靠的是音高、音色这类声音特征,不是靠内容判断。声音数量少、彼此差异明显、用同一个麦克风以差不多的音量录下来,效果最好;人数越多、声音越相似,准确度就越会下降。

为什么转录文本把两个不同的人合并成了同一个说话人标签?

通常是因为有人中途才加入录音,或者只说了几句话,又或者因为离麦克风远而声音明显偏小。系统手里这个人的声音样本不够,没法单独建一个声音档案。

一段录音里最多能有几个人,说话人标注才不会出问题?

没有固定的数字,但人越多准确度越会下降,尤其是声音相近的情况。两三个声音明显不同的人,标注效果会比一大群声音相似的人明显更可靠。

录多人对话时,手机或录音设备该放在哪儿?

放在中间位置,比如桌子正中,而不是靠近某一个人。麦克风离说话人的距离,比麦克风本身的好坏更重要,因为声音小或离得远的人最容易被漏标或标错。

能不能让转录文本直接显示真实姓名,而不是说话人1、说话人2?

不能自动做到——音频本身没法告诉系统任何人的名字。你需要在转录文本开头手动添加姓名,如果每个人在录音开始时都念一下自己的名字,这一步会容易很多。

两个人同时说话时,转录文本会怎么处理?

在真正重叠的那一刻,两个人的声音是混在一起的,没法干净地分给某一方,系统通常会把一个人的话并进另一个人的发言里。这是这类问题本身的局限,不是靠调设置能解决的,一般需要人工再核对一遍。

Merey Tleugazin

SozAI 创始人。正在为全球专业人士打造将语音转为文本的工具。

SozAI
SozAI — 免费下载即时转录音频和视频
获取 App