核心要点
转录文本可能把每一个字都听对了,却还是安到了错的人头上——因为“识别说的是什么”和“判断是谁在说”本来就是两件不同的事。说话人标注靠的是声音特征来区分,所以最擅长应对的是:几个声音明显不同的人,用同一个麦克风、以差不多的音量录下来。它最怕的是大家抢着说话、有人说话声音小或者中途才加入,而且它永远不会自己给你真实姓名——那一步得你自己来补上。
如果你打开一份多人对话的转录文本,发现里面一半内容都安到了错的人身上,那大概不是文字本身出了问题。问题出在流程中更靠前的一环——判断“谁在说话”,而不是“说了什么”。这一环用的是完全不同的信息,出错的方式也不一样,而且决定它能不能做好的因素,几乎都在录音那一刻就定下来了,软件还没碰到这份文件之前就已经决定了。
如果你正准备录一段采访、一场座谈,或者一次家庭聚会的对话,而且你真正在意的是谁说了什么、而不只是说了什么内容,这部分内容就值得好好了解一下。这里面一部分是关于麦克风该放在哪儿,另一部分则是要接受——不管你用什么工具处理,有些场景就是没法标得干净。
两个不同的活儿,却挤进同一份文本
识别文字和判断是谁说的,其实是两项不同的工作,只是最后都落在同一份文档里。第一项工作听的是声音,判断的是语言内容——它基本不在乎这个声音是谁的。第二项工作听的是同一段声音,问的却是另一个问题:这个声音跟两句话之前的是同一个人吗,还是换了个新的说话人?这个问题的答案来自声音本身的特征——音高、音色、说话的节奏,也就是一个人说话时独有的“声纹”——而不是靠说的内容来判断。
这就是为什么一份转录文本可能逐字逐句都对,却还是把台词安错了人。识别文字这一步成功了,区分说话人这一步没成功。这两件事可以各自独立地出错,所以有人跟你说转录“错了”的时候,值得先弄清楚到底是哪一步出了问题,因为解决办法完全不一样。
什么情况下说话人区分做得好
说话人区分表现最好的情况是:说话人数量不多,声音彼此听起来差异明显,而且都是同一个麦克风位置录下来的,音量也差不多。理想情况就是这样——两三个人,声音各有特点,一台录音设备放在能均匀听到全场的地方。
偏离这个理想状态,每一步都要付出代价。人数越多,两个声音听起来相似、混在一起的可能性就越大。声音相近的人——比如年龄相仿、口音相似的两个人——比一个低音一个高音的组合更难分开。而如果某个人被录得比别人明显大声,系统就会把音量的差异当成说话人的差异来处理,可实际上这两者根本不是一回事。
这些都不是什么高深的东西。换成一个人闭上眼睛去听,大概也会注意到同样的情况。软件的优势在于能在一小时的音频里保持耐心和一致性,而不是拥有什么听众没有的“超能力”。
最容易崩的地方:大家抢着说话
有一种情况几乎百分百会打乱说话人标注,而且再怎么把录音条件做好都救不回来:真正意义上的“抢话”,也就是两个人同时在说话。重叠的那一刻,没有哪一段声音是干干净净属于某一个人的——音频本身就是两个人声音的混合体,根本没法干净地分给谁。通常的结果是,一个人说的话会被并进另一个人的发言里,转录文本上看起来像是一个人连续说了一整段,其实那段时间是两个人同时在说话。
这不是以后可以打补丁修好的漏洞,而是这类问题本身自带的极限——事后想把两个混在一起的声音干干净净地拆成两条独立的音轨,做不到,至少不可靠。比较现实的期待是:录音里真正重叠的那些片段,需要人工再过一遍才能理清谁说了什么,不然就只能保留系统猜测的结果。如果你的对话里经常有人抢话——比如一场火药味很浓的座谈,或者一场吵得热闹的家庭聚餐——就要提前料到那一部分转录文本会需要手动修正,别因为那一段就否定整个工具。
麦克风放在哪儿,比麦克风本身是什么更重要
麦克风离说话人的距离,对说话人标注的影响比麦克风本身的好坏更大。一台手机放在桌子中间,通常比一支质量更好但恰好放在某一个人旁边的麦克风,能给出更好的说话人区分效果,因为声音小、离得远的参与者恰恰是系统最先“听丢”的对象。如果有个人因为离麦克风最远,说话声音一直明显比别人小,这种音量差距对说话人标注的影响,可能比任何设备上的差异都更大。
对于多人对话来说,这就指向一个简单的原则:把录音设备放在中心位置,而不是放在方便的地方。放桌子中间,而不是放在离主持人最近的那一端。如果大家坐得比较分散,而不是紧挨着围坐在一起,那不管用什么设备都会更难处理,提前知道这一点,总比事后才发现要好。
让转录文本显示真实姓名,而不是“说话人1”“说话人2”
音频本身没法告诉转录系统任何人的名字——它能分辨出这是两个不同的声音,但没办法知道其中一个叫小陈,另一个叫小李。所以输出结果一开始都是匿名标签:说话人1、说话人2,依此类推。把这些标签换成真实姓名是一个手动步骤,而且只需要在转录文本开头做一次,把每个标签对应到一个名字上就行。
让这一步变得轻松而不是麻烦的诀窍,是让每个人在录音刚开始的时候都大声说一下自己的名字。这只花大概十秒钟,却能给你一个清晰的参照点——你知道开头那句“我是小李”的声音,接下来整份文档里都该标成小李。省了这一步,你就只能靠记忆或者上下文去把声音和名字对上号,这样也行,但更费时间,说话人越多、出错的概率也越大。
如果你专门是在录一场采访,这个习惯值得写进你每次开录的固定流程里——更多关于怎么从第一分钟就把这件事做好的内容,可以看看采访录音转文字这篇。至于怎么把录好的音频变成标注好说话人的文字,音频转文字这篇讲了具体的转换步骤;而像SozAI推出的转录app,拿到录音之后就能生成说话人标注、摘要,还能在多种语言之间做翻译——事后给说话人填上真实姓名仍然要你自己来做,但那一步会很快。
现实一点:该有什么预期
即便录音条件已经很好,还是有几种情况会稳定地产生不完美的结果,提前了解这些情况,把它们当作正常现象而不是工具的失败,会更划算。
- 如果有人是在录音进行到一半才加入的,这时系统已经根据前面的声音建好了各自的“声音档案”,这位新加入的人往往会被并进已有的某个说话人标签里,而不会单独给一个新标签。
- 如果有人在整段录音里只说了几句话——比如简单应一声、问一句话——常常会被归并到旁边那个人的发言里,因为系统手里这个人的声音样本太少,不够单独建一个档案。
- 真正的重叠发言,就像前面说的那样,往往会被合并成某一个人的一整段发言。
- 人数多、声音又相似的大群体,比声音各有特色的小群体,会产生更多的标注错误,原因很简单——出错的机会更多了。
这些都不是说难处理的录音就不值得转录了——它们只是提醒你,这些片段大概需要人工再核对一遍,而不是整份文档都要重新检查一遍。如果你知道自己要录的东西本来就比较复杂,也值得提前想清楚:你到底需要逐字逐句的全部转录,还是只需要标好说话人的重点内容?把每个字都转录出来并不总是最有用的做法,尤其是对长录音来说,你其实主要想知道的是谁在什么事情上表了态——这类用法可以参考把录音变成会议记录这篇。另外,如果你想在处理长文件之前,先测试一下某段录音的标注效果,可以去下载页拿到这个app,先跑一小段样本试试,这比任何笼统的建议都更能告诉你实际结果。
真正起作用的是什么
如果这篇文章只让你记住一件事,那就是:录音本身比软件更重要。麦克风放在中心位置、说话人数量不多且声音各不相同、每个人一开始都说一下自己的名字,再加上接受重叠发言需要人工核对——这套组合带来的效果,会比事后调什么设置、选什么功能都更明显。标注这一步确实在做实实在在的工作,但它能做到什么程度,取决于录音本身给了它什么素材;一段从一开始就考虑到说话人区分的录音,标注效果永远会比没考虑这一点的录音更好,不管后面用什么软件来转录,都是这样。

