要点速览
在你把录音转成文字之前,先确认通话双方所在地是否允许录音。不同地区的规定不同,有的要求所有人同意,有的只需一方同意——这个问题在你按下录音键之前就该想清楚。搞清楚这一点之后,剩下的就是技术问题了。电话通话的音质是“窄带”的,编码压缩过程会丢掉转写所依赖的很多细节,而且很多录音把两边的声音混在同一个声道里,导致说话人区分不太可靠。数字、拼写和地址是最容易出错的部分。这些内容一定要对照录音核实,不要直接相信文字稿。
你手上有一份录音文件。里面有人说了些很重要的话——一个数字、一个日期、一个名字、一句承诺——你想把它变成文字,方便以后随时查阅。把文件转成文字其实是最简单的一步。真正决定这份文字稿能不能用的两件事,都发生在你打开文件之前:这段录音是否合法,以及当时的录音方式是怎样的。
先说法律问题。这个问题跟技术无关,而且无论转写得多仔细,都救不回一段本不该录的录音。
先确认录音是否合法
电话录音是否合法,取决于通话双方当时所在的地方。不同地区的规定并不一样。有些地方要求通话中的每个人都同意才能录音;有些地方只需要其中一方同意——这个人甚至可以就是正在录音的那个人。这是两种截然不同的规则,具体适用哪一种,光听录音本身是判断不出来的。
这是个法律问题,不是技术问题。这一点比听起来重要得多,因为答案在录音那一刻就已经确定了,之后做什么都改变不了它。转写文件改变不了它。删掉部分文件改变不了它。事后让对方补一句“我同意”,也不能让当初的录音行为变得合法。
如果通话双方当时不在同一个地方,可能同时涉及好几种规则,这种情况下最好去问真正懂当地法律的人,而不是凭自己读到的信息瞎猜。这只是一次简短的咨询,而且应该在你拿这份录音做任何事情之前完成。
这些提醒不是让你放弃手上已有的录音。很多通话录音确实是双方都知情的,或者发生在一方同意即可的地区,或者只是通话人自己留作参考用的。但在你把文字稿传出去、引用它,或者把它附在什么文件上之前,一定要先把这个问题想清楚。文字稿传播的范围比音频文件要广得多,速度也快得多。
为什么电话录音比在房间里录的音更难转写
电话通话的音质是“窄带”的。传输通话的编码方式会在写入文件之前,先丢掉大量的声音信息,因为它只需要保留足够让人实时听懂对话的部分就够了。人耳很擅长靠上下文补全缺失的信息。而转写软件在这方面就差多了,恰恰是那些用来区分相近发音的细节,在编码压缩时被丢掉了。
这就是为什么同一个人说同一句话,用桌上的录音设备录下来会比用电话线路录下来转写得更准。这不是软件在哪种情况下更强的问题,而是电话录音文件里根本就没有那些信息。之后无论怎么处理都补不回来——降噪不行,音量归一化不行,再拿去别的工具跑一遍也不行。你能用的,就是编码压缩之后剩下的那些内容。
再加上真实通话常见的状况,情况就更糟了。有人一边走路一边说话。有人网络信号不好,音频每隔几个字就断一下。有人抢话说。在房间里录的音,重叠的说话声已经不好处理;在压缩过的电话录音里,重叠的部分往往根本救不回来,而转写软件不会告诉你它处理得很吃力,它只会悄悄挑一个人的声音留下,把另一个人的丢掉。
用另一台设备录免提通话
把电话开成免提,再用另一台手机或录音设备录下来,听起来像是个变通办法,但实际效果比原始通话更差。对方那端的声音已经被压缩成窄带了,而你现在录的是这段已经压缩过的声音,从一个小喇叭里放出来,在房间里回荡,还混进了房间本身的回声和其他杂音。编码带来的每一层损失你都保留了,还在上面加了一层新的损失。
如果设备或服务本身能直接录下通话,就用那种方式。开免提再另外录音只是万不得已的办法,而且值得记住的是,在你打算靠这份录音做任何精确的事情之前,它始终只是万不得已的办法。
单声道还是双声道,决定了能不能区分说话人
很多通话录音会把双方的声音混进同一个声道里。所有内容都挤在一条音轨里,原本最能区分两个人的信号——也就是各自在电话线的哪一端——就没了。剩下能用来判断的,只有声音本身的特点:音调、语速、音色。如果两个人的声音本来就差异明显,这种判断方式效果还不错;如果两人声音相近,效果就差。而在窄带音频上,这种判断方式会更差,因为能区分声音特征的那些细节,正是编码压缩时被丢掉的部分。
如果双方的声音被分别保存在两个独立声道里,说话人的区分就会可靠得多。一个声道对应一个人,不需要靠猜。如果你用的录音工具可以选择这个设置,这就是值得找出来打开的选项——而且最好在打电话之前就设置好,而不是通话之后。
处理混合声道的录音时,把说话人标签当成一个有帮助的猜测,而不是确凿的记录。在一段较长、没有打断的对话里,标签通常是准的;但在两人切换说话、尤其是互相打断的地方,就容易出错。如果这份文字稿的重点是“谁答应了什么”,偏偏就是这些切换的地方最需要准确,所以一定要对照录音仔细核对这些时刻。
把文字从文件里提取出来
一旦通话录音被导出,它就不再是“一段通话”了,而是一个普通的音频文件,可以像其他音频一样转写。导出这一步因工具而异:录音应用、电话系统、运营商各不相同,导出选项通常藏在录音本身的分享按钮或者三个点的菜单里。先把文件导出来,然后不要再把它当成一段电话通话,而是把它当成一段音频来处理。
接下来的流程,跟处理任何想转成文字的音频文件是一样的。SozAI 支持在 iOS、Android 和 macOS 上转写录音,能识别说话人、生成摘要,并支持 99+ 种语言之间的翻译;你可以在这里下载这个应用。同样的方法也适用于语音留言的转写,因为语音留言同样是窄带音频,表现出的问题也一样。这只是众多选择中的一种,而工具的选择远不如你输入的音频质量重要。
如果你要处理的不是一段通话,而是几个月积累下来的一整个文件夹,问题的性质就变了。把所有内容都转写出来,只是为了找到其中一句话——这通常不是最好的思路,更有用的目标是让自己能够搜索大量积累的通话录音,而不是逐字读完它们。
如果这段录音可能要用作证据
为了提醒自己当时说了什么而留的录音,和要用作证据的录音,标准是不一样的。作为个人参考,文字稿有点小瑕疵没关系,毕竟你自己知道当时发生了什么,文字只是帮助记忆的工具。但如果是正式用途,原始文件通常必须原封不动地保留下来。
也就是说,文件从设备里导出来是什么样,就要保持什么样。别把开头的静音剪掉。别把中间不相关的部分剪掉。别为了压缩体积重新导出成别的格式,也别用会重新写一份新文件的音量归一化工具处理它。这些操作都会生成一份“派生版本”,而真正有效力的是原始文件。要处理的话,拷贝一份副本来处理,原始文件原样留着不要动。
在这种场景下,文字稿是配合录音使用的工作文档,不能取代录音本身。它能帮人快速定位到关键的那三十秒,但录音才是那三十秒里真正说了什么的凭证。至于这段录音本身能不能作为证据被采纳,是另外一个问题,应该去问你之前咨询录音合法性时问的那个人。
哪些地方还得靠自己手动核对
通话之后人们最需要的部分,往往是数字、拼写和地址——一个编号、一笔金额、一个姓氏怎么拼、哪条街。而这些恰恰是窄带音频损耗最严重的部分,因为它们没有上下文可以依靠。一整句话可以靠前后文推测还原,但一个七位数字不行。如果其中一位数字错了,周围的音频不会有任何提示,转写软件也会用跟其他内容一样的语气,理直气壮地把这个错误的数字呈现给你。
所以,通话文字稿里出现的每一个数字、名字和地址,都应该当成需要核实的内容,而不是可以直接拿来用的内容。在文字稿里找到它,跳到录音里对应的那一秒,亲耳听一下。每一项大概花一分钟,但这一分钟决定了你手上这份文字稿是“能用来做决定的”还是“看起来说得过去而已”。判断标准很简单:如果某个细节一旦出错会让你付出代价,那它就值得核对。
对文字稿其他部分的期待也该调整到合理的程度。一份电话通话的文字稿,通常能很好地还原对话的主体内容——谈话的大致走向、提出了什么方案、对方接受了什么、争执时的语气。但它对精确细节的还原能力就弱得多,遇到两人同时说话或者信号中断的地方,还会更弱。知道哪些部分能信、哪些不能信,基本就是用好文字稿的关键。文字稿能让你快速地、可搜索地浏览整段对话,并且能精确地把你带回录音中的那一秒。它替代不了录音,而在窄带文件上,它本来也从来做不到这一点。

