核心要点
准确率没有一个统一的数字,你看到的任何百分比,都只是某个系统在某段录音上测出来的结果。干净的单人录音和嘈杂的多人对话,两者的差距大到没有一个百分比能同时覆盖。真正决定结果好坏的是录音本身:麦克风距离、背景噪音、说话重叠、口音覆盖范围。错误还会集中出现,所以转录稿大部分读起来都没问题,出错的往往是人名、专业词汇、数字和抢话的地方。如果只是用来定位某个片段,这没什么影响。但要引用原话,就得逐句对照录音检查。
你大概在某个转录工具的宣传里见过一个百分比数字。这个数字确实测量了某件事情,只不过它测量的不是你把自己的录音喂给它之后会发生什么——把它当成承诺来看待,往往会在最要命的时候让人失望。
有意义的问题不是“AI转录整体上有多准确”,而是“你拿到的这份转录稿,对你要做的这件具体事情够不够用”。这是两个完全不同的问题,答案也不一样,因为同一份文件,用来找一个片段可能完全没问题,用来直接引用却可能完全不能用。
一个准确率数字,测的是一段录音,不是一套系统
任何准确率的说法,都是某个具体系统跑在某段具体音频上的结果。换一段音频,数字就变了。这不是测量方法的缺陷,这就是这个测量本身的意义所在。
想象两个极端。一个人,靠近麦克风,房间安静,说着一种被大量训练数据覆盖的口音,讲的是些日常话题——这种录音转录效果非常好。再想象四个人围着桌子,空调开着,说话互相打断,用着他们自己行业里的行话,其中两人离手机有一米半远——这种录音转录效果会差很多。这两个都是对同一个系统的真实测量。一个数字没法同时描述这两种情况,二者的差距大到连取平均值都没有意义。
所以当你看到一个准确率数字,却不知道它是在什么样的音频上测出来的,缺失的那部分信息才是关键。你真正知道的只是“有人测过点什么”。对你有意义的基准,是你自己的素材。找一段和你实际要处理的录音类似的音频,跑一下,再对照录音读一遍输出结果。这比任何已发布的宣传数字都更有参考价值,而且花的时间比读完那些对比测评文章还短。
录音本身对结果的影响,比软件本身更大
很多人挑转录工具时比的是准确率。但对大多数录音来说,这找错了方向。录制时的条件,对结果的影响远大于你选用哪个引擎。
- 麦克风距离。距离每多一点,收进来的房间环境音就多一点,人声就少一点。手机放在两人中间的桌上,和放在其中一人面前,是完全不同的两段录音。
- 背景噪音。车流声、咖啡馆环境音、风扇声、键盘声。噪音不只是安静地待在人声后面,它会跟人声抢地盘,输的往往是句尾那些声音本来就小的词。
- 说话重叠。两个人同时说话时,根本没有干净的信号可以转录。系统总会写出点什么,但常常是两人说话内容的混合体。
- 口音覆盖范围。有些口音在系统的训练数据里占比高得多,覆盖不够的口音,即便在同样干净的录音条件下,效果也会更差。
工具之间确实有差异,如果你的素材长期属于同一类“难录”,花一个下午测试几款工具是值得的。但同一段音频在两个靠谱工具之间的差距,通常小于同一个工具在好录音和差录音之间的差距。把麦克风挪近一点,比换一款产品更管用。如果你想搞清楚软件到底是怎么处理你给它的东西的,可以看看AI转录的工作原理,那里解释了为什么这些具体条件会有这么大影响。
错误不是均匀分布在整份文件里的
这一点最容易让人踩坑,也比标题上的准确率数字重要得多。错误是成堆出现的。转录稿的大部分内容都很干净,出问题的集中在几个可预测的地方:人名、专业词汇、数字,以及任何抢话的时刻。
想想这对阅读意味着什么。一整页正常对话转录得很好,读起来很流畅。然后一个姓氏出现了,或者一个产品名、一个数字,结果就出错了。页面上没有任何标记提示你哪里不一样。错的那个词跟对的词用着一模一样的字体,理直气壮地待在一堆正确的句子中间——而这恰恰是最容易让一个错误看起来很可信的语境。一份转录稿可以读起来很漂亮,同时恰好在你打算引用的地方出错。
这几类内容会一起出错,是有原因的。普通词汇受周围语境的约束,系统听错一个词,还能靠上下文猜回来。人名没有这种约束——几乎任何一个音都可能是某人的名字,语法上也没有任何东西能排除一个错误的猜测。专业行话有同样的问题,还多一层麻烦:一个常见词往往听起来跟专业词足够接近,容易被替换掉。数字是最极端的情况,因为发音上一点点差异就会得出完全不同的数值,而且换成哪个数字,句子读起来都一样通顺。
标点符号,是对句子在哪里结束的一种猜测
自动加标点不是转录,而是根据停顿、语调和节奏,对“一个想法在哪里停、下一个从哪里开始”做出的推断。多数时候这个推断是对的,或者对得让人根本不会注意到。
但推断错了的时候,意思就变了。一个句号点错了位置,落在一个从句中间,就可能把一个限定条件从它本该修饰的内容上切断,让一句留有余地的话变得斩钉截铁,把一个假设句变成一个断言句。每一个单独的词都可能是对的,整句话说的却是说话人根本没说过的意思。这种错误在页面上是隐形的,因为没有任何东西提示你要注意它。你没法靠读转录稿本身把它挑出来,只有录音能给出答案。
说话人标注也有类似的弱点。在一个人连续说话的一段里通常是准的,最不靠谱的是在换人说话的那一刻——一句简短的插话很容易被挂在错的人名下面。如果你要引用的那句话正好靠近说话人切换的地方,那句一定要回去听一下录音。
转录稿的用途决定了准确率的标准
问题不是“这份转录稿准不准”,而是“对这件事够不够准”,而“这件事”的差别比大多数人想象的要大得多。
如果你用转录稿来找东西,零星的错误无关紧要。你搜索一个词,定位到大概那一分钟,播放录音听一下——即便上面几行有个人名转录得乱七八糟,转录稿也完成了它该做的工作。同样的道理也适用于快速浏览一小时录音、决定哪二十分钟值得你认真听,或者把录音转成文字方便你用阅读代替听录音、节省时间。
但如果这份转录稿要被引用、发表、存档,或者要给一个不在场的人依赖,标准就完全不同了,而且没有商量的余地。你打算用到的每一行,都要单独对照录音检查一遍。不是把整份文档读一遍,而是针对每一段要引用的内容,专门回去听——因为前面说的那些出错模式,光读文字是发现不了的。这一点对任何一句话的分量压在一个数字或一个人名上的内容尤其重要。
如果只是要一份日常工作用的文档,用一个App处理是合理的做法。SozAI(支持iOS、Android和macOS)能把录音、音视频文件和YouTube链接转成带说话人标注、摘要,并支持99多种语言互译的文字稿,但你依然要对照录音核对要引用的那些话,跟任何自动生成的结果一样。
如果转录稿本身就是最终交付物,那人工转录服务才是合适的选择。它更贵,是因为有一个人坐在那里认真听,你花的钱买的正是这件事:听懂人名并正确写下来的人,知道一句话到底在哪里结束的人,遇到真的听不清的地方会标注出来而不是瞎猜的人。如果接收这份文档的是客户、法庭、档案馆或出版机构,这份成本买到的是实实在在的东西。如果转录稿只是你自己用来更快找到录音内容的工具,那这份成本就是多花了。
重新录一次,比花一小时改稿子更划算
改善录制条件几乎总是比改善输出结果更省事。花十分钟把麦克风挪近、关上窗户、关掉风扇、让大家一个一个说话,能省下的功夫比事后花一小时改文字稿还多,效果也比改稿子好——因为一份改过的转录稿,好坏最终取决于你改到最后还剩多少耐心。
对任何会重复发生的场景,这一点最容易落地。如果你经常录同一类对话,花一次心思把录制环境弄好,之后每一次录音都会受益。这一点对采访尤其重要,因为素材往往是不可再来一次的,引用的原话就是整件事的核心;采访转录的实操细节,很大一部分其实就是录制采访本身的实操细节。
有时候没有第二次机会。对话只发生了一次,手机当时揣在口袋里,那就是你手上仅有的录音。这时候诚实的做法是别再指望软件能把它救回来,而是把改稿的时间提前预留出来,或者干脆交给人工处理。难录的音频不会因为你需要它变好而自己变好。
打开文件之后,该预期看到什么
预期看到流畅、可读的文字,里面夹杂着几个错的名词。预期人们抢话的那几段会显得单薄、含糊,甚至悄无声息地缺失。预期出现一些你自己不会那样断句的标点选择,以及大体准确、但在说话人切换那一刻不太可靠的说话人标注。预期不会有任何标记、任何高亮、任何表示“这里不确定”的提示。整份文档从头到尾看起来同样自信,但不会从头到尾同样准确。
预期人名和专业术语无论录音有多干净,都需要单独再检查一遍。它们在好录音上也会出错,只是频率低一些。
留着录音。自动转录稿没法自我验证,所有真正重要的核对工作都得靠听。有录音在手边支撑,转录稿是个靠得住的工作工具;录音被删掉的转录稿,是一份谁都没法核实的文档——包括你自己。

