核心要点
无障碍字幕不是“有字幕就行”。它需要包含对话内容,以及有实际意义的非对话音效,还要标出每一次说话人切换,并且要跟语音的节奏同步出现、消失。普通字幕是另外一回事,通常只翻译对话内容,而且经常是翻译版本。文字稿则是没有时间轴的纯文字,服务的是完全无法操作播放器的人,因此它是一份独立的交付物,不能替代字幕。没有经过人工校对的自动字幕,是最常见的失败情况。
有人告诉你,字幕必须做到无障碍。你确实有字幕。现在你想弄清楚,这两句话之间到底差了什么,可偏偏没人把话说清楚。
问题几乎从来不是“视频没有字幕轨”,而是字幕轨用起来不顺手——这种问题不会立刻显现,直到一位听障或有听力障碍的观众真的想靠这份字幕看懂视频时才会暴露。下面按你实际会遇到的顺序,说清楚这到底意味着什么。
三个词,三种交付物,三类受众
在日常对话里,字幕、翻译字幕、文字稿这几个词经常被随意混用,但你手上这份要求几乎肯定不是随便说的。如果它同时提到了其中两种,那它要的就是两份东西。
无障碍字幕(Captions)要包含对话内容,加上真正有意义的非对话音效。它的写作前提是观众完全听不到任何声音,所以只要音轨在做什么、画面又没表现出来,就必须写进文字里。
普通字幕(Subtitles)通常只有对话内容,而且往往是翻译版本。它假设你能听清视频的声音,只是听不懂说的是什么语言。普通字幕不会告诉你警报响了,因为一个听得懂原语言的观众根本不需要这个提示。
文字稿(Transcript)就是纯文字,没有时间轴,没有播放器参与。它服务的是使用屏幕阅读器的人、没法操作视频播放器的人,以及单纯更愿意读文字而不想看完整段视频的人。
最后这一点,正是人们最容易搞混的地方。视频旁边贴一份文字稿,不代表满足了字幕要求;一份字幕文件,也不代表满足了文字稿要求,因为它们通过不同的渠道,服务的是不同的人。如果你做了一份,却当成两份来交,那你其实只交了一份。
有必要说清楚:无障碍相关的义务在不同国家、不同行业、不同机构之间是不一样的。不存在一个全球统一的标准,让你对照一下就能确定合格。真正对你有约束力的,是你所在机构实际遵循的那一套规则,机构里一定有人知道是哪一套,只是可能没告诉你。在按某种猜测搭建整套流程之前,先去问清楚。
字幕承载的是声音,不只是话语
这一点,对只把字幕理解成“语音转文字”的人来说,往往出乎意料。关门声、警报声、画面外的笑声、一个电话铃声打断了画面里的人说话——这些都不是对话,画面上也看不出来。
如果一位听不到音轨的观众在看视频时,画面里发生了什么他完全无法理解的事,那字幕在它存在的意义上就已经失败了。画面里的人在对一个你从没提到的声音做反应,此刻在观众眼里就成了莫名其妙的举动。
判断标准不是“有没有声音”,而是“这个声音是否承载了意义”。环境的空气声不需要加字幕,没人对它做反应的背景音乐通常也不需要。但让所有人离开房间的警报声需要,能告诉你一句台词效果如何的笑声也需要。这是你的判断,是真正需要判断的事,不是能自动完成的规则——这正是人工审校环节重要的原因之一。如果想了解具体操作层面的更多细节,可以参考隐藏式字幕指南,里面讲了具体做法。
也别做过头。给每一个细微响动都加注释的字幕轨,会跟对话争夺观众的阅读时间,让观众的阅读速度追不上视频。只加会改变场景含义的内容,其余的都省掉。
标出是谁在说话
一份把三个人的对话连在一起、完全不标注切换点的字幕轨,技术上“存在”,但实际上没法用。这是那种通过了所有打勾式检查、却仍然存在的最常见缺陷,因为检查只问“有没有字幕”,不问“能不能读懂”。
想想听力正常的观众能免费得到什么。不同人的声音听起来不一样,你知道这句话是另一个人说的,因为它来自不同的嗓子,很多时候你还能听出声音是从房间的哪一侧传来的。把声音拿掉,这些线索就全没了。画面上,一个反应镜头或者一个紧凑的取景,完全可能让说话人整整一句话都不在镜头里。
标注切换的方式,各家、各平台不尽相同,只要在同一份文件里用法统一,常见的几种写法都可以。行不通的是什么都不标。采访、圆桌讨论、会议录音,任何超过一个人说话的场合,每一次交接都要标出来,即使是同两个人快速来回对话时也一样——尤其是这种情况,因为这恰恰是读者最容易跟不上的地方。
时间轴要跟上语音
字幕要在话说出来的时候出现,话说完就要消失。晚一拍出现的字幕,会让观众先看到反应镜头,再读到那句话。字幕拖到下一个镜头才消失,会让观众一边读上一场的字,一边看着下一场的画面。
单看一条字幕,这两种情况都不算致命。但十分钟下来,看的人会很累,字幕反而让视频变得比不加字幕还难跟上。通常的元凶是“漂移”:文件一开始是同步的,越往后越滞后,常见原因是字幕是照着视频的某个版本生成的,用到的却是另一个版本,前后多剪掉或多留了一两秒。
要检查的是文件的结尾,不是开头。人人都会查开头。如果一段长视频最后一条字幕仍然对得上台词,中间大概率没问题。如果已经错位了,整份文件都要重新对时,而不是修修补补。用SRT文件校验工具做一次结构检查,能在上传前发现重叠或格式错误的字幕条目,不过它测不出文字对不对。
自动字幕,以及让它变得可用的那一步
没有经过校对的自动字幕,是机构最终拿到一份“不符合自己要求”的字幕的头号原因。它们通常带着你根本不敢信的标点判断,完全没有标注说话人切换,也没有任何非对话音效,因为系统被要求做的是“把语音转成文字”,它也确实只做了这件事。
这不代表自动字幕没用。它是很好的初稿,能替你省下纯打字这部分的真实时间。真正的错误,是把这份输出当成最终交付物,而不是原材料。要把它变成真正的交付物,需要一个人对着视频逐句核对文件,修正四件事:转录错误的词、句子的断句、说话人切换、以及承载意义的声音提示。
要做初稿,SozAI能把音频、视频文件、录音以及YouTube链接转录成带说话人标注的文字,支持99种以上语言,覆盖iOS、Android和macOS应用,网站上还有免费的字幕与计数工具,全部在浏览器里本地运行,不上传任何文件。说话人标注能让你在“交接”这一步领先一截,音效提示和最终对时仍然需要你自己来完成。
把校对这一步的时间预算好。它比从零转录要短,比什么都不做要长,而这一步正是“有字幕文件”和“字幕真的能用”之间的全部差距。
做完这一切之后,还会出什么问题
还真不少,最好提前知道会出在哪。
- 人名、专业术语、产品名称,自动转录常常会出错,而且一错到底,因为不熟悉这个领域的审校者根本注意不到某个词稍微不对。
- 视频剪辑后,字幕文件被错配到了别的版本上,同步就跟着乱了。剪辑之后往往没人再复查一遍。
- 文字稿悄悄地一直没被做出来,因为它是那种在发布流程里没有固定位置、缺失了也不会报错的交付物。
- 翻译字幕被当成无障碍字幕上传,结果听障观众用原语言看视频时,只有对话内容,没有任何音效提示。
这些问题,抽查视频前三十秒是查不出来的——而这恰恰是大多数视频实际接受的检查方式。如果你要建立一套流程,检查点应该放在文件的结尾、放在最终剪辑之后,而不是之前。
另外要清楚一件事:字幕文件做得多细致,都不能替你确定你的义务到底是什么。这要看你所在机构受哪套规则约束,具体这类要求通常怎么写,可以参考转录与无障碍合规这篇文章。先把这个答案弄清楚,再把上面这些实操细节套进去,看它实际要求的是什么。

