跳到内容

如何给视频添加你不懂的语言字幕

1 min read 1 views 最后更新: 8 月 2, 2026
A monitor showing a video with a caption bar, a notepad with handwriting beside the keyboard

核心要点

把字幕翻译成你不懂的语言,其实是两项工作,不是一项。先做出原始语言的转录文本,读一遍、改一遍,然后才能翻译。如果转录本身有问题,这个问题会原封不动地带进你生成的每一种语言版本里。字幕的时间轴是跟着说话节奏走的,所以换了语言之后基本不用动;会变的是每条字幕里能塞进多少文字。人名地名这类专有名词要一个个手动核对。条件允许的话,一定要找一个以该语言为母语的人看一遍成品。

你手上有一段视频,观众看的是你完全不懂的语言。字幕必须准确,可你根本没办法判断它到底对不对。这种处境确实让人不安,而市面上大多数建议都绕开了真正决定结果好坏的那一步。

关键在于顺序。翻译字幕出的绝大多数问题,其实在翻译开始之前就已经存在了,而翻译特别擅长把一个错误伪装成一个“有意为之”的说法。接下来要说的,是能把损失降到最低的操作顺序,以及做完这些之后你依然会面对哪些风险——我会说实话,不藏着。

两个步骤,顺序不能颠倒

做另一种语言的字幕,本质上是先做出原始语言的转录文本,再把这份转录文本翻译过去。仅此而已。任何号称能“一步到位”把视频直接变成外语字幕的工具,其实都做了这两步,只是没把中间那一步展示给你看。

隐藏中间这一步的问题在于错误的处理方式。如果转录环节听错了一个词,翻译环节根本不知道这是个听错的词,它会照实翻译,把错的当成对的来处理。结果是语法通顺、读起来流畅,但内容是错的——而且正因为流畅,文字本身根本没有任何破绽能让人一眼看出问题。转录出错至少看起来乱糟糟的;把一份出错的转录翻译得漂漂亮亮,反而看起来完全没问题。

所以要把转录文本当成一份属于你自己的文档来对待。先生成它,打开它,对照音频通读一遍,改好,然后才把它交去翻译。如果你要发布三种语言的版本,这一步的重要性要乘以三,因为三个版本都是从同一份源文件生成的。这个道理同样适用于只有音频的素材:翻译一段录音依然意味着要先把它转录出来,不管你有没有机会看到那份中间文本。

有一类工具能把中间这一步保留下来给你看:SozAI 支持在 iOS、Android 和 macOS 上转录视频、音频文件以及 YouTube 链接,等你读完并修改好原始转录之后,它可以翻译成 99+ 种语言。获取转录文本的方式有很多种,关键要求只有一个——你必须能在任何内容被翻译之前看到并编辑它,而不是要求它必须来自某个特定渠道。

把原文改对,才是真正划算的那一步

你在修正源语言转录文本上花的每一分钟,都会在你输出的每一种语言里得到回报。反过来,你留下的每一个错误,也会在每一种语言里被复制一遍。这也是整个流程里唯一一个你能完全掌控质量的阶段:这是你的语言、你的录音、你熟悉的内容。一旦进入翻译环节,你判断结果对错的能力基本就归零了。

读转录文本时要一边放着音频一边对照读,而不是干读文字。干读只能挑出那些“看起来不对”的地方。对照音频读,才能挑出那些“看起来对、但其实不对”的地方,而这类错误其实更多。专业术语、专有名词,以及说得很快或者背景噪音较大的部分,是错误最容易聚集的地方。

特别留意那些语法上说得通、但你读起来总觉得有点不对味的句子。一句你自己绝对不会那么说的话,通常就是转录听错了某个词。要在源文本里改掉它。如果等翻译完了再改,你就得在每一种语言里各改一遍,还得跟看得懂那种语言的人解释清楚为什么要改。

这也是决定字幕“作为文字该怎么呈现”、而不是“作为语音原样照搬”的时机。停顿重来、口头语、重复的词——在这一步、用你自己听得懂的语言把它们去掉,而不是让翻译者把它们逐字译成另一种语言,结果读起来变得语无伦次。

时间轴留得住,文字内容留不住

字幕的起止时间是绑定在说话节奏上的,不是绑定在具体词语上的。一条字幕在有人开始说话时出现,在停顿、句子结束或说话人切换时结束,翻译文字本身并不会改变这些节点的位置。所以你为原始语言搭好的时间轴结构,换了语言之后基本能原样保留下来——这也是整个流程里真正省心的一部分。

留不住的是长度。不同语言表达同一个意思所占的篇幅差别很大,原文里两行就能放下的一句话,翻译过来可能要三行才够。当翻译内容超出了这条字幕的时长,你有两个选择:把文字压缩得更短,或者重新切分这条字幕、给它更多时间。

几乎所有情况下都应该选择压缩文字。重新切分字幕意味着它不再跟说话内容对齐,而且一条字幕的时间一动,它前后的字幕往往也得跟着动。如果要做四种语言版本,这么一来你就得维护四套不同的时间轴文件,而不是一套。压缩文字则能让所有语言版本共用同一套时间轴结构,为此牺牲一点措辞上的细腻感,是值得的。

实际操作上,这意味着不管是找人还是用工具做翻译,都要提要求“控制在多长篇幅内”,而不只是“翻译一下”。如果你需要把做好的文件转成发布平台要求的另一种格式,一个能在浏览器里直接运行的字幕格式转换工具可以帮你搞定,而且不会动到时间轴。至于最初生成字幕文件这件事,是另一项工作,从转录文本生成字幕文件正是设定字幕起止时间的地方。

一个字都看不懂的时候,该检查什么

你没办法核对翻译内容本身对不对,但你可以核对其中一类具体的东西,而且值得逐一过一遍:专有名词。人名、地名和产品名,是翻译最容易改动走样的部分,而名字一旦变了,观众能立刻察觉出问题——即便他们完全看不出字幕其他地方哪里翻错了。

翻译之前,先把视频里出现的这些名词都记下来。翻译完成后,在译文里逐一找到它们,确认都保留下来了。做这件事不需要看懂周围的句子,你只是在做模式匹配。

  • 人名,包括提到过但没有出镜的人
  • 你的公司名称,以及任何产品名称
  • 地名,尤其是那种有约定俗成的当地译法的地名
  • 视频里一个字母一个字母念出来的东西,比如网址或代码
  • 数字和单位,它们有时会被重新格式化,而不是被翻译

如果某个名字在目标语言里确实存在一个不同的规范译法,这是一个你自己没有能力判断的问题,应该去问一个人,而不是去问一个工具。如果目标语言用的文字系统跟源语言完全不一样,靠肉眼核对会更费劲,但并非做不到——你依然是在一个可预测的位置上,找一个能认出来的标记。

母语读者,才是真正靠得住的检查方式

找一个以目标语言为母语的人,打开字幕看一遍视频,是唯一真正管用的质量把关方式。不是回译(把译文再翻译回原语言核对),回译反而容易把错误“洗”得看起来很合理。也不是再跑一遍机器翻译做校对。而是要找一个真人,让他看着说,这读起来像不像一个人会说出来的话。

这个人不需要是专业翻译,也不需要花很长时间。机器翻译出来的字幕,问题大多在第一分钟内就能被母语读者看出来,因为问题往往出在语气而不是用词上:太生硬、太字面、莫名其妙地僵硬。让他们说说整体印象,而不是要求逐行核对,一次简短的交流就能得到很有用的信息。

如果实在找不到这样的人,剩下能做的就是往上游想办法。源语言写得越平实,翻译出来就越安全。用短句、常用词,不用文字游戏,不用只有一个地方的人才懂的文化梗。如果你已经知道一段视频要被字幕翻译成你看不懂的语言,这个认知应该改变你在镜头前说话的方式,而不只是改变你后期剪辑的方式。这确实是对你表达方式的一种限制,会让你少一些个人风格。但它同时也堵住了翻译最容易让你出丑的大多数漏洞。

你依然要面对的风险

习语和幽默,是机器翻译最不靠谱的地方,也是字幕出错代价最大的地方。一个专业术语翻错了,是个小问题,观众能绕过去理解。一个笑话被逐字翻译过去,会改变整段视频给人的感觉:说话人听起来不是有趣,而是奇怪,而观众根本无从判断这种奇怪是字幕的问题,还是你本人真的这样。

语气是另一个容易流失、也更难提前预判的东西。机器翻译默认会套用某种固定语域,而这种语域未必是你说话的语域。一段很随性的对话式视频,翻译出来可能读起来像一份说明书。内容本身没有任何错误,只是那已经不是“你”了,而看这份字幕的观众,永远不会认识原始录音里那个真实的你。

这些问题,光靠在翻译环节上多花功夫是解决不了的。能解决它们的,是把源文本改对、把源文本写得平实、核对好人名地名、条件允许时找母语读者把关。做到这些,你交出去的字幕会是准确但稍显平淡的版本——对于一份你自己看不懂的内容来说,这已经是一个相当不错的结果。如果跳过修正源文本这一步,你交出去的错误会永远藏在字幕里,被你发布出去的每一种语言各复制一遍,你自己却永远都发现不了。

答案

Frequently Asked Questions

应该翻译视频,还是翻译转录文本?

应该翻译转录文本。把字幕做成另一种语言,永远分两步:先用原始语言做出转录,再翻译这份转录。如果把这两步合并成一步来做,任何转录错误都会被当成正确的内容直接翻译过去。先做出转录文本,能让你用自己真正听得懂的语言去读它、改它,然后这份改好的版本才会成为其他所有语言版本的基础。

翻译完文件之后,字幕时间轴还能用吗?

基本上没问题。字幕的起止时间是根据说话节奏设定的,不是根据具体词语设定的,所以一条字幕开始和结束的时间点,翻译之后依然会保留下来。会发生变化的是每条字幕里能容纳的文字量,因为不同语言表达同一个意思所需的篇幅不一样。你需要调整的是措辞长度,而不是重新搭建整套时间轴结构。

为什么翻译出来的字幕在屏幕上放不下?

因为不同语言表达同一个意思所占的篇幅差别很大,原文里能放下的一行字,翻译过来可能就超长了。这时你可以选择把译文压缩得更短,或者重新切分这条字幕、给它更多时间。通常应该选压缩文字,因为重新切分会打乱字幕跟说话内容的对齐关系,而且发布几种语言就要重新做几次这项工作。

字幕翻译能有多信任机器翻译?

机器翻译处理平实、直白的陈述句比较靠得住,处理习语和幽默最不靠谱,而这恰恰是字幕出错后对整段视频影响最大的地方。机器翻译出来的内容通常读起来很流畅,不管它对不对,所以“读起来顺”这一点完全不能说明什么。如果源语言本身写得够平实,机器翻译能出错的地方自然就少了。

完全看不懂目标语言的时候,到底能检查什么?

可以逐一核对专有名词。人名、地名和产品名,是翻译最容易改动走样的内容,而名字一旦变了,观众能立刻察觉出问题。翻译之前先把这些名词列出来,翻译完成后再逐一在译文里找到它们,确认都保留下来了。做这件事完全不需要看懂周围的句子,只是在做模式匹配。

修正原始转录文本,真的能对结果产生这么大的影响吗?

是的,这一步是整个流程里最关键的。源语言转录里没改掉的每一个错误,都会在由它生成的每一种语言版本里被重复一遍,而且经过翻译之后,它看起来会像是一个“有意为之”的措辞选择,而不是一个错误。修正原始转录,也是整个流程里唯一一个你有充分能力判断对错的阶段。

Merey Tleugazin

SozAI 创始人。正在为全球专业人士打造将语音转为文本的工具。

SozAI
SozAI — 免费下载即时转录音频和视频
获取 App