核心要点
先拿到带时间戳的文字稿,这样文字内容和时间位置你一次就都有了。把打算引用的那句话对照原声再核对一遍,因为自动生成的字幕在人名、专业术语和数字上最不靠谱,而这些恰恰是引文里最常出现的内容。标点符号要自己加,说话人临时改口、说话卡壳的地方怎么处理也要自己拿主意。最后把时间戳换算成你所用引用格式要求的形式,如果院系有自己的规定,优先按院系的规定来,而不是照搬通用格式手册。
视频停在了你需要的那句话上。靠听力把它一字一句打出来,为了听清最后一个词倒回去三次,这样耗掉一个晚上并不值得。其实有一种更快的办法,而且这种办法反而更准确。
办法就是在往论文里写下引文的第一个字之前,先拿到一份带时间戳的文字稿。有了这份文字稿,引用这一步基本上就是复制粘贴,标注引用出处这一步基本上就是算术题。
先拿文字稿,别光靠耳朵
带时间戳的文字稿能同时给你引文需要的两样东西:准确的措辞,以及它在视频里的位置。没有文字稿,你就得一边听内容一边看时间,两件事同时做,结果两件都做不好。有了文字稿,这两件事就分开了。你在纸面上读文字,而它在视频里的位置早就写在旁边的时间戳里了。
如果视频在网上(比如某个视频平台),拿到文字稿有几种途径,具体做法可以看如何获取视频文字稿这篇文章。有些视频本来就带字幕,可以直接提取;有些则需要借助工具生成。不管走哪条路,目标是一样的:拿到一份可以滚动查看、可以搜索的文档,而不是一段要反复拖动进度条的视频。
在文字稿里搜索你记得的那句话里比较特别的一个词,而不是凭感觉去拖视频进度条。这样更快,也更容易一下子定位到那句原话。
把要引用的那句话对照原声核对一遍
这一步是大家最容易跳过的,也是最容易出问题的一步。自动生成的字幕在人名、专业术语和数字上最不可靠,而论文里的引文恰恰很容易正好包含这些内容:某位研究者的名字、一个专业词汇、别人引用过的一个数字。字幕软件猜常见词猜得还不错,但猜到你论证里最关键的那个词时,往往就猜错了。
所以,在把某句话正式写进论文之前,把那一小段原声再听一遍,跟文字稿对照一下。每条引文花不了几秒钟。这跟把整段视频重新转写一遍完全不是一回事——你只是在核对那一句话,那句你即将打上引号、署上名字、呈现给批改老师看的话。
出问题的方式通常不是整句话都离谱,而是一句话看起来大体没错,里面却混进了一个错得理直气壮的小词——这种错误很容易在你快速通读一遍时被放过,因为周围的内容看着都对。
引文里的标点该怎么加,由你决定,不是字幕说了算
自动生成的字幕,标点通常不太靠得住。有些系统是根据停顿的时长或语调来加逗号、句号的,而不是根据语法,这就意味着字幕可能会在说话人根本没打算断句的地方硬生生断开。一句话在哪里结束,会改变它看起来在主张什么。一句本来是完整条件句的话,在字幕里可能被拆成两句语气平淡、各自独立的断言。
也就是说,引文里的标点要靠你自己听完之后来决定,不能照搬字幕文件里现成的标点。如果说话人的意思取决于某个停顿是逗号而不是句号,这就是你听完之后要自己判断的事,而且值得在动笔写一整段分析之前先弄清楚。
把时间戳换算成引用格式要求的样子
各种针对音视频材料的引用格式,都要求直接引用时附上时间位置,但各家格式对“该写成什么样”并不统一。有的格式只要分钟和秒,有的哪怕是一段五分钟的视频,也要写成小时、分钟、秒。具体形式因格式而异,而且很多院系还会在通用格式手册的基础上,自己再定一套规定。两者不一致时,以院系的规定为准。这不是什么细枝末节,而是实实在在的规则:批改老师给的要求,永远比通用手册的规定优先。
时间戳出现的形式比你想的要多。文字稿给你的可能是纯粹的秒数。视频播放器显示的是“分:秒”或“时:分:秒”。字幕文件用的是它自己的格式,通常精确到毫秒,因为字幕必须跟说话内容严丝合缝地对上。在这些形式之间换算,靠的是算术,不是判断,但深夜十一点手算这种琐碎的算术,很容易出错,比如把3分45秒换算成总秒数,或者反过来算,一不小心就会漏掉一位数字。用时间码转换工具就能帮你完成这个换算,剩下要做的,只是把换算出来的数字准确地填到引文里该在的位置。
一条完整的引用,不只是一个时间戳
就算你已经把时间格式调对了,也要记住时间戳只是一条引用里的一部分,不是全部。你还需要写清楚这段素材的标题、发布平台或制作方,以及你所用格式要求的其他信息。时间戳回答的是“在视频的哪个位置”,回答不了“是谁做的”“发在哪里”,这两点同样必须写对。
保持引文的真实
人说话时会有卡壳、重复用词、说到一半又改口重说的情况。如果要准确引用一段话,就该把这些都保留下来,或者明确标出你删掉了什么,通常是在引文里加省略号。不该做的是悄悄把句子整理得更顺,因为这样会改变说话人实际说的内容,就算整理后的版本大意没错也不行。一句话如果说话人自己后来改口了,就不能算是他主张过的话;如果你悄悄删掉这次改口,那就等于把他一秒钟后又收回的话,硬塞进了他嘴里。
每次都要具体判断,删多少算过头,没有一个放之四海的标准。比较稳妥的习惯是:默认把这些“不整齐”的地方都留着,只有在卡壳确实无关紧要时才删掉,而且删的时候要标出来。
文字稿代替不了什么
文字稿再准确,也只是一份工作用的辅助文档,是你用来找到和核对引文的工具,不是你要标注的引用来源。视频本身才是出处,文字稿只是你对着视频做的笔记。如果批改老师或读者追问引文出自哪里,这个区别就很重要——诚实的答案是“出自视频某个时间点”,文字稿只是你找到那句话所用的办法。
如果视频压根没开字幕,你就没有现成的字幕文件可以提取,但仍然可以用转写工具,直接根据音频生成一份文字稿。转写工具生成的文字稿,未必比平台自带字幕在人名、专业术语和数字上更准——不管文字稿是哪来的,核对这一步的规则都一样,不能少。转写工具真正帮得上忙的地方,是速度和结构:像视频转文字稿工具这样的东西,一步就能把一个视频链接变成一份可以搜索、带时间戳的文档;SozAI这类应用则可以对已下载的文件或录音做同样的事情,如果视频里不止一个人说话,还能标出说话人,这在你要引用的那句话是对话里第二个人说的、而不是第一个人说的时候特别有用。但这些都不能代替你在引用之前把那句话亲自听一遍。
如果你手上是一个文件而不是一个链接,可以把视频或音频直接导入转写应用,从中生成带时间戳的文字稿,流程跟上面说的一样,只是起点是一个文件,而不是一个网址。
实际操作中会遇到的麻烦
就算每一步都做得很仔细,也要预料到会有些小麻烦。自动转写在口音、多人抢话、背景噪音这些情况下仍然容易出错,再怎么核对,也省不掉你亲自听一遍有疑问那句话这个步骤。时间戳格式之间的换算是简单的算术题,但赶时间的时候还是容易出小差错,换算完最好跟原始数字再对一遍。另外,院系的格式规定有时候会自相矛盾,或者跟通用手册的规定对不上,让人摸不着头脑;遇到这种情况,去问清楚,别自己瞎猜,因为时间戳格式是引用里少数几个批改老师一眼就能看出对错的地方。

