实时配音为什么总慢几秒
本页目录

实时配音开上一分钟,多数人会问同一件事:声音为什么落后?字幕贴着说话人,译文语音却晚几秒才到。
原因就两条,都不是电脑慢。声音必须先听见一句话,才能说出来。译完的句子,通常比原文更长。前者是下限,压不下去;后者决定这几秒会不会越积越多。
得先听见,才能开口
没听完的句子,谁也翻不了。人工口译也是这条规矩。口译研究把听到和开口之间的距离叫耳语时距,2025 年的一篇综述里,职业同传的平均值大约两到五秒。那是在口译箱里听一个人讲、练了好多年的人。
有些语言会把等待拉长:真正把意思钉住的词,排在句尾。德语很多句子把主要动词放到最后。日语、韩语更干脆,谓语默认在句末——对中文读者来说并不陌生。
- Ich habe den Vertrag我有这份合同。听着像说完了。并没有。
- Ich habe den Vertrag gestern昨天……这份合同还是没有动词
- Ich habe den Vertrag gestern nicht昨天没有……这份合同有个「不」,但不什么?
- Ich habe den Vertrag gestern nicht unterschrieben.昨天没有签那份合同。现在可以开口了
所以语音会等到一个意群够完整、说得出口,再翻译、再开口。前面有自然停顿,就不会硬等到一句很长的话全部说完。但意思还没出来之前,它开不了口。猜错,比稍晚更糟。
字幕能抢先一步。句子一译完,字幕就可以出现;声音还得按你跟得上的速度念出来。需要尽量贴着说话人时,先看字幕,让声音把其余部分托住。
几秒怎么变成更多
第二条更容易被忽略。译出来的句子,通常比原文长。英语译成西班牙语、法语、意大利语、葡萄牙语,都会变长。说话人句与句之间有停顿,译文语音往往没有。
按自然语速,上一句还没念完,说话人已经进到下一句。下一句已经译好、在排队。每一句都比上一句更晚开口,一堂课听下来,差距就往外长。
示意图。说话人讲了六句,译文语音逐句跟上。自动追赶关闭时,每一句译文都比上一句更晚开始,所以对方停下来时配音还落后好几句。打开后,落后的句子会说得快一些,配音一直跟在不远处。如果语速快、译文又长,就算加快也还是会越落越远。
真正要做的选择在这里。哪边都要付出代价。
三选二
现场译文语音可以贴着说话人、用自然语速、每一句都说。译文一旦变长,三件事做不齐。
| 你保住什么 | 代价 | DubTab 里 |
|---|---|---|
| 贴着说话人,每一句都说 | 落后时声音会加快 | 自动追赶打开(默认) |
| 自然语速,每一句都说 | 一场听久了,声音越落越远 | 自动追赶关闭 |
| 贴着说话人,自然语速 | 有些话被砍掉或缩短 | 不提供 |
人工口译常常走第三行:概括、丢掉不关键的。同一篇综述也写过,口译研究更宁可做这种取舍,也不要把语速拉得过快。那是人在当场做的判断,而且听得懂这场话。
我们不让软件替你做这个判断。讲座或网课里,听起来可以跳过的那句,有时正是你要用的。所以两种设置下,DubTab 都会把每一句译文说完。你选的是声音快一点,还是再晚一点。
自动追赶在做什么
自动追赶只在译文语音已经落后时,才加快它。第一句按自然语速播放,追上之后会收回来。视频和原声从不会被加快,始终正常速度。
听不听得到加快,取决于你配成哪一种语言。配成英语时,它相对清闲。配成译文偏长的语言——西班牙语最明显——声音会有很大一部分时间在加快。这个你听得出来。我们宁可写在这里,也不想让你自己撞上。
有时这样还不够。对方说得快,译文又长,连加快的声音也会被甩开。差距会再往外长,只是慢一些;说话人一停,又会缩回来。就是上面那张图的最下一行。
碰到这种情况:
- 时间要紧时,看字幕。 两种设置下,字幕都贴着说话人。
- 加快的声音比延迟更难受,就把自动追赶关掉。 每一句仍会说完,自然语速,只是更靠后。
- 设置在哪: 见配音延迟说明。扩展和桌面版里,它的名字不一样。
零延迟,说明是事先做好的
实时配音做不到零延迟。口型和画面咬得很齐的那条音轨,是拿整段成片事先做出来的,类似视频上传后 YouTube 可以生成的那条配音。那是另一件事,我们写过差别。官方配音如果已经有你的语言,用官方的。
其余的——直播、网课、会议——都得先听见。我们能管的是听见之后:不让几秒拖成一分钟,稳不住的时候把话说清楚,也绝不替你决定哪句是你不需要的。