即時配音為什麼會慢上幾秒
本頁目錄

即時配音開不到一分鐘,多數人會問同一件事:聲音為什麼落後?字幕貼著說話的人,譯文語音卻晚幾秒才到。
原因就兩條,都不是電腦慢。聲音得先聽到一句話,才能說出來。譯完的句子,通常比原文更長。前者是底線,壓不下去;後者決定這幾秒會不會愈積愈多。
先聽到,才能說
沒聽完的句子,誰也翻不了。口譯也是這條規矩。口譯研究把聽到和開口之間的距離叫耳語時距,2025 年的一篇回顧裡,職業同步口譯的平均值大約兩到五秒。那是在隔音間裡聽一個人講、練了好多年的人。
有些語言會把等待拉長:真正把意思釘住的詞,排在句尾。德語不少句子把主要動詞放到最後。日語、韓語更是通則,述語預設在句末——對中文讀者來說並不陌生。
- Ich habe den Vertrag我有這份合約。聽起來像說完了。並沒有。
- Ich habe den Vertrag gestern昨天……這份合約還是沒有動詞
- Ich habe den Vertrag gestern nicht昨天沒有……這份合約有個「不」,但不什麼?
- Ich habe den Vertrag gestern nicht unterschrieben.昨天沒有簽那份合約。現在可以開口了
所以語音會等到一個意群夠完整、說得出口,再翻譯、再開口。前面遇到自然停頓,就不會硬等到一句很長的話全部說完。但意思還沒出來之前,它開不了口。猜錯,比稍晚更糟。
字幕能搶先一步。句子一譯完,字幕就可以出現;聲音還得用你跟得上的速度唸出來。需要盡量貼著說話的人時,先看字幕,讓聲音把其餘部分托住。
幾秒怎麼變成更久
第二條更容易被忽略。譯出來的句子,通常比原文長。英文譯成西班牙文、法文、義大利文、葡萄牙文,都會變長。說話的人句與句之間有停頓,譯文語音往往沒有。
照自然語速,上一句還沒唸完,對方已經進到下一句。下一句已經譯好、在排隊。每一句都比上一句更晚開口,一堂課聽下來,差距就往外長。
示意圖。說話的人講了六句,譯文語音逐句跟上。自動追趕關閉時,每一句譯文都比上一句更晚開始,所以對方停下來時配音還落後好幾句。打開後,落後的句子會說得快一些,配音一直跟在不遠處。如果語速快、譯文又長,就算加快也還是會越落越遠。
真正要做的選擇在這裡。哪一條都有代價。
三選二
現場譯文語音可以貼著說話的人、用自然語速、每一句都說。譯文一旦變長,三件事做不齊。
| 你留下什麼 | 代價 | 在 DubTab 裡 |
|---|---|---|
| 貼著說話的人,每一句都說 | 落後時聲音會加快 | 自動追趕打開(預設) |
| 自然語速,每一句都說 | 聽得愈久,聲音愈落愈遠 | 自動追趕關閉 |
| 貼著說話的人,自然語速 | 有些話被砍掉或縮短 | 不做這條 |
口譯員多半走第三列:抓大意、把不關鍵的放掉。同一篇回顧也寫過,口譯研究更寧可做這種取捨,也不要把語速拉得過快。那是人在當場做的判斷,而且聽得懂這場話。
我們不讓軟體替你做這個判斷。講座或線上課程裡,聽起來可以跳過的那句,有時正是你要用的。所以兩種設定下,DubTab 都會把每一句譯文說完。你選的是聲音快一點,還是再晚一點。
自動追趕實際在做什麼
自動追趕只在譯文語音已經落後時,才加快它。第一句照自然語速播放,追上之後會收回來。影片和原聲從不會被加快,始終正常速度。
聽不聽得到加快,取決於你配成哪一種語言。配成英文時,它相對清閒。配成譯文偏長的語言——西班牙文最明顯——聲音會有很大一部分時間在加快。這個你聽得出來。我們寧可寫在這裡,也不想讓你自己撞上。
有時這樣還不夠。對方說得快,譯文又長,連加快的聲音也會被甩開。差距會再往外長,只是慢一些;對方一停,又會縮回來。就是上面那張圖的最下一列。
碰到這種情況:
- 時間要緊時,看字幕。 兩種設定下,字幕都貼著說話的人。
- 加快的聲音比延遲更難受,就把自動追趕關掉。 每一句仍會說完,自然語速,只是更靠後。
- 設定在哪: 見配音延遲說明。擴充套件和桌面版裡,它的名字不一樣。
沒有延遲,代表事先就做好了
即時配音做不到完全不慢。對齊到不能再齊的那條音軌,是拿整段成片事先做好的,很像影片上傳後 YouTube 可以產出的那條配音。那是另一件事,我們寫過差別。官方配音如果已經有你的語言,用官方的。
其餘的——直播、線上課程、會議——都得先聽到。我們能決定的是聽到之後:不讓幾秒拖成一分鐘,守不住的時候把話說清楚,也絕不替你決定哪一句是你不需要的。