Warum die übersetzte Stimme ein paar Sekunden hinterherhängt
Auf dieser Seite

Nach einer Minute Echtzeit-Synchronisation kommt fast immer dieselbe Frage: Warum hängt die Stimme hinterher? Die Untertitel sitzen dicht am Sprecher. Die übersetzte Stimme kommt ein paar Sekunden später.
Zwei Gründe, und keiner davon ist ein langsamer Rechner. Die Stimme muss eine Phrase hören, bevor sie sie sagen kann. Und eine übersetzte Phrase dauert meist länger als das Original. Das erste setzt eine Untergrenze, unter die man nicht kommt. Das zweite entscheidet, ob ein paar Sekunden ein paar Sekunden bleiben.
Die Stimme muss erst hören, bevor sie sprechen kann
Niemand übersetzt einen Satz, den er noch nicht gehört hat. Menschliche Dolmetscher arbeiten unter derselben Regel. Die Dolmetschforschung hat für den Abstand zwischen Hören und Sprechen einen Namen, die Ohr-Stimme-Spanne, und die Mittelwerte, die für professionelle Simultandolmetscher berichtet werden, liegen zwischen zwei und fünf Sekunden, laut einem Überblick über diese Forschung von 2025. Das sind Menschen mit jahrelanger Ausbildung, in der Kabine, bei einem Sprecher.
Manche Sprachen machen das Warten länger, weil die bedeutungstragenden Wörter zuletzt kommen. Das weißt du schon: In vielen deutschen Sätzen steht das Verb am Ende. Japanisch und Koreanisch tun das grundsätzlich.
- Ich habe den VertragIch habe den Vertrag.Klingt fertig. Ist es nicht.
- Ich habe den Vertrag gesternGestern … den VertragImmer noch kein Verb
- Ich habe den Vertrag gestern nichtGestern nicht … den VertragEin Nein — wozu?
- Ich habe den Vertrag gestern nicht unterschrieben.Ich habe den Vertrag gestern nicht unterschrieben.Jetzt kann man es sagen
Die Stimme wartet also, bis eine Phrase vollständig genug ist, um sie zu sagen, übersetzt sie und fängt an zu sprechen. Sie wartet nicht auf das Ende eines langen Satzes, wenn vorher ein natürlicher Schnitt kommt. Aber sie kann nicht loslegen, bevor der Sinn da ist. Eine Stimme, die rät und danebenliegt, ist schlechter als eine, die ein Stück spät ist.
Untertitel haben einen Vorsprung. Ein Untertitel kann erscheinen, sobald die Phrase übersetzt ist; die Stimme muss noch ausgesprochen werden, in einem Tempo, dem man folgen kann. Wenn du so nah wie möglich am Sprecher bleiben musst, lies mit und lass die Stimme den Rest tragen.
Wie aus ein paar Sekunden mehr werden
Den zweiten Grund übersieht man leichter. Ein übersetzter Satz ist meist länger als das Original. Aus dem Englischen ins Spanische, Französische, Italienische oder Portugiesische zieht sich die Übersetzung. Der Sprecher darf zwischen Sätzen innehalten. Die Stimme oft nicht.
Im natürlichen Tempo ist die Stimme noch bei einer Zeile, während der Sprecher schon in der nächsten steckt. Die nächste Zeile ist übersetzt und bereit — und wartet. Jede Zeile startet ein Stück später als die vorige, und über eine Vorlesung wächst der Abstand weiter.
Diagramm. Ein Sprecher sagt sechs Phrasen, die übersetzte Stimme spricht jede danach. Ohne automatisches Aufholen startet jede übersetzte Phrase etwas später als die vorige, sodass die Stimme beim Stopp noch mehrere Phrasen hintendran ist. Mit Aufholen werden rückständige Phrasen schneller gesprochen und die Stimme bleibt nah. Bei schnellem Sprechen und langer Übersetzung fällt selbst die schnellere Stimme weiter zurück.
Genau da liegt die eigentliche Entscheidung, und keine der Optionen ist umsonst.
Zwei davon
Eine übersetzte Stimme im Live-Betrieb kann nah am Sprecher bleiben, in natürlichem Tempo sprechen und jede Zeile sagen. Wenn die Übersetzung lang wird, schafft sie nicht alle drei.
| Was du behältst | Was es kostet | In DubTab |
|---|---|---|
| Nah am Sprecher, jede Zeile | Die Stimme spricht schneller, sobald sie zurückfällt | Automatisches Aufholen an (Standard) |
| Natürliches Tempo, jede Zeile | Die Stimme fällt über eine lange Sitzung weiter zurück | Automatisches Aufholen aus |
| Nah am Sprecher, natürliches Tempo | Ein Teil des Gesagten wird gekürzt oder weggelassen | Wird nicht angeboten |
Menschliche Dolmetscher nehmen oft die dritte Zeile. Sie fassen zusammen, lassen weg, was nicht entscheidend ist, und derselbe Überblick merkt an, dass die Dolmetschforschung solche Kompromisse für besser hält als überhastetes Sprechen. Das ist ein Urteil, das ein Mensch im Moment fällt, über eine Rede, die er versteht.
Wir lassen Software das nicht für dich entscheiden. In einer Vorlesung oder einem Kurs ist die Zeile, die überspringbar klingt, manchmal genau die, die du gebraucht hättest. Deshalb spricht DubTab in beiden Einstellungen jede übersetzte Zeile, und die Wahl liegt zwischen einer schnelleren Stimme und einer späteren.
Was Automatisches Aufholen macht
Automatisches Aufholen beschleunigt die übersetzte Stimme erst, wenn sie bereits zurückgefallen ist. Die erste Zeile läuft im natürlichen Tempo, und die Stimme geht danach wieder zurück. Video und Original-Audio werden nie beschleunigt; sie laufen in normaler Geschwindigkeit.
Wie oft du das hörst, hängt von der Sprache ab, in die du synchronisierst. Ins Englische hat es vergleichsweise wenig zu tun. In Sprachen, deren Übersetzung sich streckt — Spanisch vor allem, aber auch Französisch, Italienisch, Portugiesisch — läuft die Stimme einen Großteil der Zeit beschleunigt. Das wirst du hören. Wir sagen es lieber hier, als dass du es erst im Gebrauch merkst.
Manchmal reicht es nicht. Ein schneller Sprecher mit einer Übersetzung, die sich streckt, kann selbst die schnellere Stimme überholen. Der Abstand wächst wieder, langsamer, und schrumpft, wenn der Sprecher innehält. Das ist die untere Reihe im Diagramm oben.
Wenn das passiert:
- Lies die Untertitel, wenn das Timing zählt. Sie bleiben so oder so nah am Sprecher.
- Schalt Automatisches Aufholen aus, wenn dich die schnellere Stimme mehr stört als der Versatz. Jede Zeile wird trotzdem gesprochen, im natürlichen Tempo, weiter hinten.
- Die Einstellung findest du im Hilfeartikel zum Versatz der Synchronstimme. In der Erweiterung und in der Desktop-App heißt sie unterschiedlich.
Kein Versatz heißt: im Voraus gemacht
Echtzeit-Synchronisation ohne Versatz gibt es nicht. Eine Spur, die perfekt zum Bild sitzt, entstand vorher, aus der ganzen Aufnahme — so wie die Tonspur, die YouTube beim Upload eines Videos erzeugen kann. Das ist ein anderes Produkt, und wir haben den Unterschied aufgeschrieben. Wenn es eine offizielle Spur in deiner Sprache gibt, nutz sie.
Alles andere — ein Livestream, ein Kurs, ein Call — muss erst gehört werden. Was wir steuern, ist das Danach: dass aus ein paar Sekunden keine Minute wird, dass wir ehrlich sagen, wann es nicht reicht, und dass nie die Software entscheidet, welche Wörter des Sprechers du nicht gebraucht hast.