← Blog
Technik5 Min. Lesezeit

Warum die übersetzte Stimme ein paar Sekunden hinterherhängt

Ethan Hu
Baut DubTab
Auf dieser Seite
Ein Lernender hört eine Online-Vorlesung über Kopfhörer; versetzte blaue und grüne Schallwellen deuten einen kleinen Versatz der übersetzten Stimme an

Nach einer Minute Echtzeit-Synchronisation kommt fast immer dieselbe Frage: Warum hängt die Stimme hinterher? Die Untertitel sitzen dicht am Sprecher. Die übersetzte Stimme kommt ein paar Sekunden später.

Zwei Gründe, und keiner davon ist ein langsamer Rechner. Die Stimme muss eine Phrase hören, bevor sie sie sagen kann. Und eine übersetzte Phrase dauert meist länger als das Original. Das erste setzt eine Untergrenze, unter die man nicht kommt. Das zweite entscheidet, ob ein paar Sekunden ein paar Sekunden bleiben.

Die Stimme muss erst hören, bevor sie sprechen kann

Niemand übersetzt einen Satz, den er noch nicht gehört hat. Menschliche Dolmetscher arbeiten unter derselben Regel. Die Dolmetschforschung hat für den Abstand zwischen Hören und Sprechen einen Namen, die Ohr-Stimme-Spanne, und die Mittelwerte, die für professionelle Simultandolmetscher berichtet werden, liegen zwischen zwei und fünf Sekunden, laut einem Überblick über diese Forschung von 2025. Das sind Menschen mit jahrelanger Ausbildung, in der Kabine, bei einem Sprecher.

Manche Sprachen machen das Warten länger, weil die bedeutungstragenden Wörter zuletzt kommen. Das weißt du schon: In vielen deutschen Sätzen steht das Verb am Ende. Japanisch und Koreanisch tun das grundsätzlich.

Warum die Stimme warten mussDeutsch, Verb am Ende
  1. Ich habe den Vertrag
    Ich habe den Vertrag.Klingt fertig. Ist es nicht.
  2. Ich habe den Vertrag gestern
    Gestern … den VertragImmer noch kein Verb
  3. Ich habe den Vertrag gestern nicht
    Gestern nicht … den VertragEin Nein — wozu?
  4. Ich habe den Vertrag gestern nicht unterschrieben.
    Ich habe den Vertrag gestern nicht unterschrieben.Jetzt kann man es sagen
Das Beispiel bleibt ein deutscher Satz, weil das Verb — und hier das „nicht“ — erst am Ende steht. Bevor das letzte Wort da ist, darf die Übersetzung nicht raten. Wer früh loslegt, liegt in diesem Fall falsch.

Die Stimme wartet also, bis eine Phrase vollständig genug ist, um sie zu sagen, übersetzt sie und fängt an zu sprechen. Sie wartet nicht auf das Ende eines langen Satzes, wenn vorher ein natürlicher Schnitt kommt. Aber sie kann nicht loslegen, bevor der Sinn da ist. Eine Stimme, die rät und danebenliegt, ist schlechter als eine, die ein Stück spät ist.

Untertitel haben einen Vorsprung. Ein Untertitel kann erscheinen, sobald die Phrase übersetzt ist; die Stimme muss noch ausgesprochen werden, in einem Tempo, dem man folgen kann. Wenn du so nah wie möglich am Sprecher bleiben musst, lies mit und lass die Stimme den Rest tragen.

Wie aus ein paar Sekunden mehr werden

Den zweiten Grund übersieht man leichter. Ein übersetzter Satz ist meist länger als das Original. Aus dem Englischen ins Spanische, Französische, Italienische oder Portugiesische zieht sich die Übersetzung. Der Sprecher darf zwischen Sätzen innehalten. Die Stimme oft nicht.

Im natürlichen Tempo ist die Stimme noch bei einer Zeile, während der Sprecher schon in der nächsten steckt. Die nächste Zeile ist übersetzt und bereit — und wartet. Jede Zeile startet ein Stück später als die vorige, und über eine Vorlesung wächst der Abstand weiter.

Wie sich der Abstand verhält

Diagramm. Ein Sprecher sagt sechs Phrasen, die übersetzte Stimme spricht jede danach. Ohne automatisches Aufholen startet jede übersetzte Phrase etwas später als die vorige, sodass die Stimme beim Stopp noch mehrere Phrasen hintendran ist. Mit Aufholen werden rückständige Phrasen schneller gesprochen und die Stimme bleibt nah. Bei schnellem Sprechen und langer Übersetzung fällt selbst die schnellere Stimme weiter zurück.

Schema, nicht maßstäblich. Übersetzte Sätze dauern meist länger als das Original, deshalb beginnt bei natürlichem Tempo jeder ein Stück später als der vorige. Automatisches Aufholen beschleunigt die Stimme nur, wenn sie im Rückstand ist, und hält den Abstand — außer jemand spricht schnell und die Übersetzung wird lang.

Genau da liegt die eigentliche Entscheidung, und keine der Optionen ist umsonst.

Zwei davon

Eine übersetzte Stimme im Live-Betrieb kann nah am Sprecher bleiben, in natürlichem Tempo sprechen und jede Zeile sagen. Wenn die Übersetzung lang wird, schafft sie nicht alle drei.

Was du behältstWas es kostetIn DubTab
Nah am Sprecher, jede ZeileDie Stimme spricht schneller, sobald sie zurückfälltAutomatisches Aufholen an (Standard)
Natürliches Tempo, jede ZeileDie Stimme fällt über eine lange Sitzung weiter zurückAutomatisches Aufholen aus
Nah am Sprecher, natürliches TempoEin Teil des Gesagten wird gekürzt oder weggelassenWird nicht angeboten

Menschliche Dolmetscher nehmen oft die dritte Zeile. Sie fassen zusammen, lassen weg, was nicht entscheidend ist, und derselbe Überblick merkt an, dass die Dolmetschforschung solche Kompromisse für besser hält als überhastetes Sprechen. Das ist ein Urteil, das ein Mensch im Moment fällt, über eine Rede, die er versteht.

Wir lassen Software das nicht für dich entscheiden. In einer Vorlesung oder einem Kurs ist die Zeile, die überspringbar klingt, manchmal genau die, die du gebraucht hättest. Deshalb spricht DubTab in beiden Einstellungen jede übersetzte Zeile, und die Wahl liegt zwischen einer schnelleren Stimme und einer späteren.

Probier's an dem, was du gerade siehst
Übersetzte Stimme und Untertitel in deiner Sprache, auf dem Video oder Stream, der läuft. 15 Minuten testen, ohne Karte.
DubTab testen

Was Automatisches Aufholen macht

Automatisches Aufholen beschleunigt die übersetzte Stimme erst, wenn sie bereits zurückgefallen ist. Die erste Zeile läuft im natürlichen Tempo, und die Stimme geht danach wieder zurück. Video und Original-Audio werden nie beschleunigt; sie laufen in normaler Geschwindigkeit.

Wie oft du das hörst, hängt von der Sprache ab, in die du synchronisierst. Ins Englische hat es vergleichsweise wenig zu tun. In Sprachen, deren Übersetzung sich streckt — Spanisch vor allem, aber auch Französisch, Italienisch, Portugiesisch — läuft die Stimme einen Großteil der Zeit beschleunigt. Das wirst du hören. Wir sagen es lieber hier, als dass du es erst im Gebrauch merkst.

Manchmal reicht es nicht. Ein schneller Sprecher mit einer Übersetzung, die sich streckt, kann selbst die schnellere Stimme überholen. Der Abstand wächst wieder, langsamer, und schrumpft, wenn der Sprecher innehält. Das ist die untere Reihe im Diagramm oben.

Wenn das passiert:

  • Lies die Untertitel, wenn das Timing zählt. Sie bleiben so oder so nah am Sprecher.
  • Schalt Automatisches Aufholen aus, wenn dich die schnellere Stimme mehr stört als der Versatz. Jede Zeile wird trotzdem gesprochen, im natürlichen Tempo, weiter hinten.
  • Die Einstellung findest du im Hilfeartikel zum Versatz der Synchronstimme. In der Erweiterung und in der Desktop-App heißt sie unterschiedlich.

Kein Versatz heißt: im Voraus gemacht

Echtzeit-Synchronisation ohne Versatz gibt es nicht. Eine Spur, die perfekt zum Bild sitzt, entstand vorher, aus der ganzen Aufnahme — so wie die Tonspur, die YouTube beim Upload eines Videos erzeugen kann. Das ist ein anderes Produkt, und wir haben den Unterschied aufgeschrieben. Wenn es eine offizielle Spur in deiner Sprache gibt, nutz sie.

Alles andere — ein Livestream, ein Kurs, ein Call — muss erst gehört werden. Was wir steuern, ist das Danach: dass aus ein paar Sekunden keine Minute wird, dass wir ehrlich sagen, wann es nicht reicht, und dass nie die Software entscheidet, welche Wörter des Sprechers du nicht gebraucht hast.