Zum Inhalt springen

Was barrierefreie Untertitel wirklich brauchen

9 min read 1 views Zuletzt aktualisiert: Aug. 2, 2026
A wall-mounted screen in an office corridor showing a video with a caption bar across the bottom

Das Wichtigste in Kürze

Barrierefreie Untertitel sind nicht einfach Untertitel, die irgendwie vorhanden sind. Sie enthalten den Dialog plus die Geräusche, die für das Verständnis wichtig sind, sie kennzeichnen jeden Sprecherwechsel, und sie erscheinen und verschwinden im Takt der gesprochenen Sprache. Übersetzungsuntertitel sind noch einmal etwas anderes und enthalten meist nur den Dialog. Ein Transkript ist der Text ohne Zeitangaben und richtet sich an Menschen, die den Videoplayer gar nicht bedienen können – es ist also ein eigenständiges Produkt und kein Ersatz. Automatisch erstellte Untertitel ohne Korrekturdurchgang sind der klassische Fehler.

Jemand hat Ihnen gesagt, die Untertitel müssten barrierefrei sein. Sie haben Untertitel. Jetzt versuchen Sie herauszufinden, wo genau die Lücke zwischen diesen beiden Aussagen liegt, und niemand hat sich dazu besonders konkret geäußert.

Die Lücke liegt fast nie darin, dass ein Video gar keine Untertitelspur hat. Sie liegt darin, dass die Untertitelspur auf eine Weise unbrauchbar ist, die erst auffällt, wenn eine gehörlose oder schwerhörige Person versucht, dem Video mit dieser Spur zu folgen. Im Folgenden geht es darum, was das konkret bedeutet – in der Reihenfolge, in der es Ihnen begegnen wird.

Drei Begriffe, drei Ergebnisse, drei Zielgruppen

Barrierefreie Untertitel, Übersetzungsuntertitel und Transkripte werden in der Umgangssprache gern in einen Topf geworfen, aber die Vorgabe, die Sie bekommen haben, tut das mit ziemlicher Sicherheit nicht. Wenn dort zwei dieser Begriffe genannt werden, sind auch zwei unterschiedliche Ergebnisse gefragt.

Barrierefreie Untertitel enthalten den Dialog plus die Geräusche, die für das Verständnis wichtig sind. Sie werden unter der Annahme geschrieben, dass die zuschauende Person gar nichts hört – alles, was auf der Tonspur passiert und im Bild nicht zu erkennen ist, muss also im Text stehen.

Übersetzungsuntertitel enthalten meist nur den Dialog und sind häufig eine Übersetzung. Sie gehen davon aus, dass man das Video problemlos hören kann, nur eben die gesprochene Sprache nicht versteht. Eine solche Untertitelspur wird nicht erwähnen, dass der Alarm losgegangen ist, weil eine hörende Person in der Zielsprache das nicht erklärt bekommen muss.

Ein Transkript ist der Text für sich, ohne Zeitangaben. Keine Einblendmarken, keine Synchronisation, kein Player. Es richtet sich an Menschen, die einen Screenreader nutzen, an Menschen, die den Videoplayer gar nicht bedienen können, und an alle, die den Inhalt lieber lesen als sich das Video anzusehen.

Genau diese letzte Unterscheidung wird am häufigsten übersehen. Ein Transkript, das neben dem Video steht, erfüllt keine Anforderung an barrierefreie Untertitel, und eine Untertitelspur erfüllt keine Anforderung an ein Transkript – beide erreichen unterschiedliche Zielgruppen auf unterschiedlichen Wegen. Wer nur eines von beidem produziert und es als beides ausgibt, hat am Ende nur eines produziert.

Und noch etwas, das man klar sagen sollte: Barrierefreiheits-Vorgaben unterscheiden sich von Land zu Land, von Branche zu Branche und von Organisation zu Organisation. Es gibt keinen einzigen weltweiten Standard, an dem Sie sich selbst abgleichen und die Sache dann abhaken könnten. Entscheidend ist die Vorgabe, an die Ihre Organisation tatsächlich gebunden ist, und irgendjemand in Ihrer Organisation weiß, welche das ist, auch wenn es Ihnen noch niemand gesagt hat. Fragen Sie nach, bevor Sie einen ganzen Prozess auf eine Vermutung aufbauen.

Untertitel transportieren den Ton, nicht nur die Sprache

Das ist der Punkt, der alle überrascht, die barrierefreie Untertitel bisher nur als Sprache-zu-Text verstanden haben. Eine Tür, die zufällt. Ein Alarm. Lachen von außerhalb des Bildes. Ein Telefon, das klingelt und die Person im Bild mitten im Satz stoppen lässt. Nichts davon ist Dialog, und nichts davon ist im Bild zu sehen.

Wenn eine Person, die die Tonspur nicht hören kann, Ihr Video ansieht und etwas passiert, das sie sich nicht erklären kann, haben die Untertitel genau an der Stelle versagt, für die es sie überhaupt gibt. Die Person im Bild, die auf ein Geräusch reagiert, das nirgends erwähnt wurde, wirkt jetzt einfach unerklärlich.

Die Prüffrage lautet nicht „gab es ein Geräusch“, sondern „trägt das Geräusch Bedeutung“. Raumatmosphäre braucht keinen Untertitel. Hintergrundmusik, auf die niemand reagiert, meist auch nicht. Der Alarm, wegen dem alle den Raum verlassen, schon. Genauso Lachen, wenn es zeigt, wie eine Aussage ankam. Diese Einschätzung müssen Sie selbst treffen, und es ist eine echte Ermessensfrage statt einer Regel, die sich automatisieren lässt – ein Grund mehr, warum ein menschlicher Durchgang durch die Datei so wichtig ist. Wer die ausführlichere Version davon sucht, findet die Mechanik im Leitfaden zu Closed Captions.

Übertreiben Sie es auch nicht. Eine Untertitelspur, die jedes Rascheln kommentiert, konkurriert mit dem Dialog um die Lesezeit und lässt die zuschauende Person hinter dem Video zurückfallen. Nehmen Sie auf, was die Bedeutung der Szene verändert. Den Rest lassen Sie weg.

Zeigen, wer gerade spricht

Eine Untertitelspur, die den Dialog von drei Personen ohne jede Kennzeichnung ineinanderlaufen lässt, ist formal vorhanden und praktisch unbrauchbar. Das ist einer der häufigsten Mängel in Dateien, die jede formale Prüfung bestanden haben, weil diese Prüfung nur fragt, ob Untertitel existieren, nicht ob man sie lesen kann.

Überlegen Sie, was eine hörende Person automatisch mitbekommt. Stimmen klingen unterschiedlich. Man merkt, dass eine Antwort von jemand anderem kommt, weil sie aus einer anderen Kehle kommt, und oft hört man sogar, aus welcher Richtung im Raum. Nimmt man den Ton weg, verschwindet das alles. Im Bild kann eine Reaktionseinstellung oder ein enger Bildausschnitt die sprechende Person für die Dauer eines ganzen Satzes komplett aus dem Bild lassen.

Die Konventionen zur Kennzeichnung eines Wechsels unterscheiden sich zwischen Häusern und Plattformen, und jede der gängigen Varianten funktioniert, solange sie innerhalb einer Datei konsequent verwendet wird. Was nicht funktioniert, ist gar keine Kennzeichnung. Ein Interview, eine Podiumsdiskussion, die Aufnahme eines Meetings, alles mit mehr als einer Stimme braucht bei jedem einzelnen Wechsel eine Kennzeichnung, auch wenn dieselben zwei Personen schnell kurze Sätze austauschen. Gerade dann sogar, weil genau dort der Faden am schnellsten verloren geht.

Timing, das der Sprache folgt

Untertitel müssen erscheinen, wenn die Worte gesprochen werden, und wieder verschwinden, wenn sie enden. Ein Untertitel, der einen Takt zu spät kommt, führt dazu, dass die zuschauende Person die Zeile liest, nachdem sie schon die Reaktion darauf gesehen hat. Ein Untertitel, der bis in die nächste Einstellung hinein stehen bleibt, führt dazu, dass man eine Szene liest, während man eine andere sieht.

Bei einer einzelnen Einblendung ist das nicht schlimm. Über zehn Minuten hinweg ist es anstrengend, und das Video wird mit Untertiteln schwerer verfolgbar, als es ohne sie gewesen wäre. Meist steckt eine Drift dahinter: eine Datei, die synchron beginnt und im Verlauf immer weiter zurückfällt, oft weil sie gegen eine Version des Videos erstellt und dann auf eine andere angewendet wurde, die vorne oder hinten eine Sekunde mehr hat.

Prüfen Sie das Ende der Datei, nicht den Anfang. Den Anfang prüft jeder. Wenn die letzte Einblendung in einem langen Video noch zu den Worten passt, ist die Mitte wahrscheinlich in Ordnung. Ist sie verrutscht, muss die ganze Datei neu getimt werden, statt nur ausgebessert. Eine strukturelle Prüfung mit einem SRT-Validator findet überlappende oder fehlerhafte Einblendungen, bevor Sie die Datei hochladen – ob die Worte auch die richtigen Worte sind, kann das Tool allerdings nicht sagen.

Automatische Untertitel und der Durchgang, der sie brauchbar macht

Automatisch erstellte Untertitel ohne Korrekturdurchgang sind der häufigste Grund, warum eine Organisation am Ende Untertitel hat, die ihre eigene Vorgabe nicht erfüllen. Sie kommen in der Regel mit Zeichensetzung, der man nicht trauen würde, ohne jede Kennzeichnung von Sprecherwechseln und ohne jedes bedeutungstragende Geräusch – weil das System die Aufgabe hatte, Sprache zu Text zu machen, und genau das getan hat.

Das macht automatische Untertitel nicht nutzlos. Sie liefern einen guten ersten Entwurf und sparen echte Zeit bei dem Teil der Arbeit, der reine Abschrift ist. Der Fehler liegt darin, das Ergebnis als fertiges Produkt zu behandeln statt als Rohmaterial. Aus dem einen wird das andere, wenn eine Person die Datei gegen das Video liest und vier Dinge korrigiert: falsch erkannte Wörter, Satzgrenzen, Sprecherwechsel und die Geräusche, die Bedeutung tragen.

Für den ersten Entwurf selbst wandelt SozAI Audio- und Videodateien, Aufnahmen und YouTube-Links in Text mit Sprecherkennzeichnung um, in mehr als 99 Sprachen, per App für iOS, Android und macOS. Auf der Website gibt es außerdem kostenlose Untertitel- und Zähl-Tools, die vollständig im Browser laufen, ohne dass irgendetwas hochgeladen wird. Die Sprecherkennzeichnung gibt Ihnen bei den Wechseln einen Vorsprung; die Geräuschhinweise und das endgültige Timing müssen Sie trotzdem selbst ergänzen.

Planen Sie den Korrekturdurchgang fest ein. Er dauert kürzer als eine Abschrift von null, aber länger als gar nichts, und er macht den ganzen Unterschied zwischen einer Datei, die existiert, und einer, die funktioniert.

Was danach immer noch schiefgehen kann

Einiges, und es ist besser, das vorher zu wissen.

  • Namen, Fachbegriffe und Produktbezeichnungen kommen aus der automatischen Transkription falsch heraus und bleiben falsch, weil eine prüfende Person ohne Fachnähe nicht bemerkt, dass ein Begriff leicht daneben liegt.
  • Die Untertiteldatei wird nach einem Schnitt an die falsche Videofassung angehängt, und die Synchronität geht mit verloren. Nach einem Trimm prüft das niemand noch einmal.
  • Das Transkript wird schlicht nie erstellt, weil es das Ergebnis ohne festen Platz im Veröffentlichungsprozess ist und keine Fehlermeldung ausgibt, wenn es fehlt.
  • Eine übersetzte Untertitelspur wird hochgeladen, als wäre sie eine Spur mit barrierefreien Untertiteln, und lässt gehörlose Personen in der Originalsprache mit reinem Dialogtext ohne Geräuschhinweise zurück.

Nichts davon fällt bei einer Stichprobe der ersten dreißig Sekunden auf, und genau das ist die Prüfung, die die meisten Videos tatsächlich bekommen. Wenn Sie einen Prozess aufbauen, legen Sie die Prüfung ans Ende der Datei und nach den letzten Schnitten, nicht davor.

Und noch etwas ist zu erwarten: Keine noch so sorgfältige Untertiteldatei klärt für sich, welche Pflicht Sie eigentlich haben. Das ergibt sich aus der Vorgabe, an die Ihre Organisation gebunden ist, und wie solche Anforderungen in der Praxis meist formuliert sind, steht im Beitrag zu Transkription und Barrierefreiheits-Vorgaben. Klären Sie diese Frage zuerst, und wenden Sie das Handwerk von oben dann auf das an, was sich daraus tatsächlich ergibt.

Antworten

Frequently Asked Questions

Was ist der Unterschied zwischen barrierefreien Untertiteln und Übersetzungsuntertiteln?

Barrierefreie Untertitel enthalten den Dialog plus die Geräusche, die für das Verständnis wichtig sind, etwa eine Tür, einen Alarm oder Lachen, und richten sich an Personen, die die Tonspur nicht hören können. Übersetzungsuntertitel enthalten meist nur den Dialog und sind oft eine Übersetzung, gedacht für Menschen, die den Ton hören, aber die gesprochene Sprache nicht verstehen. Wird dort, wo barrierefreie Untertitel gefordert sind, nur eine Übersetzungsspur hochgeladen, fehlen gehörlosen Zuschauern genau die Geräuschinformationen, die sie brauchen.

Müssen Untertitel auch Hintergrundgeräusche enthalten?

Sie müssen die Geräusche enthalten, die Bedeutung tragen – nicht jedes einzelne Geräusch. Eine zufallende Tür, ein Alarm, ein Telefon, das jemanden unterbricht, Lachen, das zeigt, wie eine Aussage ankam: Das gehört in die Untertitel, weil das Bild allein diese Information nicht liefert. Raumatmosphäre und unauffällige Hintergrundmusik meist nicht. Wer zu viel kommentiert, nimmt der Zuschauerin oder dem Zuschauer die Lesezeit für den eigentlichen Dialog.

Reichen automatisch erstellte Untertitel für Barrierefreiheit aus?

Nicht ohne Korrekturdurchgang. Automatisch erstellte Untertitel kommen in der Regel mit Zeichensetzung, der man nicht trauen würde, ohne markierte Sprecherwechsel und ganz ohne Geräuschhinweise, weil das System nur die Aufgabe hatte, Sprache zu Text zu machen. Sie sind ein brauchbarer erster Entwurf und sparen echte Zeit bei der Abschrift. Danach muss jemand die Datei gegen das Video lesen und falsche Wörter, Satzgrenzen, Sprecherwechsel und Geräuschhinweise korrigieren.

Brauche ich neben Untertiteln auch noch ein Transkript?

In der Regel ja, und ein Transkript ersetzt keine Untertitelspur. Ein Transkript ist der Text für sich, ohne Zeitangaben, und richtet sich an Menschen, die einen Screenreader nutzen, oder an alle, die den Videoplayer gar nicht bedienen können. Untertitel richten sich an Menschen, die das Video zwar ansehen, aber nicht hören können. Beide erreichen unterschiedliche Zielgruppen auf unterschiedlichen Wegen, weshalb eine Vorgabe, die beides nennt, auch zwei getrennte Ergebnisse verlangt.

Wie zeigt man in Untertiteln, dass die sprechende Person gewechselt hat?

Kennzeichnen Sie jeden Wechsel, mit welcher Konvention auch immer Ihre Plattform oder Ihr Haus vorgibt, konsequent durch die ganze Datei hindurch. Eine Untertitelspur, die den Dialog mehrerer Personen ohne Kennzeichnung ineinanderlaufen lässt, ist formal vorhanden und praktisch unbrauchbar. Hörende Personen bekommen Sprecherwechsel automatisch über den Klang der Stimmen mit; eine lesende Person bekommt gar nichts, wenn Sie es nicht in den Text schreiben. Am nötigsten ist das bei schnellen Wortwechseln zwischen zwei Personen.

Wie genau muss das Timing von Untertiteln zur gesprochenen Sprache passen?

So genau, dass der Untertitel erscheint, während die Worte gesprochen werden, und wieder verschwindet, wenn sie enden. Ein Untertitel, der zu spät kommt, lässt die Zuschauerin die Zeile erst nach der Reaktion darauf lesen, und einer, der zu lange stehen bleibt, hängt sie eine Szene hinterher. Prüfen Sie eher das Ende einer langen Datei als den Anfang, denn Drift baut sich allmählich auf, und ein komplettes Neu-Timing ist dann meist besser als bloßes Ausbessern.

Merey Tleugazin

Gründer von SozAI. Entwickelt Tools, die Sprache für Fachleute weltweit in Text umwandeln.

SozAI
SozAI — Kostenlos herunterladenAudio und Video sofort transkribieren
App holen