Das Wichtigste in Kürze
Legen Sie den Wortlaut-Grad fest, bevor Sie ein Wort tippen: Beim Full Verbatim bleibt jedes Ähm und jeder Satzabbruch erhalten, beim Clean Verbatim bleibt der Sinn ohne die Füllwörter, und ein bearbeitetes Transkript glättet die Grammatik zum Lesen. Wählen Sie eine Notation für Pausen, Überlappungen und unverständliche Stellen, schreiben Sie sie als Schlüssel an den Anfang des Dokuments und beschriften Sie die Sprecher einheitlich. Von Hand setzt der Oral-History-Leitfaden der Texas Tech University Libraries sechs Stunden Tippen pro Stunde Aufnahme an, ein Kursleitfaden der Cornell University vier bis sechs. Ein automatisches Transkript liefert in Minuten einen ersten Entwurf; die menschliche Arbeit verlagert sich vom Tippen zum Abgleich mit der Aufnahme.
Die Aufnahme liegt vor. Nun möchte jemand ein Transkript, das sich zitieren, kodieren oder abgeben lässt, und die erste Frage lautet nicht, welche App Sie nehmen – sondern, wie viel von der Sprache Sie behalten wollen.
Füllwörter und Satzabbrüche zählen in der Gesprächsanalyse und in manchen juristischen Zusammenhängen; überall sonst sind sie Rauschen. Dieser Artikel geht die drei Wortlaut-Grade durch, die Notation für Pausen und Überlappungen, den Zeitaufwand von Hand und das, was ein automatisches Transkript bei einer echten Aufnahme richtig und falsch macht.
Wie lässt sich ein Interview am einfachsten transkribieren?
Lassen Sie die Aufnahme zuerst von einer Spracherkennung verarbeiten, korrigieren Sie dann Namen, prüfen Sie stichprobenartig am Audio und ergänzen Sie die Notation, die Ihr Projekt braucht – das geht schneller, als vor einer leeren Seite zu tippen, und genau das meinen die meisten, wenn sie „am einfachsten“ sagen. Eine volle Stunde Sprache Wort für Wort von null an zu tippen ist der langsame Einstieg, nicht der einfache.
Für einen kurzen Ausschnitt erledigt unser Browser-Tool Interview online transkribieren diesen ersten Durchgang ohne Konto: Sie laden eine Aufnahme hoch, und es transkribiert die ersten 5 Minuten, beschriftet jeden Redebeitrag mit Speaker A, Speaker B und so weiter samt Zeitstempel und erkennt die Sprache automatisch aus 99 Sprachen. Dateien bis 25 MB gehen unverändert durch; längere Aufnahmen werden im Browser auf 5 Minuten gekürzt, bevor etwas gesendet wird. Audio und Transkript werden beim Anbieter gelöscht, sobald das Ergebnis zurück ist, und Sie erhalten drei Vorschauen pro Gerät und Tag.
Das reicht, um zu sehen, ob sich ein Tool für eine bestimmte Aufnahme lohnt. Für ein ganzes Interview in einem Durchgang, mit durchgehend beschrifteten Redebeiträgen und jedem Transkript danach in einer durchsuchbaren Bibliothek, gibt es die SozAI App – die ersten 30 Minuten sind kostenlos. Wie die Interview-Transkription im Ganzen funktioniert, steht unter So funktioniert die Interview-Transkription, oder laden Sie die App herunter.
Was ist der Unterschied zwischen Verbatim und Clean Verbatim?
Full Verbatim behält jedes Wort, wie es gesprochen wurde: die Ähms, die Satzabbrüche, die wiederholten Wörter, das Stottern und das hörbare Lachen. Clean Verbatim behält die Worte und den Sinn der Sprecherin oder des Sprechers, lässt aber die Füllwörter, die Satzabbrüche und die zufälligen Wiederholungen weg. Ein bearbeitetes Transkript geht einen Schritt weiter und glättet Grammatik und Satzstellung, damit es sich gut liest – und gerade deshalb taugt es nicht mehr als Beleg dafür, was tatsächlich gesagt wurde.
- Full Verbatim: Gesprächsanalyse, manche juristische und Beweiszwecke.
- Clean Verbatim: die meiste qualitative Forschung, Journalismus, Nutzerforschung.
- Bearbeitet: veröffentlichte Frage-und-Antwort-Artikel.
| Grad | Was er behält | Typischer Einsatz |
|---|---|---|
| Full Verbatim | Jedes Wort wie gesprochen: Füllwörter, Satzabbrüche, Wiederholungen, Stottern, hörbare Laute | Gesprächsanalyse, manche juristische und Beweiszwecke |
| Clean Verbatim | Worte und Sinn des Sprechenden, Füllwörter und Satzabbrüche entfallen | Die meiste qualitative Forschung, Journalismus, Nutzerforschung |
| Bearbeitet | Geglättete Grammatik und Satzstellung zum Lesen | Veröffentlichte Frage-und-Antwort-Artikel |
Wenn das Transkript in ein Forschungsprojekt gehört und nicht in einen veröffentlichten Text, entscheiden Sie das vor dem ersten Interview, nicht nach dem fünften – wer mittendrin den Grad wechselt, muss frühere Transkripte angleichen. Die forschungsspezifische Seite mit Einwilligung, Anonymisierung und Speicherung behandelt Interviews für die Forschung transkribieren.
Wie schreibt man ein Interview-Transkript?
Beginnen Sie mit einem Schlüssel: dem Wortlaut-Grad, den verwendeten Symbolen und der Art, wie Sprecher beschriftet werden, geschrieben oben im Dokument vor der ersten Sprachzeile. Wer das Transkript später kodiert oder zitiert, braucht diesen Schlüssel, und Sie selbst brauchen ihn auch, wenn Sie Wochen später vergessen haben, was (.) bedeuten sollte.
Das bekannteste System für detaillierte Transkripte stammt von Gail Jefferson und ist in ihrem Glossary of transcript symbols with an introduction (2004) dargelegt. Wie Clift, Kendrick, Raymond und Robinson (2024) es zusammenfassen, markiert eine linke eckige Klammer die Stelle, an der überlappendes Sprechen beginnt, ein Gleichheitszeichen verbindet Sprechen ohne Lücke, eine Zahl in Klammern wie (0.5) ist eine gemessene Stille in Sekunden, und (.) kennzeichnet eine Pause, die zu kurz zum Messen ist. Wie kurz eine Mikropause genau ist, sehen die Quellen unterschiedlich; wenn Ihr Schlüssel (.) verwendet, sollte er also sagen, was Sie damit meinen.
Die meisten Interviewprojekte brauchen diesen Detailgrad nicht und lesen sich ohne ihn leichter. Eine Konvention in eckigen Klammern deckt ab, was tatsächlich vorkommt: [inaudible 00:12:31] für eine Passage, die Sie nicht verstehen, mit Zeitstempel, damit Sie sie wiederfinden; [crosstalk], wenn zwei Personen durcheinandersprechen; [laughs] und andere nichtsprachliche Ereignisse in eckigen Klammern; und ein Sprecherlabel zu Beginn jedes Redebeitrags.
| Symbol | Bedeutung | System |
|---|---|---|
| [ | Stelle, an der überlappendes Sprechen beginnt | Jefferson |
| = | Sprechen ohne Lücke angeschlossen (Latching) | Jefferson |
| (0.5) | Gemessene Stille in Sekunden | Jefferson |
| (.) | Pause, zu kurz zum Messen | Jefferson |
| [inaudible 00:12:31] | Passage, die sich nicht verstehen lässt, mit Zeitstempel | Eckige Klammern |
| [crosstalk] | Zwei Personen sprechen gleichzeitig | Eckige Klammern |
| [laughs] | Nichtsprachlicher Laut | Eckige Klammern |
Über die Notation hinaus sagt die Transkriptions-Anleitung des UK Data Service, ein Transkript solle eine eindeutige Kennung tragen, im ganzen Projekt ein einheitliches Layout verwenden, für den Sprecherwechsel Sprecher-Tags nutzen und Zeilenumbrüche beibehalten – Kleinigkeiten, aber sie sind es, die Sie Transkripte später finden und vergleichen lassen, statt alle erneut zu lesen.
Sprecherlabels sind Namen, die die Transkriptionssoftware nicht kennen kann – erwarten Sie Speaker A und Speaker B, die Sie von Hand umbenennen, sobald Sie wissen, wer wer ist. Sprecher einheitlich beschriften zeigt, wie das über ein ganzes Projekt gelingt, ohne dass die Namen zwischen den Dateien auseinanderlaufen.
Anonymisieren Sie gleich beim Arbeiten, nicht hinterher: Ersetzen Sie Namen und identifizierende Angaben direkt im Transkript durch einheitliche Platzhalter wie [Participant 2] oder [city], und halten Sie den Schlüssel, der Platzhalter echten Namen zuordnet, in einer getrennten Datei. Eine Person aufzunehmen erfordert fast überall ihre Einwilligung, und eine Ethikkommission will diese Einwilligung in der Regel schriftlich; das Transkribieren der Aufnahme ändert an dieser Anforderung nichts.
Wie lange dauert es, ein Interview zu transkribieren?
Von Hand sollten Sie Stunden einplanen, nicht Minuten. Der Oral-History-Leitfaden der Texas Tech University Libraries sagt, selbst erfahrene Transkribierende arbeiten typischerweise mit sechs Stunden Tippen pro Stunde Audio. Ein Kursleitfaden der Cornell University setzt es niedriger an, bei vier bis sechs Stunden pro Stunde Aufnahme – der Unterschied liegt vor allem daran, wie sauber das Audio ist und wie viel Notation unterwegs hinzukommt.
Ein automatisches Transkript verändert, wohin die Zeit fließt, statt sie verschwinden zu lassen. Der Entwurf kommt in Minuten zurück; übrig bleibt, ihn gegen die Aufnahme durchzuhören, Namen und Fachbegriffe zu korrigieren, richtigzustellen, wer was gesagt hat, wo sich die Labels vertauscht haben, und die Notation zu ergänzen, die das Projekt braucht. Bei einem einstündigen Interview ist das immer noch echte Arbeit, nur eine andere – wie lange Transkription tatsächlich dauert schlüsselt das weiter auf.
Kann ChatGPT ein Interview transkribieren?
Ob ein Chatbot eine Audiodatei in Text verwandeln kann, hängt vom Produkt ab, doch ein Interview-Transkript braucht mehr als Text: Zeitstempel, zu denen Sie zurückspringen können, und Redebeiträge, auf die Sie sich verlassen können – wofür eine Transkriptions-Engine gebaut ist. Seinen Platz hat ein Chatbot danach, beim Glätten, Zusammenfassen oder Umformatieren eines Transkripts, das Sie schon haben.
So oder so muss automatischer Text vor dem Zitieren an der Aufnahme geprüft werden, und diese Prüfung nimmt Ihnen kein Tool ab.
Wie viel Prüfung eine bestimmte Engine braucht, schwankt ziemlich stark. Wie genau KI-Transkription ist behandelt, was Sie erwarten können und wo sich die Fehler häufen.
Was ein echtes automatisches Transkript falsch macht
Ein automatisches Transkript ist ein Entwurf, und am deutlichsten sieht man, was das heißt, wenn man eines erstellt und gegen die Aufnahme liest. Am 2. Oktober 2026 haben wir genau das getan, an den ersten 5 Minuten einer öffentlichen Aufnahme, die jeder anhand dieses Artikels nachprüfen kann.
Wir haben die Engine hinter dem Interview-Tool von SozAI über die ersten 5 Minuten (300 Sekunden) des NASA-Johnson-Space-Center-Podcasts Houston We Have a Podcast laufen lassen, Folge 180, „Artemis Mission Management“, mit Moderator Gary Jordan und Gast Mike Sarafin – ein NASA-Werk, also nicht urheberrechtlich geschützt. Heraus kamen 778 Wörter, erkannt wurde Englisch, und es fand 2 Sprecher. Die ersten Zeilen, so wie die Engine sie ausgegeben hat:
[00:00] Speaker A: Houston, we have a podcast. Welcome to the official podcast of the NASA Johnson Space Center, episode 180, Artemis Mission Management. I'm Gary Jordan, and I'll be your host today. [01:19] Speaker B: T-minus five seconds and counting. Mark. [01:22] Speaker A: Launch commit lights are correct. There she goes. Houston. We have a podcast. Mike Serafin, thanks for coming on Houston, We Have a Podcast today. [01:36] Speaker B: Thank you. It's a pleasure to be here to talk about these exciting Artemis missions we have ahead of us. Yeah, right? [01:43] Speaker A: Returning to the Moon. Not a bad thing to be a part of.
Drei Dinge allein in diesen fünf Redebeiträgen brauchten einen menschlichen Durchgang. Der Start-Countdown bei 01:19 und „Launch commit lights are correct. There she goes.“ bei 01:22 sind Archiv-Audio eines Starts, das in den Podcast geschnitten wurde, und nicht der Moderator oder der Gast beim Sprechen – die Engine hat sie trotzdem als Speaker B und Speaker A beschriftet. „Yeah, right?“ am Ende des Beitrags bei 01:36 ist in Wahrheit der Moderator, der das Gespräch wieder aufnimmt; es gehört an den Anfang des nächsten Beitrags, nicht ans Ende des Beitrags des Gasts. Und der Nachname des Gasts kommt hier als Serafin heraus, obwohl der Abspann der Folge ihn Sarafin schreibt.
Ein späterer Beitrag zeigt, wofür Clean Verbatim da ist. Die Ausgabe der Engine bei 02:51 lautet: „Yes, so you’re, you’re right in that I lived in the operations realm for 22 of my 27 years in, in my NASA career.“ Ein Clean-Verbatim-Durchgang macht daraus: „You’re right in that I lived in the operations realm for 22 of my 27 years in my NASA career.“ Full Verbatim würde die Wiederholungen genau so behalten, wie sie herauskamen; die Engine neigt eher dazu, sie zu behalten – sie hat die meisten Wiederholungen und Satzabbrüche in der ganzen Datei beibehalten („you’re, you’re right“, „in, in my NASA career“, „That’s, that’s quite a number of“), womit ihre Ausgabe näher am Verbatim als am Clean Verbatim liegt. Braucht ein Projekt Clean Verbatim, planen Sie einen Bearbeitungsdurchgang ein, egal welche Engine den Entwurf liefert.

