**Interview transkribieren: Wortlaut, Sprecher & Notation**
Source: https://sozai.app/de/how-to-transcribe-an-interview/

[Anleitungen](https://sozai.app/de/category/anleitungen/)

# Interview transkribieren: Wortlaut-Grade, Sprecherlabels und Notation

Okt. 2, 2026  • 10 min read • 16 views  • Zuletzt aktualisiert: Okt. 2, 2026

![Two chairs facing each other at a small table by a window, a phone recording between them next to a notebook](https://sozai.app/wp-content/uploads/post-how-to-transcribe-an-interview-1280x720.webp)

> ### Das Wichtigste in Kürze
>
>
>
> Legen Sie den Wortlaut-Grad fest, bevor Sie ein Wort tippen: Beim Full Verbatim bleibt jedes Ähm und jeder Satzabbruch erhalten, beim Clean Verbatim bleibt der Sinn ohne die Füllwörter, und ein bearbeitetes Transkript glättet die Grammatik zum Lesen. Wählen Sie eine Notation für Pausen, Überlappungen und unverständliche Stellen, schreiben Sie sie als Schlüssel an den Anfang des Dokuments und beschriften Sie die Sprecher einheitlich. Von Hand setzt der Oral-History-Leitfaden der Texas Tech University Libraries sechs Stunden Tippen pro Stunde Aufnahme an, ein Kursleitfaden der Cornell University vier bis sechs. Ein automatisches Transkript liefert in Minuten einen ersten Entwurf; die menschliche Arbeit verlagert sich vom Tippen zum Abgleich mit der Aufnahme.

Die Aufnahme liegt vor. Nun möchte jemand ein Transkript, das sich zitieren, kodieren oder abgeben lässt, und die erste Frage lautet nicht, welche App Sie nehmen – sondern, wie viel von der Sprache Sie behalten wollen.

Füllwörter und Satzabbrüche zählen in der Gesprächsanalyse und in manchen juristischen Zusammenhängen; überall sonst sind sie Rauschen. Dieser Artikel geht die drei Wortlaut-Grade durch, die Notation für Pausen und Überlappungen, den Zeitaufwand von Hand und das, was ein automatisches Transkript bei einer echten Aufnahme richtig und falsch macht.

## Wie lässt sich ein Interview am einfachsten transkribieren?

Lassen Sie die Aufnahme zuerst von einer Spracherkennung verarbeiten, korrigieren Sie dann Namen, prüfen Sie stichprobenartig am Audio und ergänzen Sie die Notation, die Ihr Projekt braucht – das geht schneller, als vor einer leeren Seite zu tippen, und genau das meinen die meisten, wenn sie „am einfachsten“ sagen. Eine volle Stunde Sprache Wort für Wort von null an zu tippen ist der langsame Einstieg, nicht der einfache.

Für einen kurzen Ausschnitt erledigt unser Browser-Tool [Interview online transkribieren](https://sozai.app/de/tools/transcribe-interview/) diesen ersten Durchgang ohne Konto: Sie laden eine Aufnahme hoch, und es transkribiert die ersten 5 Minuten, beschriftet jeden Redebeitrag mit Speaker A, Speaker B und so weiter samt Zeitstempel und erkennt die Sprache automatisch aus 99 Sprachen. Dateien bis 25 MB gehen unverändert durch; längere Aufnahmen werden im Browser auf 5 Minuten gekürzt, bevor etwas gesendet wird. Audio und Transkript werden beim Anbieter gelöscht, sobald das Ergebnis zurück ist, und Sie erhalten drei Vorschauen pro Gerät und Tag.

Das reicht, um zu sehen, ob sich ein Tool für eine bestimmte Aufnahme lohnt. Für ein ganzes Interview in einem Durchgang, mit durchgehend beschrifteten Redebeiträgen und jedem Transkript danach in einer durchsuchbaren Bibliothek, gibt es die SozAI App – die ersten 30 Minuten sind kostenlos. Wie die Interview-Transkription im Ganzen funktioniert, steht unter [So funktioniert die Interview-Transkription](https://sozai.app/de/interview-transcription/), oder [laden Sie die App herunter](https://sozai.app/de/download/).

## Was ist der Unterschied zwischen Verbatim und Clean Verbatim?

Full Verbatim behält jedes Wort, wie es gesprochen wurde: die Ähms, die Satzabbrüche, die wiederholten Wörter, das Stottern und das hörbare Lachen. Clean Verbatim behält die Worte und den Sinn der Sprecherin oder des Sprechers, lässt aber die Füllwörter, die Satzabbrüche und die zufälligen Wiederholungen weg. Ein bearbeitetes Transkript geht einen Schritt weiter und glättet Grammatik und Satzstellung, damit es sich gut liest – und gerade deshalb taugt es nicht mehr als Beleg dafür, was tatsächlich gesagt wurde.

- Full Verbatim: Gesprächsanalyse, manche juristische und Beweiszwecke.
- Clean Verbatim: die meiste qualitative Forschung, Journalismus, Nutzerforschung.
- Bearbeitet: veröffentlichte Frage-und-Antwort-Artikel.

| Grad | Was er behält | Typischer Einsatz |
| --- | --- | --- |
| Full Verbatim | Jedes Wort wie gesprochen: Füllwörter, Satzabbrüche, Wiederholungen, Stottern, hörbare Laute | Gesprächsanalyse, manche juristische und Beweiszwecke |
| Clean Verbatim | Worte und Sinn des Sprechenden, Füllwörter und Satzabbrüche entfallen | Die meiste qualitative Forschung, Journalismus, Nutzerforschung |
| Bearbeitet | Geglättete Grammatik und Satzstellung zum Lesen | Veröffentlichte Frage-und-Antwort-Artikel |

Wenn das Transkript in ein Forschungsprojekt gehört und nicht in einen veröffentlichten Text, entscheiden Sie das vor dem ersten Interview, nicht nach dem fünften – wer mittendrin den Grad wechselt, muss frühere Transkripte angleichen. Die forschungsspezifische Seite mit Einwilligung, Anonymisierung und Speicherung behandelt [Interviews für die Forschung transkribieren](https://sozai.app/de/interview-transcript-for-research/).

## Wie schreibt man ein Interview-Transkript?

Beginnen Sie mit einem Schlüssel: dem Wortlaut-Grad, den verwendeten Symbolen und der Art, wie Sprecher beschriftet werden, geschrieben oben im Dokument vor der ersten Sprachzeile. Wer das Transkript später kodiert oder zitiert, braucht diesen Schlüssel, und Sie selbst brauchen ihn auch, wenn Sie Wochen später vergessen haben, was (.) bedeuten sollte.

Das bekannteste System für detaillierte Transkripte stammt von Gail Jefferson und ist in ihrem [Glossary of transcript symbols with an introduction](https://doi.org/10.1075/pbns.125.02jef) (2004) dargelegt. Wie [Clift, Kendrick, Raymond und Robinson (2024)](https://eprints.whiterose.ac.uk/id/eprint/237652/1/Clift_Kendrick_Raymond_Robinson._2024_-_Jeffersonian_Transcription_conventions.pdf) es zusammenfassen, markiert eine linke eckige Klammer die Stelle, an der überlappendes Sprechen beginnt, ein Gleichheitszeichen verbindet Sprechen ohne Lücke, eine Zahl in Klammern wie (0.5) ist eine gemessene Stille in Sekunden, und (.) kennzeichnet eine Pause, die zu kurz zum Messen ist. Wie kurz eine Mikropause genau ist, sehen die Quellen unterschiedlich; wenn Ihr Schlüssel (.) verwendet, sollte er also sagen, was Sie damit meinen.

Die meisten Interviewprojekte brauchen diesen Detailgrad nicht und lesen sich ohne ihn leichter. Eine Konvention in eckigen Klammern deckt ab, was tatsächlich vorkommt: [inaudible 00:12:31] für eine Passage, die Sie nicht verstehen, mit Zeitstempel, damit Sie sie wiederfinden; [crosstalk], wenn zwei Personen durcheinandersprechen; [laughs] und andere nichtsprachliche Ereignisse in eckigen Klammern; und ein Sprecherlabel zu Beginn jedes Redebeitrags.

| Symbol | Bedeutung | System |
| --- | --- | --- |
| [ | Stelle, an der überlappendes Sprechen beginnt | Jefferson |
| = | Sprechen ohne Lücke angeschlossen (Latching) | Jefferson |
| (0.5) | Gemessene Stille in Sekunden | Jefferson |
| (.) | Pause, zu kurz zum Messen | Jefferson |
| [inaudible 00:12:31] | Passage, die sich nicht verstehen lässt, mit Zeitstempel | Eckige Klammern |
| [crosstalk] | Zwei Personen sprechen gleichzeitig | Eckige Klammern |
| [laughs] | Nichtsprachlicher Laut | Eckige Klammern |

Über die Notation hinaus sagt die [Transkriptions-Anleitung des UK Data Service](https://dam.ukdataservice.ac.uk/media/187730/transcriptiondm25april2013.pdf), ein Transkript solle eine eindeutige Kennung tragen, im ganzen Projekt ein einheitliches Layout verwenden, für den Sprecherwechsel Sprecher-Tags nutzen und Zeilenumbrüche beibehalten – Kleinigkeiten, aber sie sind es, die Sie Transkripte später finden und vergleichen lassen, statt alle erneut zu lesen.

Sprecherlabels sind Namen, die die Transkriptionssoftware nicht kennen kann – erwarten Sie Speaker A und Speaker B, die Sie von Hand umbenennen, sobald Sie wissen, wer wer ist. [Sprecher einheitlich beschriften](https://sozai.app/de/who-said-what-transcript/) zeigt, wie das über ein ganzes Projekt gelingt, ohne dass die Namen zwischen den Dateien auseinanderlaufen.

Anonymisieren Sie gleich beim Arbeiten, nicht hinterher: Ersetzen Sie Namen und identifizierende Angaben direkt im Transkript durch einheitliche Platzhalter wie [Participant 2] oder [city], und halten Sie den Schlüssel, der Platzhalter echten Namen zuordnet, in einer getrennten Datei. Eine Person aufzunehmen erfordert fast überall ihre Einwilligung, und eine Ethikkommission will diese Einwilligung in der Regel schriftlich; das Transkribieren der Aufnahme ändert an dieser Anforderung nichts.

## Wie lange dauert es, ein Interview zu transkribieren?

Von Hand sollten Sie Stunden einplanen, nicht Minuten. Der [Oral-History-Leitfaden der Texas Tech University Libraries](https://guides.library.ttu.edu/c.php?g=1275281&p=9356352) sagt, selbst erfahrene Transkribierende arbeiten typischerweise mit sechs Stunden Tippen pro Stunde Audio. Ein [Kursleitfaden der Cornell University](https://courses2.cit.cornell.edu/fit117/CP_T.htm) setzt es niedriger an, bei vier bis sechs Stunden pro Stunde Aufnahme – der Unterschied liegt vor allem daran, wie sauber das Audio ist und wie viel Notation unterwegs hinzukommt.

Ein automatisches Transkript verändert, wohin die Zeit fließt, statt sie verschwinden zu lassen. Der Entwurf kommt in Minuten zurück; übrig bleibt, ihn gegen die Aufnahme durchzuhören, Namen und Fachbegriffe zu korrigieren, richtigzustellen, wer was gesagt hat, wo sich die Labels vertauscht haben, und die Notation zu ergänzen, die das Projekt braucht. Bei einem einstündigen Interview ist das immer noch echte Arbeit, nur eine andere – [wie lange Transkription tatsächlich dauert](https://sozai.app/de/how-long-will-transcription-take/) schlüsselt das weiter auf.

## Kann ChatGPT ein Interview transkribieren?

Ob ein Chatbot eine Audiodatei in Text verwandeln kann, hängt vom Produkt ab, doch ein Interview-Transkript braucht mehr als Text: Zeitstempel, zu denen Sie zurückspringen können, und Redebeiträge, auf die Sie sich verlassen können – wofür eine Transkriptions-Engine gebaut ist. Seinen Platz hat ein Chatbot danach, beim Glätten, Zusammenfassen oder Umformatieren eines Transkripts, das Sie schon haben.

So oder so muss automatischer Text vor dem Zitieren an der Aufnahme geprüft werden, und diese Prüfung nimmt Ihnen kein Tool ab.

Wie viel Prüfung eine bestimmte Engine braucht, schwankt ziemlich stark. [Wie genau KI-Transkription ist](https://sozai.app/de/how-accurate-is-ai-transcription/) behandelt, was Sie erwarten können und wo sich die Fehler häufen.

## Was ein echtes automatisches Transkript falsch macht

Ein automatisches Transkript ist ein Entwurf, und am deutlichsten sieht man, was das heißt, wenn man eines erstellt und gegen die Aufnahme liest. Am 2. Oktober 2026 haben wir genau das getan, an den ersten 5 Minuten einer öffentlichen Aufnahme, die jeder anhand dieses Artikels nachprüfen kann.

Wir haben die Engine hinter dem Interview-Tool von SozAI über die ersten 5 Minuten (300 Sekunden) des NASA-Johnson-Space-Center-Podcasts Houston We Have a Podcast laufen lassen, Folge 180, „Artemis Mission Management“, mit Moderator Gary Jordan und Gast Mike Sarafin – ein NASA-Werk, also nicht urheberrechtlich geschützt. Heraus kamen 778 Wörter, erkannt wurde Englisch, und es fand 2 Sprecher. Die ersten Zeilen, so wie die Engine sie ausgegeben hat:

[00:00] Speaker A: Houston, we have a podcast. Welcome to the official podcast of the NASA Johnson Space Center, episode 180, Artemis Mission Management. I'm Gary Jordan, and I'll be your host today.
[01:19] Speaker B: T-minus five seconds and counting. Mark.
[01:22] Speaker A: Launch commit lights are correct. There she goes. Houston. We have a podcast. Mike Serafin, thanks for coming on Houston, We Have a Podcast today.
[01:36] Speaker B: Thank you. It's a pleasure to be here to talk about these exciting Artemis missions we have ahead of us. Yeah, right?
[01:43] Speaker A: Returning to the Moon. Not a bad thing to be a part of.

Drei Dinge allein in diesen fünf Redebeiträgen brauchten einen menschlichen Durchgang. Der Start-Countdown bei 01:19 und „Launch commit lights are correct. There she goes.“ bei 01:22 sind Archiv-Audio eines Starts, das in den Podcast geschnitten wurde, und nicht der Moderator oder der Gast beim Sprechen – die Engine hat sie trotzdem als Speaker B und Speaker A beschriftet. „Yeah, right?“ am Ende des Beitrags bei 01:36 ist in Wahrheit der Moderator, der das Gespräch wieder aufnimmt; es gehört an den Anfang des nächsten Beitrags, nicht ans Ende des Beitrags des Gasts. Und der Nachname des Gasts kommt hier als Serafin heraus, obwohl der Abspann der Folge ihn Sarafin schreibt.

Ein späterer Beitrag zeigt, wofür Clean Verbatim da ist. Die Ausgabe der Engine bei 02:51 lautet: „Yes, so you’re, you’re right in that I lived in the operations realm for 22 of my 27 years in, in my NASA career.“ Ein Clean-Verbatim-Durchgang macht daraus: „You’re right in that I lived in the operations realm for 22 of my 27 years in my NASA career.“ Full Verbatim würde die Wiederholungen genau so behalten, wie sie herauskamen; die Engine neigt eher dazu, sie zu behalten – sie hat die meisten Wiederholungen und Satzabbrüche in der ganzen Datei beibehalten („you’re, you’re right“, „in, in my NASA career“, „That’s, that’s quite a number of“), womit ihre Ausgabe näher am Verbatim als am Clean Verbatim liegt. Braucht ein Projekt Clean Verbatim, planen Sie einen Bearbeitungsdurchgang ein, egal welche Engine den Entwurf liefert.

Antworten

## Frequently Asked Questions

Wie lässt sich ein Interview am einfachsten transkribieren?

Lassen Sie die Aufnahme für einen ersten Entwurf von einer Spracherkennung verarbeiten, prüfen Sie ihn dann am Audio und korrigieren Sie Sprechernamen und unklare Wörter – von Grund auf von Hand zu tippen ist langsamer, nicht einfacher. Ein Browser-Tool wie der Interview-Transkribierer von SozAI kann ohne Konto einen beschrifteten Entwurf der ersten 5 Minuten mit Zeitstempeln erstellen, was reicht, um zu beurteilen, ob sich ein Durchlauf der ganzen Datei lohnt.

Wie sollte ein fertiges Interview-Transkript aussehen?

Es beginnt mit einem kurzen Schlüssel, der den Wortlaut-Grad, die verwendete Notation und die Sprecherbeschriftung nennt, gefolgt von beschrifteten Redebeiträgen wie Speaker A mit Zeitstempeln. Die Transkriptions-Anleitung des UK Data Service ergänzt, es solle eine eindeutige Kennung, ein einheitliches Layout, Sprecher-Tags und Zeilenumbrüche tragen, damit es später gefunden und verglichen werden kann, statt vollständig neu gelesen zu werden.

Kann ChatGPT ein Interview transkribieren?

Das hängt vom Produkt ab, und für den ersten Schritt ist es das falsche Werkzeug. Ein Interview-Transkript braucht Zeitstempel und Redebeiträge, auf die Verlass ist, und genau das liefert eine Transkriptions-Engine. Ein Chatbot nützt danach, beim Glätten, Zusammenfassen oder Umformatieren eines Transkripts, das Sie schon haben, und jeder automatische Text muss weiterhin an der Aufnahme geprüft werden.

Soll ich Verbatim oder Clean Verbatim verwenden?

Verwenden Sie Full Verbatim für Gesprächsanalyse oder juristische und Beweiszwecke, wo jedes Ähm, jeder Satzabbruch und jede Wiederholung zählt; nehmen Sie Clean Verbatim für die meiste qualitative Forschung, Journalismus und Nutzerforschung, wo der Sinn wichtiger ist als die Sprechunflüssigkeiten. Entscheiden Sie das vor dem ersten Interview, denn ein Wechsel mittendrin heißt, frühere Transkripte neu zu machen.

Wie markiert man unverständliche Stellen in einem Transkript?

Schreiben Sie [inaudible] mit einem Zeitstempel, etwa [inaudible 00:12:31], damit Sie oder jemand anderes die Stelle in der Aufnahme später wiederfindet. Für überlappendes Sprechen nehmen Sie [crosstalk], für nichtsprachliche Geräusche wie Lachen [laughs] – alles in eckigen Klammern und einmal im Schlüssel am Anfang des Transkripts erklärt.

Wie lange dauert es, ein einstündiges Interview zu transkribieren?

Von Hand setzt der Oral-History-Leitfaden der Texas Tech University Libraries etwa sechs Stunden Tippen pro Stunde Audio an; ein Kursleitfaden der Cornell University schätzt vier bis sechs Stunden. Ein automatisches Transkript liefert in Minuten einen Entwurf, und die verbleibende Zeit geht in den Abgleich mit der Aufnahme statt ins Abtippen.

![Merey Tleugazin](https://sozai.app/wp-content/themes/sozai/assets/images/merey-tleugazin.webp)

[Merey Tleugazin](https://sozai.app/about/merey/)

Gründer von SozAI. Entwickelt Tools, die Sprache für Fachleute weltweit in Text umwandeln.

- [Instagram](https://instagram.com/mereytleugazin)
- [X](https://x.com/mereytleugazin)

## Ähnliche Artikel

- [März 18 16 min ### So wandeln Sie Voicemail in Text um: Kostenlose Methoden für iPhone & Android](https://sozai.app/de/voicemail-to-text/)
- [Aug. 2 10 min ### Wie genau ist KI-Transkription wirklich?](https://sozai.app/de/how-accurate-is-ai-transcription/)
- [März 20 17 min ### So nutzen Sie die Sprachaufnahme in Microsoft Word: Die umfassende Schritt-für-Schritt-Anleitung](https://sozai.app/de/voice-typing-microsoft-word/)

[![SozAI](https://sozai.app/wp-content/themes/sozai/assets/images/appicon.png) SozAI — Kostenlos herunterladen Audio und Video sofort transkribieren App holen](https://sozai.app/de/download/)


---
This is the markdown twin of https://sozai.app/de/how-to-transcribe-an-interview/ — the same content, without the markup.
Published by SozAI (https://sozai.app). Reuse and quotation are allowed with attribution and a link back.
Machine-readable index: https://sozai.app/llms.txt · data API: https://sozai.app/api/
