Hovedpunkter
Beslut ordretniveauet, før du skriver et eneste ord: fuld ordret transskription beholder hvert eneste øh og hver falsk start, ren ordret beholder meningen uden fyldordene, og en redigeret transskription pudser grammatikken af, så den er let at læse. Vælg en notation til pauser, overlap og uhørlige stykker, skriv den som en nøgle øverst i dokumentet, og mærk talerne ens hele vejen. Med håndkraft sætter oral history-guiden fra Texas Tech University Libraries forholdet til seks timers skrivning pr. times optagelse; en kursusguide fra Cornell University siger fire til seks. En automatisk transskription giver dig et udkast på få minutter; det menneskelige arbejde flytter sig fra at skrive til at kontrollere mod optagelsen.
Du har optagelsen. Nu vil nogen have en transskription, de kan citere, kode eller aflevere, og det første spørgsmål er ikke, hvilket værktøj du skal bruge, men hvor meget af talen du vil beholde.
Fyldord og falske starter betyder noget i samtaleanalyse og i nogle juridiske sammenhænge; alle andre steder er de støj. Denne artikel gennemgår de tre ordretniveauer, den notation der markerer pauser og overlap, hvor lang tid arbejdet tager i hånden, og hvad en automatisk transskription får rigtigt og forkert på en rigtig optagelse.
Hvad er den nemmeste måde at transskribere et interview på?
Kør først optagelsen gennem en tale-til-tekst-motor, ret derefter navne, stikprøvetjek mod lyden og tilføj den notation, dit projekt har brug for. Det går hurtigere end at skrive fra en blank side, og det er det, de fleste faktisk mener med nemmest. At skrive en hel times tale fra bunden, ord for ord, er den langsomme vej ind, ikke den nemme.
Til et kort klip laver vores browserværktøj til at transskribere et interview online den første gennemgang uden konto: du uploader en optagelse, og den transskriberer de første 5 minutter, mærker hver replik som Speaker A, Speaker B og så videre med et tidsstempel og registrerer sproget automatisk blandt 99 sprog. Filer på op til 25 MB sendes, som de er; længere optagelser klippes til 5 minutter i browseren, før noget sendes. Lyden og transskriptionen slettes hos leverandøren, så snart resultatet er kommet tilbage, og du får tre forhåndsvisninger pr. enhed pr. dag.
Det er nok til at se, om et værktøj er umagen værd på en given optagelse. Til et helt interview i ét hug, med replikkerne mærket hele vejen igennem og hver transskription gemt bagefter i et søgbart bibliotek, gør SozAI-appen det: de første 30 minutter er gratis. Se hvordan interviewtransskription fungerer for det fulde billede, eller download appen.
Hvad er forskellen på ordret og ren ordret?
Fuld ordret transskription beholder hvert ord, som det blev sagt: øh’erne, de falske starter, de gentagne ord, stammen og de hørbare latterudbrud. Ren ordret beholder talerens ord og mening, men dropper fyldordene, de falske starter og de tilfældige gentagelser. En redigeret transskription går et skridt videre og pudser grammatik og sætningsrækkefølge af, så den læses godt, og det er netop derfor, den ikke længere kan bruges som bevis for, hvad der faktisk blev sagt.
- Fuld ordret: samtaleanalyse, noget juridisk arbejde og bevisarbejde.
- Ren ordret: det meste kvalitative forskning, journalistik, brugerforskning.
- Redigeret: udgivne spørgsmål-og-svar-artikler.
| Niveau | Hvad det beholder | Typisk brug |
|---|---|---|
| Fuld ordret | Hvert ord som sagt: fyldord, falske starter, gentagelser, stammen, hørbare lyde | Samtaleanalyse, noget juridisk arbejde og bevisarbejde |
| Ren ordret | Talerens ord og mening, uden fyldord og falske starter | Det meste kvalitative forskning, journalistik, brugerforskning |
| Redigeret | Pudset grammatik og sætningsrækkefølge til læsning | Udgivne spørgsmål-og-svar-artikler |
Hvis transskriptionen skal bruges i et forskningsprojekt og ikke i en udgivet artikel, så beslut det før det første interview, ikke efter det femte: at skifte niveau midtvejs betyder, at de tidligere transskriptioner skal laves om, så de passer. Den forskningsspecifikke side, samtykke, anonymisering og opbevaring, er beskrevet i transskribere interviews til forskning.
Hvordan skriver man en transskription af et interview?
Start med en nøgle: ordretniveauet, de symboler du bruger, og hvordan talerne mærkes, skrevet øverst i dokumentet før den første talelinje. Den, der senere koder eller citerer transskriptionen, har brug for nøglen, og det har du også, uger senere, når du har glemt, hvad (.) skulle betyde.
Det bedst kendte system til detaljerede transskriptioner stammer fra Gail Jefferson og er beskrevet i hendes Glossary of transcript symbols with an introduction (2004). Som opsummeret af Clift, Kendrick, Raymond og Robinson (2024) markerer en venstre kantet parentes det punkt, hvor overlappende tale begynder, et lighedstegn binder tale sammen uden mellemrum, et tal i parentes som (0.5) er en målt pause i sekunder, og (.) markerer en pause, der er for kort til at måle. Kilderne er uenige om, præcis hvor kort en mikropause er, så hvis din nøgle bruger (.), bør den sige, hvad du mener med det.
De fleste interviewprojekter har ikke brug for så detaljeret et niveau og er lettere at læse uden. En konvention med kantede parenteser dækker det, der faktisk dukker op: [inaudible 00:12:31] for et stykke, du ikke kan tyde, med et tidsstempel, så du kan finde det igen; [crosstalk] hvor to personer taler i munden på hinanden; [laughs] og andre ikke-talebegivenheder i kantede parenteser; og et talermærke i starten af hver replik.
| Symbol | Betydning | System |
|---|---|---|
| [ | Punkt hvor overlappende tale begynder | Jefferson |
| = | Tale bundet sammen uden mellemrum (latching) | Jefferson |
| (0.5) | Målt stilhed, i sekunder | Jefferson |
| (.) | Pause for kort til at måle | Jefferson |
| [inaudible 00:12:31] | Stykke der ikke kan tydes, med et tidsstempel | Kantede parenteser |
| [crosstalk] | To personer der taler på samme tid | Kantede parenteser |
| [laughs] | Lyd der ikke er tale | Kantede parenteser |
Ud over notationen siger UK Data Service’s vejledning om transskription, at en transskription bør have en unik identifikator, bruge et ensartet layout i hele projektet, bruge talermærker til replikskift og bevare linjeskift: små ting, men det er dem, der gør det muligt at finde og sammenligne transskriptioner bagefter i stedet for at genlæse dem alle.
Talermærker er navne, som transskriptionsprogrammet ikke kan kende: forvent Speaker A og Speaker B, som du omdøber i hånden, når du ved, hvem der er hvem. At mærke talere konsekvent gennemgår, hvordan du gør det på tværs af et helt projekt, uden at navnene glider fra fil til fil.
Anonymisér undervejs, ikke bagefter: erstat navne og identificerende oplysninger med konsekvente pladsholdere som [Participant 2] eller [city] direkte i transskriptionen, og gem nøglen, der forbinder pladsholderne med de rigtige navne, i en separat fil. Optagelse af en person kræver næsten alle steder samtykke, og et forskningsetisk udvalg vil som regel have det samtykke skriftligt; at transskribere optagelsen ændrer ikke på det krav.
Hvor lang tid tager det at transskribere et interview?
I hånden skal du regne med timer, ikke minutter. Oral history-guiden fra Texas Tech University Libraries siger, at selv erfarne transskribenter typisk arbejder med seks timers skrivning for hver time lyd. En kursusguide fra Cornell University sætter det lavere, til fire til seks timer pr. times optagelse; forskellen skyldes mest, hvor ren lyden er, og hvor meget notation der tilføjes undervejs.
En automatisk transskription ændrer, hvor tiden går hen, i stedet for at få den til at forsvinde. Udkastet kommer tilbage på få minutter; det, der er tilbage, er at lytte det igennem mod optagelsen, rette navne og fagudtryk, rette op på, hvem der sagde hvad, hvor mærkerne krydsede hinanden, og tilføje den notation, projektet har brug for. For et interview på en time er det stadig rigtigt arbejde, bare af en anden slags; hvor lang tid transskription faktisk tager bryder det yderligere ned.
Kan ChatGPT transskribere et interview?
Om en chatbot kan gøre en lydfil til tekst, afhænger af produktet, men en interviewtransskription har brug for mere end tekst: tidsstempler, du kan vende tilbage til, og replikskift, du kan stole på, og det er det, en transskriptionsmotor er bygget til at levere. Hvor en chatbot gør nytte, er efter det trin: at rydde op i, opsummere eller omformatere en transskription, du allerede har.
Under alle omstændigheder skal automatisk tekst tjekkes mod optagelsen, før du citerer den, og det tjek er den del, intet værktøj fjerner.
Hvor meget tjek en given motor kræver, varierer en del. Hvor nøjagtig AI-transskription er gennemgår, hvad du kan forvente, og hvor fejlene har en tendens til at samle sig.
Hvad en rigtig automatisk transskription gør forkert
En automatisk transskription er et udkast, og den tydeligste måde at se, hvad det betyder, er at køre en og læse den mod optagelsen. Den 2. oktober 2026 gjorde vi præcis det med de første 5 minutter af en offentlig optagelse, som enhver kan tjekke mod denne artikel.
Vi kørte motoren bag SozAI’s interviewværktøj på de første 5 minutter (300 sekunder) af NASA Johnson Space Centers podcast Houston We Have a Podcast, afsnit 180, “Artemis Mission Management”, med værten Gary Jordan og gæsten Mike Sarafin, et NASA-værk og dermed ikke beskyttet af ophavsret. Den leverede 778 ord, registrerede engelsk og fandt 2 talere. De første linjer, som motoren gengav dem:
[00:00] Speaker A: Houston, we have a podcast. Welcome to the official podcast of the NASA Johnson Space Center, episode 180, Artemis Mission Management. I'm Gary Jordan, and I'll be your host today. [01:19] Speaker B: T-minus five seconds and counting. Mark. [01:22] Speaker A: Launch commit lights are correct. There she goes. Houston. We have a podcast. Mike Serafin, thanks for coming on Houston, We Have a Podcast today. [01:36] Speaker B: Thank you. It's a pleasure to be here to talk about these exciting Artemis missions we have ahead of us. Yeah, right? [01:43] Speaker A: Returning to the Moon. Not a bad thing to be a part of.
Tre ting i netop de fem replikker krævede en menneskelig gennemgang. Nedtællingen til opsendelsen ved 01:19 og “Launch commit lights are correct. There she goes.” ved 01:22 er arkivlyd fra opsendelser, klippet ind i podcasten, ikke værten eller gæsten, der taler; motoren mærkede dem alligevel som Speaker B og Speaker A. “Yeah, right?” i slutningen af replikken ved 01:36 er i virkeligheden værten, der tager samtalen op igen; den hører hjemme i begyndelsen af den næste replik, ikke i slutningen af gæstens. Og gæstens efternavn kommer ud som Serafin her, selvom afsnittets egne rulletekster staver det Sarafin.
En senere replik viser, hvad ren ordret er til for. Motorens output ved 02:51 lyder: “Yes, so you’re, you’re right in that I lived in the operations realm for 22 of my 27 years in, in my NASA career.” En ren ordret-gennemgang gør den til: “You’re right in that I lived in the operations realm for 22 of my 27 years in my NASA career.” Fuld ordret ville beholde gentagelserne præcis, som de kom ud; motoren hælder om noget til at beholde dem: den holdt fast i de fleste af gentagelserne og de falske starter i hele filen (“you’re, you’re right”, “in, in my NASA career”, “That’s, that’s quite a number of”), hvilket placerer dens output tættere på ordret end på ren ordret. Hvis et projekt har brug for ren ordret, så regn med en redigeringsgennemgang, uanset hvilken motor der producerer udkastet.

