**Transkribera en intervju: nivåer, talare och notation**
Source: https://sozai.app/sv/how-to-transcribe-an-interview/

[Handledningar](https://sozai.app/sv/category/handledningar/)

# Transkribera en intervju: ordagrannhetsnivåer, talaretiketter och notation

okt 2, 2026  • 10 min read • 12 views  • Senast uppdaterad: okt 2, 2026

![Two chairs facing each other at a small table by a window, a phone recording between them next to a notebook](https://sozai.app/wp-content/uploads/post-how-to-transcribe-an-interview-1280x720.webp)

> ### Det viktigaste i korthet
>
>
>
> Bestäm ordagrannhetsnivån innan du skriver ett enda ord: vid full verbatim bevaras varje öh och varje avbruten mening, vid clean verbatim bevaras innebörden utan utfyllnadsljuden, och en redigerad utskrift rättar grammatiken för läsning. Välj en notation för pauser, överlappningar och ohörbara avsnitt, skriv ner den som en nyckel överst i dokumentet och märk upp talarna konsekvent. För hand anger Texas Tech University Libraries guide om muntlig historia sex timmars skrivande per inspelad timme; en kursguide från Cornell University anger fyra till sex. En automatisk utskrift ger ett första utkast på några minuter; det mänskliga arbetet flyttas från att skriva till att kontrollera mot inspelningen.

Du har inspelningen. Nu vill någon ha en utskrift som går att citera, koda eller lämna in, och den första frågan är inte vilken app du ska använda – utan hur mycket av talet du ska behålla.

Utfyllnadsljud och avbrutna meningar spelar roll i samtalsanalys och i vissa juridiska sammanhang; överallt annars är de brus. Den här artikeln går igenom de tre ordagrannhetsnivåerna, notationen för pauser och överlappningar, hur lång tid arbetet tar för hand och vad en automatisk utskrift får rätt och fel på en riktig inspelning.

## Vad är det enklaste sättet att transkribera en intervju?

Kör först inspelningen genom en taligenkänningsmotor, rätta sedan namn, stickprovskontrollera mot ljudet och lägg till den notation som ditt projekt behöver – det går fortare än att skriva från ett tomt blad, och det är vad de flesta egentligen menar med enklast. Att skriva en hel timmes tal ord för ord från grunden är den långsamma vägen in, inte den enkla.

För ett kort klipp gör vårt webbläsarverktyg [transkribera en intervju online](https://sozai.app/sv/tools/transcribe-interview/) det första steget utan konto: du laddar upp en inspelning och det transkriberar de första 5 minuterna, märker varje replik med Speaker A, Speaker B och så vidare med tidsstämpel, och identifierar språket automatiskt bland 99 språk. Filer upp till 25 MB går igenom som de är; längre inspelningar klipps till 5 minuter i webbläsaren innan något skickas. Ljudet och utskriften raderas hos leverantören så fort resultatet har kommit tillbaka, och du får tre förhandsvisningar per enhet och dag.

Det räcker för att se om ett verktyg är värt att använda på en viss inspelning. För en hel intervju i ett svep, med repliker märkta hela vägen och varje utskrift sparad i ett sökbart bibliotek efteråt, finns SozAI-appen – de första 30 minuterna är gratis. Se [hur intervjutranskribering fungerar](https://sozai.app/sv/interview-transcription/) för helheten, eller [ladda ner appen](https://sozai.app/sv/download/).

## Vad är skillnaden mellan verbatim och clean verbatim?

Full verbatim behåller varje ord som det sades: öhen, de avbrutna meningarna, de upprepade orden, stammandet och det hörbara skrattet. Clean verbatim behåller talarens ord och innebörd men utelämnar utfyllnadsljuden, de avbrutna meningarna och de oavsiktliga upprepningarna. En redigerad utskrift går ett steg längre och rättar grammatik och meningsordning så att den läser bra – vilket är precis varför den slutar fungera som bevis för vad som faktiskt sades.

- Full verbatim: samtalsanalys, visst juridiskt arbete och bevisarbete.
- Clean verbatim: det mesta av kvalitativ forskning, journalistik, användarforskning.
- Redigerad: publicerade artiklar i frågeform.

| Nivå | Vad den behåller | Typisk användning |
| --- | --- | --- |
| Full verbatim | Varje ord som det sades: utfyllnadsljud, avbrutna meningar, upprepningar, stammande, hörbara ljud | Samtalsanalys, visst juridiskt arbete och bevisarbete |
| Clean verbatim | Talarens ord och innebörd, utfyllnadsljud och avbrutna meningar utelämnas | Det mesta av kvalitativ forskning, journalistik, användarforskning |
| Redigerad | Rättad grammatik och meningsordning för läsning | Publicerade artiklar i frågeform |

Om utskriften ska in i ett forskningsprojekt snarare än en publicerad text, bestäm det före den första intervjun, inte efter den femte – byter du nivå mitt i måste tidigare utskrifter göras om så att de stämmer. Den forskningsspecifika sidan, samtycke, anonymisering och lagring, tas upp i [transkribera intervjuer för forskning](https://sozai.app/sv/interview-transcript-for-research/).

## Hur skriver man ut en intervju?

Börja med en nyckel: ordagrannhetsnivån, symbolerna du använder och hur talare märks upp, skriven överst i dokumentet före första talraden. Den som senare kodar eller citerar utskriften behöver den nyckeln, och det gör du också, veckor senare, när du har glömt vad (.) skulle betyda.

Det mest kända systemet för detaljerade utskrifter kommer från Gail Jefferson och finns i hennes [Glossary of transcript symbols with an introduction](https://doi.org/10.1075/pbns.125.02jef) (2004). Som [Clift, Kendrick, Raymond och Robinson (2024)](https://eprints.whiterose.ac.uk/id/eprint/237652/1/Clift_Kendrick_Raymond_Robinson._2024_-_Jeffersonian_Transcription_conventions.pdf) sammanfattar det markerar en vänster hakparentes den punkt där överlappande tal börjar, ett likhetstecken binder ihop tal utan lucka, ett tal inom parentes som (0.5) är en tidsmätt tystnad i sekunder, och (.) markerar en paus som är för kort för att mätas. Källorna är oeniga om exakt hur kort en mikropaus är, så om din nyckel använder (.) bör den säga vad du menar med det.

De flesta intervjuprojekt behöver inte den detaljnivån och är lättare att läsa utan den. En konvention med hakparenteser täcker det som faktiskt förekommer: [inaudible 00:12:31] för ett avsnitt du inte kan urskilja, med tidsstämpel så att du hittar tillbaka; [crosstalk] där två personer pratar i munnen på varandra; [laughs] och andra icke-talade händelser inom hakparenteser; och en talaretikett i början av varje replik.

| Symbol | Betydelse | System |
| --- | --- | --- |
| [ | Punkt där överlappande tal börjar | Jefferson |
| = | Tal som sluter an utan lucka (latching) | Jefferson |
| (0.5) | Tidsmätt tystnad, i sekunder | Jefferson |
| (.) | Paus för kort för att mätas | Jefferson |
| [inaudible 00:12:31] | Avsnitt som inte går att urskilja, med tidsstämpel | Hakparenteser |
| [crosstalk] | Två personer pratar samtidigt | Hakparenteser |
| [laughs] | Icke-talat ljud | Hakparenteser |

Utöver notationen säger [UK Data Services vägledning om transkribering](https://dam.ukdataservice.ac.uk/media/187730/transcriptiondm25april2013.pdf) att en utskrift ska ha en unik identifierare, använda en enhetlig layout genom hela projektet, använda talartaggar för replikbyten och behålla radbrytningar – små saker, men det är de som låter dig hitta och jämföra utskrifter senare i stället för att läsa om alla.

Talaretiketter är namn som transkriberingsprogramvaran inte kan känna till – räkna med Speaker A och Speaker B, som du döper om för hand när du vet vem som är vem. [Märka upp talare konsekvent](https://sozai.app/sv/who-said-what-transcript/) går igenom hur du gör det över ett helt projekt utan att namnen glider isär mellan filerna.

Anonymisera medan du arbetar, inte efteråt: ersätt namn och identifierande uppgifter med konsekventa platshållare som [Participant 2] eller [city] direkt i utskriften, och förvara nyckeln som kopplar platshållare till riktiga namn i en separat fil. Att spela in en person kräver nästan överallt hennes samtycke, och en etikprövningsnämnd vill vanligtvis ha det samtycket skriftligt; att transkribera inspelningen ändrar inte det kravet.

## Hur lång tid tar det att transkribera en intervju?

För hand bör du räkna med timmar, inte minuter. [Texas Tech University Libraries guide om muntlig historia](https://guides.library.ttu.edu/c.php?g=1275281&p=9356352) säger att även erfarna transkriberare typiskt arbetar med sex timmars skrivande för varje timme ljud. En [kursguide från Cornell University](https://courses2.cit.cornell.edu/fit117/CP_T.htm) lägger det lägre, på fyra till sex timmar per inspelad timme – skillnaden beror mest på hur rent ljudet är och hur mycket notation som läggs till på vägen.

En automatisk utskrift ändrar var tiden går åt snarare än att få den att försvinna. Utkastet kommer tillbaka på några minuter; det som återstår är att lyssna igenom det mot inspelningen, rätta namn och facktermer, korrigera vem som sade vad där etiketterna har bytt plats, och lägga till den notation projektet behöver. För en intervju på en timme är det fortfarande ett verkligt arbete, bara av ett annat slag – [hur lång tid transkribering faktiskt tar](https://sozai.app/sv/how-long-will-transcription-take/) bryter ner det vidare.

## Kan ChatGPT transkribera en intervju?

Om en chattbot kan göra en ljudfil till text beror på produkten, men en intervjuutskrift behöver mer än text: tidsstämplar du kan gå tillbaka till och repliker du kan lita på, vilket är vad en transkriberingsmotor är byggd för att ge. Där en chattbot gör nytta är efter det steget, när den städar, sammanfattar eller formaterar om en utskrift du redan har.

Hur som helst måste automatisk text kontrolleras mot inspelningen innan du citerar den, och den kontrollen tar inget verktyg bort.

Hur mycket kontroll en viss motor behöver varierar ganska mycket. [Hur exakt AI-transkribering är](https://sozai.app/sv/how-accurate-is-ai-transcription/) går igenom vad du kan förvänta dig och var felen brukar samlas.

## Vad en riktig automatisk utskrift gör fel

En automatisk utskrift är ett utkast, och det tydligaste sättet att se vad det betyder är att köra en och läsa den mot inspelningen. Den 2 oktober 2026 gjorde vi precis det, på de första 5 minuterna av en offentlig inspelning som vem som helst kan kontrollera mot den här artikeln.

Vi körde motorn bakom SozAI:s intervjuverktyg på de första 5 minuterna (300 sekunder) av NASA Johnson Space Centers podd Houston We Have a Podcast, avsnitt 180, ”Artemis Mission Management”, med programledaren Gary Jordan och gästen Mike Sarafin – ett NASA-verk och därmed inte upphovsrättsskyddat. Den gav tillbaka 778 ord, identifierade engelska och hittade 2 talare. De inledande raderna, så som motorn återgav dem:

[00:00] Speaker A: Houston, we have a podcast. Welcome to the official podcast of the NASA Johnson Space Center, episode 180, Artemis Mission Management. I'm Gary Jordan, and I'll be your host today.
[01:19] Speaker B: T-minus five seconds and counting. Mark.
[01:22] Speaker A: Launch commit lights are correct. There she goes. Houston. We have a podcast. Mike Serafin, thanks for coming on Houston, We Have a Podcast today.
[01:36] Speaker B: Thank you. It's a pleasure to be here to talk about these exciting Artemis missions we have ahead of us. Yeah, right?
[01:43] Speaker A: Returning to the Moon. Not a bad thing to be a part of.

Tre saker i just de fem replikerna behövde en mänsklig genomgång. Nedräkningen vid 01:19 och ”Launch commit lights are correct. There she goes.” vid 01:22 är arkivljud från en uppskjutning som klippts in i podden, inte programledaren eller gästen som talar – motorn märkte dem ändå som Speaker B och Speaker A. ”Yeah, right?” i slutet av repliken vid 01:36 är i själva verket programledaren som tar upp samtalet igen; det hör hemma i början av nästa replik, inte i slutet av gästens. Och gästens efternamn blir här Serafin, fast avsnittets egna eftertexter stavar det Sarafin.

En senare replik visar vad clean verbatim är till för. Motorns utskrift vid 02:51 lyder: ”Yes, so you’re, you’re right in that I lived in the operations realm for 22 of my 27 years in, in my NASA career.” En clean verbatim-genomgång gör om det till: ”You’re right in that I lived in the operations realm for 22 of my 27 years in my NASA career.” Full verbatim skulle behålla upprepningarna precis som de kom ut; motorn lutar om något åt att behålla dem – den behöll de flesta upprepningar och avbrutna meningar genom hela filen (”you’re, you’re right”, ”in, in my NASA career”, ”That’s, that’s quite a number of”), vilket gör att dess utskrift ligger närmare verbatim än clean verbatim. Om ett projekt kräver clean verbatim, budgetera för ett redigeringssteg oavsett vilken motor som tar fram utkastet.

Svar

## Frequently Asked Questions

Vad är det enklaste sättet att transkribera en intervju?

Kör inspelningen genom en taligenkänningsmotor för ett första utkast, kontrollera det sedan mot ljudet och rätta talarnamn och oklara ord – att skriva från grunden för hand går långsammare, inte enklare. Ett webbläsarverktyg som SozAI:s intervjutranskriberare kan ta fram ett märkt utkast med tidsstämplar av de första 5 minuterna utan konto, vilket räcker för att bedöma om det är värt att köra hela filen.

Hur ska en färdig intervjuutskrift se ut?

Den inleds med en kort nyckel som anger ordagrannhetsnivå, använd notation och hur talare märks upp, följd av märkta repliker som Speaker A med tidsstämplar. UK Data Services vägledning om transkribering tillägger att den ska ha en unik identifierare, enhetlig layout, talartaggar och radbrytningar, så att den går att hitta och jämföra senare i stället för att läsas om i sin helhet.

Kan ChatGPT transkribera en intervju?

Det beror på produkten, och det är fel verktyg för det första steget. En intervjuutskrift behöver tidsstämplar och repliker man kan lita på, vilket en transkriberingsmotor ger. En chattbot är användbar efteråt, för att städa, sammanfatta eller formatera om en utskrift du redan har, och all automatisk text måste fortfarande kontrolleras mot inspelningen.

Ska jag använda verbatim eller clean verbatim?

Använd full verbatim för samtalsanalys eller juridiskt arbete och bevisarbete, där varje öh, varje avbruten mening och varje upprepning spelar roll; använd clean verbatim för det mesta av kvalitativ forskning, journalistik och användarforskning, där innebörden väger tyngre än talets ojämnheter. Bestäm det före den första intervjun, eftersom ett byte mitt i innebär att tidigare utskrifter görs om.

Hur markerar man ohörbara delar i en utskrift?

Skriv [inaudible] med en tidsstämpel, som [inaudible 00:12:31], så att du eller någon annan kan hitta stället i inspelningen igen senare. För överlappande tal använd [crosstalk], och för icke-talade ljud som skratt [laughs] – allt inom hakparenteser och förklarat en gång i nyckeln överst i utskriften.

Hur lång tid tar det att transkribera en intervju på en timme?

För hand anger Texas Tech University Libraries guide om muntlig historia ungefär sex timmars skrivande per timme ljud; en kursguide från Cornell University uppskattar fyra till sex timmar. En automatisk utskrift ger ett utkast på några minuter, och den återstående tiden går till att kontrollera det mot inspelningen i stället för att skriva ut det.

![Merey Tleugazin](https://sozai.app/wp-content/themes/sozai/assets/images/merey-tleugazin.webp)

[Merey Tleugazin](https://sozai.app/about/merey/)

Grundare av SozAI. Bygger verktyg som omvandlar tal till text för yrkesverksamma världen över.

- [Instagram](https://instagram.com/mereytleugazin)
- [X](https://x.com/mereytleugazin)

## Relaterade artiklar

- [aug 2 10 min ### Hur lång tid tar det att transkribera en tvåtimmarsinspelning?](https://sozai.app/sv/how-long-will-transcription-take/)
- [jul 30 7 min ### Så läser du ett röstmeddelande när du inte kan lyssna på det](https://sozai.app/sv/read-a-voice-message/)
- [jul 19 13 min ### Så transkriberar du medicinska föreläsningar och diktat med AI](https://sozai.app/sv/transcribe-medical-lectures-dictation/)

[![SozAI](https://sozai.app/wp-content/themes/sozai/assets/images/appicon.png) SozAI — Gratis nedladdning Transkribera ljud och video direkt Hämta appen](https://sozai.app/sv/download/)


---
This is the markdown twin of https://sozai.app/sv/how-to-transcribe-an-interview/ — the same content, without the markup.
Published by SozAI (https://sozai.app). Reuse and quotation are allowed with attribution and a link back.
Machine-readable index: https://sozai.app/llms.txt · data API: https://sozai.app/api/
