Hoppa till innehållet

Att transkribera forskningsintervjuer utan att förlora data

11 min read 1 views Senast uppdaterad: aug 2, 2026
A desk with a handheld voice recorder, a printed sheet, a pen and an open laptop showing text

Det viktigaste

Bestäm detaljnivån innan du transkriberar något. Om din analys handlar om vad som sades räcker en ren, läsbar transkription. Om den handlar om hur det sades måste pauser, överlapp och trevande formuleringar bevaras, och det är just sådant som automatisk transkribering tar bort. Kolla vad ditt samtyckesformulär och ditt etiska godkännande säger om var inspelningar får skickas innan du laddar upp något någonstans. Anonymisera i transkriptionen, inte i inspelningen, håll en eventuell kodnyckel separat, och använd tidsstämplar så att citat går att spåra.

Ingen berättar för dig vad standarden är, för det finns ingen enda standard. Det finns flera, och vilken som gäller för dig beror på vad du tänker göra med transkriptionerna när du väl har dem. Det beslutet är metodologiskt, och det ska fattas före valet av verktyg, inte efter.

Gör det i fel ordning och priset är verkligt. Du transkriberar sex intervjuer rent, sätter dig med analysen, upptäcker att du behöver veta var deltagaren tvekade, och nu går du igenom sex inspelningar igen med nya öron. Lägg därför en timme på frågan först.

Bestäm vad transkriptionen ska användas till innan du skriver ett ord

Hur detaljerad en transkription behöver vara är ett metodologiskt val, inte en fråga om noggrannhet. Det följer av din analytiska ansats.

Om din analys handlar om vad som sades räcker en ren transkription bra. Du vill ha orden, korrekt återgivna och rätt tillskrivna talare. Utfyllnadsord, avbrutna meningar och korta pauser kan städas bort utan att det skadar något, eftersom inget av det ändå kommer in i din kodning. Det mesta tematiska och innehållsinriktade arbetet hamnar här, och en ren transkription är snabbare att göra, snabbare att läsa och snabbare att koda.

Om din analys handlar om hur något sades är läget det motsatta. Pauser, överlapp, trevande formuleringar, ögonblicket då två personer pratar samtidigt, de tre sekunderna innan ett svar kommer, självrättningen mitt i en mening – det är där datan finns. En transkription som tar bort det har tagit bort själva det du studerar. Det här gäller särskilt automatisk transkribering, eftersom det är precis sådana drag den är bra på att jämna ut. Den ger dig flytande, läsbar text, och flytande läsbar text är en förenklad återgivning av ett trevande, överlappande samtal.

Det finns en frestelse att gardera sig genom att transkribera allt på finaste detaljnivå, med tanken att man alltid kan bortse från det man inte behöver. Oftast är det fel väg att gå. Detaljerad transkribering går långsamt, och långsamt arbete med tjugo intervjuer äter upp månader du inte har. Det gör också transkriptionerna svårare att läsa, vilket gör kodningen långsammare. Om du genuint inte vet ännu om samspelet spelar roll för din analys är det ett samtal att ha med din handledare nu, inte ett problem att lösa med råstyrka. Vad du än bestämmer dig för finns inspelningarna kvar, och inspelningen är den egentliga datan. Transkriptionen är bara en återgivning av den.

Skriv ner dina principer före den andra intervjun

När du har bestämt detaljnivån, lägg fast principerna och skriv dem i ett kort dokument du har bredvid dig när du arbetar. Att ändra dem senare innebär att gå igenom varje inspelning du redan gjort, och det är den typen av uppgift som tyst äter upp ett par veckor.

Det som är värt att bestämma i förväg:

  • Om utfyllnadsord och avbrutna meningar behålls, städas bort, eller behålls bara där de verkar betydelsefulla – det sistnämnda är alternativet som mest sannolikt skapar inkonsekvens mellan intervjuer.
  • Hur pauser markeras, och om korta och långa pauser skiljs åt.
  • Hur överlappande tal visas, och vad som händer när du inte kan avgöra vem som pratade först.
  • Hur du markerar passager du inte kan tyda, och om du noterar orsaken.
  • Hur talare märks upp, och hur den märkningen förhåller sig till ditt anonymiseringsschema.
  • Var tidsstämplar sätts: vid jämna intervall, vid varje talarbyte, eller bara vid passager du räknar med att citera.

Tidsstämplar förtjänar ett eget stycke. De gör att ett citat i din avhandling går att spåra tillbaka till sin plats i inspelningen, vilket är det som gör påståendet kontrollerbart för vem som helst med tillgång till din data, inklusive en examinator. Att lägga in dem samtidigt som du arbetar kostar nästan ingenting. Att lägga dem till efteråt, i en färdig transkription, innebär att lyssna igenom hela inspelningen igen med stoppur i hand. Oavsett vilket verktyg du använder – få in dem redan i den första genomgången.

Samtycke och etiskt godkännande bestämmer var ljudet får hamna

Ditt samtyckesformulär är inte pappersarbete som avklarades innan forskningen startade. Det är ett set villkor för vad du nu får göra med inspelningarna, och det brukar täcka tre saker: hur inspelningen förvaras, vem som får lyssna på den och när den ska förstöras.

Att skicka ljud till en extern transkriberingstjänst är en form av utlämnande. Någon eller något utanför ditt projekt har nu en kopia av en deltagares röst. Det måste vara förenligt med vad deltagaren gick med på. Ibland är det uppenbart okej, eftersom formuläret förutsåg det. Ibland är det uppenbart inte okej, eftersom deltagaren fick veta att bara forskningsteamet skulle lyssna på inspelningen. Ofta är formuläret otydligt, och den otydligheten är värd att reda ut med din handledare eller etikkommitté innan du laddar upp – inte efteråt.

Etiskt godkännande går ofta längre och anger var inspelningar får förvaras, på vilken typ av enhet eller institutionellt system, och hur länge. Transkriptionen ärver de villkoren. Det gör även allt som härletts från den: dina kodade filer, dina citatutdrag, arbetsdokumentet där du klistrar in passager medan du skriver. Allt det räknas som data, och allt hör hemma i det förvaringsupplägg du fått godkänt. Det är lätt att tappa greppet om det här när man är djupt inne i analysen och kopior börjar mångfaldigas mellan en dator, ett molnkonto och ett mejl till sig själv.

I praktiken snävar det in dina alternativ för verktyg redan innan du hunnit jämföra dem på kvalitet eller pris. En tjänst som bearbetar filer på din egen enhet är en helt annan sak än en som laddar upp dem, och om du väger det mot varandra är det värt att läsa hur ett givet verktyg hanterar dina filer och din data snarare än att bara anta. Om svaret inte står klart och tydligt angivet, tolka det som ett svar i sig.

Anonymisering sker i transkriptionen

Inspelningen förblir som den är. Du kan inte anonymisera en röst genom att redigera text, och du bör inte försöka ändra din primärdata över huvud taget. Anonymisering är något du gör med transkriptionen.

Det betyder att du byter ut namn, platsnamn, arbetsgivarnamn, yrkestitlar som pekar ut en enskild person, och de små kringliggande detaljerna som gör någon igenkännbar för alla som känner till sammanhanget. Gör det konsekvent. Om en kollega heter [Kollega A] i en intervju ska hon vara [Kollega A] varje gång hon dyker upp, och samma princip gäller genom hela materialet. Inkonsekvent pseudonymisering är värre än ingen alls, eftersom den ser anonymiserad ut men fortfarande går att spåra av någon som läser noggrant.

Om du håller en nyckel mellan verkliga identiteter och ersättningar, förvara den separat från transkriptionerna, under de förvaringsvillkor ditt godkännande anger, och var tydlig med dig själv om varför du håller kvar den och när den ska förstöras. I vissa projekt finns goda skäl att ha den: du kan behöva återkontakta deltagare, eller koppla samman intervjuer från olika omgångar. I andra finns det inte, och den säkraste nyckeln är den som inte existerar. Poängen är att bestämma det medvetet.

En varning gällande att göra det här snabbt. Sök-och-ersätt fångar de uppenbara namnen men missar resten: smeknamnet som används två gånger, felstavningen, beskrivningen av en byggnad som bara stämmer på ett ställe i staden. Anonymiseringsgenomgången kräver mänskliga ögon på hela dokumentet.

Var automatisk transkribering faktiskt hjälper

Automatisk transkribering ger dig ett utkast. Det är en verklig tidsvinst, och att avvisa den på principiell grund innebär mest att skriva ut flera timmar tal för hand utan någon metodologisk vinst. Vad den inte ger dig är en färdig transkription.

För intervjudata är korrigeringsgenomgången mot ljudet en del av metoden, inte en valfri putsning på slutet. Du lyssnar igenom med utkastet framför dig, rättar det som är fel, återställer det din princip kräver som maskinen tappat bort, sätter in eller kontrollerar tidsstämplarna, och genomför din anonymisering. Det går långsammare än att läsa och snabbare än att skriva från grunden. Det är också här du blir förtrogen med materialet, vilket inte är någon sidoeffekt. Forskare som transkriberar sina egna intervjuer går in i analysen med redan god kunskap om vad materialet innehåller, och korrigeringsgenomgången köper tillbaka en god del av den förtrogenheten.

Om du vill ha ett utkast utan att skicka filer till en server transkriberar appen SozAI för iOS, Android och macOS inspelningar och filer med talarmärkning, vilket sköter den mekaniska delen av en intervjutranskription och lämnar dig den genomgång som verkligen spelar roll; mer om hur det tillämpas på att transkribera just intervjuer. Det är ett alternativ bland flera, och förvaringsfrågan ovan bör sortera din urvalslista innan kvaliteten gör det.

Vad det första utkastet inte gör åt dig

Räkna med att utkastet är svagast just där intervjuer är svårast. Samtidigt tal förvirrar talarseparationen, och två personer som pratar samtidigt brukar bli en person som säger något lätt osammanhängande. Stark dialekt eller brytning, tystlåtna deltagare, bakgrundsljud från ett café eller en korridor, och fackspecifikt vokabulär minskar alla träffsäkerheten. Talarmärkningen ligger vanligtvis nära men är inte tillförlitlig vid gränserna, särskilt kring korta inpass.

Och den ger dig inte prosodi. Ingen automatisk transkription bevarar längden på en paus eller markerar punkten där deltagarens röstläge ändrades. Om din analys behöver det är maskinutkastet bara en stomme för orden och inget mer, och du bör lägga upp din tid därefter. En kollega som arbetar med samma material men med en innehållsinriktad fråga blir klar på en bråkdel av tiden, och det beror inte på att hen arbetar mindre noggrant. Kollegans transkription besvarar helt enkelt en annan fråga.

Räkna med mer tid än vad kalkylen antyder, också. Korrigeringsgenomgången är inte en genomlyssning i normal hastighet; det handlar om att stanna, spola tillbaka, lyssna om de sex sekunderna man inte riktigt kan tyda. Att göra det på ett helt intervjumaterial är ett omfattande arbete, och det är normalt att det är det. Om du vill se hur delarna hänger ihop över ett helt projekt finns en genomgång av en avhandlingsforskares arbetsflöde som följer en uppsättning inspelningar från fil till citerbar transkription.

Det sista att hålla fast vid är att transkriptionen är en återgivning, och varje princip du valt är ett beslut om vad som ska bevaras och vad som ska förloras. Skriv in dessa beslut i ditt metodkapitel. En examinator som förstår varför dina transkriptioner ser ut som de gör kommer att läsa dem som genomtänkta. En som inte förstår kommer att undra.

Svar

Frequently Asked Questions

Hur detaljerad måste en transkription av en forskningsintervju vara?

Det beror på vad din analys ska göra med den. Om du studerar vad deltagarna sade räcker en ren transkription av orden. Om du studerar hur de sade det behöver pauser, överlapp och trevande formuleringar bevaras. Bestäm detta innan du börjar, för att ändra principen senare innebär att gå igenom varje inspelning du redan transkriberat.

Kan jag använda automatisk transkribering i kvalitativ forskning?

Ja, som ett första utkast. Korrigeringsgenomgången mot ljudet är en del av metoden snarare än en valfri putsning, och det är också där du blir förtrogen med materialet. Två villkor gäller: dina samtyckes- och etikvillkor måste tillåta att ljudet skickas dit det ska, och eftersom automatisk transkribering tar bort pauser och trevande formuleringar passar den bättre för innehållsanalys än för interaktionsanalys.

Bryter det mot deltagarnas samtycke att skicka inspelningar till en transkriberingstjänst?

Det kan göra det. Samtycke brukar täcka hur inspelningen förvaras, vem som får lyssna och när den förstörs, och att skicka ljud till en extern tjänst är en form av utlämnande som måste vara förenligt med vad deltagaren gick med på. Etiskt godkännande anger ofta även förvaringsplats och tidsgräns. Kontrollera båda innan du laddar upp något, och lös eventuell otydlighet med din handledare eller etikkommitté i förväg, inte efteråt.

Hur anonymiserar jag en transkription på rätt sätt?

Anonymisering sker i transkriptionen, inte i inspelningen. Byt ut namn, platser och identifierande detaljer konsekvent, så att samma person får samma ersättning varje gång i hela materialet. Om du håller en nyckel mellan verkliga identiteter och ersättningar, förvara den separat från transkriptionerna och var tydlig med varför du håller kvar den. Sök-och-ersätt missar smeknamn, felstavningar och kringliggande detaljer, så läs igenom manuellt.

Ska jag behålla pauser och utfyllnadsord i transkriptionen?

Behåll dem om din analys handlar om hur något sades, ta bort dem om den handlar om vad som sades. Att transkribera allt på finaste detaljnivå som en säkerhetsåtgärd är oftast fel väg: det går långsamt, gör transkriptionerna svårare att läsa och koda, och det mesta av detaljerna kommer aldrig att användas. Bestäm en gång och tillämpa det konsekvent.

Måste jag kontrollera hela transkriptionen mot ljudet?

För intervjudata, ja. Automatisk transkribering ger ett första utkast, och korrigeringsgenomgången är där fel rättas, tidsstämplar kontrolleras och det som din princip kräver återställs. Det är också där du hinner lära känna materialet innan analysen börjar. Räkna med att det tar riktig tid, eftersom du kommer att stanna och lyssna om istället för att bara spela igenom rakt av.

Merey Tleugazin

Grundare av SozAI. Bygger verktyg som omvandlar tal till text för yrkesverksamma världen över.

SozAI
SozAI — Gratis nedladdningTranskribera ljud och video direkt
Hämta appen