Hoppa till innehållet

Så citerar du en video i en uppsats utan att skriva av allt

9 min read 1 views Senast uppdaterad: aug 2, 2026
An open laptop and a notebook side by side on a library desk, a pen resting in the fold

Sammanfattning

Skaffa först en transkription med tidsstämplar, så har du både exakta ordalydelsen och tidpunkten på en gång. Kontrollera meningen du tänker citera mot ljudet, eftersom automatiska undertexter är minst tillförlitliga när det gäller namn, facktermer och siffror – vilket ofta är precis det ett citat innehåller. Sätt själv ut skiljetecken och bestäm hur du vill hantera avbrutna meningar. Omvandla sedan tidsstämpeln till det format din referensstil kräver, och följ alltid institutionens egna anvisningar framför en generell regel.

Videon står pausad precis där någon sa det du behöver. Att skriva av det på gehör, och spola tillbaka tre gånger för att fånga sista ordet, är inte hur du vill spendera en kväll. Det finns ett snabbare sätt som dessutom blir mer korrekt.

Lösningen är att skaffa en transkription med tidsstämplar innan du skriver in ett enda ord av citatet i uppsatsen. När du har den blir citerandet mest kopiering, och referenshanteringen mest huvudräkning.

Börja med en transkription, inte med öronen

En transkription med tidsstämplar ger dig båda delarna ett citat behöver: den exakta ordalydelsen och positionen i videon där den finns. Utan en transkription gör du två saker samtidigt – lyssnar efter innehåll och lyssnar efter klockan – och gör båda dåligt. Med en transkription delar du upp uppgifterna. Du läser texten på skärmen, och du vet redan var i videon den kommer från eftersom tidsstämpeln står precis bredvid.

Om videon ligger på YouTube finns det några vägar till en transkription, och en genomgång av dem hittar du i hur du får fram en transkription av en YouTube-video. Vissa videor har redan undertexter du kan hämta direkt, andra kräver ett verktyg som skapar dem. Målet är ändå samma: ett dokument du kan skrolla och söka i, istället för en video du hela tiden måste spola i.

Sök i transkriptionen efter ett utmärkande ord från det ögonblick du minns, istället för att spola i videon på känn. Det går snabbare, och du hamnar närmare den exakta raden.

Kontrollera den exakta meningen mot ljudet

Det här är steget folk hoppar över, och det är det som orsakar mest skada. Automatiskt genererade undertexter är minst tillförlitliga när det gäller namn, facktermer och siffror. Ett citat i en uppsats innehåller ofta just sådant: en forskares namn, en fackterm, en siffra någon nämnde. Undertextprogrammet gissar hyfsat rätt på vanliga ord. Det gissar dåligt på det ord som betyder mest för ditt argument.

Innan en citerad mening hamnar i uppsatsen bör du därför lyssna på just den delen av ljudet igen och jämföra med vad transkriptionen säger. Det tar några sekunder per citat. Det är inte samma sak som att transkribera om hela videon – du kontrollerar en mening, den du är på väg att sätta inom citattecken och koppla till någon vid namn inför en examinator.

Felet är sällan en helt galen mening. Det är oftare ett litet, självsäkert fel ord som sitter mitt i en annars korrekt mening – den typen av misstag som överlever en snabb genomläsning eftersom allt runt omkring ser rätt ut.

Skiljetecknen i citatet är ditt beslut, inte undertextens

Automatiskt genererade undertexter innehåller vanligtvis inga skiljetecken du kan lita på. En del system sätter in komman och punkter utifrån pauser eller tonläge, inte grammatik, vilket betyder att en undertext kan bryta en mening där talaren aldrig menade att göra ett stopp. Var en mening slutar avgör vad den verkar påstå. En talare som formulerade ett långt villkorssatsat påstående kan i undertexten se ut att ha gjort två separata, kategoriska uttalanden.

Det betyder att skiljetecknen inuti citatet är något du själv bestämmer utifrån vad du hör, inte något du ärver från undertextfilen. Om talarens innebörd hänger på att en paus är ett komma och inte en punkt, är det ett beslut du fattar efter att ha lyssnat – och värt att få rätt innan du bygger ett helt analysstycke ovanpå det.

Att omvandla tidsstämpeln till det din referensstil kräver

Referensstilar som täcker audiovisuellt material kräver en tidsangivelse tillsammans med ett direkt citat. Vad de inte är överens om är formatet. Vissa stilar vill ha minuter och sekunder. Andra vill ha timmar, minuter och sekunder även för en femminutersvideo. Den exakta formen skiljer sig mellan stilar, och det är vanligt att en institution publicerar sin egen variant ovanpå den allmänna referensguiden. När de två strider mot varandra vinner institutionens version. Det är ingen teknikalitet, det är den faktiska regeln: examinatorns instruktioner går alltid före den allmänna manualen.

Tidsstämplar dyker upp i fler former än man kanske tror. En transkription kan ge dig rena sekunder. En videospelare visar M:SS eller HH:MM:SS. En undertextfil använder sitt eget format, oftast ner till millisekunden, eftersom undertexter måste synka exakt med talet. Att flytta mellan de här formaten är huvudräkning, inte bedömning, men det är pilligt att göra för hand klockan elva på kvällen, och lätt att tappa en siffra när man räknar om 3:45 till totala sekunder eller tvärtom. En tidskodsomvandlare gör den omräkningen åt dig, så det enda som är kvar att få rätt är att kopiera siffran till rätt plats i referensen.

En referens är mer än en tidsstämpel

Även när du har rätt tidsformat, kom ihåg att tidsstämpeln bara är en del av en referens, inte hela. Du behöver fortfarande källans titel, plattform eller utgivare, och allt annat din stil kräver runt omkring. Tidsstämpeln svarar på var i videon; den svarar inte på vem som gjorde den eller var den publicerades, och båda de sakerna måste fortfarande vara rätt.

Att hålla citatet ärligt

Folk pratar med avbrutna meningar, upprepade ord och halva satser de rättar till mitt i. Att citera tal korrekt betyder att behålla det, eller tydligt markera att du tagit bort det, oftast med tre punkter inuti citatet. Vad du inte bör göra är att i tysthet snygga till meningen så att den flyter bättre. Det förändrar vad som faktiskt sades, även om den putsade versionen fångar den övergripande tanken. En mening en talare rättade sig själv ur är inte en mening de påstod; om du stryker rättelsen i tysthet har du lagt ord i munnen på dem som de tog tillbaka en sekund senare.

Det här är ett omdöme du gör varje gång, och det finns ingen generell regel för hur mycket städning som är för mycket. Den säkrare vanan är att som standard behålla röran, och bara ta bort den när avbrottet verkligen är ovidkommande – och markera borttagningen när du gör det.

Vad det här inte kan göra åt dig

En transkription, hur exakt den än är, är ett arbetsdokument. Det är det du använder för att hitta och kontrollera ett citat. Det är inte det du refererar till. Videon är fortfarande källan; transkriptionen är dina anteckningar om den. Den skillnaden spelar roll om en examinator eller läsare någon gång frågar var ett citat kommer från – det ärliga svaret är videon, vid den tidsstämpeln, och transkriptionen var hur du hittade den.

Om videon inte har några undertexter aktiverade alls kan du inte hämta en befintlig undertextfil, men du kan fortfarande skapa en transkription från ljudet med hjälp av ett transkriptionsverktyg. Träffsäkerheten på svåra ord blir inte bättre bara för att transkriptionen kommer från en dedikerad app istället för plattformens inbyggda undertexter – samma regel om att kontrollera namn, facktermer och siffror mot ljudet gäller fortfarande. Där ett transkriptionsverktyg hjälper är hastighet och struktur: något som ett YouTube-transkriptionsverktyg kan omvandla en länk till ett sökbart dokument med tidsstämplar i ett steg, och en app som SozAI kan göra samma sak för en nedladdad fil eller inspelning, med talarmärkning om videon har mer än en röst – användbart när citatet du behöver sades av den andra personen i samtalet snarare än den första. Inget av detta ersätter att lyssna på den exakta meningen innan du citerar den.

Om du arbetar utifrån en fil istället för en länk kan du föra in videon eller ljudet i transkriptionsappen och skapa en transkription med tidsstämplar från den, vilket är samma process som ovan men som utgår från en fil istället för en URL.

Vad som realistiskt kan gå fel

Även om du gör allt det här noggrant, räkna med lite friktion. Automatisk transkription snubblar fortfarande på dialekter, överlappande tal och bakgrundsljud, och ingen mängd kontroll tar bort behovet av att faktiskt lyssna på den ifrågasatta meningen själv. Att omvandla tidsstämplar mellan format är enkel huvudräkning, men det är fortfarande ett ställe att göra ett litet fel om du skyndar dig, så dubbelkolla den omräknade siffran mot originalet en gång. Och institutioners egna riktlinjer motsäger ibland varandra eller den allmänna manualen på sätt som verkligen förvirrar; när det händer, fråga hellre än att gissa, eftersom tidsstämpelformatet är en av få saker i en referens som en examinator märker direkt om den är fel.

Svar

Frequently Asked Questions

Refererar jag till videon eller till transkriptionen jag gjorde av den?

Du refererar till videon. Transkriptionen är ett arbetsdokument du använde för att hitta och kontrollera ordalydelsen, inte källan i sig. Referensen ska peka på den ursprungliga videon och dess utgivare, med tidsstämpeln som markerar var i videon citatet finns.

Hur hittar jag exakt när i en video ett citat förekommer?

Skaffa en transkription med tidsstämplar och sök i den efter ett utmärkande ord från citatet, istället för att spola i videon på känn. Tidsstämpeln bredvid den matchande raden ger dig positionen; lyssna på den delen av ljudet en gång för att bekräfta den innan du citerar.

Är automatiska undertexter tillräckligt exakta för att citera direkt från?

Inte utan kontroll. Automatiskt genererade undertexter är minst tillförlitliga när det gäller namn, facktermer och siffror, vilket är precis det citat ofta innehåller. Behandla undertexten som ett första utkast och lyssna på den exakta meningen igen innan den hamnar i uppsatsen.

Vad gör jag med en talares avbrutna meningar och utfyllnadsord?

Behåll dem, eller markera tydligt var du tagit bort dem, oftast med tre punkter. Att i tysthet putsa till ett citat förändrar vad som faktiskt sades, särskilt om talaren rättade sig själv mitt i en mening och du stryker rättelsen utan att markera det.

Kan jag få en transkription av en video som har undertexter avstängda?

Ja, ett transkriptionsverktyg kan skapa en från ljudet även utan befintliga undertexter. Samma försiktighet gäller oavsett: kontrollera namn, facktermer och siffror mot ljudet innan du citerar, eftersom källan till transkriptionen inte ändrar den risken.

Hur omvandlar jag en tidsstämpel till det format min referensstil kräver?

Tidsstämplar finns i flera former – sekunder, minuter och sekunder, timmar-minuter-sekunder, och undertextfiler med millisekunder. Att omvandla mellan dem är huvudräkning; en tidskodsomvandlare gör det åt dig. Kontrollera alltid institutionens egna riktlinjer, eftersom de kan gå före den allmänna referensmanualens format.

Merey Tleugazin

Grundare av SozAI. Bygger verktyg som omvandlar tal till text för yrkesverksamma världen över.

SozAI
SozAI — Gratis nedladdningTranskribera ljud och video direkt
Hämta appen