Det viktigaste
macOS transkriberar inte en videofil på egen hand. Vad det klarar av, utan några nedladdningar, är att exportera ljudspåret ur videon med QuickTime Player, vilket ger dig en mycket mindre fil att arbeta med. Inbyggd diktering skriver ner det som mikrofonen hör medan du pratar, i realtid, så det är inte verktyget för en inspelning du redan har. Transkribering är ett separat steg, och det är samma steg oavsett vilken dator du sitter vid.
Du har en video liggande på din Mac. En skärminspelning av ett möte, en föreläsning någon skickat dig, ett klipp du sparat. Du vill ha texten. Och du vill helst inte skapa ett konto hos ett företag du aldrig hört talas om för att få den.
Uppgiften delas tydligt i två delar. Först ska du få ut en ren ljudfil ur videon. Sedan ska ljudet omvandlas till text. Den första halvan klarar din Mac redan, med programvara som redan finns på maskinen. Den andra halvan klarar den inte, och hur mycket du än letar i Systeminställningar ändrar det inget. Att veta var gränsen går sparar dig en eftermiddag av att söka efter en menyrad som inte finns.
Det macOS redan kan göra
QuickTime Player följer med varje Mac. Det spelar upp video, spelar in skärmen, och det kan exportera ljudet ur en videofil. Det sista är den nyttiga delen här, och det är ofta det enda steget du behöver ta innan du lämnar filen vidare till något annat.
macOS har också diktering, som omvandlar tal till text medan du pratar. Röstmemon finns också där, och appen synkroniserar med samma app på en iPhone via iCloud. Tillsammans kan de tre fånga ljud, lagra det, och skriva med hjälp av rösten.
Inget av dem läser en befintlig videofil och ger dig en transkribering. Det är värt att säga rakt ut, eftersom verktygen ligger så nära varandra att det känns som att funktionen borde finnas gömd någonstans. Den gör inte det. Mac:en är bra på att skapa inspelningar och dålig på att omvandla dem till text.
Få ut ljudet först
En videofil är en behållare. Den bär på bild och den bär på ett ljudspår, och transkribering rör bara ljudet. Bilden är dödvikt för det här ändamålet.
Exportera därför ljudet innan du gör något annat. QuickTime Player klarar det, vilket betyder att det första steget inte kostar dig något och kräver ingen installation. Vad du får tillbaka är en mycket mindre fil än videon du började med — ibland dramatiskt mindre, beroende på vad videon innehöll.
Den skillnaden i storlek slutar vara abstrakt så fort inspelningen är lång. En två timmar lång föreläsning som video är krångligt att flytta runt, ladda upp eller ha i flera kopior medan du bestämmer dig för vilket verktyg du ska använda. Samma två timmar som ljud är en blygsam fil du hanterar utan att tänka på det. Har du en mapp full av inspelningar att gå igenom är det skillnaden mellan en kväll och en helg.
Extraheringen löser också en fråga som brukar sätta krokben för folk: om de behöver något som specifikt hanterar videofiler omvandlade till text, eller om vanlig ljudtranskribering räcker. När ljudet är en separat fil spelar skillnaden ingen roll längre. Alla transkriberingsverktyg som tar emot ljud tar emot din fil.
Diktering är en annan uppgift
Diktering och transkribering används som om de var samma ord. De är det inte, och skillnaden är precis det som står mellan dig och den transkribering du vill ha.
Diktering lyssnar på en mikrofon och skriver ner vad den hör, i realtid, medan det händer. Du pratar, text dyker upp. Det är en skrivmetod. Transkribering tar en inspelning som redan finns — något som hände för en timme eller ett år sedan — och skapar text utifrån den. Det ena är en inmatningsmetod, det andra är en omvandling.
Du kan försöka lösa problemet genom att spela upp videon högt och låta dikteringen lyssna via högtalarna. Folk gör det. Det funkar dåligt. Du ber en mikrofon spela in ljud som redan spelats in en gång, i ett rum, med rummets akustik och allt, och du måste sitta igenom hela speltiden medan det pågår. En timme video kostar dig en timme. För något längre än ett kort klipp är det inget seriöst alternativ. Det finns mer att säga om tal till text på en Mac och var den inbyggda vägen tar slut, men kortversionen är att diktering aldrig var byggt för filer.
När du inte har filen än
Allt ovan förutsätter att videon redan finns på din disk. Ibland gör den inte det. Det du vill ha text från är ett samtal som pågår, eller en video som spelas i en webbläsarflik, och det finns inget att extrahera ljud ur eftersom ingenting har sparats.
Det är här Mac:en ställer till det på allvar. Att fånga upp Mac:ens eget systemljud — ljudet som kommer ut ur maskinen, snarare än in i mikrofonen — är inget macOS erbjuder som standard. Skärminspelning ger dig bilden. Att få tag på ljudet som hörde till är ett separat problem, och det är det enskilda steg som oftast stoppar folk helt. Har du någon gång slutat med en ljudlös inspelning av ett möte och inte kunnat förstå vad du gjorde fel, är det det här du stötte på. Du gjorde inget fel.
Det finns sätt att komma runt det, och de är värda att förstå innan du behöver dem, snarare än fem minuter in i ett samtal du inte kan göra om. Tekniken bakom att spela in skärmen på en Mac med ljud är ett eget ämne. Det som spelar roll här är att det är ett inspelningsproblem, inte ett transkriberingsproblem, och löser du det är du tillbaka i det vanliga fallet: en fil på disken.
En väg kringgår problemet helt. Röstmemon på Mac delar inspelningar med samma app på en iPhone via iCloud, så allt du spelar in på telefonen dyker upp på Mac:en utan att du mejlar dig själv en fil eller letar efter en sladd. För ett samtal ansikte mot ansikte, eller ett föredrag du sitter och lyssnar på, är det mindre bökigt att spela in på telefonen och hämta filen på datorn än att kämpa med systemljudet. Det hjälper förstås inte alls med ljud som Mac:en själv producerar.
Att omvandla ljudet till text
När ljudet finns som en fil spelar inget av de tidigare valen längre någon roll. Transkribering bryr sig inte om filen kom från en video, en telefon, en skärminspelning eller något en kollega skickade. Den bryr sig inte om att du sitter vid en Mac. Från den här punkten är det samma uppgift som på vilken dator som helst, vilket betyder att ditt enda val handlar om vilket transkriberingsverktyg du väljer och ingenting annat.
Det är också här önskan om att slippa registrera konto krockar med verkligheten, så låt mig vara rak. Allt som körs helt inuti webbläsaren kan lova att filen aldrig lämnar maskinen, och vissa verktyg fungerar verkligen på det sättet. Men webbläsarverktyg av det slaget hanterar saker som undertextfiler och ordräkning — text som redan är text. Faktisk taligenkänning på en tvåtimmars inspelning är tyngre arbete, och verktyg som klarar det vill oftast ha antingen en installerad app eller din fil på deras servrar. Vilket du än väljer är det frågan att ställa, och svaret bör vara lätt att hitta.
SozAI är ett alternativ: en transkriberingsapp för macOS som hanterar ljud- och videofiler, inspelningar och YouTube-länkar, med taggning av talare, sammanfattningar och översättning till över 99 språk. Samma webbplats har fria webbläsarbaserade verktyg för undertexter och ordräkning som körs helt i webbläsaren utan uppladdning och utan konto — de transkriberar inte ljud, men de är användbara när du redan har en transkribering att arbeta vidare med.
Vad transkriberingen inte gör åt dig
Be om tidsstämplar om syftet är att kunna gå tillbaka till ett visst ögonblick. En transkribering utan dem är en vägg av text du kan söka i — du hittar meningen — men att hitta meningen är inte samma sak som att hitta platsen i videon där den sades. Transkriberar du en föreläsning för att kunna hoppa till de tio minuter som betydde något är tidsstämplar hela poängen. Transkriberar du för att läsa igenom en gång och sedan aldrig öppna videon igen, är de bara skräp. Bestäm vilket av de två du gör innan du börjar, för att lägga till dem efteråt betyder att göra jobbet två gånger.
Räkna med att texten speglar inspelningen den kommer från. Taligenkänning arbetar med det som faktiskt spelades in, och en inspelning gjord i ett rum med folk som pratar i mun på varandra ger den mindre att jobba med än en ren inspelning. Att extrahera ljudet ur videon förbättrar inte ljudet; det isolerar bara det som redan fanns där. Är källjudet dåligt kommer du att redigera transkriberingen, och inget tidigare steg i processen fixar det.
Och acceptera att en del av videon inte överlever resan. Bilder, diagram, allt som skrevs på en whiteboard, vem som pekade på vad — allt faller bort, eftersom du medvetet slängde bort bilden för att få en fil du kunde arbeta med. För ett samtal förlorar man inget på det. För en demo eller en presentation är transkriberingen bara halva dokumentationen, och du vill ha originalvideon kvar bredvid den.

