In sintesi
Decidi il livello di verbatim prima di scrivere una sola parola: il verbatim integrale conserva ogni “ehm” e ogni falsa partenza, il verbatim pulito conserva il significato senza gli intercalari, e una trascrizione rielaborata sistema la grammatica per la lettura. Scegli una notazione per pause, sovrapposizioni e tratti inudibili, scrivila come legenda all’inizio del documento ed etichetta i parlanti in modo coerente. A mano, la guida alla storia orale delle Texas Tech University Libraries indica un rapporto di sei ore di digitazione per ogni ora di registrazione; una guida di corso della Cornell University dice da quattro a sei. Una trascrizione automatica ti dà una prima bozza in pochi minuti; il lavoro umano passa dal digitare al controllarla sulla registrazione.
Hai la registrazione. Ora qualcuno vuole una trascrizione da citare, codificare o consegnare, e la prima domanda non è quale app usare: è quanto del parlato intendi conservare.
Gli intercalari e le false partenze contano nell’analisi della conversazione e in alcuni contesti legali; ovunque altrove sono rumore. Questo articolo passa in rassegna i tre livelli di verbatim, la notazione che segna pause e sovrapposizioni, quanto dura il lavoro a mano e cosa una trascrizione automatica coglie e sbaglia su una registrazione reale.
Qual è il modo più semplice per trascrivere un’intervista?
Passa prima la registrazione in un motore di riconoscimento vocale, poi correggi i nomi, controlla a campione sull’audio e aggiungi la notazione che serve al tuo progetto: è più veloce che scrivere da una pagina bianca, ed è ciò che la maggior parte delle persone intende davvero per “più semplice”. Digitare da zero un’ora intera di parlato, parola per parola, è la strada lenta, non quella facile.
Per un breve estratto, il nostro strumento nel browser per trascrivere un’intervista online fa questa prima passata senza account: carichi una registrazione e trascrive i primi 5 minuti, etichetta ogni intervento Speaker A, Speaker B e così via con un timestamp, e rileva automaticamente la lingua tra 99 lingue. I file fino a 25 MB passano così come sono; le registrazioni più lunghe vengono ritagliate a 5 minuti nel browser prima che venga inviato qualcosa. L’audio e la trascrizione vengono eliminati presso il fornitore appena torna il risultato, e hai tre anteprime per dispositivo al giorno.
Basta per capire se uno strumento vale la pena su una data registrazione. Per un’intervista intera in un solo passaggio, con gli interventi etichettati dall’inizio alla fine e ogni trascrizione conservata poi in una libreria ricercabile, lo fa l’app SozAI: i primi 30 minuti sono gratuiti. Vedi come funziona la trascrizione delle interviste per il quadro completo, oppure scarica l’app.
Che differenza c’è tra verbatim e verbatim pulito?
Il verbatim integrale conserva ogni parola come pronunciata: gli “ehm”, le false partenze, le parole ripetute, le balbuzie e le risate udibili. Il verbatim pulito conserva le parole e il significato di chi parla ma elimina gli intercalari, le false partenze e le ripetizioni accidentali. Una trascrizione rielaborata va un passo oltre e sistema grammatica e ordine delle frasi perché si legga bene, ed è proprio per questo che smette di essere utilizzabile come prova di ciò che è stato detto davvero.
- Verbatim integrale: analisi della conversazione, alcuni lavori legali e probatori.
- Verbatim pulito: gran parte della ricerca qualitativa, del giornalismo, della ricerca sugli utenti.
- Rielaborata: articoli pubblicati in forma di domande e risposte.
| Livello | Cosa conserva | Uso tipico |
|---|---|---|
| Verbatim integrale | Ogni parola come pronunciata: intercalari, false partenze, ripetizioni, balbuzie, suoni udibili | Analisi della conversazione, alcuni lavori legali e probatori |
| Verbatim pulito | Le parole e il significato di chi parla, senza intercalari e false partenze | Gran parte della ricerca qualitativa, giornalismo, ricerca sugli utenti |
| Rielaborata | Grammatica e ordine delle frasi sistemati per la lettura | Articoli pubblicati in forma di domande e risposte |
Se la trascrizione andrà in un progetto di ricerca e non in un pezzo pubblicato, decidilo prima della prima intervista, non dopo la quinta: cambiare livello a metà strada significa rifare le trascrizioni precedenti per uniformarle. L’aspetto specifico della ricerca, cioè consenso, anonimizzazione e conservazione, è trattato in trascrivere interviste per la ricerca.
Come si scrive la trascrizione di un’intervista?
Inizia con una legenda: il livello di verbatim, i simboli che usi e come sono etichettati i parlanti, scritta in cima al documento prima della prima riga di parlato. Chiunque codifichi o citi la trascrizione in seguito ha bisogno di quella legenda, e ne avrai bisogno anche tu, settimane dopo, quando avrai dimenticato cosa doveva significare (.).
Il sistema più noto per le trascrizioni dettagliate viene da Gail Jefferson, esposto nel suo Glossary of transcript symbols with an introduction (2004). Come riassunto da Clift, Kendrick, Raymond e Robinson (2024), una parentesi quadra sinistra segna il punto in cui inizia un parlato sovrapposto, un segno di uguale unisce un parlato senza pausa tra i due, un numero tra parentesi come (0.5) è un silenzio misurato in secondi e (.) segna una pausa troppo breve per essere misurata. Le fonti non concordano su quanto breve sia una micropausa, quindi se la tua legenda usa (.) dovrebbe dire cosa intendi con essa.
La maggior parte dei progetti di interviste non ha bisogno di quel livello di dettaglio e si legge meglio senza. Una convenzione con le parentesi copre ciò che capita davvero: [inaudible 00:12:31] per un passaggio che non riesci a decifrare, con un timestamp per ritrovarlo; [crosstalk] dove due persone parlano una sopra l’altra; [laughs] e altri eventi non verbali tra parentesi quadre; e un’etichetta del parlante all’inizio di ogni intervento.
| Simbolo | Significato | Sistema |
|---|---|---|
| [ | Punto in cui inizia un parlato sovrapposto | Jeffersoniano |
| = | Parlato unito senza pausa (latching) | Jeffersoniano |
| (0.5) | Silenzio misurato, in secondi | Jeffersoniano |
| (.) | Pausa troppo breve per essere misurata | Jeffersoniano |
| [inaudible 00:12:31] | Passaggio che non si riesce a decifrare, con timestamp | Con parentesi |
| [crosstalk] | Due persone che parlano insieme | Con parentesi |
| [laughs] | Suono non verbale | Con parentesi |
Oltre alla notazione, le linee guida dell’UK Data Service sulla trascrizione dicono che una trascrizione dovrebbe avere un identificativo univoco, usare un’impaginazione uniforme in tutto il progetto, usare etichette dei parlanti per l’alternanza dei turni e mantenere gli a capo: piccole cose, ma sono ciò che permette di trovare e confrontare le trascrizioni in seguito invece di rileggerle tutte.
Le etichette dei parlanti sono nomi che il software di trascrizione non può conoscere: aspettati Speaker A e Speaker B, che rinomini a mano appena sai chi è chi. Etichettare i parlanti in modo coerente spiega come farlo su un intero progetto senza che i nomi cambino da un file all’altro.
Anonimizza man mano, non dopo: sostituisci nomi e dettagli identificativi con segnaposto coerenti come [Participant 2] o [city] direttamente nella trascrizione, e tieni la chiave che associa i segnaposto ai nomi reali in un file separato. Registrare una persona richiede quasi ovunque il suo consenso, e un comitato etico della ricerca di solito lo vorrà per iscritto; trascrivere la registrazione non cambia questo requisito.
Quanto tempo ci vuole per trascrivere un’intervista?
A mano, prevedi ore, non minuti. La guida alla storia orale delle Texas Tech University Libraries dice che anche i trascrittori esperti lavorano di solito a sei ore di digitazione per ogni ora di audio. Una guida di corso della Cornell University la mette più in basso, da quattro a sei ore per ora di registrazione: la differenza dipende soprattutto da quanto è pulito l’audio e da quanta notazione viene aggiunta lungo la strada.
Una trascrizione automatica cambia dove va il tempo, non lo fa sparire. La bozza torna in pochi minuti; resta da ascoltarla confrontandola con la registrazione, correggere nomi e termini tecnici, sistemare chi ha detto cosa dove le etichette si sono incrociate e aggiungere la notazione che serve al progetto. Per un’intervista di un’ora è comunque un lavoro vero, solo di un altro tipo: quanto richiede davvero la trascrizione lo scompone ulteriormente.
ChatGPT può trascrivere un’intervista?
Se un chatbot possa trasformare un file audio in testo dipende dal prodotto, ma la trascrizione di un’intervista richiede più del testo: timestamp a cui tornare e interventi dei parlanti di cui fidarsi, ed è ciò che un motore di trascrizione è costruito per produrre. Il chatbot trova il suo posto dopo quel passaggio, per rifinire, riassumere o riformattare una trascrizione che hai già.
In ogni caso, il testo automatico va controllato sulla registrazione prima di citarlo, e quel controllo è la parte che nessuno strumento elimina.
Quanto controllo serva a un dato motore varia parecchio. Quanto è accurata la trascrizione con IA spiega cosa aspettarsi e dove tendono a concentrarsi gli errori.
Cosa sbaglia una vera trascrizione automatica
Una trascrizione automatica è una bozza, e il modo più chiaro per vedere cosa significa è farne una e leggerla confrontandola con la registrazione. Il 2 ottobre 2026 abbiamo fatto proprio questo, sui primi 5 minuti di una registrazione pubblica che chiunque può confrontare con questo articolo.
Abbiamo fatto girare il motore alla base dello strumento di interviste di SozAI sui primi 5 minuti (300 secondi) del podcast del NASA Johnson Space Center Houston We Have a Podcast, episodio 180, “Artemis Mission Management”, con il conduttore Gary Jordan e l’ospite Mike Sarafin: un’opera della NASA, quindi non protetta da copyright. Ha restituito 778 parole, ha rilevato l’inglese e ha trovato 2 parlanti. Le prime righe, come le ha rese il motore:
[00:00] Speaker A: Houston, we have a podcast. Welcome to the official podcast of the NASA Johnson Space Center, episode 180, Artemis Mission Management. I'm Gary Jordan, and I'll be your host today. [01:19] Speaker B: T-minus five seconds and counting. Mark. [01:22] Speaker A: Launch commit lights are correct. There she goes. Houston. We have a podcast. Mike Serafin, thanks for coming on Houston, We Have a Podcast today. [01:36] Speaker B: Thank you. It's a pleasure to be here to talk about these exciting Artemis missions we have ahead of us. Yeah, right? [01:43] Speaker A: Returning to the Moon. Not a bad thing to be a part of.
Tre cose in quei soli cinque interventi hanno richiesto una passata umana. Il conto alla rovescia del lancio a 01:19 e “Launch commit lights are correct. There she goes.” a 01:22 sono audio d’archivio di un lancio inserito nel podcast, non il conduttore né l’ospite che parlano: il motore li ha etichettati comunque Speaker B e Speaker A. “Yeah, right?” alla fine dell’intervento delle 01:36 è in realtà il conduttore che riprende la conversazione; appartiene all’inizio dell’intervento successivo, non alla fine di quello dell’ospite. E il cognome dell’ospite esce come Serafin qui, mentre i crediti dell’episodio scrivono Sarafin.
Un intervento successivo mostra a cosa serve il verbatim pulito. L’output del motore a 02:51 dice: “Yes, so you’re, you’re right in that I lived in the operations realm for 22 of my 27 years in, in my NASA career.” Una passata di verbatim pulito lo trasforma in: “You’re right in that I lived in the operations realm for 22 of my 27 years in my NASA career.” Il verbatim integrale conserverebbe le ripetizioni esattamente come sono uscite; il motore, semmai, tende a tenerle: ha mantenuto la maggior parte delle ripetizioni e delle false partenze nel file (“you’re, you’re right”, “in, in my NASA career”, “That’s, that’s quite a number of”), il che avvicina il suo output al verbatim più che al verbatim pulito. Se un progetto richiede il verbatim pulito, metti in conto una passata di revisione qualunque sia il motore che produce la bozza.

