Vai al contenuto

Come trascrivere un’intervista: livelli di verbatim, etichette dei parlanti e notazione

•10 min read• 13 views •Ultimo aggiornamento: Ott 2, 2026
Two chairs facing each other at a small table by a window, a phone recording between them next to a notebook

In sintesi

Decidi il livello di verbatim prima di scrivere una sola parola: il verbatim integrale conserva ogni “ehm” e ogni falsa partenza, il verbatim pulito conserva il significato senza gli intercalari, e una trascrizione rielaborata sistema la grammatica per la lettura. Scegli una notazione per pause, sovrapposizioni e tratti inudibili, scrivila come legenda all’inizio del documento ed etichetta i parlanti in modo coerente. A mano, la guida alla storia orale delle Texas Tech University Libraries indica un rapporto di sei ore di digitazione per ogni ora di registrazione; una guida di corso della Cornell University dice da quattro a sei. Una trascrizione automatica ti dà una prima bozza in pochi minuti; il lavoro umano passa dal digitare al controllarla sulla registrazione.

Hai la registrazione. Ora qualcuno vuole una trascrizione da citare, codificare o consegnare, e la prima domanda non è quale app usare: è quanto del parlato intendi conservare.

Gli intercalari e le false partenze contano nell’analisi della conversazione e in alcuni contesti legali; ovunque altrove sono rumore. Questo articolo passa in rassegna i tre livelli di verbatim, la notazione che segna pause e sovrapposizioni, quanto dura il lavoro a mano e cosa una trascrizione automatica coglie e sbaglia su una registrazione reale.

Qual è il modo più semplice per trascrivere un’intervista?

Passa prima la registrazione in un motore di riconoscimento vocale, poi correggi i nomi, controlla a campione sull’audio e aggiungi la notazione che serve al tuo progetto: è più veloce che scrivere da una pagina bianca, ed è ciò che la maggior parte delle persone intende davvero per “più semplice”. Digitare da zero un’ora intera di parlato, parola per parola, è la strada lenta, non quella facile.

Per un breve estratto, il nostro strumento nel browser per trascrivere un’intervista online fa questa prima passata senza account: carichi una registrazione e trascrive i primi 5 minuti, etichetta ogni intervento Speaker A, Speaker B e così via con un timestamp, e rileva automaticamente la lingua tra 99 lingue. I file fino a 25 MB passano così come sono; le registrazioni più lunghe vengono ritagliate a 5 minuti nel browser prima che venga inviato qualcosa. L’audio e la trascrizione vengono eliminati presso il fornitore appena torna il risultato, e hai tre anteprime per dispositivo al giorno.

Basta per capire se uno strumento vale la pena su una data registrazione. Per un’intervista intera in un solo passaggio, con gli interventi etichettati dall’inizio alla fine e ogni trascrizione conservata poi in una libreria ricercabile, lo fa l’app SozAI: i primi 30 minuti sono gratuiti. Vedi come funziona la trascrizione delle interviste per il quadro completo, oppure scarica l’app.

Che differenza c’è tra verbatim e verbatim pulito?

Il verbatim integrale conserva ogni parola come pronunciata: gli “ehm”, le false partenze, le parole ripetute, le balbuzie e le risate udibili. Il verbatim pulito conserva le parole e il significato di chi parla ma elimina gli intercalari, le false partenze e le ripetizioni accidentali. Una trascrizione rielaborata va un passo oltre e sistema grammatica e ordine delle frasi perché si legga bene, ed è proprio per questo che smette di essere utilizzabile come prova di ciò che è stato detto davvero.

  • Verbatim integrale: analisi della conversazione, alcuni lavori legali e probatori.
  • Verbatim pulito: gran parte della ricerca qualitativa, del giornalismo, della ricerca sugli utenti.
  • Rielaborata: articoli pubblicati in forma di domande e risposte.
Tre livelli di verbatim e cosa conserva ciascuno
LivelloCosa conservaUso tipico
Verbatim integraleOgni parola come pronunciata: intercalari, false partenze, ripetizioni, balbuzie, suoni udibiliAnalisi della conversazione, alcuni lavori legali e probatori
Verbatim pulitoLe parole e il significato di chi parla, senza intercalari e false partenzeGran parte della ricerca qualitativa, giornalismo, ricerca sugli utenti
RielaborataGrammatica e ordine delle frasi sistemati per la letturaArticoli pubblicati in forma di domande e risposte

Se la trascrizione andrà in un progetto di ricerca e non in un pezzo pubblicato, decidilo prima della prima intervista, non dopo la quinta: cambiare livello a metà strada significa rifare le trascrizioni precedenti per uniformarle. L’aspetto specifico della ricerca, cioè consenso, anonimizzazione e conservazione, è trattato in trascrivere interviste per la ricerca.

Come si scrive la trascrizione di un’intervista?

Inizia con una legenda: il livello di verbatim, i simboli che usi e come sono etichettati i parlanti, scritta in cima al documento prima della prima riga di parlato. Chiunque codifichi o citi la trascrizione in seguito ha bisogno di quella legenda, e ne avrai bisogno anche tu, settimane dopo, quando avrai dimenticato cosa doveva significare (.).

Il sistema più noto per le trascrizioni dettagliate viene da Gail Jefferson, esposto nel suo Glossary of transcript symbols with an introduction (2004). Come riassunto da Clift, Kendrick, Raymond e Robinson (2024), una parentesi quadra sinistra segna il punto in cui inizia un parlato sovrapposto, un segno di uguale unisce un parlato senza pausa tra i due, un numero tra parentesi come (0.5) è un silenzio misurato in secondi e (.) segna una pausa troppo breve per essere misurata. Le fonti non concordano su quanto breve sia una micropausa, quindi se la tua legenda usa (.) dovrebbe dire cosa intendi con essa.

La maggior parte dei progetti di interviste non ha bisogno di quel livello di dettaglio e si legge meglio senza. Una convenzione con le parentesi copre ciò che capita davvero: [inaudible 00:12:31] per un passaggio che non riesci a decifrare, con un timestamp per ritrovarlo; [crosstalk] dove due persone parlano una sopra l’altra; [laughs] e altri eventi non verbali tra parentesi quadre; e un’etichetta del parlante all’inizio di ogni intervento.

Notazione della trascrizione: simboli jeffersoniani e una convenzione più leggera con le parentesi
SimboloSignificatoSistema
[Punto in cui inizia un parlato sovrappostoJeffersoniano
=Parlato unito senza pausa (latching)Jeffersoniano
(0.5)Silenzio misurato, in secondiJeffersoniano
(.)Pausa troppo breve per essere misurataJeffersoniano
[inaudible 00:12:31]Passaggio che non si riesce a decifrare, con timestampCon parentesi
[crosstalk]Due persone che parlano insiemeCon parentesi
[laughs]Suono non verbaleCon parentesi

Oltre alla notazione, le linee guida dell’UK Data Service sulla trascrizione dicono che una trascrizione dovrebbe avere un identificativo univoco, usare un’impaginazione uniforme in tutto il progetto, usare etichette dei parlanti per l’alternanza dei turni e mantenere gli a capo: piccole cose, ma sono ciò che permette di trovare e confrontare le trascrizioni in seguito invece di rileggerle tutte.

Le etichette dei parlanti sono nomi che il software di trascrizione non può conoscere: aspettati Speaker A e Speaker B, che rinomini a mano appena sai chi è chi. Etichettare i parlanti in modo coerente spiega come farlo su un intero progetto senza che i nomi cambino da un file all’altro.

Anonimizza man mano, non dopo: sostituisci nomi e dettagli identificativi con segnaposto coerenti come [Participant 2] o [city] direttamente nella trascrizione, e tieni la chiave che associa i segnaposto ai nomi reali in un file separato. Registrare una persona richiede quasi ovunque il suo consenso, e un comitato etico della ricerca di solito lo vorrà per iscritto; trascrivere la registrazione non cambia questo requisito.

Quanto tempo ci vuole per trascrivere un’intervista?

A mano, prevedi ore, non minuti. La guida alla storia orale delle Texas Tech University Libraries dice che anche i trascrittori esperti lavorano di solito a sei ore di digitazione per ogni ora di audio. Una guida di corso della Cornell University la mette più in basso, da quattro a sei ore per ora di registrazione: la differenza dipende soprattutto da quanto è pulito l’audio e da quanta notazione viene aggiunta lungo la strada.

Una trascrizione automatica cambia dove va il tempo, non lo fa sparire. La bozza torna in pochi minuti; resta da ascoltarla confrontandola con la registrazione, correggere nomi e termini tecnici, sistemare chi ha detto cosa dove le etichette si sono incrociate e aggiungere la notazione che serve al progetto. Per un’intervista di un’ora è comunque un lavoro vero, solo di un altro tipo: quanto richiede davvero la trascrizione lo scompone ulteriormente.

ChatGPT può trascrivere un’intervista?

Se un chatbot possa trasformare un file audio in testo dipende dal prodotto, ma la trascrizione di un’intervista richiede più del testo: timestamp a cui tornare e interventi dei parlanti di cui fidarsi, ed è ciò che un motore di trascrizione è costruito per produrre. Il chatbot trova il suo posto dopo quel passaggio, per rifinire, riassumere o riformattare una trascrizione che hai già.

In ogni caso, il testo automatico va controllato sulla registrazione prima di citarlo, e quel controllo è la parte che nessuno strumento elimina.

Quanto controllo serva a un dato motore varia parecchio. Quanto è accurata la trascrizione con IA spiega cosa aspettarsi e dove tendono a concentrarsi gli errori.

Cosa sbaglia una vera trascrizione automatica

Una trascrizione automatica è una bozza, e il modo più chiaro per vedere cosa significa è farne una e leggerla confrontandola con la registrazione. Il 2 ottobre 2026 abbiamo fatto proprio questo, sui primi 5 minuti di una registrazione pubblica che chiunque può confrontare con questo articolo.

Abbiamo fatto girare il motore alla base dello strumento di interviste di SozAI sui primi 5 minuti (300 secondi) del podcast del NASA Johnson Space Center Houston We Have a Podcast, episodio 180, “Artemis Mission Management”, con il conduttore Gary Jordan e l’ospite Mike Sarafin: un’opera della NASA, quindi non protetta da copyright. Ha restituito 778 parole, ha rilevato l’inglese e ha trovato 2 parlanti. Le prime righe, come le ha rese il motore:

[00:00] Speaker A: Houston, we have a podcast. Welcome to the official podcast of the NASA Johnson Space Center, episode 180, Artemis Mission Management. I'm Gary Jordan, and I'll be your host today.
[01:19] Speaker B: T-minus five seconds and counting. Mark.
[01:22] Speaker A: Launch commit lights are correct. There she goes. Houston. We have a podcast. Mike Serafin, thanks for coming on Houston, We Have a Podcast today.
[01:36] Speaker B: Thank you. It's a pleasure to be here to talk about these exciting Artemis missions we have ahead of us. Yeah, right?
[01:43] Speaker A: Returning to the Moon. Not a bad thing to be a part of.

Tre cose in quei soli cinque interventi hanno richiesto una passata umana. Il conto alla rovescia del lancio a 01:19 e “Launch commit lights are correct. There she goes.” a 01:22 sono audio d’archivio di un lancio inserito nel podcast, non il conduttore né l’ospite che parlano: il motore li ha etichettati comunque Speaker B e Speaker A. “Yeah, right?” alla fine dell’intervento delle 01:36 è in realtà il conduttore che riprende la conversazione; appartiene all’inizio dell’intervento successivo, non alla fine di quello dell’ospite. E il cognome dell’ospite esce come Serafin qui, mentre i crediti dell’episodio scrivono Sarafin.

Un intervento successivo mostra a cosa serve il verbatim pulito. L’output del motore a 02:51 dice: “Yes, so you’re, you’re right in that I lived in the operations realm for 22 of my 27 years in, in my NASA career.” Una passata di verbatim pulito lo trasforma in: “You’re right in that I lived in the operations realm for 22 of my 27 years in my NASA career.” Il verbatim integrale conserverebbe le ripetizioni esattamente come sono uscite; il motore, semmai, tende a tenerle: ha mantenuto la maggior parte delle ripetizioni e delle false partenze nel file (“you’re, you’re right”, “in, in my NASA career”, “That’s, that’s quite a number of”), il che avvicina il suo output al verbatim più che al verbatim pulito. Se un progetto richiede il verbatim pulito, metti in conto una passata di revisione qualunque sia il motore che produce la bozza.

Risposte

Frequently Asked Questions

Qual è il modo più semplice per trascrivere un'intervista?

Passa la registrazione in un motore di riconoscimento vocale per una prima bozza, poi controllala sull'audio e correggi i nomi dei parlanti e le parole poco chiare: digitarla da zero a mano è più lento, non più facile. Uno strumento nel browser come il trascrittore di interviste di SozAI può produrre una bozza etichettata e con timestamp dei primi 5 minuti senza account, che basta per giudicare se vale la pena far girare l'intero file.

Che aspetto dovrebbe avere una trascrizione di intervista finita?

Si apre con una breve legenda che indica il livello di verbatim, la notazione usata e come sono etichettati i parlanti, seguita da interventi etichettati come Speaker A, con timestamp. Le linee guida dell'UK Data Service sulla trascrizione aggiungono che dovrebbe avere un identificativo univoco, un'impaginazione uniforme, etichette dei parlanti e a capo, così da poter essere trovata e confrontata in seguito invece che riletta per intero.

ChatGPT può trascrivere un'intervista?

Dipende dal prodotto, ed è lo strumento sbagliato per il primo passaggio. La trascrizione di un'intervista richiede timestamp e interventi dei parlanti affidabili, ed è ciò che produce un motore di trascrizione. Un chatbot è utile dopo, per rifinire, riassumere o riformattare una trascrizione che hai già, e qualsiasi testo automatico va comunque controllato sulla registrazione.

Devo usare il verbatim o il verbatim pulito?

Usa il verbatim integrale per l'analisi della conversazione o per lavori legali e probatori, dove contano ogni “ehm”, falsa partenza e ripetizione; usa il verbatim pulito per gran parte della ricerca qualitativa, del giornalismo e della ricerca sugli utenti, dove il significato conta più delle disfluenze. Decidi prima della prima intervista, perché cambiare a metà strada significa rifare le trascrizioni precedenti.

Come si segnalano le parti inudibili in una trascrizione?

Scrivi [inaudible] con un timestamp, come [inaudible 00:12:31], così tu o chiunque altro potete ritrovare quel punto nella registrazione in seguito. Per il parlato sovrapposto usa [crosstalk], e per i suoni non verbali come una risata usa [laughs]: sempre tra parentesi quadre, spiegato una sola volta nella legenda in cima alla trascrizione.

Quanto tempo ci vuole per trascrivere un'intervista di un'ora?

A mano, la guida alla storia orale delle Texas Tech University Libraries indica circa sei ore di digitazione per ogni ora di audio; una guida di corso della Cornell University stima da quattro a sei ore. Una trascrizione automatica restituisce una bozza in pochi minuti, spostando il tempo restante sul controllarla con la registrazione invece che sul digitarla.

Merey Tleugazin

Fondatore di SozAI. Crea strumenti che trasformano il parlato in testo per professionisti in tutto il mondo.

SozAI
SozAI — Download gratuitoTrascrivi audio e video all'istante
Scarica l'app