Pontos principais
Decida o nível de literalidade antes de digitar uma palavra: a transcrição literal completa mantém cada “hum” e cada começo falso, a literal limpa mantém o sentido sem as muletas de fala e a transcrição editada ajeita a gramática para facilitar a leitura. Escolha uma notação para pausas, sobreposições e trechos inaudíveis, escreva-a como uma chave no topo do documento e rotule os falantes sempre do mesmo jeito. À mão, o guia de história oral das bibliotecas da Texas Tech University coloca a proporção em seis horas de digitação por hora de gravação; um guia de curso da Cornell University diz de quatro a seis. Uma transcrição automática dá um rascunho em minutos; o trabalho humano passa de digitar para conferir com a gravação.
Você tem a gravação. Agora alguém quer uma transcrição que possa citar, codificar ou entregar, e a primeira pergunta não é qual aplicativo usar, e sim quanto da fala você vai manter.
Muletas de fala e começos falsos importam na análise da conversa e em alguns contextos jurídicos; em todo o resto são ruído. Este artigo passa pelos três níveis de literalidade, pela notação que marca pausas e sobreposições, por quanto tempo o trabalho leva à mão e pelo que uma transcrição automática acerta e erra numa gravação real.
Qual é a forma mais fácil de transcrever uma entrevista?
Passe primeiro a gravação por um motor de fala para texto, depois corrija os nomes, confira por amostragem com o áudio e acrescente a notação de que o seu projeto precisa: é mais rápido do que digitar a partir de uma página em branco, e é o que a maioria das pessoas entende por “mais fácil”. Digitar uma hora inteira de fala do zero, palavra por palavra, é o caminho lento, não o fácil.
Para um trecho curto, a nossa ferramenta do navegador para transcrever uma entrevista online faz essa primeira passada sem conta: você envia uma gravação e ela transcreve os primeiros 5 minutos, rotula cada turno como Speaker A, Speaker B e assim por diante com um carimbo de tempo, e detecta o idioma automaticamente entre 99 idiomas. Arquivos de até 25 MB seguem como estão; gravações mais longas são cortadas para 5 minutos no navegador antes de qualquer envio. O áudio e a transcrição são apagados no provedor assim que o resultado volta, e você tem três prévias por dispositivo por dia.
Isso basta para ver se vale a pena usar uma ferramenta numa gravação específica. Para uma entrevista inteira de uma só vez, com os turnos rotulados do começo ao fim e cada transcrição guardada depois numa biblioteca em que dá para pesquisar, quem faz isso é o app da SozAI: os primeiros 30 minutos são grátis. Veja como funciona a transcrição de entrevistas para o quadro completo, ou baixe o app.
Qual é a diferença entre literal e literal limpa?
A transcrição literal completa mantém cada palavra como foi dita: os “hum”, os começos falsos, as palavras repetidas, as gagueiras e as risadas audíveis. A literal limpa mantém as palavras e o sentido do falante, mas tira as muletas, os começos falsos e as repetições acidentais. Uma transcrição editada vai um passo além e ajeita a gramática e a ordem das frases para ler bem, e é exatamente por isso que deixa de servir como prova do que foi realmente dito.
- Literal completa: análise da conversa, alguns trabalhos jurídicos e probatórios.
- Literal limpa: a maior parte da pesquisa qualitativa, o jornalismo, a pesquisa com usuários.
- Editada: artigos publicados em formato de pergunta e resposta.
| Nível | O que mantém | Uso típico |
|---|---|---|
| Literal completa | Cada palavra como foi dita: muletas, começos falsos, repetições, gagueiras, sons audíveis | Análise da conversa, alguns trabalhos jurídicos e probatórios |
| Literal limpa | As palavras e o sentido do falante, sem muletas nem começos falsos | A maior parte da pesquisa qualitativa, o jornalismo, a pesquisa com usuários |
| Editada | Gramática e ordem das frases ajeitadas para a leitura | Artigos publicados em formato de pergunta e resposta |
Se a transcrição vai para um projeto de pesquisa e não para uma matéria publicada, decida isso antes da primeira entrevista, não depois da quinta: mudar de nível no meio do caminho obriga a refazer as transcrições anteriores para igualá-las. O lado específico da pesquisa, o consentimento, a anonimização e o armazenamento, é tratado em transcrever entrevistas para pesquisa.
Como se escreve a transcrição de uma entrevista?
Comece com uma chave: o nível de literalidade, os símbolos que você usa e como os falantes são rotulados, escrita no topo do documento antes da primeira linha de fala. Quem for codificar ou citar a transcrição depois precisa dessa chave, e você também, semanas mais tarde, quando tiver esquecido o que (.) queria dizer.
O sistema mais conhecido para transcrições detalhadas é o de Gail Jefferson, exposto no seu Glossary of transcript symbols with an introduction (2004). Segundo o resumo de Clift, Kendrick, Raymond e Robinson (2024), um colchete esquerdo marca o ponto em que a fala sobreposta começa, um sinal de igual une falas sem pausa entre uma e outra, um número entre parênteses como (0.5) é um silêncio cronometrado em segundos, e (.) marca uma pausa curta demais para cronometrar. As fontes divergem sobre quão curta exatamente é uma micropausa, então se a sua chave usa (.) ela deve dizer o que você entende por isso.
A maioria dos projetos de entrevistas não precisa desse nível de detalhe e fica mais fácil de ler sem ele. Uma convenção com colchetes cobre o que realmente aparece: [inaudible 00:12:31] para um trecho que não dá para entender, com um carimbo de tempo para encontrá-lo de novo; [crosstalk] quando duas pessoas falam ao mesmo tempo; [laughs] e outros eventos que não são fala entre colchetes; e um rótulo de falante no início de cada turno.
| Símbolo | Significado | Sistema |
|---|---|---|
| [ | Ponto em que a fala sobreposta começa | Jeffersoniano |
| = | Fala unida sem pausa (encadeada) | Jeffersoniano |
| (0.5) | Silêncio cronometrado, em segundos | Jeffersoniano |
| (.) | Pausa curta demais para cronometrar | Jeffersoniano |
| [inaudible 00:12:31] | Trecho que não dá para entender, com um carimbo de tempo | Com colchetes |
| [crosstalk] | Duas pessoas falando ao mesmo tempo | Com colchetes |
| [laughs] | Som que não é fala | Com colchetes |
Além da notação, o guia do UK Data Service sobre transcrição diz que uma transcrição deve levar um identificador único, usar um layout uniforme em todo o projeto, usar rótulos de falante para a troca de turnos e manter as quebras de linha: detalhes pequenos, mas são eles que permitem encontrar e comparar transcrições depois em vez de reler todas.
Os rótulos de falante são nomes que o software de transcrição não tem como saber: espere Speaker A e Speaker B, que você renomeia à mão quando souber quem é quem. Rotular os falantes de forma consistente explica como fazer isso num projeto inteiro sem que os nomes mudem de um arquivo para outro.
Anonimize ao longo do caminho, não depois: troque nomes e dados identificadores por marcadores consistentes como [Participant 2] ou [city] direto na transcrição, e guarde num arquivo separado a chave que liga os marcadores aos nomes reais. Gravar uma pessoa exige o consentimento dela em quase todo lugar, e um comitê de ética em pesquisa costuma querer esse consentimento por escrito; transcrever a gravação não muda essa exigência.
Quanto tempo leva para transcrever uma entrevista?
À mão, conte com horas, não com minutos. O guia de história oral das bibliotecas da Texas Tech University diz que até transcritores experientes costumam trabalhar a seis horas de digitação para cada hora de áudio. Um guia de curso da Cornell University coloca mais baixo, em quatro a seis horas por hora de gravação; a diferença vem principalmente de quão limpo é o áudio e de quanta notação se acrescenta pelo caminho.
Uma transcrição automática muda para onde o tempo vai em vez de fazê-lo desaparecer. O rascunho volta em minutos; o que sobra é ouvi-lo comparando com a gravação, corrigir nomes e termos técnicos, acertar quem disse o quê onde os rótulos se cruzaram e acrescentar a notação de que o projeto precisa. Para uma entrevista de uma hora ainda é trabalho de verdade, só que de outro tipo; quanto tempo a transcrição realmente leva detalha isso melhor.
O ChatGPT consegue transcrever uma entrevista?
Se um chatbot consegue transformar um arquivo de áudio em texto depende do produto, mas a transcrição de uma entrevista precisa de mais do que texto: carimbos de tempo aos quais voltar e turnos de falante em que confiar, que é o que um motor de transcrição foi feito para produzir. Onde um chatbot ganha o seu lugar é depois dessa etapa: organizar, resumir ou reformatar uma transcrição que você já tem.
De qualquer forma, o texto automático precisa ser conferido com a gravação antes de ser citado, e essa conferência é a parte que nenhuma ferramenta elimina.
Quanta conferência um motor específico exige varia bastante. Qual a precisão da transcrição por IA explica o que esperar e onde os erros tendem a se concentrar.
O que uma transcrição automática real erra
Uma transcrição automática é um rascunho, e a forma mais clara de ver o que isso significa é gerar uma e lê-la contra a gravação. Em 2 de outubro de 2026 fizemos exatamente isso, com os primeiros 5 minutos de uma gravação pública que qualquer pessoa pode conferir com este artigo.
Passamos o motor por trás da ferramenta de entrevistas da SozAI pelos primeiros 5 minutos (300 segundos) do podcast Houston We Have a Podcast, do Johnson Space Center da NASA, episódio 180, “Artemis Mission Management”, com o apresentador Gary Jordan e o convidado Mike Sarafin, uma obra da NASA e portanto não protegida por direitos autorais. Ele devolveu 778 palavras, detectou inglês e encontrou 2 falantes. As primeiras linhas, como o motor as devolveu:
[00:00] Speaker A: Houston, we have a podcast. Welcome to the official podcast of the NASA Johnson Space Center, episode 180, Artemis Mission Management. I'm Gary Jordan, and I'll be your host today. [01:19] Speaker B: T-minus five seconds and counting. Mark. [01:22] Speaker A: Launch commit lights are correct. There she goes. Houston. We have a podcast. Mike Serafin, thanks for coming on Houston, We Have a Podcast today. [01:36] Speaker B: Thank you. It's a pleasure to be here to talk about these exciting Artemis missions we have ahead of us. Yeah, right? [01:43] Speaker A: Returning to the Moon. Not a bad thing to be a part of.
Três coisas só nesses cinco turnos precisaram de uma passada humana. A contagem regressiva do lançamento em 01:19 e “Launch commit lights are correct. There she goes.” em 01:22 são áudio de arquivo de lançamentos inserido no podcast, não o apresentador nem o convidado falando; o motor os rotulou mesmo assim como Speaker B e Speaker A. “Yeah, right?” no fim do turno de 01:36 é na verdade o apresentador retomando a conversa; pertence ao começo do turno seguinte, não ao fim do turno do convidado. E o sobrenome do convidado sai como Serafin aqui, embora os próprios créditos do episódio o escrevam Sarafin.
Um turno posterior mostra para que serve a literal limpa. A saída do motor em 02:51 diz: “Yes, so you’re, you’re right in that I lived in the operations realm for 22 of my 27 years in, in my NASA career.” Uma passada de literal limpa a transforma em: “You’re right in that I lived in the operations realm for 22 of my 27 years in my NASA career.” A literal completa manteria as repetições exatamente como saíram; o motor, se alguma coisa, tende a mantê-las: segurou a maioria das repetições e dos começos falsos ao longo do arquivo (“you’re, you’re right”, “in, in my NASA career”, “That’s, that’s quite a number of”), o que aproxima a saída mais da literal do que da literal limpa. Se um projeto precisa de literal limpa, conte com uma passada de edição não importa qual motor produza o rascunho.

