Saltar para o conteúdo

Transcrição de entrevista: níveis de literalidade, rótulos de falante e notação

•11 min read• 11 views •Última atualização: out 2, 2026
Two chairs facing each other at a small table by a window, a phone recording between them next to a notebook

Pontos principais

Decida o nível de literalidade antes de digitar uma palavra: a transcrição literal completa mantém cada “hum” e cada começo falso, a literal limpa mantém o sentido sem as muletas de fala e a transcrição editada ajeita a gramática para facilitar a leitura. Escolha uma notação para pausas, sobreposições e trechos inaudíveis, escreva-a como uma chave no topo do documento e rotule os falantes sempre do mesmo jeito. À mão, o guia de história oral das bibliotecas da Texas Tech University coloca a proporção em seis horas de digitação por hora de gravação; um guia de curso da Cornell University diz de quatro a seis. Uma transcrição automática dá um rascunho em minutos; o trabalho humano passa de digitar para conferir com a gravação.

Você tem a gravação. Agora alguém quer uma transcrição que possa citar, codificar ou entregar, e a primeira pergunta não é qual aplicativo usar, e sim quanto da fala você vai manter.

Muletas de fala e começos falsos importam na análise da conversa e em alguns contextos jurídicos; em todo o resto são ruído. Este artigo passa pelos três níveis de literalidade, pela notação que marca pausas e sobreposições, por quanto tempo o trabalho leva à mão e pelo que uma transcrição automática acerta e erra numa gravação real.

Qual é a forma mais fácil de transcrever uma entrevista?

Passe primeiro a gravação por um motor de fala para texto, depois corrija os nomes, confira por amostragem com o áudio e acrescente a notação de que o seu projeto precisa: é mais rápido do que digitar a partir de uma página em branco, e é o que a maioria das pessoas entende por “mais fácil”. Digitar uma hora inteira de fala do zero, palavra por palavra, é o caminho lento, não o fácil.

Para um trecho curto, a nossa ferramenta do navegador para transcrever uma entrevista online faz essa primeira passada sem conta: você envia uma gravação e ela transcreve os primeiros 5 minutos, rotula cada turno como Speaker A, Speaker B e assim por diante com um carimbo de tempo, e detecta o idioma automaticamente entre 99 idiomas. Arquivos de até 25 MB seguem como estão; gravações mais longas são cortadas para 5 minutos no navegador antes de qualquer envio. O áudio e a transcrição são apagados no provedor assim que o resultado volta, e você tem três prévias por dispositivo por dia.

Isso basta para ver se vale a pena usar uma ferramenta numa gravação específica. Para uma entrevista inteira de uma só vez, com os turnos rotulados do começo ao fim e cada transcrição guardada depois numa biblioteca em que dá para pesquisar, quem faz isso é o app da SozAI: os primeiros 30 minutos são grátis. Veja como funciona a transcrição de entrevistas para o quadro completo, ou baixe o app.

Qual é a diferença entre literal e literal limpa?

A transcrição literal completa mantém cada palavra como foi dita: os “hum”, os começos falsos, as palavras repetidas, as gagueiras e as risadas audíveis. A literal limpa mantém as palavras e o sentido do falante, mas tira as muletas, os começos falsos e as repetições acidentais. Uma transcrição editada vai um passo além e ajeita a gramática e a ordem das frases para ler bem, e é exatamente por isso que deixa de servir como prova do que foi realmente dito.

  • Literal completa: análise da conversa, alguns trabalhos jurídicos e probatórios.
  • Literal limpa: a maior parte da pesquisa qualitativa, o jornalismo, a pesquisa com usuários.
  • Editada: artigos publicados em formato de pergunta e resposta.
Três níveis de literalidade e o que cada um mantém
NívelO que mantémUso típico
Literal completaCada palavra como foi dita: muletas, começos falsos, repetições, gagueiras, sons audíveisAnálise da conversa, alguns trabalhos jurídicos e probatórios
Literal limpaAs palavras e o sentido do falante, sem muletas nem começos falsosA maior parte da pesquisa qualitativa, o jornalismo, a pesquisa com usuários
EditadaGramática e ordem das frases ajeitadas para a leituraArtigos publicados em formato de pergunta e resposta

Se a transcrição vai para um projeto de pesquisa e não para uma matéria publicada, decida isso antes da primeira entrevista, não depois da quinta: mudar de nível no meio do caminho obriga a refazer as transcrições anteriores para igualá-las. O lado específico da pesquisa, o consentimento, a anonimização e o armazenamento, é tratado em transcrever entrevistas para pesquisa.

Como se escreve a transcrição de uma entrevista?

Comece com uma chave: o nível de literalidade, os símbolos que você usa e como os falantes são rotulados, escrita no topo do documento antes da primeira linha de fala. Quem for codificar ou citar a transcrição depois precisa dessa chave, e você também, semanas mais tarde, quando tiver esquecido o que (.) queria dizer.

O sistema mais conhecido para transcrições detalhadas é o de Gail Jefferson, exposto no seu Glossary of transcript symbols with an introduction (2004). Segundo o resumo de Clift, Kendrick, Raymond e Robinson (2024), um colchete esquerdo marca o ponto em que a fala sobreposta começa, um sinal de igual une falas sem pausa entre uma e outra, um número entre parênteses como (0.5) é um silêncio cronometrado em segundos, e (.) marca uma pausa curta demais para cronometrar. As fontes divergem sobre quão curta exatamente é uma micropausa, então se a sua chave usa (.) ela deve dizer o que você entende por isso.

A maioria dos projetos de entrevistas não precisa desse nível de detalhe e fica mais fácil de ler sem ele. Uma convenção com colchetes cobre o que realmente aparece: [inaudible 00:12:31] para um trecho que não dá para entender, com um carimbo de tempo para encontrá-lo de novo; [crosstalk] quando duas pessoas falam ao mesmo tempo; [laughs] e outros eventos que não são fala entre colchetes; e um rótulo de falante no início de cada turno.

Notação de transcrição: símbolos jeffersonianos e uma convenção mais leve com colchetes
SímboloSignificadoSistema
[Ponto em que a fala sobreposta começaJeffersoniano
=Fala unida sem pausa (encadeada)Jeffersoniano
(0.5)Silêncio cronometrado, em segundosJeffersoniano
(.)Pausa curta demais para cronometrarJeffersoniano
[inaudible 00:12:31]Trecho que não dá para entender, com um carimbo de tempoCom colchetes
[crosstalk]Duas pessoas falando ao mesmo tempoCom colchetes
[laughs]Som que não é falaCom colchetes

Além da notação, o guia do UK Data Service sobre transcrição diz que uma transcrição deve levar um identificador único, usar um layout uniforme em todo o projeto, usar rótulos de falante para a troca de turnos e manter as quebras de linha: detalhes pequenos, mas são eles que permitem encontrar e comparar transcrições depois em vez de reler todas.

Os rótulos de falante são nomes que o software de transcrição não tem como saber: espere Speaker A e Speaker B, que você renomeia à mão quando souber quem é quem. Rotular os falantes de forma consistente explica como fazer isso num projeto inteiro sem que os nomes mudem de um arquivo para outro.

Anonimize ao longo do caminho, não depois: troque nomes e dados identificadores por marcadores consistentes como [Participant 2] ou [city] direto na transcrição, e guarde num arquivo separado a chave que liga os marcadores aos nomes reais. Gravar uma pessoa exige o consentimento dela em quase todo lugar, e um comitê de ética em pesquisa costuma querer esse consentimento por escrito; transcrever a gravação não muda essa exigência.

Quanto tempo leva para transcrever uma entrevista?

À mão, conte com horas, não com minutos. O guia de história oral das bibliotecas da Texas Tech University diz que até transcritores experientes costumam trabalhar a seis horas de digitação para cada hora de áudio. Um guia de curso da Cornell University coloca mais baixo, em quatro a seis horas por hora de gravação; a diferença vem principalmente de quão limpo é o áudio e de quanta notação se acrescenta pelo caminho.

Uma transcrição automática muda para onde o tempo vai em vez de fazê-lo desaparecer. O rascunho volta em minutos; o que sobra é ouvi-lo comparando com a gravação, corrigir nomes e termos técnicos, acertar quem disse o quê onde os rótulos se cruzaram e acrescentar a notação de que o projeto precisa. Para uma entrevista de uma hora ainda é trabalho de verdade, só que de outro tipo; quanto tempo a transcrição realmente leva detalha isso melhor.

O ChatGPT consegue transcrever uma entrevista?

Se um chatbot consegue transformar um arquivo de áudio em texto depende do produto, mas a transcrição de uma entrevista precisa de mais do que texto: carimbos de tempo aos quais voltar e turnos de falante em que confiar, que é o que um motor de transcrição foi feito para produzir. Onde um chatbot ganha o seu lugar é depois dessa etapa: organizar, resumir ou reformatar uma transcrição que você já tem.

De qualquer forma, o texto automático precisa ser conferido com a gravação antes de ser citado, e essa conferência é a parte que nenhuma ferramenta elimina.

Quanta conferência um motor específico exige varia bastante. Qual a precisão da transcrição por IA explica o que esperar e onde os erros tendem a se concentrar.

O que uma transcrição automática real erra

Uma transcrição automática é um rascunho, e a forma mais clara de ver o que isso significa é gerar uma e lê-la contra a gravação. Em 2 de outubro de 2026 fizemos exatamente isso, com os primeiros 5 minutos de uma gravação pública que qualquer pessoa pode conferir com este artigo.

Passamos o motor por trás da ferramenta de entrevistas da SozAI pelos primeiros 5 minutos (300 segundos) do podcast Houston We Have a Podcast, do Johnson Space Center da NASA, episódio 180, “Artemis Mission Management”, com o apresentador Gary Jordan e o convidado Mike Sarafin, uma obra da NASA e portanto não protegida por direitos autorais. Ele devolveu 778 palavras, detectou inglês e encontrou 2 falantes. As primeiras linhas, como o motor as devolveu:

[00:00] Speaker A: Houston, we have a podcast. Welcome to the official podcast of the NASA Johnson Space Center, episode 180, Artemis Mission Management. I'm Gary Jordan, and I'll be your host today.
[01:19] Speaker B: T-minus five seconds and counting. Mark.
[01:22] Speaker A: Launch commit lights are correct. There she goes. Houston. We have a podcast. Mike Serafin, thanks for coming on Houston, We Have a Podcast today.
[01:36] Speaker B: Thank you. It's a pleasure to be here to talk about these exciting Artemis missions we have ahead of us. Yeah, right?
[01:43] Speaker A: Returning to the Moon. Not a bad thing to be a part of.

Três coisas só nesses cinco turnos precisaram de uma passada humana. A contagem regressiva do lançamento em 01:19 e “Launch commit lights are correct. There she goes.” em 01:22 são áudio de arquivo de lançamentos inserido no podcast, não o apresentador nem o convidado falando; o motor os rotulou mesmo assim como Speaker B e Speaker A. “Yeah, right?” no fim do turno de 01:36 é na verdade o apresentador retomando a conversa; pertence ao começo do turno seguinte, não ao fim do turno do convidado. E o sobrenome do convidado sai como Serafin aqui, embora os próprios créditos do episódio o escrevam Sarafin.

Um turno posterior mostra para que serve a literal limpa. A saída do motor em 02:51 diz: “Yes, so you’re, you’re right in that I lived in the operations realm for 22 of my 27 years in, in my NASA career.” Uma passada de literal limpa a transforma em: “You’re right in that I lived in the operations realm for 22 of my 27 years in my NASA career.” A literal completa manteria as repetições exatamente como saíram; o motor, se alguma coisa, tende a mantê-las: segurou a maioria das repetições e dos começos falsos ao longo do arquivo (“you’re, you’re right”, “in, in my NASA career”, “That’s, that’s quite a number of”), o que aproxima a saída mais da literal do que da literal limpa. Se um projeto precisa de literal limpa, conte com uma passada de edição não importa qual motor produza o rascunho.

Respostas

Frequently Asked Questions

Qual é a forma mais fácil de transcrever uma entrevista?

Passe a gravação por um motor de fala para texto para obter um primeiro rascunho, depois confira com o áudio e corrija os nomes dos falantes e as palavras pouco claras: digitar do zero à mão é mais lento, não mais fácil. Uma ferramenta do navegador como o transcritor de entrevistas da SozAI pode produzir um rascunho rotulado e com carimbos de tempo dos primeiros 5 minutos sem conta, o que basta para julgar se vale a pena processar o arquivo inteiro.

Qual a aparência de uma transcrição de entrevista pronta?

Ela abre com uma breve chave que indica o nível de literalidade, a notação usada e como os falantes são rotulados, seguida de turnos rotulados como Speaker A, com carimbos de tempo. O guia do UK Data Service sobre transcrição acrescenta que ela deve levar um identificador único, um layout uniforme, rótulos de falante e quebras de linha, para poder ser encontrada e comparada depois em vez de relida por inteiro.

O ChatGPT consegue transcrever uma entrevista?

Depende do produto, e não é a ferramenta certa para o primeiro passo. A transcrição de uma entrevista precisa de carimbos de tempo e turnos de falante confiáveis, que é o que um motor de transcrição produz. Um chatbot é útil depois, para organizar, resumir ou reformatar uma transcrição que você já tem, e qualquer texto automático ainda precisa ser conferido com a gravação.

Devo usar transcrição literal ou literal limpa?

Use a literal completa para análise da conversa ou trabalho jurídico e probatório, em que cada hum, começo falso e repetição importa; use a literal limpa para a maior parte da pesquisa qualitativa, do jornalismo e da pesquisa com usuários, em que o sentido importa mais do que as disfluências. Decida antes da primeira entrevista, porque mudar no meio do caminho obriga a refazer as transcrições anteriores.

Como marcar trechos inaudíveis numa transcrição?

Escreva [inaudible] com um carimbo de tempo, como [inaudible 00:12:31], para que você ou qualquer outra pessoa possa encontrar esse ponto na gravação depois. Para fala sobreposta use [crosstalk], e para sons que não são fala, como risadas, [laughs]; tudo entre colchetes e explicado uma vez na chave no topo da transcrição.

Quanto tempo leva para transcrever uma entrevista de uma hora?

À mão, o guia de história oral das bibliotecas da Texas Tech University coloca em cerca de seis horas de digitação por hora de áudio; um guia de curso da Cornell University estima de quatro a seis horas. Uma transcrição automática devolve um rascunho em minutos, e o tempo restante vai para conferi-lo com a gravação em vez de digitá-lo.

Merey Tleugazin

Fundador do SozAI. Criando ferramentas que transformam fala em texto para profissionais no mundo todo.

SozAI
SozAI — Download grátisTranscreva áudio e vídeo na hora
Obter app