**Transcrição de entrevista: literalidade e notação**
Source: https://sozai.app/pt/how-to-transcribe-an-interview/

[Transcrição](https://sozai.app/pt/category/transcricao/)

# Transcrição de entrevista: níveis de literalidade, rótulos de falante e notação

out 2, 2026  • 11 min read • 12 views  • Última atualização: out 2, 2026

![Two chairs facing each other at a small table by a window, a phone recording between them next to a notebook](https://sozai.app/wp-content/uploads/post-how-to-transcribe-an-interview-1280x720.webp)

> ### Pontos principais
>
>
>
> Decida o nível de literalidade antes de digitar uma palavra: a transcrição literal completa mantém cada “hum” e cada começo falso, a literal limpa mantém o sentido sem as muletas de fala e a transcrição editada ajeita a gramática para facilitar a leitura. Escolha uma notação para pausas, sobreposições e trechos inaudíveis, escreva-a como uma chave no topo do documento e rotule os falantes sempre do mesmo jeito. À mão, o guia de história oral das bibliotecas da Texas Tech University coloca a proporção em seis horas de digitação por hora de gravação; um guia de curso da Cornell University diz de quatro a seis. Uma transcrição automática dá um rascunho em minutos; o trabalho humano passa de digitar para conferir com a gravação.

Você tem a gravação. Agora alguém quer uma transcrição que possa citar, codificar ou entregar, e a primeira pergunta não é qual aplicativo usar, e sim quanto da fala você vai manter.

Muletas de fala e começos falsos importam na análise da conversa e em alguns contextos jurídicos; em todo o resto são ruído. Este artigo passa pelos três níveis de literalidade, pela notação que marca pausas e sobreposições, por quanto tempo o trabalho leva à mão e pelo que uma transcrição automática acerta e erra numa gravação real.

## Qual é a forma mais fácil de transcrever uma entrevista?

Passe primeiro a gravação por um motor de fala para texto, depois corrija os nomes, confira por amostragem com o áudio e acrescente a notação de que o seu projeto precisa: é mais rápido do que digitar a partir de uma página em branco, e é o que a maioria das pessoas entende por “mais fácil”. Digitar uma hora inteira de fala do zero, palavra por palavra, é o caminho lento, não o fácil.

Para um trecho curto, a nossa ferramenta do navegador para [transcrever uma entrevista online](https://sozai.app/pt/tools/transcribe-interview/) faz essa primeira passada sem conta: você envia uma gravação e ela transcreve os primeiros 5 minutos, rotula cada turno como Speaker A, Speaker B e assim por diante com um carimbo de tempo, e detecta o idioma automaticamente entre 99 idiomas. Arquivos de até 25 MB seguem como estão; gravações mais longas são cortadas para 5 minutos no navegador antes de qualquer envio. O áudio e a transcrição são apagados no provedor assim que o resultado volta, e você tem três prévias por dispositivo por dia.

Isso basta para ver se vale a pena usar uma ferramenta numa gravação específica. Para uma entrevista inteira de uma só vez, com os turnos rotulados do começo ao fim e cada transcrição guardada depois numa biblioteca em que dá para pesquisar, quem faz isso é o app da SozAI: os primeiros 30 minutos são grátis. Veja [como funciona a transcrição de entrevistas](https://sozai.app/pt/interview-transcription/) para o quadro completo, ou [baixe o app](https://sozai.app/pt/download/).

## Qual é a diferença entre literal e literal limpa?

A transcrição literal completa mantém cada palavra como foi dita: os “hum”, os começos falsos, as palavras repetidas, as gagueiras e as risadas audíveis. A literal limpa mantém as palavras e o sentido do falante, mas tira as muletas, os começos falsos e as repetições acidentais. Uma transcrição editada vai um passo além e ajeita a gramática e a ordem das frases para ler bem, e é exatamente por isso que deixa de servir como prova do que foi realmente dito.

- Literal completa: análise da conversa, alguns trabalhos jurídicos e probatórios.
- Literal limpa: a maior parte da pesquisa qualitativa, o jornalismo, a pesquisa com usuários.
- Editada: artigos publicados em formato de pergunta e resposta.

| Nível | O que mantém | Uso típico |
| --- | --- | --- |
| Literal completa | Cada palavra como foi dita: muletas, começos falsos, repetições, gagueiras, sons audíveis | Análise da conversa, alguns trabalhos jurídicos e probatórios |
| Literal limpa | As palavras e o sentido do falante, sem muletas nem começos falsos | A maior parte da pesquisa qualitativa, o jornalismo, a pesquisa com usuários |
| Editada | Gramática e ordem das frases ajeitadas para a leitura | Artigos publicados em formato de pergunta e resposta |

Se a transcrição vai para um projeto de pesquisa e não para uma matéria publicada, decida isso antes da primeira entrevista, não depois da quinta: mudar de nível no meio do caminho obriga a refazer as transcrições anteriores para igualá-las. O lado específico da pesquisa, o consentimento, a anonimização e o armazenamento, é tratado em [transcrever entrevistas para pesquisa](https://sozai.app/pt/interview-transcript-for-research/).

## Como se escreve a transcrição de uma entrevista?

Comece com uma chave: o nível de literalidade, os símbolos que você usa e como os falantes são rotulados, escrita no topo do documento antes da primeira linha de fala. Quem for codificar ou citar a transcrição depois precisa dessa chave, e você também, semanas mais tarde, quando tiver esquecido o que (.) queria dizer.

O sistema mais conhecido para transcrições detalhadas é o de Gail Jefferson, exposto no seu [Glossary of transcript symbols with an introduction](https://doi.org/10.1075/pbns.125.02jef) (2004). Segundo o resumo de [Clift, Kendrick, Raymond e Robinson (2024)](https://eprints.whiterose.ac.uk/id/eprint/237652/1/Clift_Kendrick_Raymond_Robinson._2024_-_Jeffersonian_Transcription_conventions.pdf), um colchete esquerdo marca o ponto em que a fala sobreposta começa, um sinal de igual une falas sem pausa entre uma e outra, um número entre parênteses como (0.5) é um silêncio cronometrado em segundos, e (.) marca uma pausa curta demais para cronometrar. As fontes divergem sobre quão curta exatamente é uma micropausa, então se a sua chave usa (.) ela deve dizer o que você entende por isso.

A maioria dos projetos de entrevistas não precisa desse nível de detalhe e fica mais fácil de ler sem ele. Uma convenção com colchetes cobre o que realmente aparece: [inaudible 00:12:31] para um trecho que não dá para entender, com um carimbo de tempo para encontrá-lo de novo; [crosstalk] quando duas pessoas falam ao mesmo tempo; [laughs] e outros eventos que não são fala entre colchetes; e um rótulo de falante no início de cada turno.

| Símbolo | Significado | Sistema |
| --- | --- | --- |
| [ | Ponto em que a fala sobreposta começa | Jeffersoniano |
| = | Fala unida sem pausa (encadeada) | Jeffersoniano |
| (0.5) | Silêncio cronometrado, em segundos | Jeffersoniano |
| (.) | Pausa curta demais para cronometrar | Jeffersoniano |
| [inaudible 00:12:31] | Trecho que não dá para entender, com um carimbo de tempo | Com colchetes |
| [crosstalk] | Duas pessoas falando ao mesmo tempo | Com colchetes |
| [laughs] | Som que não é fala | Com colchetes |

Além da notação, o [guia do UK Data Service sobre transcrição](https://dam.ukdataservice.ac.uk/media/187730/transcriptiondm25april2013.pdf) diz que uma transcrição deve levar um identificador único, usar um layout uniforme em todo o projeto, usar rótulos de falante para a troca de turnos e manter as quebras de linha: detalhes pequenos, mas são eles que permitem encontrar e comparar transcrições depois em vez de reler todas.

Os rótulos de falante são nomes que o software de transcrição não tem como saber: espere Speaker A e Speaker B, que você renomeia à mão quando souber quem é quem. [Rotular os falantes de forma consistente](https://sozai.app/pt/who-said-what-transcript/) explica como fazer isso num projeto inteiro sem que os nomes mudem de um arquivo para outro.

Anonimize ao longo do caminho, não depois: troque nomes e dados identificadores por marcadores consistentes como [Participant 2] ou [city] direto na transcrição, e guarde num arquivo separado a chave que liga os marcadores aos nomes reais. Gravar uma pessoa exige o consentimento dela em quase todo lugar, e um comitê de ética em pesquisa costuma querer esse consentimento por escrito; transcrever a gravação não muda essa exigência.

## Quanto tempo leva para transcrever uma entrevista?

À mão, conte com horas, não com minutos. O [guia de história oral das bibliotecas da Texas Tech University](https://guides.library.ttu.edu/c.php?g=1275281&p=9356352) diz que até transcritores experientes costumam trabalhar a seis horas de digitação para cada hora de áudio. Um [guia de curso da Cornell University](https://courses2.cit.cornell.edu/fit117/CP_T.htm) coloca mais baixo, em quatro a seis horas por hora de gravação; a diferença vem principalmente de quão limpo é o áudio e de quanta notação se acrescenta pelo caminho.

Uma transcrição automática muda para onde o tempo vai em vez de fazê-lo desaparecer. O rascunho volta em minutos; o que sobra é ouvi-lo comparando com a gravação, corrigir nomes e termos técnicos, acertar quem disse o quê onde os rótulos se cruzaram e acrescentar a notação de que o projeto precisa. Para uma entrevista de uma hora ainda é trabalho de verdade, só que de outro tipo; [quanto tempo a transcrição realmente leva](https://sozai.app/pt/how-long-will-transcription-take/) detalha isso melhor.

## O ChatGPT consegue transcrever uma entrevista?

Se um chatbot consegue transformar um arquivo de áudio em texto depende do produto, mas a transcrição de uma entrevista precisa de mais do que texto: carimbos de tempo aos quais voltar e turnos de falante em que confiar, que é o que um motor de transcrição foi feito para produzir. Onde um chatbot ganha o seu lugar é depois dessa etapa: organizar, resumir ou reformatar uma transcrição que você já tem.

De qualquer forma, o texto automático precisa ser conferido com a gravação antes de ser citado, e essa conferência é a parte que nenhuma ferramenta elimina.

Quanta conferência um motor específico exige varia bastante. [Qual a precisão da transcrição por IA](https://sozai.app/pt/how-accurate-is-ai-transcription/) explica o que esperar e onde os erros tendem a se concentrar.

## O que uma transcrição automática real erra

Uma transcrição automática é um rascunho, e a forma mais clara de ver o que isso significa é gerar uma e lê-la contra a gravação. Em 2 de outubro de 2026 fizemos exatamente isso, com os primeiros 5 minutos de uma gravação pública que qualquer pessoa pode conferir com este artigo.

Passamos o motor por trás da ferramenta de entrevistas da SozAI pelos primeiros 5 minutos (300 segundos) do podcast Houston We Have a Podcast, do Johnson Space Center da NASA, episódio 180, “Artemis Mission Management”, com o apresentador Gary Jordan e o convidado Mike Sarafin, uma obra da NASA e portanto não protegida por direitos autorais. Ele devolveu 778 palavras, detectou inglês e encontrou 2 falantes. As primeiras linhas, como o motor as devolveu:

[00:00] Speaker A: Houston, we have a podcast. Welcome to the official podcast of the NASA Johnson Space Center, episode 180, Artemis Mission Management. I'm Gary Jordan, and I'll be your host today.
[01:19] Speaker B: T-minus five seconds and counting. Mark.
[01:22] Speaker A: Launch commit lights are correct. There she goes. Houston. We have a podcast. Mike Serafin, thanks for coming on Houston, We Have a Podcast today.
[01:36] Speaker B: Thank you. It's a pleasure to be here to talk about these exciting Artemis missions we have ahead of us. Yeah, right?
[01:43] Speaker A: Returning to the Moon. Not a bad thing to be a part of.

Três coisas só nesses cinco turnos precisaram de uma passada humana. A contagem regressiva do lançamento em 01:19 e “Launch commit lights are correct. There she goes.” em 01:22 são áudio de arquivo de lançamentos inserido no podcast, não o apresentador nem o convidado falando; o motor os rotulou mesmo assim como Speaker B e Speaker A. “Yeah, right?” no fim do turno de 01:36 é na verdade o apresentador retomando a conversa; pertence ao começo do turno seguinte, não ao fim do turno do convidado. E o sobrenome do convidado sai como Serafin aqui, embora os próprios créditos do episódio o escrevam Sarafin.

Um turno posterior mostra para que serve a literal limpa. A saída do motor em 02:51 diz: “Yes, so you’re, you’re right in that I lived in the operations realm for 22 of my 27 years in, in my NASA career.” Uma passada de literal limpa a transforma em: “You’re right in that I lived in the operations realm for 22 of my 27 years in my NASA career.” A literal completa manteria as repetições exatamente como saíram; o motor, se alguma coisa, tende a mantê-las: segurou a maioria das repetições e dos começos falsos ao longo do arquivo (“you’re, you’re right”, “in, in my NASA career”, “That’s, that’s quite a number of”), o que aproxima a saída mais da literal do que da literal limpa. Se um projeto precisa de literal limpa, conte com uma passada de edição não importa qual motor produza o rascunho.

Respostas

## Frequently Asked Questions

Qual é a forma mais fácil de transcrever uma entrevista?

Passe a gravação por um motor de fala para texto para obter um primeiro rascunho, depois confira com o áudio e corrija os nomes dos falantes e as palavras pouco claras: digitar do zero à mão é mais lento, não mais fácil. Uma ferramenta do navegador como o transcritor de entrevistas da SozAI pode produzir um rascunho rotulado e com carimbos de tempo dos primeiros 5 minutos sem conta, o que basta para julgar se vale a pena processar o arquivo inteiro.

Qual a aparência de uma transcrição de entrevista pronta?

Ela abre com uma breve chave que indica o nível de literalidade, a notação usada e como os falantes são rotulados, seguida de turnos rotulados como Speaker A, com carimbos de tempo. O guia do UK Data Service sobre transcrição acrescenta que ela deve levar um identificador único, um layout uniforme, rótulos de falante e quebras de linha, para poder ser encontrada e comparada depois em vez de relida por inteiro.

O ChatGPT consegue transcrever uma entrevista?

Depende do produto, e não é a ferramenta certa para o primeiro passo. A transcrição de uma entrevista precisa de carimbos de tempo e turnos de falante confiáveis, que é o que um motor de transcrição produz. Um chatbot é útil depois, para organizar, resumir ou reformatar uma transcrição que você já tem, e qualquer texto automático ainda precisa ser conferido com a gravação.

Devo usar transcrição literal ou literal limpa?

Use a literal completa para análise da conversa ou trabalho jurídico e probatório, em que cada hum, começo falso e repetição importa; use a literal limpa para a maior parte da pesquisa qualitativa, do jornalismo e da pesquisa com usuários, em que o sentido importa mais do que as disfluências. Decida antes da primeira entrevista, porque mudar no meio do caminho obriga a refazer as transcrições anteriores.

Como marcar trechos inaudíveis numa transcrição?

Escreva [inaudible] com um carimbo de tempo, como [inaudible 00:12:31], para que você ou qualquer outra pessoa possa encontrar esse ponto na gravação depois. Para fala sobreposta use [crosstalk], e para sons que não são fala, como risadas, [laughs]; tudo entre colchetes e explicado uma vez na chave no topo da transcrição.

Quanto tempo leva para transcrever uma entrevista de uma hora?

À mão, o guia de história oral das bibliotecas da Texas Tech University coloca em cerca de seis horas de digitação por hora de áudio; um guia de curso da Cornell University estima de quatro a seis horas. Uma transcrição automática devolve um rascunho em minutos, e o tempo restante vai para conferi-lo com a gravação em vez de digitá-lo.

![Merey Tleugazin](https://sozai.app/wp-content/themes/sozai/assets/images/merey-tleugazin.webp)

[Merey Tleugazin](https://sozai.app/about/merey/)

Fundador do SozAI. Criando ferramentas que transformam fala em texto para profissionais no mundo todo.

- [Instagram](https://instagram.com/mereytleugazin)
- [X](https://x.com/mereytleugazin)

## Artigos relacionados

- [ago 2 10 min ### Você Gravou a Reunião. Agora É Hora de Transformá-la em Texto](https://sozai.app/pt/transcript-from-a-teams-or-meet-recording/)
- [ago 2 12 min ### Transformando um Episódio de Podcast em Show Notes que as Pessoas Realmente Leem](https://sozai.app/pt/podcast-episode-into-show-notes/)
- [jul 30 8 min ### Centenas de Mensagens de Voz Que Você Nunca Ouviu: O Que Fazer Com Elas](https://sozai.app/pt/hundreds-of-voice-messages/)

[![SozAI](https://sozai.app/wp-content/themes/sozai/assets/images/appicon.png) SozAI — Download grátis Transcreva áudio e vídeo na hora Obter app](https://sozai.app/pt/download/)


---
This is the markdown twin of https://sozai.app/pt/how-to-transcribe-an-interview/ — the same content, without the markup.
Published by SozAI (https://sozai.app). Reuse and quotation are allowed with attribution and a link back.
Machine-readable index: https://sozai.app/llms.txt · data API: https://sozai.app/api/
