Puntos clave
Decide el nivel de literalidad antes de teclear una sola palabra: la transcripción literal completa conserva cada «ehm» y cada comienzo en falso, la literal limpia conserva el sentido sin las muletillas y la transcripción editada pule la gramática para facilitar la lectura. Elige una notación para pausas, solapamientos y tramos inaudibles, escríbela como una clave al principio del documento y etiqueta a los hablantes siempre igual. A mano, la guía de historia oral de las bibliotecas de Texas Tech University fija la proporción en seis horas de escritura por hora de grabación; una guía de curso de Cornell University dice entre cuatro y seis. Una transcripción automática te da un borrador en minutos; el trabajo humano pasa de teclear a comprobarlo con la grabación.
Ya tienes la grabación. Ahora alguien quiere una transcripción que pueda citar, codificar o entregar, y la primera pregunta no es qué aplicación usar, sino cuánto del habla vas a conservar.
Las muletillas y los comienzos en falso importan en el análisis de la conversación y en algunos contextos legales; en todo lo demás son ruido. Este artículo repasa los tres niveles de literalidad, la notación que marca pausas y solapamientos, cuánto se tarda a mano y qué acierta y qué falla una transcripción automática en una grabación real.
¿Cuál es la forma más fácil de transcribir una entrevista?
Pasa primero la grabación por un motor de voz a texto, luego corrige los nombres, comprueba al azar con el audio y añade la notación que necesite tu proyecto: es más rápido que teclear desde una página en blanco, y es lo que casi todo el mundo entiende por «más fácil». Teclear una hora entera de habla desde cero, palabra por palabra, es la vía lenta, no la fácil.
Para un fragmento corto, nuestra herramienta del navegador para transcribir una entrevista online hace esa primera pasada sin cuenta: subes una grabación y transcribe los primeros 5 minutos, etiqueta cada turno como Speaker A, Speaker B y así sucesivamente con una marca de tiempo, y detecta el idioma automáticamente entre 99 idiomas. Los archivos de hasta 25 MB se envían tal cual; las grabaciones más largas se recortan a 5 minutos en el navegador antes de enviar nada. El audio y la transcripción se eliminan en el proveedor en cuanto vuelve el resultado, y tienes tres vistas previas por dispositivo y día.
Eso basta para ver si merece la pena usar una herramienta con una grabación concreta. Para una entrevista entera de una sola vez, con los turnos etiquetados de principio a fin y cada transcripción guardada después en una biblioteca en la que se puede buscar, lo hace la app de SozAI: los primeros 30 minutos son gratis. Consulta cómo funciona la transcripción de entrevistas para ver el panorama completo, o descarga la app.
¿Cuál es la diferencia entre literal y literal limpia?
La transcripción literal completa conserva cada palabra tal como se dijo: los «ehm», los comienzos en falso, las palabras repetidas, los tartamudeos y las risas audibles. La literal limpia conserva las palabras y el sentido del hablante, pero elimina las muletillas, los comienzos en falso y las repeticiones accidentales. Una transcripción editada va un paso más allá y pule la gramática y el orden de las frases para que se lea bien, y precisamente por eso deja de servir como prueba de lo que se dijo en realidad.
- Literal completa: análisis de la conversación, algunos trabajos legales y probatorios.
- Literal limpia: la mayor parte de la investigación cualitativa, el periodismo, la investigación de usuarios.
- Editada: artículos publicados en formato de preguntas y respuestas.
| Nivel | Qué conserva | Uso habitual |
|---|---|---|
| Literal completa | Cada palabra tal como se dijo: muletillas, comienzos en falso, repeticiones, tartamudeos, sonidos audibles | Análisis de la conversación, algunos trabajos legales y probatorios |
| Literal limpia | Las palabras y el sentido del hablante, sin muletillas ni comienzos en falso | La mayor parte de la investigación cualitativa, el periodismo, la investigación de usuarios |
| Editada | Gramática y orden de las frases pulidos para la lectura | Artículos publicados en formato de preguntas y respuestas |
Si la transcripción va a un proyecto de investigación y no a una pieza publicada, decídelo antes de la primera entrevista, no después de la quinta: cambiar de nivel a mitad de camino obliga a rehacer las transcripciones anteriores para igualarlas. El lado propio de la investigación, el consentimiento, la anonimización y el almacenamiento, se trata en transcribir entrevistas para investigación.
¿Cómo se escribe la transcripción de una entrevista?
Empieza con una clave: el nivel de literalidad, los símbolos que usas y cómo se etiqueta a los hablantes, escrita al principio del documento antes de la primera línea de habla. Quien codifique o cite la transcripción más adelante necesita esa clave, y tú también, semanas después, cuando hayas olvidado qué significaba (.).
El sistema más conocido para transcripciones detalladas es el de Gail Jefferson, expuesto en su Glossary of transcript symbols with an introduction (2004). Según el resumen de Clift, Kendrick, Raymond y Robinson (2024), un corchete izquierdo marca el punto en que empieza el habla solapada, un signo igual une el habla sin pausa entre una intervención y otra, un número entre paréntesis como (0.5) es un silencio medido en segundos, y (.) marca una pausa demasiado corta para medirla. Las fuentes no coinciden en cuán corta es exactamente una micropausa, así que si tu clave usa (.) debe decir qué entiendes por ello.
La mayoría de los proyectos de entrevistas no necesita ese nivel de detalle y resulta más fácil de leer sin él. Una convención con corchetes cubre lo que realmente aparece: [inaudible 00:12:31] para un pasaje que no se entiende, con una marca de tiempo para volver a encontrarlo; [crosstalk] cuando dos personas hablan a la vez; [laughs] y otros sucesos que no son habla entre corchetes; y una etiqueta de hablante al principio de cada turno.
| Símbolo | Significado | Sistema |
|---|---|---|
| [ | Punto en que empieza el habla solapada | Jeffersoniano |
| = | Habla unida sin pausa (encadenada) | Jeffersoniano |
| (0.5) | Silencio medido, en segundos | Jeffersoniano |
| (.) | Pausa demasiado corta para medirla | Jeffersoniano |
| [inaudible 00:12:31] | Pasaje que no se entiende, con una marca de tiempo | Con corchetes |
| [crosstalk] | Dos personas hablando a la vez | Con corchetes |
| [laughs] | Sonido que no es habla | Con corchetes |
Más allá de la notación, la guía del UK Data Service sobre transcripción dice que una transcripción debe llevar un identificador único, usar un formato uniforme en todo el proyecto, usar etiquetas de hablante para los turnos de palabra y conservar los saltos de línea: detalles pequeños, pero son los que permiten encontrar y comparar transcripciones después en lugar de releerlas todas.
Las etiquetas de hablante son nombres que el programa de transcripción no puede conocer: espera Speaker A y Speaker B, que renombras a mano cuando sepas quién es quién. Etiquetar a los hablantes de forma coherente explica cómo hacerlo en todo un proyecto sin que los nombres cambien de un archivo a otro.
Anonimiza sobre la marcha, no después: sustituye nombres y datos identificativos por marcadores coherentes como [Participant 2] o [city] directamente en la transcripción, y guarda en un archivo aparte la clave que relaciona los marcadores con los nombres reales. Grabar a una persona requiere su consentimiento casi en todas partes, y un comité de ética de la investigación suele querer ese consentimiento por escrito; transcribir la grabación no cambia ese requisito.
¿Cuánto se tarda en transcribir una entrevista?
A mano, cuenta con horas, no con minutos. La guía de historia oral de las bibliotecas de Texas Tech University dice que incluso los transcriptores con experiencia suelen trabajar a razón de seis horas de escritura por cada hora de audio. Una guía de curso de Cornell University lo sitúa más bajo, en entre cuatro y seis horas por hora de grabación; la diferencia depende sobre todo de lo limpio que esté el audio y de cuánta notación se añada por el camino.
Una transcripción automática cambia dónde se va el tiempo en lugar de hacerlo desaparecer. El borrador vuelve en minutos; lo que queda es escucharlo comparándolo con la grabación, corregir nombres y términos técnicos, arreglar quién dijo qué donde se cruzaron las etiquetas y añadir la notación que necesite el proyecto. Para una entrevista de una hora sigue siendo trabajo de verdad, solo que de otro tipo; cuánto tarda realmente una transcripción lo desglosa con más detalle.
¿Puede ChatGPT transcribir una entrevista?
Que un chatbot pueda convertir un archivo de audio en texto depende del producto, pero la transcripción de una entrevista necesita algo más que texto: marcas de tiempo a las que poder volver y turnos de hablante en los que puedas confiar, que es lo que está hecho para producir un motor de transcripción. Donde un chatbot se gana su sitio es después de ese paso: ordenar, resumir o reformatear una transcripción que ya tienes.
En cualquier caso, el texto automático hay que contrastarlo con la grabación antes de citarlo, y esa comprobación es la parte que ninguna herramienta elimina.
Cuánta revisión necesita un motor concreto varía bastante. Qué precisión tiene la transcripción con IA explica qué esperar y dónde tienden a concentrarse los errores.
Qué falla en una transcripción automática real
Una transcripción automática es un borrador, y la forma más clara de ver lo que eso significa es generar una y leerla frente a la grabación. El 2 de octubre de 2026 hicimos exactamente eso, con los primeros 5 minutos de una grabación pública que cualquiera puede comprobar con este artículo.
Pasamos el motor que hay detrás de la herramienta de entrevistas de SozAI por los primeros 5 minutos (300 segundos) del pódcast Houston We Have a Podcast del Johnson Space Center de la NASA, episodio 180, «Artemis Mission Management», con el presentador Gary Jordan y el invitado Mike Sarafin, una obra de la NASA y por tanto no protegida por derechos de autor. Devolvió 778 palabras, detectó inglés y encontró 2 hablantes. Las primeras líneas, tal como las devolvió el motor:
[00:00] Speaker A: Houston, we have a podcast. Welcome to the official podcast of the NASA Johnson Space Center, episode 180, Artemis Mission Management. I'm Gary Jordan, and I'll be your host today. [01:19] Speaker B: T-minus five seconds and counting. Mark. [01:22] Speaker A: Launch commit lights are correct. There she goes. Houston. We have a podcast. Mike Serafin, thanks for coming on Houston, We Have a Podcast today. [01:36] Speaker B: Thank you. It's a pleasure to be here to talk about these exciting Artemis missions we have ahead of us. Yeah, right? [01:43] Speaker A: Returning to the Moon. Not a bad thing to be a part of.
Tres cosas de solo esos cinco turnos necesitaron una pasada humana. La cuenta atrás del lanzamiento en 01:19 y «Launch commit lights are correct. There she goes.» en 01:22 son audio de archivo de lanzamientos intercalado en el pódcast, no el presentador ni el invitado hablando; el motor los etiquetó de todos modos como Speaker B y Speaker A. «Yeah, right?» al final del turno de 01:36 es en realidad el presentador retomando la conversación; pertenece al comienzo del turno siguiente, no al final del del invitado. Y el apellido del invitado sale como Serafin aquí, aunque los propios créditos del episodio lo escriben Sarafin.
Un turno posterior muestra para qué sirve la literal limpia. La salida del motor en 02:51 dice: «Yes, so you’re, you’re right in that I lived in the operations realm for 22 of my 27 years in, in my NASA career.» Una pasada de literal limpia la convierte en: «You’re right in that I lived in the operations realm for 22 of my 27 years in my NASA career.» La literal completa conservaría las repeticiones exactamente como salieron; el motor, si acaso, tiende a conservarlas: mantuvo la mayoría de las repeticiones y los comienzos en falso a lo largo del archivo («you’re, you’re right», «in, in my NASA career», «That’s, that’s quite a number of»), lo que acerca su salida más a la literal que a la literal limpia. Si un proyecto necesita literal limpia, cuenta con una pasada de edición sea cual sea el motor que produzca el borrador.

