Ir al contenido

Qué requieren realmente los subtítulos accesibles

10 min read 1 views Última actualización: Ago 2, 2026
A wall-mounted screen in an office corridor showing a video with a caption bar across the bottom

Puntos clave

Los subtítulos accesibles no son simplemente subtítulos que existen. Incluyen el diálogo más el sonido no verbal que aporta información, marcan cada cambio de interlocutor y aparecen y desaparecen al ritmo del habla. Los subtítulos traducidos son otra cosa distinta: normalmente solo diálogo y a menudo en otro idioma. Una transcripción es el texto sin sincronización, y sirve a personas que no pueden usar el reproductor en absoluto, así que es un producto aparte y no un sustituto. El fallo más habitual son los subtítulos automáticos sin ninguna revisión posterior.

Alguien te ha dicho que los subtítulos tienen que ser accesibles. Tú ya tienes subtítulos. Ahora intentas averiguar dónde está la diferencia entre esas dos frases, y nadie te ha dado muchos detalles.

La diferencia casi nunca es que el vídeo carezca de pista de subtítulos. Es que esa pista resulta inutilizable de una forma que no se nota hasta que una persona sorda o con dificultades auditivas intenta seguir el vídeo con ella. A continuación va lo que eso significa en la práctica, en el orden en que te lo vas a encontrar.

Tres palabras, tres productos, tres públicos

En una conversación normal, «subtítulos», «subtítulos para sordos» y «transcripción» se usan como si fueran lo mismo, y el requisito que te han pasado casi seguro no los trata como sinónimos. Si nombra dos de ellos, quiere dos cosas distintas.

Los subtítulos SDH (pensados para personas sordas o con dificultades auditivas) incluyen el diálogo más el sonido no verbal que aporta información. Se escriben partiendo de que el espectador no oye nada, así que cualquier cosa que ocurra en la banda sonora y que la imagen no muestre tiene que aparecer en el texto.

Los subtítulos traducidos suelen llevar solo el diálogo, y a menudo están en otro idioma. Parten de que puedes oír el vídeo perfectamente, solo que no entiendes la lengua que se habla. Una pista de subtítulos traducidos no te dirá que sonó una alarma, porque un espectador oyente que entiende el idioma no necesita que se lo digan.

Una transcripción es el texto por sí solo, sin sincronización. Sin marcas de tiempo, sin ajuste al vídeo, sin reproductor de por medio. Sirve a personas que usan un lector de pantalla, a quienes no pueden manejar el reproductor de vídeo y a quienes simplemente prefieren leer el contenido antes que verlo entero.

Esta última es la distinción que la gente confunde más a menudo. Publicar una transcripción junto al vídeo no cumple el requisito de subtítulos, y una pista de subtítulos no cumple el requisito de transcripción, porque llegan a públicos distintos por vías distintas. Si produces solo uno de los dos y lo llamas de las dos formas, has producido solo uno.

Conviene decirlo con claridad: las obligaciones de accesibilidad varían según el país, el sector y la organización. No existe un estándar único a nivel mundial con el que puedas comprobar tu caso y darlo por resuelto. La norma que importa es aquella a la que tu organización está sujeta, y alguien en tu organización sabe cuál es, aunque no te lo haya dicho. Pregunta antes de montar un proceso basándote en una suposición.

Los subtítulos llevan el sonido, no solo el habla

Esta es la parte que sorprende a quienes solo han pensado en los subtítulos como conversión de voz a texto. Una puerta que se cierra. Una alarma. Risas fuera de plano. Un teléfono que suena y hace que alguien deje la frase a medias. Nada de eso es diálogo, y nada de eso se ve.

Si un espectador que no oye la banda sonora ve tu vídeo y pasa algo que no puede explicarse, los subtítulos han fallado justo en aquello para lo que existen. La persona en pantalla que reacciona a un ruido que nunca se mencionó ahora parece comportarse sin motivo.

La pregunta no es «¿hubo un sonido?» sino «¿ese sonido aporta significado?». El ruido ambiente no necesita subtítulo. La música de fondo a la que nadie reacciona tampoco, normalmente. La alarma que hace que todos salgan de la sala sí. También las risas, cuando indican cómo cayó una frase. La decisión es tuya, y es una decisión real, no una regla que se pueda automatizar, y esa es una de las razones por las que importa que una persona revise el archivo. Si quieres la versión larga de cómo se maneja esto en la práctica, la guía sobre subtítulos ocultos explica la mecánica.

Tampoco conviene pasarse. Una pista que anota cada roce compite con el diálogo por el tiempo de lectura del espectador y lo deja por detrás del vídeo. Incluye lo que cambia el sentido de la escena. Deja el resto fuera.

Mostrar quién habla

Una pista de subtítulos que mezcla el diálogo de tres personas sin indicar dónde termina una y empieza la siguiente está técnicamente presente y es funcionalmente inservible. Es uno de los defectos más comunes en un archivo que ha pasado todas las comprobaciones formales, porque esa comprobación se limita a preguntar si hay subtítulos, no si se pueden leer con sentido.

Piensa en lo que un espectador oyente recibe gratis. Las voces suenan distinto. Sabes que la respuesta viene de otra persona porque sale de otra garganta, y muchas veces incluso percibes de qué lado de la sala viene. Quita el audio y todo eso desaparece. En pantalla, un plano de reacción o un encuadre cerrado puede dejar a quien habla fuera de cámara durante toda una frase.

Las convenciones para marcar un cambio de interlocutor varían entre estudios y plataformas, y cualquiera de las habituales funciona siempre que la uses de forma coherente dentro de un mismo archivo. Lo que no funciona es no marcar nada. Una entrevista, una mesa redonda, la grabación de una reunión, cualquier cosa con más de una voz, necesita que el cambio quede señalado cada vez que ocurre, incluso cuando las mismas dos personas intercambian frases cortas muy rápido. Sobre todo entonces, de hecho, porque ahí es donde el lector pierde el hilo más rápido.

Una sincronización que sigue al habla

Los subtítulos tienen que aparecer cuando se dicen las palabras y desaparecer cuando terminan. Un subtítulo que llega un instante tarde hace que el espectador lea la frase después de haber visto la reacción a ella. Un subtítulo que se queda en pantalla durante el plano siguiente le hace leer una escena mientras mira otra.

Ninguno de esos dos fallos es grave si ocurre una sola vez. A lo largo de diez minutos resultan agotadores, y el vídeo se vuelve más difícil de seguir con subtítulos que sin ellos. El culpable habitual es el desajuste progresivo: un archivo que empieza sincronizado y se va retrasando cada vez más, a menudo porque se generó sobre una versión del vídeo y se aplicó a otra que tiene un segundo extra al principio o al final.

Revisa el final del archivo, no el principio. Todo el mundo revisa el principio. Si la última línea de un vídeo largo sigue encajando con las palabras, es probable que el resto también esté bien. Si se ha desviado, hay que resincronizar todo el archivo en vez de parchearlo. Una comprobación estructural con un validador de archivos SRT detecta líneas superpuestas o mal formadas antes de subir el archivo, aunque no puede decirte si las palabras son las correctas.

Los subtítulos automáticos y la revisión que los hace utilizables

Los subtítulos automáticos sin ninguna revisión posterior son la forma más habitual en que una organización acaba con subtítulos que no cumplen ni su propio requisito. Suelen llegar con decisiones de puntuación en las que no confiarías, sin ningún cambio de interlocutor marcado y sin ningún sonido no verbal, porque al modelo se le pidió transcribir el habla, y eso es exactamente lo que hizo.

Nada de eso convierte a los subtítulos automáticos en algo inútil. Son un buen primer borrador y ahorran tiempo real en la parte del trabajo que es pura mecanografía. El error está en tratar ese resultado como el producto final en lugar de como materia prima. Lo que convierte uno en el otro es que una persona lea el archivo comparándolo con el vídeo y corrija cuatro cosas: las palabras mal transcritas, los cortes de frase, los cambios de interlocutor y los sonidos que aportan significado.

Para ese primer borrador, SozAI transcribe archivos de audio y vídeo, grabaciones y enlaces de YouTube en texto con etiquetas de interlocutor en más de 99 idiomas, disponible en su app para iOS, Android y macOS, y el sitio también ofrece herramientas gratuitas de subtítulos y conteo que funcionan enteramente en el navegador, sin subir nada a ningún servidor. Las etiquetas de interlocutor te dan ventaja con los cambios de turno; los sonidos ambientales y el ajuste final de tiempos siguen siendo tarea tuya.

Reserva tiempo para esa revisión. Es más corta que transcribir desde cero y más larga que no hacer nada, y marca toda la diferencia entre un archivo que existe y uno que funciona.

Lo que todavía puede salir mal después de todo esto

Bastantes cosas, y conviene saber cuáles.

  • Los nombres propios, la jerga y los términos de producto salen mal de la transcripción automática y se quedan así, porque quien revisa sin conocer bien el tema no nota que un término está ligeramente equivocado.
  • El archivo de subtítulos se asocia al corte equivocado del vídeo después de una edición, y la sincronización se pierde con él. Nadie vuelve a comprobarlo tras un recorte.
  • La transcripción sencillamente nunca llega a producirse, porque es el producto que no tiene un lugar obvio en el flujo de publicación y no da ningún error cuando falta.
  • Una pista de subtítulos traducidos se sube como si fuera una pista SDH, lo que deja a los espectadores sordos que hablan el idioma original solo con el diálogo y sin ninguna indicación de sonido.

Ninguno de estos problemas aparece en una revisión rápida de los primeros treinta segundos, que es la comprobación que de verdad recibe la mayoría de los vídeos. Si estás montando un proceso, coloca la comprobación al final del archivo y después de la edición definitiva, no antes.

La otra cosa que hay que tener presente es que ningún nivel de cuidado en el archivo de subtítulos resuelve cuál es tu obligación legal. Esa respuesta depende de la norma a la que tu organización esté sujeta, y el detalle práctico de cómo suelen formularse esos requisitos se trata en el artículo sobre transcripción y cumplimiento normativo en accesibilidad. Consigue esa respuesta primero, y luego aplica todo lo anterior a lo que resulte que exige.

Respuestas

Frequently Asked Questions

¿Cuál es la diferencia entre subtítulos para personas sordas y subtítulos traducidos?

Los subtítulos para sordos (SDH) incluyen el diálogo más el sonido no verbal que aporta información, como una puerta, una alarma o unas risas, y están pensados para espectadores que no oyen la banda sonora. Los subtítulos traducidos suelen llevar solo el diálogo y a menudo están en otro idioma, pensados para quien oye el audio pero no entiende la lengua hablada. Subir una pista de subtítulos traducidos donde se exige SDH deja a los espectadores sordos sin la información sonora que necesitan.

¿Los subtítulos tienen que incluir los sonidos de fondo?

Tienen que incluir los sonidos que aportan significado, no todos los sonidos. Una puerta que se cierra, una alarma, un teléfono que interrumpe a alguien, unas risas que indican cómo cayó una frase: eso sí debe aparecer, porque la imagen sola no lo transmite. El ruido ambiente y la música de fondo sin reacción normalmente no. Anotar de más compite con el diálogo por el tiempo de lectura del espectador.

¿Los subtítulos automáticos son suficientes para ser accesibles?

No sin una revisión posterior. Los subtítulos automáticos suelen llegar con decisiones de puntuación poco fiables, sin ningún cambio de interlocutor marcado y sin ningún sonido no verbal, porque el sistema solo transcribió el habla. Son un buen primer borrador y ahorran tiempo real de mecanografía. Después, alguien tiene que leer el archivo comparándolo con el vídeo y corregir las palabras mal transcritas, los cortes de frase, los cambios de interlocutor y los sonidos relevantes.

¿Necesito una transcripción además de los subtítulos?

Normalmente sí, y una transcripción no sustituye a una pista de subtítulos. Una transcripción es el texto por sí solo, sin sincronización, y sirve a quien usa un lector de pantalla o no puede manejar el reproductor de vídeo. Los subtítulos sirven a quien ve el vídeo pero no puede oírlo. Llegan a públicos distintos por vías distintas, así que un requisito que nombra ambos pide dos productos separados.

¿Cómo se indica que ha cambiado el interlocutor en los subtítulos?

Marcando cada cambio, con la convención que use tu plataforma o estilo editorial, aplicada de forma coherente en todo el archivo. Una pista que mezcla el diálogo de varias personas sin señalar el cambio está técnicamente presente y es funcionalmente inservible. Un espectador oyente reconoce el cambio de voz gratis, por el sonido; un lector no recibe nada si no se lo indicas por escrito. Los intercambios rápidos entre dos personas son donde más falta hace.

¿Con qué precisión debe seguir el subtítulo la sincronización del habla?

Con la suficiente para que el subtítulo aparezca cuando se dicen las palabras y desaparezca cuando terminan. Uno que llega tarde hace que el espectador lea la frase después de ver la reacción a ella, y uno que se queda demasiado tiempo lo deja leyendo una escena atrasada respecto a otra. Conviene revisar el final de un archivo largo y no solo el principio, porque el desajuste se acumula poco a poco y suele ser mejor resincronizar todo que parchear.

Merey Tleugazin

Fundador de SozAI. Creando herramientas que convierten voz en texto para profesionales de todo el mundo.

SozAI
SozAI — Descarga gratisTranscribe audio y video al instante
Obtener app