Ce qu’il faut retenir
Il n’existe pas un taux de fiabilité unique, et le chiffre que vous avez pu lire quelque part décrit un système testé sur un enregistrement précis. Un audio propre avec un seul locuteur et une conversation de groupe bruyante donnent des résultats si éloignés qu’aucun pourcentage ne peut couvrir les deux à la fois. Ce qui déterminera votre résultat, c’est l’enregistrement lui-même : la distance au micro, le bruit de fond, les prises de parole qui se chevauchent, la couverture de l’accent. Les erreurs se regroupent aussi : la majeure partie du texte est correcte, mais les noms propres, le jargon, les chiffres et les moments où plusieurs personnes parlent en même temps posent problème. Pour retrouver un passage, ce n’est pas gênant. Pour citer quelqu’un, il faut vérifier chaque ligne à l’oreille.
Vous avez sûrement déjà vu un pourcentage affiché en face d’un outil de transcription. C’est une mesure réelle de quelque chose. Ce n’est simplement pas une mesure de ce qui se passera quand vous lui confierez votre propre enregistrement, et le prendre pour une promesse, c’est la meilleure façon d’être déçu au pire moment.
La bonne question n’est pas de savoir si la transcription automatique est fiable en général. C’est de savoir si le texte que vous obtiendrez sera assez bon pour ce que vous voulez en faire précisément. Ce sont deux questions différentes, avec des réponses différentes : le même fichier peut être parfaitement utilisable pour retrouver un passage et totalement inutilisable pour en citer un.
Un taux de fiabilité mesure un enregistrement, pas un système
Toute annonce de fiabilité résulte d’un test d’un système donné sur un audio donné. Changez l’audio, et le chiffre change avec lui. Ce n’est pas un défaut de la mesure, c’est ce qu’elle est.
Imaginez les deux extrêmes. Un seul locuteur, proche du micro, dans une pièce silencieuse, qui parle avec un accent largement représenté de choses banales. Cela se transcrit très bien. Imaginez maintenant quatre personnes autour d’une table, dans une pièce où tourne un climatiseur, qui se coupent la parole, utilisent des raccourcis propres à leur métier, deux d’entre elles à un mètre cinquante du téléphone. Cela se transcrit beaucoup moins bien. Les deux mesures sont honnêtes pour le même système. Un seul chiffre ne peut pas décrire les deux situations, et l’écart entre elles est tel qu’une moyenne n’aurait pas de sens non plus.
Donc quand vous voyez un chiffre sans savoir sur quel audio il a été mesuré, l’information importante est justement celle qui manque. Tout ce que vous avez appris, c’est que quelqu’un a testé quelque chose. Le seul test qui compte pour vous, c’est votre propre matériau. Prenez quelques minutes d’un enregistrement qui ressemble à ceux que vous utilisez réellement, passez-le dans l’outil, et comparez le résultat à l’audio. C’est plus instructif que n’importe quelle annonce publicitaire, et ça prend moins de temps que de lire des comparatifs.
L’enregistrement pèse plus lourd que le logiciel sur le résultat
Les gens comparent les outils pour choisir le plus fiable. C’est se tromper de problème pour la plupart des enregistrements. Les conditions de captation font bouger le résultat bien davantage que le choix du moteur de transcription.
- La distance au micro. Chaque centimètre supplémentaire fait entrer plus de pièce et moins de voix. Un téléphone posé sur la table entre deux personnes ne donne pas le même enregistrement qu’un téléphone placé devant l’une d’elles.
- Le bruit de fond. La circulation, un café, des ventilateurs, un clavier. Le bruit ne se contente pas de rester en arrière-plan de la parole, il entre en concurrence avec elle, et les mots qui perdent sont les plus discrets, souvent ceux en fin de phrase.
- Les prises de parole simultanées. Quand deux personnes parlent en même temps, il n’y a pas de signal propre à transcrire. Quelque chose sera écrit, et ce sera souvent un mélange des deux voix.
- La couverture de l’accent. Certains accents sont bien mieux représentés que d’autres dans les données d’apprentissage de ces systèmes, et ceux qui le sont moins donnent de moins bons résultats, même sur un audio tout aussi propre.
Les outils diffèrent réellement entre eux, et si votre matériau pose systématiquement le même type de difficulté, tester plusieurs solutions vaut l’après-midi qu’on y passe. Mais l’écart entre deux outils sérieux sur le même audio est en général plus petit que l’écart entre un bon et un mauvais audio avec le même outil. Rapprocher le micro rapporte plus que changer de logiciel. Pour comprendre ce que le logiciel fait réellement de ce que vous lui donnez, l’explication générale de comment fonctionne la transcription par IA montre pourquoi ces conditions précises comptent autant.
Les erreurs ne sont pas réparties uniformément dans le texte
C’est le point qui piège le plus de gens, et il compte plus que le chiffre affiché en une. Les erreurs se regroupent. La majorité du texte sort propre, et les ratés se concentrent dans quelques endroits prévisibles : les noms propres, le vocabulaire technique, les chiffres, et les moments où les gens parlent en même temps.
Réfléchissez à ce que cela change pour la lecture. Une page de conversation ordinaire se transcrit bien et se lit couramment. Puis un nom de famille arrive, ou un nom de produit, ou un chiffre, et il sort faux. Rien sur la page ne signale la différence. Le mot erroné est écrit dans la même police assurée que les mots justes, entouré de phrases correctes, ce qui est exactement le contexte qui rend une erreur crédible. Un texte peut se lire à merveille et être faux précisément aux endroits où vous vouliez vous en servir.
Il y a une raison à ce que ces catégories échouent ensemble. Les mots ordinaires sont contraints par tout ce qui les entoure, donc un système qui en comprend mal un peut se rattraper grâce au contexte. Un nom propre n’est pas contraint de cette façon ; presque n’importe quel son pourrait être le nom de quelqu’un, et rien dans la grammaire ne permet d’écarter une mauvaise hypothèse. Le jargon spécialisé pose le même problème, avec la difficulté supplémentaire qu’un mot courant ressemble souvent suffisamment au terme technique pour être substitué à sa place. Les chiffres sont le cas le plus net, parce qu’une petite différence acoustique produit une valeur totalement différente, et la phrase se lit correctement dans les deux cas.
La ponctuation est une hypothèse sur la fin des phrases
La ponctuation automatique n’est pas de la transcription. C’est une déduction tirée des pauses, de l’intonation et du rythme, qui tente de deviner où une idée s’arrête et où la suivante commence. La plupart du temps, l’hypothèse est correcte, ou assez proche pour que personne ne remarque rien.
Quand elle est fausse, le sens change. Un point placé au milieu d’une proposition peut détacher une nuance de ce qu’elle nuançait, si bien qu’une affirmation prudente devient catégorique et qu’un conditionnel devient une affirmation. Chaque mot pris individuellement peut être exact, et la phrase peut malgré tout dire quelque chose que la personne n’a pas dit. Ce type d’erreur est invisible sur la page, parce qu’il n’y a rien à remarquer. On ne peut pas la corriger en relisant le texte. Seul l’audio permet de trancher.
Les étiquettes d’intervenants ont une faiblesse voisine. Elles sont généralement correctes pendant qu’une même personne parle longtemps, et le moins fiables lors des changements de locuteur, c’est-à-dire précisément là où une courte interjection peut être attribuée à la mauvaise personne. Si vous tirez une citation près d’un changement d’intervenant, c’est une ligne à réécouter.
Fixez le niveau d’exigence selon l’usage du texte
La question n’est pas de savoir si un texte transcrit est fiable. C’est de savoir s’il est assez fiable pour l’usage prévu, et cet usage varie plus qu’on ne le pense.
Si vous utilisez la transcription pour retrouver un passage, quelques erreurs éparpillées ne changent rien. Vous cherchez un mot, vous arrivez près de la bonne minute, vous lancez l’audio. Le texte a fait son travail, même avec un nom écorché trois lignes plus haut. C’est la même chose quand vous parcourez une heure d’enregistrement pour décider quels vingt minutes méritent votre attention, ou quand vous transformez un enregistrement audio en texte pour le lire plus vite que vous ne l’auriez écouté.
Si le texte doit être cité, publié, archivé, ou utilisé par quelqu’un qui n’était pas dans la pièce, le niveau d’exigence change, et ce n’est pas négociable. Chaque ligne que vous comptez utiliser doit être vérifiée à l’oreille, une par une. Pas une relecture du document entier : une écoute ciblée de chaque passage cité, parce que les erreurs décrites plus haut sont justement celles qu’une relecture ne peut pas détecter. Cela vaut d’autant plus pour tout ce qui repose sur un chiffre ou un nom.
Pour un document de travail, une application est la solution la plus raisonnable. SozAI, disponible sur iOS, Android et macOS, transforme des enregistrements, des fichiers audio et vidéo ainsi que des liens YouTube en texte avec identification des intervenants, résumés et traduction dans plus de 99 langues, et il faut malgré tout vérifier les citations à l’oreille, comme pour tout résultat automatique.
Quand le texte transcrit est lui-même le produit final, les services de transcription humaine sont la réponse adaptée. Ils coûtent plus cher parce qu’une personne écoute réellement, et c’est exactement ce que vous payez : quelqu’un qui entend le nom et l’écrit correctement, qui sait où la phrase s’arrête vraiment, qui signale le passage réellement inaudible plutôt que de le deviner. Si un client, un tribunal, des archives ou une publication reçoivent le document, ce coût achète quelque chose de bien réel. Si le texte est un outil que vous utilisez pour vous-même afin d’aller plus vite dans l’audio, ce coût achète quelque chose dont vous n’avez pas besoin.
Un deuxième enregistrement vaut mieux qu’une heure de correction
Améliorer la prise de son coûte presque toujours moins cher qu’améliorer le résultat après coup. Dix minutes passées à rapprocher le micro, fermer une fenêtre, éteindre le ventilateur et demander à chacun de parler à son tour font gagner plus de temps qu’une heure de correction de texte, et le résultat est meilleur que celui obtenu par la correction, parce qu’un texte corrigé n’est jamais meilleur que la patience qu’on y a mise jusqu’au bout.
C’est le plus facile à mettre en pratique pour tout ce qui se répète. Si vous enregistrez régulièrement le même type de conversation, une seule fois où vous prêtez attention à l’installation améliore tout ce que vous enregistrerez ensuite. Cela compte le plus pour les entretiens, où le matériau est souvent irremplaçable et où les citations sont tout l’enjeu ; l’essentiel des questions pratiques sur la transcription d’entretiens se ramène à des questions pratiques sur leur enregistrement.
Parfois, il n’y a pas de deuxième chance. La conversation a eu lieu une seule fois, le téléphone était dans une poche, et c’est l’audio dont vous disposez. Dans ce cas, la démarche honnête consiste à ne plus attendre du logiciel qu’il sauve la situation, à prévoir plutôt du temps de correction, ou à confier le travail à une personne. Un audio difficile ne devient pas facile simplement parce que vous en aviez besoin.
Ce qu’il faut attendre en ouvrant le fichier
Attendez-vous à un texte fluide et lisible, avec quelques noms erronés dedans. Attendez-vous à ce que les passages où les gens parlaient en même temps soient maigres, brouillés ou discrètement absents. Attendez-vous à des choix de ponctuation que vous n’auriez pas faits vous-même, et à des étiquettes d’intervenants globalement correctes mais peu fiables aux changements de parole. N’attendez aucun signal, aucun surlignage, aucune marque d’incertitude. Le document aura l’air tout aussi sûr de lui du début à la fin, et il ne sera pas tout aussi correct du début à la fin.
Attendez-vous à ce que les noms propres et les termes spécialisés nécessitent une relecture, quelle que soit la qualité de l’enregistrement. Ils échouent aussi sur un bon audio, simplement moins souvent.
Et gardez l’audio. Un texte transcrit automatiquement ne peut pas se vérifier lui-même, et toutes les vérifications qui comptent passent par l’écoute. Un texte accompagné de son enregistrement est un outil de travail fiable. Un texte dont l’enregistrement a été supprimé est un document que personne ne peut vérifier, vous non plus.

