À retenir
Choisissez le niveau de verbatim avant de taper le moindre mot : le verbatim intégral garde chaque « euh » et chaque faux départ, le verbatim propre garde le sens sans les tics de langage, et une transcription éditée met la grammaire au propre pour la lecture. Choisissez une notation pour les pauses, les chevauchements et les passages inaudibles, notez-la sous forme de légende en haut du document et étiquetez les locuteurs de façon cohérente. À la main, le guide d’histoire orale des bibliothèques de Texas Tech University compte six heures de saisie par heure d’enregistrement ; un guide de cours de Cornell University parle de quatre à six. Une transcription automatique donne un premier jet en quelques minutes ; le travail humain passe de la saisie à la vérification par rapport à l’enregistrement.
Vous avez l’enregistrement. Maintenant, quelqu’un veut une transcription qu’il puisse citer, coder ou rendre, et la première question n’est pas de savoir quelle application utiliser, mais quelle part de la parole vous allez conserver.
Les tics de langage et les faux départs comptent en analyse conversationnelle et dans certains contextes juridiques ; partout ailleurs, ce n’est que du bruit. Cet article passe en revue les trois niveaux de verbatim, la notation qui marque les pauses et les chevauchements, le temps que le travail prend à la main, et ce qu’une transcription automatique réussit ou rate sur un enregistrement réel.
Quelle est la façon la plus simple de retranscrire un entretien ?
Passez d’abord l’enregistrement dans un moteur de reconnaissance vocale, puis corrigez les noms, vérifiez par sondage avec l’audio et ajoutez la notation dont votre projet a besoin : c’est plus rapide que de taper devant une page blanche, et c’est ce que la plupart des gens entendent par « le plus simple ». Taper une heure entière de parole à partir de zéro, mot pour mot, est la voie lente, pas la facile.
Pour un court extrait, notre outil dans le navigateur, retranscrire un entretien en ligne, fait ce premier passage sans compte : envoyez un enregistrement et il transcrit les 5 premières minutes, étiquette chaque tour de parole Speaker A, Speaker B et ainsi de suite avec un horodatage, et détecte automatiquement la langue parmi 99 langues. Les fichiers jusqu’à 25 MB passent tels quels ; les enregistrements plus longs sont coupés à 5 minutes dans le navigateur avant que quoi que ce soit ne soit envoyé. L’audio et la transcription sont supprimés chez le prestataire dès que le résultat revient, et vous disposez de trois aperçus par appareil et par jour.
Cela suffit pour voir si un outil vaut la peine d’être utilisé sur un enregistrement donné. Pour un entretien entier en un seul passage, avec des tours étiquetés de bout en bout et toutes les transcriptions conservées ensuite dans une bibliothèque consultable, l’application SozAI le fait : les 30 premières minutes sont gratuites. Voir comment fonctionne la retranscription d’entretien pour le tableau complet, ou télécharger l’application.
Quelle est la différence entre verbatim et verbatim propre ?
Le verbatim intégral garde chaque mot tel qu’il a été prononcé : les « euh », les faux départs, les mots répétés, les bégaiements et les rires audibles. Le verbatim propre garde les mots et le sens du locuteur mais supprime les tics de langage, les faux départs et les répétitions accidentelles. Une transcription éditée va plus loin et met en ordre la grammaire et la construction des phrases pour que le texte se lise bien, ce qui est précisément la raison pour laquelle elle n’est plus utilisable comme preuve de ce qui a réellement été dit.
- Verbatim intégral : analyse conversationnelle, certains travaux juridiques et probatoires.
- Verbatim propre : la plupart des recherches qualitatives, le journalisme, les études utilisateurs.
- Édité : articles publiés en questions-réponses.
| Niveau | Ce qu’il conserve | Usage typique |
|---|---|---|
| Verbatim intégral | Chaque mot tel que prononcé : tics de langage, faux départs, répétitions, bégaiements, sons audibles | Analyse conversationnelle, certains travaux juridiques et probatoires |
| Verbatim propre | Les mots et le sens du locuteur, tics de langage et faux départs supprimés | La plupart des recherches qualitatives, journalisme, études utilisateurs |
| Édité | Grammaire et ordre des phrases mis au propre pour la lecture | Articles publiés en questions-réponses |
Si la transcription doit alimenter un projet de recherche plutôt qu’une publication, décidez-le avant le premier entretien, pas après le cinquième : changer de niveau en cours de route oblige à refaire les transcriptions précédentes pour les aligner. L’aspect propre à la recherche, le consentement, l’anonymisation et le stockage, est traité dans retranscrire des entretiens pour la recherche.
Comment rédiger la transcription d’un entretien ?
Commencez par une légende : le niveau de verbatim, les symboles que vous utilisez et la manière dont les locuteurs sont étiquetés, écrits en haut du document avant la première ligne de parole. Quiconque code ou cite la transcription plus tard en a besoin, et vous aussi, des semaines après, quand vous aurez oublié ce que (.) devait signifier.
Le système le plus connu pour les transcriptions détaillées vient de Gail Jefferson, exposé dans son Glossary of transcript symbols with an introduction (2004). Comme le résument Clift, Kendrick, Raymond and Robinson (2024), un crochet gauche marque le point où commence une parole qui chevauche, un signe égal relie des paroles sans intervalle entre elles, un nombre entre parenthèses comme (0,5) est un silence chronométré en secondes, et (.) marque une pause trop courte pour être chronométrée. Les sources ne s’accordent pas sur la durée exacte d’une micropause ; si votre légende utilise (.), elle doit donc préciser ce que vous entendez par là.
La plupart des projets d’entretiens n’ont pas besoin de ce niveau de détail et se lisent plus facilement sans lui. Une convention entre crochets couvre ce qui se présente réellement : [inaudible 00:12:31] pour un passage que vous ne distinguez pas, avec un horodatage pour le retrouver ; [crosstalk] quand deux personnes parlent en même temps ; [laughs] et les autres événements non verbaux entre crochets ; et une étiquette de locuteur au début de chaque tour.
| Symbole | Signification | Système |
|---|---|---|
| [ | Point où commence la parole en chevauchement | Jeffersonien |
| = | Paroles enchaînées sans intervalle (latching) | Jeffersonien |
| (0,5) | Silence chronométré, en secondes | Jeffersonien |
| (.) | Pause trop courte pour être chronométrée | Jeffersonien |
| [inaudible 00:12:31] | Passage qu’on ne distingue pas, avec un horodatage | Entre crochets |
| [crosstalk] | Deux personnes parlent en même temps | Entre crochets |
| [laughs] | Son non verbal | Entre crochets |
Au-delà de la notation, les recommandations du UK Data Service sur la transcription indiquent qu’une transcription doit porter un identifiant unique, adopter une mise en page uniforme dans tout le projet, utiliser des étiquettes de locuteur pour les tours de parole et conserver les sauts de ligne : de petites choses, mais ce sont elles qui permettent de retrouver et de comparer les transcriptions plus tard au lieu de toutes les relire.
Les étiquettes de locuteur sont des noms que le logiciel de transcription ne peut pas connaître : attendez-vous à Speaker A et Speaker B, que vous renommerez à la main une fois que vous saurez qui est qui. Étiqueter les locuteurs de façon cohérente explique comment le faire sur tout un projet sans que les noms dérivent d’un fichier à l’autre.
Anonymisez au fur et à mesure, pas après : remplacez les noms et les détails identifiants par des marqueurs cohérents comme [Participant 2] ou [city] directement dans la transcription, et conservez dans un fichier séparé la table qui relie les marqueurs aux vrais noms. Enregistrer une personne nécessite son consentement presque partout, et un comité d’éthique de la recherche voudra généralement ce consentement par écrit ; transcrire l’enregistrement ne change rien à cette exigence.
Combien de temps faut-il pour retranscrire un entretien ?
À la main, comptez en heures, pas en minutes. Le guide d’histoire orale des bibliothèques de Texas Tech University indique que même les transcripteurs expérimentés travaillent en général à six heures de saisie pour chaque heure d’audio. Un guide de cours de Cornell University donne un chiffre plus bas, de quatre à six heures par heure d’enregistrement ; l’écart tient surtout à la netteté de l’audio et à la quantité de notation ajoutée en chemin.
Une transcription automatique change l’endroit où passe le temps plutôt qu’elle ne le fait disparaître. Le brouillon revient en quelques minutes ; il reste à l’écouter en le suivant sur l’enregistrement, corriger les noms et les termes techniques, rectifier qui a dit quoi là où les étiquettes se sont croisées, et ajouter la notation dont le projet a besoin. Pour un entretien d’une heure, cela reste un vrai travail, simplement d’une autre nature ; combien de temps prend réellement une transcription le détaille davantage.
ChatGPT peut-il retranscrire un entretien ?
Qu’un chatbot puisse transformer un fichier audio en texte dépend du produit, mais la transcription d’un entretien demande plus que du texte : des horodatages auxquels on peut revenir et des tours de parole fiables, ce qu’un moteur de transcription est conçu pour produire. Le chatbot trouve sa place après cette étape, pour mettre en forme, résumer ou reformater une transcription que vous avez déjà.
Dans tous les cas, un texte automatique doit être vérifié par rapport à l’enregistrement avant d’être cité, et cette vérification est la part qu’aucun outil ne supprime.
Le degré de vérification nécessaire varie beaucoup d’un moteur à l’autre. La précision de la transcription par IA explique à quoi s’attendre et où les erreurs tendent à se concentrer.
Ce qu’une vraie transcription automatique rate
Une transcription automatique est un brouillon, et la meilleure façon de comprendre ce que cela veut dire est d’en lancer une et de la lire en regard de l’enregistrement. Le 2 octobre 2026, nous avons fait exactement cela, sur les 5 premières minutes d’un enregistrement public que chacun peut vérifier à partir de cet article.
Nous avons passé le moteur qui fait tourner l’outil d’entretien de SozAI sur les 5 premières minutes (300 secondes) du podcast Houston We Have a Podcast du NASA Johnson Space Center, épisode 180, « Artemis Mission Management », avec l’animateur Gary Jordan et l’invité Mike Sarafin ; c’est une œuvre de la NASA, donc non protégée par le droit d’auteur. Il a rendu 778 mots, détecté l’anglais et trouvé 2 locuteurs. Les premières lignes, telles que le moteur les a rendues :
[00:00] Speaker A: Houston, we have a podcast. Welcome to the official podcast of the NASA Johnson Space Center, episode 180, Artemis Mission Management. I'm Gary Jordan, and I'll be your host today. [01:19] Speaker B: T-minus five seconds and counting. Mark. [01:22] Speaker A: Launch commit lights are correct. There she goes. Houston. We have a podcast. Mike Serafin, thanks for coming on Houston, We Have a Podcast today. [01:36] Speaker B: Thank you. It's a pleasure to be here to talk about these exciting Artemis missions we have ahead of us. Yeah, right? [01:43] Speaker A: Returning to the Moon. Not a bad thing to be a part of.
Trois choses dans ces seuls cinq tours ont demandé un passage humain. Le compte à rebours de lancement à 01:19 et « Launch commit lights are correct. There she goes. » à 01:22 sont des extraits audio d’archives de lancement insérés dans le podcast, et non l’animateur ou l’invité qui parlent ; le moteur les a pourtant étiquetés Speaker B et Speaker A. « Yeah, right? » à la fin du tour de 01:36 est en réalité l’animateur qui reprend la conversation ; cela appartient au début du tour suivant, pas à la fin de celui de l’invité. Et le nom de l’invité ressort sous la forme Serafin, alors que le générique de l’épisode écrit Sarafin.
Un tour plus tardif montre à quoi sert le verbatim propre. La sortie du moteur à 02:51 donne : « Yes, so you’re, you’re right in that I lived in the operations realm for 22 of my 27 years in, in my NASA career. » Un passage en verbatim propre en fait : « You’re right in that I lived in the operations realm for 22 of my 27 years in my NASA career. » Le verbatim intégral garderait les répétitions exactement comme elles sont sorties ; le moteur, si quoi que ce soit, a tendance à les conserver : il a gardé la plupart des répétitions et faux départs sur tout le fichier (« you’re, you’re right », « in, in my NASA career », « That’s, that’s quite a number of »), ce qui rapproche sa sortie du verbatim intégral plutôt que du verbatim propre. Si un projet exige du verbatim propre, prévoyez un passage d’édition quel que soit le moteur qui produit le brouillon.

