Aperçu gratuit
Transcription d'entretien en ligne
Déposez l'enregistrement d'un entretien et récupérez les 5 premières minutes en texte, avec l'intervieweur et le participant identifiés séparément. Sans compte, détection automatique de la langue, fichier supprimé après traitement.
- Aperçu gratuit : les 5 premières minutes
- Supprimé après traitement
- Sans inscription
Déposez un enregistrement d'entretien ici
ou
Compatible avec MP3, M4A, WAV, OGG/OPUS, AAC, FLAC et WEBM
Ajouter des fichiers SRT (2+)
Transcription
Comment ça marche
Transcription d'entretien en ligne en trois étapes
Déposez l'audio de l'entretien
Enregistrement au téléphone, export audio Zoom ou fichier de dictaphone. Le navigateur garde les 5 premières minutes.
Les interlocuteurs sont identifiés
Intervieweur et participant reçoivent des étiquettes distinctes, avec horodatage. Langue détectée automatiquement.
Reprenez le texte dans votre analyse
Téléchargez un .txt ou copiez le texte. L'entretien complet se poursuit dans l'application.
De l'enregistrement au verbatim exploitable
Entretien de recherche pour un mémoire, source pour un article, entretien utilisateur pour un produit : l'enregistrement ne sert vraiment qu'une fois devenu du texte, que l'on peut coder, citer et fouiller. À la main, il faut compter quatre à six heures de travail par heure d'audio. Cette page vous montre ce que donne la version automatique sur votre propre enregistrement, à partir des 5 premières minutes, avant de confier le reste à l'application.
Qui dit quoi
Un entretien est un enregistrement à deux voix, et la transcription le restitue : chaque prise de parole est étiquetée Speaker A ou Speaker B avec un horodatage, si bien que les questions de l'intervieweur et les réponses du participant restent distinctes. Une table ronde à trois fonctionne de la même façon. Les étiquettes restent cohérentes d'un bout à l'autre du texte — le Speaker B de la première minute est le même à la quatrième —, et c'est précisément ce qui rend possible un codage par répondant.
Ce que fait l'aperçu
Votre navigateur lit le fichier et n'en garde que les 5 premières minutes : les enregistrements plus longs sont coupés localement, et cette portion est réencodée en WAV mono 16 kHz, de sorte que le reste n'est jamais envoyé. L'audio part par connexion chiffrée vers le moteur de transcription utilisé par l'application SozAI (AssemblyAI). La langue est détectée automatiquement parmi 99 langues, la ponctuation est ajoutée et les mots de remplissage sont légèrement nettoyés : on obtient une transcription lisible plutôt qu'un verbatim strict. Une fois le texte remis, l'audio et la transcription sont supprimés chez le prestataire.
Formats et limites
- M4A, MP3, WAV, AAC, FLAC, OGG/OPUS, WEBM, jusqu'à 25 Mo tels quels ; les enregistrements plus longs sont d'abord ramenés à 5 minutes dans le navigateur (jusqu'à 30 Mo sur ordinateur, 12 Mo sur téléphone).
- Trois aperçus par appareil et par jour, sans compte.
- Un appel téléphonique enregistré via le haut-parleur comme un entretien mené à la table d'un café se transcrivent tous les deux, avec davantage d'erreurs sur la voix la plus faible.
Consentement et confidentialité
Enregistrer une personne suppose son consentement à peu près partout, et les comités d'éthique de la recherche l'exigent généralement par écrit. La transcription ne change rien à cette règle. Si votre protocole encadre le lieu de traitement de l'audio, sachez que l'aperçu est traité par un prestataire situé aux États-Unis, sauf si le site a été basculé sur son point d'accès européen ; pour tout ce qui relève d'un accord de traitement des données, passez par les paramètres de projet de l'application.
L'entretien en entier
Un entretien d'une heure représente douze fois la durée d'un aperçu. L'application SozAI le transcrit en une seule passe, conserve l'identification des interlocuteurs, produit une synthèse des thèmes abordés et range chaque entretien dans une bibliothèque consultable dans son ensemble. Importez depuis Dictaphone, Fichiers ou un enregistrement partagé. Les 30 premières minutes sont gratuites.
Réponses
Transcription d'entretien — questions fréquentes
L'outil distingue-t-il les interlocuteurs ?
Oui. Chaque prise de parole est étiquetée Speaker A, Speaker B, etc., avec un horodatage, et les étiquettes restent cohérentes sur toute la transcription. Les prénoms ne sont pas devinés : vous renommez les étiquettes dans votre document ou dans l'application.
Est-ce un verbatim intégral ?
C'est une transcription nettoyée : la ponctuation est ajoutée et les hésitations évidentes sont retirées pour que le texte se lise naturellement. Si votre méthode exige chaque « euh » et chaque faux départ, signalez-le dans votre protocole et prévoyez d'en rétablir une partie à l'oreille.
Quelles langues sont prises en charge ?
La langue est détectée automatiquement parmi 99 langues. Un entretien mené dans une langue avec quelques mots empruntés à une autre est transcrit dans la langue dominante.
Quelle durée d'enregistrement puis-je tester ?
N'importe quelle durée, mais vous obtenez les 5 premières minutes. Les fichiers jusqu'à 25 Mo sont envoyés entiers ; les enregistrements plus longs sont d'abord coupés à 5 minutes dans votre navigateur (jusqu'à 30 Mo sur ordinateur, 12 Mo sur téléphone).
Où l'audio est-il traité, et est-il conservé ?
Il part par connexion chiffrée vers le prestataire de transcription (AssemblyAI, région États-Unis sauf si le point d'accès européen est activé), y est transcrit, puis supprimé avec la transcription une fois celle-ci remise. Ce site ne conserve ni l'un ni l'autre.
Est-ce acceptable au regard de l'éthique de la recherche ?
Cela dépend des règles de votre comité sur le recours à un tiers pour le traitement. L'aperçu sert à vérifier rapidement votre propre enregistrement. Pour des entretiens couverts par un accord de traitement des données, consultez la page sécurité de SozAI et utilisez l'application, où l'enregistrement complet est traité sous un seul compte.
Puis-je transcrire un appel téléphonique ou une réunion Zoom enregistrée ?
Oui, dès lors que vous disposez d'un fichier audio : Zoom et Teams peuvent enregistrer une piste audio seule (.m4a), et les enregistreurs d'appels produisent du MP3 ou du M4A. Deux voix qui partagent le même canal sont malgré tout séparées.
Quelle est la précision ?
Sur un enregistrement calme, micro proche, la transcription est proche du verbatim. Un téléphone posé sur la table d'un café entre deux personnes perd généralement quelques mots de la voix la plus faible. L'identification des interlocuteurs est la plus fiable quand les voix se distinguent nettement.
L'enregistrement complet, pas seulement les premières minutes
Enregistrez ou importez sans limite de durée dans l'application : identification des locuteurs, horodatage, résumé et traduction en plus de 100 langues.
Gratuite sur iOS et Android. 30 minutes de transcription incluses, sans carte bancaire.
Outils gratuits
Plus d’outils gratuits
YouTube Transcript Generator · SozAI vs Other Tools · Alternatives to Popular Apps