Qu’est-ce qu’une transcription ? — Définition, exemples et méthodes (2026)

Un guide francophone concis sur le mot « transcription » : ce qu’il signifie, d’où il vient (latin transcribere), comment il diffère du « transcript », quels sont ses quatre sens (linguistique, biologie, droit, musique) et comment les outils IA modernes comme Whisper automatisent la mise à l’écrit de la parole.

Définition + étymologie4 sens désambiguïsésWhisper FLEURS FR ~4–5 % WERZéro argumentaire commercial

Supported formats:

MP3WAVM4AMP4FLACOGG

Réponse courte : que veut dire transcription ?

La transcription est la conversion d’un enregistrement audio ou vidéo en texte écrit — l’action de mettre à l’écrit ce qui a été prononcé oralement. Le mot vient du latin transcribere (« écrire d’un support à un autre »), composé de trans- (« au-delà ») et scribere (« écrire »). En linguistique, elle désigne le processus systématique de restitution de la parole, souvent avec horodatages et étiquettes de locuteurs ; le document produit est appelé transcription ou transcript. Elle sert aux entretiens, réunions, cours, podcasts, procédures judiciaires et études qualitatives, et peut être réalisée manuellement, automatiquement par IA (OpenAI Whisper) ou en mode hybride.

Réponse courte : que veut dire transcription ?

Transcrire, c’est écouter un enregistrement (audio ou vidéo) et écrire ce qui y est dit. La transcription peut être fidèle mot à mot (verbatim), reformulée pour la lisibilité (synthétique), ou coupée et réécrite pour publication (éditée). Dans tous les cas, l’objectif est le même : rendre la parole lisible, citable et consultable.

On distingue en pratique le processus (la transcription elle-même) et le résultat (le document écrit obtenu, parfois appelé « transcript » en contexte professionnel). Ce résultat sert aux journalistes, chercheurs, avocats, podcasteurs, étudiants et à toute personne qui doit documenter la parole avec précision.

Définition de transcription et transcript — l’origine du mot

Le mot transcription vient du latin transcribere, formé de trans- (« au-delà », « d’un côté à l’autre ») et de scribere (« écrire »). Littéralement : « écrire d’un support à un autre » ou « reporter par écrit ». Historiquement, le terme désignait la copie d’un texte manuscrit ; en français moderne, il désigne surtout la mise à l’écrit d’un contenu oral.

Le mot « transcript » est un emprunt à l’anglais, utilisé dans les milieux tech, académiques internationaux et audiovisuels pour désigner le document texte issu de la transcription. En français normatif, on préférera parler de « transcription » (le résultat) ou de « retranscription ». Les deux termes cohabitent aujourd’hui, notamment dans les interfaces d’outils IA.

Un document de transcription typique contient : un en-tête (date, lieu, contexte), des étiquettes de locuteurs (par ex. « Journaliste », « Invité »), des horodatages réguliers et le texte retranscrit. Les transcriptions académiques ajoutent des conventions pour les pauses, chevauchements et l’intonation.

Transcription en 4 contextes — audio, biologie, juridique, musique

Le mot « transcription » a plusieurs sens selon la discipline. Cette page traite exclusivement le sens linguistique (mise à l’écrit de la parole). Pour les autres sens, nous renvoyons aux sources francophones de référence :

ContexteDéfinitionExemple / source
Linguistique / audio
← sujet de cette page
Conversion d’un enregistrement audio ou vidéo en texte écrit. C’est le domaine dans lequel opère VexaScribe.Transcription d’entretien, notes de cours, sous-titres. Transcrire un audio
Biologie / génétiqueSynthèse d’ARN messager à partir d’une matrice d’ADN — étape fondamentale de l’expression génétique dans la cellule.ARN polymérase, transcription de l’ADN. Futura-Sciences
JuridiqueCopie intégrale d’un acte sur un registre officiel — état civil, hypothèques, publicité foncière.Transcription d’un acte de mariage, transcription hypothécaire. Dictionnaire juridique
Musique / éditionAdaptation d’une œuvre pour un instrument différent, ou notation écrite d’une œuvre entendue (relevé musical).Transcription pour piano d’une symphonie, relevé d’un solo de jazz. Larousse

Toutes les sections suivantes de cette page traitent exclusivement le sens linguistique : la mise à l’écrit de la parole.

Transcription ou retranscription ? — la distinction clarifiée

En français, les deux mots sont largement synonymes. Ils désignent tous deux la mise à l’écrit d’un contenu oral. La différence est essentiellement d’usage :

TermeNuance d’usageContexte typique
TranscriptionTerme générique, neutre. Couvre aussi bien les processus manuels que les outils IA. Utilisé dans la tech, l’audiovisuel et l’enseignement.« Lancer la transcription automatique d’un podcast. »
RetranscriptionSouvent utilisé pour souligner le caractère minutieux, manuel ou fidèle du travail. Fréquent en recherche qualitative, journalisme d’enquête, comptes rendus officiels.« Retranscrire les entretiens de terrain pour l’analyse thématique. »

Verbes associés : transcrire et retranscrire. Le résultat est dans les deux cas un document texte qu’on peut appeler « transcription », « retranscription » ou « transcript » selon le contexte.

Types de transcription : verbatim, synthétique, éditée

Selon l’usage, on choisit un niveau de détail différent. Les trois formes les plus courantes :

TypeCe qui est conservéUsage typique
Verbatim (mot à mot)Tout : hésitations (euh, hmm), pauses, répétitions, faux-départs, fautes de grammaire, accents.Procédures judiciaires, analyse conversationnelle, étude de marché, recherche qualitative.
Synthétique (lissée)Le sens et les affirmations sont préservés ; la grammaire est corrigée, les hésitations supprimées, les phrases achevées.Entretiens qualitatifs, journalisme, comptes rendus de réunion, publications académiques.
Éditée (raccourcie)Seules les idées essentielles ; digressions et répétitions supprimées, style retravaillé pour publication.Interviews publiées en presse, notes de podcast, synthèses pour dirigeants.

Le choix a des conséquences sur le temps de travail : le verbatim exige typiquement 4 à 6 fois la durée de l’audio, le synthétique 3 à 4 fois, l’édité davantage encore mais avec un résultat plus court.

Exemple de transcription (avec horodatages et locuteurs)

Voici à quoi ressemble un transcript d’entretien type : horodatages, étiquettes de locuteurs et restitution fidèle. Cet exemple simule un échange sur la transcription IA en français.

Formats d’export :
TXTDOCXSRT
00:00:03Journaliste:Pouvez-vous nous présenter vos travaux actuels ?
00:00:07Chercheuse:Depuis 2024, nous évaluons les modèles de reconnaissance vocale pour le français — en particulier pour les entretiens et les cours magistraux.
00:00:18Journaliste:Et êtes-vous satisfaite des résultats ? Est-ce suffisant pour le quotidien académique ?
00:00:24Chercheuse:Sur audio propre, oui — le taux d’erreur avoisine 4 à 5 %. Sur les accents régionaux ou le vocabulaire technique, on doit repasser derrière.

Normes de transcription — ICOR, GAT et pratiques francophones

Dans le monde académique francophone, plusieurs conventions coexistent pour transcrire la parole avec précision :

ICOR — laboratoire ICAR (ENS Lyon)

Conventions développées par le laboratoire ICAR (Interactions, Corpus, Apprentissages, Représentations) de l’ENS de Lyon, notamment par Véronique Traverso (2007). Standard de fait en analyse conversationnelle francophone : notation des pauses (0.3), chevauchements ([ ]), intonation (↑ ↓) et allongements (:).

GAT 2 — référence germanophone largement citée

Gesprächsanalytisches Transkriptionssystem 2 (Selting et al., 2009). Bien que développé pour l’allemand, il est cité dans la littérature francophone comme référence multilingue en linguistique interactionnelle.

Pratiques journalistiques et professionnelles

Hors du cadre académique, on se contente de règles simples : étiquettes de locuteurs uniformes, horodatages toutes les 30 à 60 secondes, hésitations supprimées ou conservées selon le contexte, citations exactes entre guillemets.

Comment faire une transcription — méthodes manuelle vs IA

Deux approches principales pour transcrire un contenu audio ou vidéo :

MéthodeTemps de travailPrécision typique
Manuelle (traitement de texte + lecteur audio)Environ 4 heures de travail par heure d’audio pour un transcripteur expérimenté (jusqu’à 6 h en verbatim strict).99 %+ après relecture ; grande maîtrise de la mise en forme et des noms propres.
IA (VexaScribe / Whisper)5 à 10 minutes pour une heure d’audio, incluant horodatages et détection des locuteurs.~95–96 % sur audio propre en français (Whisper FLEURS FR ~4–5 % WER) ; relecture rapide recommandée.

Un flux hybride — pré-transcription IA puis relecture humaine — combine aujourd’hui vitesse et précision. C’est le standard pour la plupart des usages professionnels.

Transcription audio — la définition technique

Sur le plan technique, la transcription audio automatique repose sur des modèles neuronaux de type encodeur-décodeur(architecture Transformer). L’exemple le plus connu est OpenAI Whisper, entraîné sur 680 000 heures d’audio multilingue, avec des performances de l’ordre de 4 à 5 % d’erreur de mots en français (benchmark FLEURS).

Étapes du pipeline :

  1. Prétraitement audio — segmentation en fenêtres de 30 secondes et conversion en spectrogramme de Mel.
  2. Encodeur acoustique — un Transformer analyse le spectrogramme et produit une représentation dense.
  3. Décodeur linguistique — un second Transformer génère le texte en combinant probabilités acoustiques et linguistiques.
  4. Post-traitement — ajout des horodatages, ponctuation, casse, et éventuellement diarisation (identification des locuteurs).

Pour l’implémentation concrète, voir nos pages transcrire un audio et vidéo en texte.

Précision de la transcription automatique en français

Le taux d’erreur de mots (Word Error Rate, WER) mesure combien de mots sont incorrectement transcrits. Plus il est faible, meilleur est le modèle. Les valeurs ci-dessous proviennent du benchmark FLEURS (Radford et al., 2022 — arXiv:2212.04356, tableau 5) pour OpenAI Whisper Large-v2/v3 :

LangueWER (FLEURS)
Français~4–5 %
Anglais~4,2 %
Espagnol~4 %
Allemand~4,5 %
Italien~5 %
Portugais~5 %
Néerlandais~6 %

Le français figure parmi les langues les mieux traitées. En conditions réelles, la précision baisse avec les accents régionaux (québécois, francophone d’Afrique de l’Ouest), les bruits de fond, le vocabulaire technique ou plusieurs locuteurs simultanés — une brève relecture dans l’éditeur reste recommandée.

Questions fréquentes

Qu’est-ce qu’une transcription simplement expliqué ?

Une transcription consiste à convertir un enregistrement audio ou vidéo en texte écrit. Concrètement, on écoute l’enregistrement et on note fidèlement (mot à mot ou de façon synthétique) ce qui a été dit. Le résultat est un document texte souvent appelé « transcript » en contexte professionnel. La transcription sert aux entretiens, réunions, cours, podcasts, études qualitatives et sous-titres. En linguistique, c’est la méthode centrale pour rendre la parole analysable.

Quelle est la différence entre transcription et retranscription ?

En français courant, « transcription » et « retranscription » sont largement synonymes : les deux désignent la mise à l’écrit d’un contenu oral. La nuance existe surtout dans l’usage : « retranscription » insiste souvent sur le caractère minutieux ou manuel du travail (recherche qualitative, journalisme, comptes rendus), tandis que « transcription » est le terme générique couvrant aussi les processus automatiques par IA. Techniquement, les deux produisent le même type de document.

Comment faire une transcription ?

Deux méthodes principales : manuelle et automatique. En manuel, on ouvre un lecteur audio (VLC, oTranscribe) et un traitement de texte, on écoute par courts segments et on tape — compter environ 4 heures de travail par heure d’audio. En automatique, on téléverse le fichier dans un outil comme VexaScribe basé sur Whisper : la transcription est prête en 5 à 10 minutes avec horodatages et étiquettes de locuteurs, à relire avant publication.

Qu’est-ce que la transcription verbatim ?

Verbatim (du latin « mot pour mot ») désigne une transcription qui restitue intégralement la parole : hésitations (euh, hmm), répétitions, faux-départs, fautes de grammaire, silences. Elle est utilisée en recherche qualitative, en analyse conversationnelle, dans les procédures judiciaires et en étude de marché — chaque nuance compte. Pour la publication (presse, livre), on lui préfère souvent une version synthétique ou éditée, plus lisible.

Peut-on avoir un exemple de transcription ?

Un exemple type contient des horodatages, des étiquettes de locuteurs et le texte transcrit. Par exemple : « [00:00:03] Journaliste : Pouvez-vous nous présenter vos travaux ? [00:00:07] Chercheuse : Bien sûr. Depuis 2024, nous évaluons les modèles de reconnaissance vocale pour le français. » Les transcriptions académiques ajoutent des conventions pour les pauses, les chevauchements et l’intonation. Plus bas sur cette page, un exemple complet en quatre tours de parole illustre le format standard.

Transcription — c’est quoi exactement ?

La transcription est l’action de convertir de la parole (audio ou vidéo) en texte écrit. Le mot vient du latin « transcribere » (trans- « au-delà » + scribere « écrire »), littéralement « écrire d’un support à un autre ». En pratique moderne, c’est ce que font les journalistes après un entretien, les étudiants après un cours, les chercheurs après une session d’enquête ou les outils IA comme VexaScribe qui traitent des heures d’audio en quelques minutes.

Quelle est la définition de « transcript » en français ?

« Transcript » est un emprunt à l’anglais, de plus en plus utilisé en milieu professionnel francophone (tech, business, académique international) pour désigner le document texte issu d’une transcription. En français normatif, on dit plutôt « transcription » (le résultat) ou « retranscription ». Le terme « transcript » n’a pas d’entrée dans le Dictionnaire de l’Académie française mais figure dans les glossaires spécialisés du numérique et de l’audiovisuel.

Qu’est-ce qu’on appelle transcription en linguistique ?

En linguistique, la transcription désigne la mise à l’écrit systématique d’un discours oral, avec ou sans conventions particulières (pauses, intonation, chevauchements). Attention à ne pas confondre avec les trois autres sens du mot : en biologie moléculaire, la transcription est la synthèse d’ARN à partir d’ADN ; en droit, c’est la copie d’un acte sur un registre officiel (état civil, hypothèques) ; en musique, c’est l’adaptation d’une œuvre pour un autre instrument. Cette page traite exclusivement le sens linguistique.

Quelle est la précision d’une transcription automatique française ?

Sur le benchmark FLEURS, OpenAI Whisper Large-v3 atteint un taux d’erreur de mots (WER) d’environ 4 à 5 % en français (Radford et al., 2022 — arXiv:2212.04356, tableau 5). Autrement dit, sur 100 mots prononcés, 4 à 5 sont mal reconnus en moyenne. La précision diminue avec les accents régionaux (québécois, francophone d’Afrique de l’Ouest), les bruits de fond, le vocabulaire technique ou plusieurs personnes qui parlent en même temps. Sur un audio studio propre, la précision dépasse souvent 96 %.

Quelle est la définition technique de la transcription audio ?

Techniquement, la transcription audio automatique repose sur des modèles neuronaux de type encodeur-décodeur (architecture Transformer). L’audio est découpé en segments courts (30 secondes), converti en spectrogramme de Mel, puis analysé par un encodeur acoustique. Un décodeur linguistique génère ensuite le texte, en combinant probabilités acoustiques et probabilités linguistiques. Les modèles multilingues comme Whisper sont entraînés sur des centaines de milliers d’heures d’audio dans des dizaines de langues, dont le français.

Whisper est une marque d’OpenAI. Les valeurs WER en français reposent sur le benchmark FLEURS (Radford et al., 2022 — arXiv:2212.04356, tableau 5). Les résultats réels dépendent de la qualité audio, de l’accent et du vocabulaire technique. Étymologie et désambiguïsation contextuelle basées sur Larousse (larousse.fr), Le Robert (dictionnaire.lerobert.com), Dictionnaire de l’Académie française (dictionnaire-academie.fr) et Futura-Sciences (futura-sciences.com).