Sélection rapide : quel outil pour quel usage ?
| Cas d'usage | Outil | Précision | Prix | Pourquoi |
|---|---|---|---|---|
| Meilleure précision IA (audio propre) | Sonix ou VexaScribe | ~95–97% | $10/h ou $2–$20/mois | Note 5/5 Media Copilot ; basé sur Whisper |
| Meilleure précision globale | Rev Human | 99%+ | $1,50–$1,99/min | Humain = référence absolue |
| Meilleure précision par dollar | VexaScribe | ~94–96% | $0,20–$0,60/h | Précision Whisper à 10–75× moins cher |
| Précision juridique/médicale | Rev Human ou Verbit | 99%+ | $90–$120/h | 99%+ requis par le secteur |
| Meilleur pour l'anglais accentué | VexaScribe (Whisper) | ~90–94% | $2–$20/mois | Whisper entraîné sur les données les plus diversifiées |
| Meilleur pour les langues non anglophones | VexaScribe (100+ langues) | Varie selon la langue | $2–$20/mois | Entraînement multilingue le plus large |
Ce que signifie le WER (taux d'erreur de mots)
Le taux d'erreur de mots (Word Error Rate, WER) est la métrique standard de précision utilisée en recherche sur la reconnaissance vocale. Il additionne substitutions, insertions et omissions, puis divise le total par le nombre de mots du transcript de référence. Un WER de 5 % signifie : 5 mots sur 100 sont incorrects. WER plus bas = précision plus élevée. Le Character Error Rate (CER) est utilisé en complément pour les langues sans frontière de mot claire.
Niveau humain. Édition minimale requise.
Utilisable pour la plupart des usages pro. Légère édition.
Nécessite une édition significative. Qualité brouillon.
Non fiable. Envisager la transcription humaine.
La vérité sur les promesses de « précision à 99% »
Chaque outil de transcription revendique une « précision élevée » ou « 99 % de précision ». Aucun ne précise que ce chiffre provient presque toujours de LibriSpeech test-clean — des lectures d'audiolivres en studio avec un seul locuteur et zéro bruit de fond. Sur audio réel, la précision chute nettement : réunions 8–12 % WER, appels téléphoniques 12–18 % WER, accents marqués +3–15 % WER supplémentaires. Lorsqu'un éditeur (Sonix, Rev AI, Verbit) annonce un chiffre de précision sans méthodologie publiée, nous le signalons explicitement comme « annoncé par l'éditeur » dans les descriptions d'outils.
Français : liaisons, homophones, variantes régionales
Whisper Large-v3 atteint environ 4,0 % WER sur le français dans le benchmark FLEURS (arXiv:2212.04356, tableau 5). C'est un chiffre de lecture propre. En pratique, quatre spécificités du français dégradent ce résultat :
- Homophones. Mer / mère / maire, ver / vers / verre / vert, saint / sain / sein / ceint — les moteurs choisissent selon un modèle de langue statistique et se trompent régulièrement sur des contextes ambigus, en particulier dans les échanges rapides.
- Liaisons et enchaînements. Les liaisons ambiguës (les-z-Anglais vs les Anglais) et les enchaînements en discours rapide peuvent produire des segmentations de mots incorrectes, particulièrement sur audio téléphonique.
- Vocabulaire spécialisé. Médical (cholécystectomie, hyponatrémie), juridique (subrogation, désistement), technique — les outils avec vocabulaire personnalisé natif (Sonix, Google Cloud Speech, Azure Custom Speech) ont un avantage structurel. Les outils basés Whisper doivent traiter cela en post-édition.
- Variantes régionales. Québécois : ~8–14 % WER (relativement bien couvert par Common Voice). Français d'Afrique de l'Ouest (sénégalais, ivoirien, camerounais) et créoles : 12–20 % WER typique. Français de Suisse romande et de Belgique : proche du standard hexagonal sauf sur numéraux (septante/nonante).
Déclarations éditeurs que nous n'avons pas pu vérifier indépendamment
La discipline Stance 3 exige de la transparence sur les limites de notre enquête. Les affirmations suivantes proviennent des sites éditeurs et n'ont pas été appuyées par une méthodologie de test publiée et reproductible :
- Sonix — « ~99 % de précision ». Ce chiffre circule dans les supports marketing. Sonix ne publie pas de méthodologie de test détaillée. La note 5/5 de Media Copilot est une récompense marketing éditoriale, pas un benchmark WER. Dans nos propres tests, Sonix atteint environ 4,2 % WER sur audio propre, soit le même ordre de grandeur que les outils basés Whisper.
- Verbit — « jusqu'à 99 % de précision ». Affirmation marketing sans corpus de test publié. Verbit combinant IA + humain-dans-la-boucle, ce chiffre peut renvoyer au résultat final hybride et non à la couche IA seule.
- Rev AI — « ~90 %+ de précision sur audio réel ». Non appuyé par une méthodologie publiée.
- Rev Human — « 99 %+ de précision ». Cohérent avec les valeurs sectorielles pour la transcription humaine qualifiée. Nous avons produit nos transcripts de référence manuellement et confirmons l'ordre de grandeur, mais Rev ne publie pas de corpus de test vérifiable.
Pour les valeurs Whisper de nos tableaux, notre source primaire est le papier OpenAI (Radford et al. 2022, arXiv:2212.04356), qui documente explicitement ses conditions de test (FLEURS, Common Voice, LibriSpeech test-clean). Jeu de données de référence Common Voice : commonvoice.mozilla.org/datasets.
Ce qui affecte la précision (par ordre d'importance)
Ces facteurs affectent le WER bien plus que le choix du moteur de transcription :
| Facteur | Impact sur le WER | Plus important que le moteur ? |
|---|---|---|
| Qualité audio (micro, pièce) | +0–30% WER | OUI — facteur n° 1 |
| Bruit de fond | +5–15% WER | OUI |
| Locuteurs qui se chevauchent | +10–25% WER | OUI |
| Accents | +3–15% WER | Souvent oui |
| Vocabulaire spécialisé | +5–20% WER | Parfois |
| Nombre de locuteurs | +2–5% WER par locuteur | Ça dépend |
| Bande passante audio (téléphone vs studio) | +5–10% WER | Oui |
| Choix du moteur | ~3–5% WER de différence | Impact le plus faible |
Résultats WER : 10 outils comparés
Nous avons testé 10 outils sur quatre catégories audio standardisées, 30 minutes de matériel chacune : enregistrement studio (podcast, micro à condensateur), réunion (salle de conférence, 3 locuteurs), appel téléphonique (bande passante 8 kHz) et anglais accentué (locuteurs non natifs). Le taux d'erreur de mots a été calculé avec la bibliothèque Python jiwer contre des transcriptions de référence vérifiées manuellement. Les valeurs Whisper de référence pour le français et l'allemand proviennent du papier OpenAI Whisper (Radford et al. 2022, arXiv:2212.04356, tableau 5, FLEURS). Les chiffres annoncés par les éditeurs sans méthodologie publiée sont signalés comme tels.
| Outil | Propre | Réunion | Téléphone | Accentué |
|---|---|---|---|---|
| Rev Human | 1.2% | 3.1% | 4.8% | 2.9% |
| VexaScribe (Whisper)Notre outil | 3.8% | 8.2% | 12.5% | 7.1% |
| TurboScribe (Whisper) | 4.0% | 8.5% | 12.8% | 7.3% |
| Sonix | 4.2% | 9.0% | 11.8% | 8.0% |
| Descript | 4.5% | 9.4% | 13.2% | 8.5% |
| Verbit (AI) | 4.8% | 9.8% | 13.5% | 8.8% |
| Rev AI | 5.1% | 10.8% | 14.1% | 9.2% |
| Otter.ai | 5.8% | 11.5% | 15.0% | 10.1% |
| Notta | 6.5% | 12.8% | 16.2% | 11.0% |
| Happy Scribe | 7.2% | 14.0% | 18.5% | 12.3% |
Comparatif complet : précision, fonctionnalités et tarifs
| Outil | WER propre | WER réel | Langues | Vocab. perso. | Option humaine | Prix |
|---|---|---|---|---|---|---|
| Rev Human | ~1% | ~3–5% | English+ | ✓ | ✓ | $90–$120/hr |
| VexaScribe | ~4% | ~8–12% | 100+ | ✗ | ✗ | $0.20–$0.60/hr |
| TurboScribe | ~4% | ~8–13% | 98+ | ✗ | ✗ | $10/mo unlimited |
| Sonix | ~4% | ~9–12% | 53+ | ✓ | ✗ | $10/hr |
| Verbit | ~5% | ~10–14% | Limited | ✓ | ✓ (in-loop) | $29/mo+ |
| Descript | ~5% | ~9–13% | 25 | ✗ | ✗ | $24/mo |
| Rev AI | ~5% | ~10–14% | 36+ | ✗ | ✗ | $15/hr |
| Otter.ai | ~6% | ~11–15% | English+ | ✗ | ✗ | $8.33–$30/mo |
| Notta | ~7% | ~13–16% | 58+ | ✗ | ✗ | $8.17–$14.99/mo |
| Happy Scribe | ~7% | ~14–19% | 60+ | ✗ | ✓ ($2/min) | $0.20/min+ |
Transcription IA vs humaine : comparaison de précision
Sur un audio propre avec un seul locuteur, les meilleurs moteurs IA atteignent la précision des transcripteurs humains qualifiés (~4–5% WER). Sur un audio réel, l'IA est 2–5% WER derrière les humains. Pour les discours qui se chevauchent et les accents forts, les humains restent nettement meilleurs. Pour les contenus juridiques, médicaux et publiés, la révision humaine reste la référence absolue.
Quand vous avez besoin d'une transcription humaine
La transcription IA est suffisante pour la plupart des usages professionnels. La transcription humaine reste recommandée pour : les procédures judiciaires (99%+ de précision requis), la documentation médicale (standard clinique), les enregistrements multilingues avec changements de code fréquents, l'audio avec accents très forts ou dialectaux, et les contenus journalistiques ou académiques publiés.
Foire aux questions
Quel outil de transcription IA est le plus précis ?
Sur un audio propre, les outils basés sur Whisper (VexaScribe, TurboScribe) et Sonix atteignent ~95–97 % de précision (~3–5 % WER). Sur un audio réel avec bruit de fond, la précision chute à 85–92 % pour tous les outils. La différence entre les meilleurs et les pires moteurs IA est de ~3–5 % WER — moins que la plupart ne s'y attendent. La qualité audio importe plus que le choix du moteur.
La transcription IA est-elle aussi précise que la transcription humaine ?
Sur un audio anglais propre avec un seul locuteur, oui — les meilleurs moteurs IA atteignent ou dépassent la précision moyenne d'un transcripteur humain (~4–5 % WER). Sur un audio réel (réunions, appels téléphoniques, accents), l'IA est encore 2–5 % WER derrière les humains qualifiés. Pour les discours qui se chevauchent, les humains sont nettement meilleurs. Pour la plupart des usages professionnels, la précision IA est suffisante. Pour les contenus juridiques, médicaux et publiés, une révision humaine reste recommandée.
Quel taux d'erreur de mots (WER) dois-je attendre ?
Audio de studio propre : 3–5 % WER. Réunion avec 2–3 locuteurs : 8–12 % WER. Appel téléphonique : 12–18 % WER. Accents prononcés : +3–15 % WER. Bruit de fond : +5–15 % WER.
La qualité audio importe-t-elle vraiment plus que l'outil de transcription ?
Oui — considérablement. La différence entre les meilleurs et les pires outils IA sur le même audio est de ~3–5 % WER. La différence entre un audio propre et bruyant sur le MÊME outil peut être de 20–30 % WER. Un microphone externe à 30 € améliorera votre précision de transcription plus que changer d'outil IA.
Quel outil est le plus précis pour la terminologie médicale ?
Pour la transcription médicale, les outils avec vocabulaire personnalisé (Google Cloud Speech, Azure Custom Speech, Deepgram keyword boosting) surpassent les outils basés sur Whisper qui manquent de vocabulaire personnalisé natif. Pour la documentation clinique nécessitant 99 %+ de précision, la transcription humaine avec spécialisation médicale (Rev, Verbit) reste la référence.
Whisper (OpenAI) est-il la transcription open-source la plus précise ?
Oui — Whisper Large-v3 est la référence open-source actuelle. Sur le benchmark FLEURS (Radford et al. 2022, arXiv:2212.04356, tableau 5), le français atteint environ 4,0 % WER, l'allemand environ 4,5 % WER. Sur audio réel (réunions, appels téléphoniques), ces chiffres montent à 8–12 % WER. Faiblesse principale : absence de vocabulaire personnalisé natif.
Quelle est la transcription la plus précise pour les langues non anglophones ?
Les outils basés sur Whisper (VexaScribe, TurboScribe) ont le support multilingue le plus large. Le papier Whisper (arXiv:2212.04356, tableau 5) donne les WER de référence sur FLEURS : ~4,0 % pour le français, ~2,7 % pour l'espagnol, ~4,5 % pour l'italien, ~4,7 % pour le portugais. Ces chiffres correspondent à de la lecture propre — l'audio réel double ou triple ces valeurs.
Comment les outils IA gèrent-ils les variantes régionales du français (québécois, français africain, Belgique, Suisse) ?
Le français standard hexagonal est bien géré par les outils basés sur Whisper (~4–6 % WER, cohérent avec FLEURS dans arXiv:2212.04356). Le québécois est relativement bien pris en charge (~8–14 % WER) car présent dans les données d'entraînement Common Voice. Les variantes du français africain (sénégalais, ivoirien, congolais) et les enregistrements très marqués en Suisse romande ou en Belgique donnent typiquement 12–20 % WER. Les liaisons ambiguës et les homophones (mer/mère/maire, ver/vers/verre) restent une source de fautes systémique même sur audio propre.
Comment ont été calculés les WER de ce tableau ?
Nous avons transcrit quatre types d'audio de 30 minutes chacun : enregistrement studio (podcast, micro à condensateur), réunion (salle de conférence, 3 locuteurs), appel téléphonique (bande passante 8 kHz), anglais accentué (locuteurs non natifs). Le WER a été calculé avec la bibliothèque Python jiwer contre des transcriptions de référence vérifiées manuellement. Les chiffres annoncés par les éditeurs sans méthodologie publiée sont explicitement marqués « annoncé par l'éditeur » — concrètement Sonix, Verbit et Rev AI.
Prêt à tester votre précision de transcription ?
VexaScribe offre la précision basée sur Whisper à une fraction du prix des concurrents. Testez-le avec vos propres fichiers audio.
Essayer VexaScribe gratuitement