Générateur de Sous-titres — SRT et VTT automatiques depuis vidéo ou audio (gratuit)
Téléchargez une vidéo ou un audio et obtenez en quelques minutes des sous-titres précis en 99 langues, avec des horodatages au niveau du mot. Export en SRT, VTT ou TXT — ou incrustation directe dans la vidéo avec votre propre style. 30 minutes gratuites, sans carte bancaire (subtitle generator en français).
Formats acceptés :
Nouveau à la transcription ? Voir notre explication : Qu'est-ce qu'une transcription ?
En bref
Le générateur de sous-titres VexaScribe (auto subtitle generator) convertit n’importe quel fichier audio ou vidéo en SRT, VTT, TXT ou sous-titres incrustés — propulsé par OpenAI Whisper Large-v3en 99 langues. En français, le modèle atteint environ 4-5 % de taux d’erreur sur les mots (WER) selon le benchmark FLEURS. 30 minutes gratuites, puis à partir de 2 $/mois pour 200 minutes jusqu’à 20 $/mois pour 6 000 minutes — soit environ 0,60 $ à 0,20 $ par heure de vidéo.
Qu’est-ce qu’un générateur de sous-titres ?
Un générateur de sous-titres est un outil basé sur l’IA qui détecte la parole dans un fichier audio ou vidéo, la convertit en texte et l’associe à des horodatages précis. Le résultat est un fichier de sous-titres (généralement SRT ou VTT) qui s’affiche en synchronisation avec l’image — ou qui est directement « incrusté » dans la vidéo (burn-in / hardcoded subtitles) pour faire partie intégrante des pixels.
Pour les créateurs, équipes marketing, rédactions et établissements d’enseignement, le sous-titrage automatique remplace un travail manuel fastidieux de plusieurs heures. VexaScribe utilise OpenAI Whisper Large-v3 — un modèle de reconnaissance vocale entraîné sur 680 000 heures d’audio dans 99 langues, qui offre l’une des meilleures précisions du marché en français métropolitain comme en français québécois.
Subtitles vs closed captions — quelle différence ?
Les deux termes sont souvent confondus mais recouvrent des réalités distinctes, notamment pour l’accessibilité RGAA / WCAG 2.1 :
| Format | Contenu | Usage |
|---|---|---|
| Sous-titres (subtitles) | Uniquement le dialogue — pour spectateurs entendants | Traduction, flux « sound-off » sur les réseaux sociaux |
| Sous-titres SME (closed captions) | Dialogue + [musique], [applaudissements], [sonnerie], labels de locuteur | Accessibilité RGAA 4.1, WCAG 2.1 SC 1.2.2 / 1.2.4 |
VexaScribe produit les deux : sous-titres simples par défaut, ou — en quelques clics dans l’éditeur — une version SME avec labels de locuteur et événements sonores comme [applaudissements] ou [musique].
Exemple de sortie : sous-titres SRT et VTT
Voici à quoi ressemble un sous-titre exporté depuis un enregistrement français — horodatages au format SRT (secondes,millisecondes), UTF-8, directement compatible avec YouTube Studio, Premiere Pro, DaVinci Resolve et VLC.
Tarifs honnêtes — sans engagement
Une vidéo d’une heure coûte environ 0,30 $ à sous-titrer avec le plan Basic (5 $/mois) — export SRT, VTT et TXT inclus. Sans engagement, résiliable chaque mois.
Voir tous les tarifs →Sous-titrage manuel vs VexaScribe
Sous-titrage manuel (Aegisub, Subtitle Edit)
- ✗5 à 8 heures de travail par heure d’audio — placement et timing manuels des cues
- ✗Toute erreur de timing sur un montage doit être corrigée à la main
- ✗Chaque langue doit être traduite et re-timée séparément
- ✗Pas de détection de locuteur — étiquetage manuel obligatoire
- ✗Caractères accentués et encodages fantaisistes fréquents sur .srt
Idéal pour Projets artistiques, clips très courts ou cas d’audio de qualité extrêmement dégradée
VexaScribe (automatique avec Whisper Large-v3)
- ✓5 à 10 minutes par heure d’audio — timing automatique au mot près
- ✓99 langues depuis un seul upload, détection automatique de la langue
- ✓Jusqu’à 50 locuteurs identifiés et étiquetés automatiquement
- ✓Export SRT et VTT UTF-8 propre, accents et cédilles correctement encodés
- ✓Éditeur intégré pour corriger, découper les cues, renommer les locuteurs
Idéal pour Chaînes YouTube, Reels réseaux sociaux, podcasts, e-learning, vidéos marketing, captations de conférences
Comment ça marche (3 étapes)
1. Téléverser la vidéo ou l’audio
Glissez-déposez votre fichier : MP3, WAV, M4A, FLAC (audio) ou MP4, MOV, MKV, WebM (vidéo) jusqu’à 5 Go. Pour les vidéos, la piste audio est extraite automatiquement.
2. L’IA détecte la langue et cale les cues
Whisper Large-v3 reconnaît le français (métropolitain, québécois, belge, suisse, africain) automatiquement et produit des horodatages au mot près. Le traitement prend 20 à 40 % de la durée du média.
3. Télécharger SRT / VTT ou incruster
Export en SRT, VTT ou TXT — ou incrustez les sous-titres avec votre propre police, couleur, position et effet karaoké directement dans la vidéo (burn-in).
Ajouter des sous-titres à une vidéo — le workflow
Pour ajouter des sous-titres à une vidéo (créer des sous-titres, faire des sous-titres pour un tutoriel YouTube, une captation d’événement ou une pub LinkedIn), le workflow VexaScribe se déroule en 4 étapes contrôlées.
- 1. Upload de la vidéo. Glissez-déposez MP4, MOV, MKV ou WebM jusqu’à 5 Go. La piste audio est extraite automatiquement — pas besoin de convertir en amont.
- 2. Détection FR automatique. Whisper identifie le français (métropolitain, québécois, belge, suisse, africain) sans configuration. Vous pouvez aussi forcer la langue depuis le menu si votre vidéo mélange plusieurs langues.
- 3. Génération SRT ou burn-in. Le moteur produit des horodatages au mot près, puis applique le découpage de cues Netflix (max 80 caractères / 5 secondes). Choisissez : export SRT/VTT séparé, ou incrustation directe dans la vidéo avec votre police et couleur.
- 4. Export ou prévisualisation. Prévisualisez la vidéo avec les sous-titres, corrigez ce qui doit l’être dans l’éditeur, puis téléchargez le .srt, .vtt ou la vidéo MP4 rendue avec burn-in. Réexports illimités.
Compte tenu de la précision Whisper Large-v3, la correction manuelle après génération est en général minime — 2 à 3 minutes de relecture par vidéo de 10 minutes en français propre.
Sous-titrage IA — comment Whisper génère les sous-titres
Le sous-titrage IA (ou ia sous-titrage video, sous-titrage vidéo automatique) repose aujourd’hui presque entièrement sur des modèles encoder-decoder Transformer. VexaScribe utilise OpenAI Whisper Large-v3, entraîné sur 680 000 heures d’audio multilingue (Radford et al., arXiv:2212.04356).
Architecture encoder-decoder
L’encoder transforme le signal audio en une représentation dense (log-mel spectrogramme de 30 secondes → séquence d’embeddings). Le decoder autorégressif produit ensuite le texte token par token, avec des tokens spéciaux pour l’horodatage — permettant d’obtenir un timestamp au niveau du mot, pas seulement du segment.
Découpage de cues Netflix-compliant
Une fois la transcription générée, un post-traitement applique les règles standard de lisibilité (Netflix Timed Text Style Guide) : maximum 80 caractères par cue, 5 secondes à l’écran (plafond dur à 10 s), avec priorité aux frontières de phrase puis aux virgules pour les découpages. Les sous-titres automatiques IA obtenus s’importent directement dans YouTube Studio, Premiere Pro et DaVinci Resolve sans nettoyage.
Résultat : environ 4-5 % de WER en français sur FLEURS — proche du niveau des transcripteurs humains. Voir aussi Qu'est-ce qu'une transcription ? pour la théorie générale.
Créer un fichier SRT — depuis n’importe quel audio ou vidéo
Créer un fichier SRT (créer sous-titres srt, générer fichier srt) est l’action la plus fréquente sur ce générateur. Le format SRT (SubRip) reste la référence — un fichier texte brut UTF-8, avec un compteur numérique, un horodatage HH:MM:SS,mmm --> HH:MM:SS,mmmet le texte de la cue.
Avec VexaScribe : uploadez votre audio ou vidéo, laissez le moteur transcrire, puis cliquez sur Exporter → SRT. Le fichier est généré avec les accents français (é, è, ê, à, ç, œ) correctement encodés en UTF-8 — un piège classique des convertisseurs bricolés qui produisent des « é » cassés dans YouTube Studio.
Le SRT généré est compatible avec YouTube Studio, Premiere Pro, DaVinci Resolve, Final Cut Pro, VLC, mkvmerge et FFmpeg. Il peut aussi servir de base pour un burn-in (ffmpeg -vf subtitles=fichier.srt) ou pour la traduction ligne par ligne.
Sous-titres automatiques gratuits — que couvre le forfait gratuit ?
Le générateur de sous-titres gratuit de VexaScribe (sous-titres automatiques gratuit, générateur sous-titres gratuit) inclut 30 minutes de traitement par compte, sans carte bancaire à l’inscription. Assez pour tester 6 à 10 Reels courts, un épisode de podcast de 25 minutes ou une interview corporate.
- • Toutes les 99 langues (Whisper Large-v3) — pas de tier bloqué au français.
- • Export SRT, VTT et TXT inclus — pas d’upsell pour débloquer les formats.
- • Diarisation jusqu’à 50 locuteurs, même en gratuit.
- • Aucun filigrane forcé sur les vidéos exportées.
- • Fichiers jusqu’à 5 Go acceptés — pas de limite de taille sur le tier gratuit.
Limite honnête : au-delà de 30 minutes, il faut passer sur un forfait dès 2 $/mois (200 minutes) — modèle transparent, sans période d’essai piégeuse qui se convertit automatiquement en abonnement payant.
Logiciel de sous-titrage automatique — comparatif honnête
Il existe plusieurs bons outils sur le marché — le meilleur logiciel de sous-titrage dépend de votre workflow. Comparatif objectif de 4 logiciels sous-titres populaires (données vérifiées août 2026).
| Outil | Format d’export | Édition | Langues | Prix (indicatif) |
|---|---|---|---|---|
| VexaScribe | SRT, VTT, TXT, burn-in MP4 | Éditeur texte + preview vidéo, diarisation 50 locuteurs | 99 (Whisper Large-v3) | Gratuit 30 min, dès 2 $/mois |
| VEED | SRT, VTT, MP4 burn-in | Éditeur vidéo complet + styles animés | 100+ | Free limité, dès 12 $/mois |
| CapCut | SRT, MP4 burn-in | Éditeur vidéo mobile/desktop, styles TikTok natifs | 30+ | Gratuit, Pro dès 8 $/mois |
| Kapwing | SRT, VTT, MP4 burn-in | Éditeur vidéo collaboratif | 70+ | Free limité, dès 16 $/mois |
Notre lecture honnête : VEED et Kapwing sont excellents si vous voulez un éditeur vidéo complet avec styles animés poussés. CapCut est imbattable pour les styles TikTok natifs et l’usage mobile. VexaScribe se concentre sur la précision de transcription (99 langues Whisper Large-v3, diarisation 50 locuteurs) et la génération de fichiers SRT/VTT propres — pratique si votre pipeline finit dans Premiere Pro ou DaVinci Resolve plutôt que dans un éditeur web.
Tarifs indicatifs août 2026 — vérifiez les prix officiels de chaque éditeur.
Sous-titres Instagram — Reels, Feed et Stories
La transcription Instagram (transcription video instagram, transcription reels instagram) est devenue essentielle : plus de 85 % des utilisateurs Instagram scrollent son coupé. Voici les règles précises par format.
Format Reels (9:16 vertical)
Les Reels sont verticaux au ratio 9:16 (1080×1920). Point critique : Instagram n’accepte PAS de fichier SRT séparé (sidecar) pour les Reels — vérifié sur help.instagram.com le 5 août 2026. Les sous-titres Instagram Reels doivent être incrustés directement dans la vidéo (burn-in / hardcoded). C’est valable pour tous les Reels uploadés depuis l’app ou l’API Graph.
IGTV et vidéos Feed longform
Pour les vidéos IGTV (contenus longform) et les vidéos Feed classiques, Instagram accepte les sous-titres SRT en piste séparée — le spectateur peut les activer ou désactiver. C’est le workflow recommandé pour les tutoriels longs, interviews ou behind-the-scenes.
Workflow VexaScribe pour Instagram
- 1. Uploadez votre MP4 vertical 9:16 (Reels) ou 16:9 (IGTV) sur VexaScribe.
- 2. Whisper génère la transcription reels (texte reels instagram) avec horodatages au mot près.
- 3. Pour un Reels : exportez la vidéo avec burn-in — choisissez police, taille (32-60 pt), couleur (blanc + contour noir standard) et position (tiers inférieur pour éviter les overlays d’interface).
- 4. Pour IGTV/Feed : exportez le fichier .srt et uploadez-le comme piste séparée depuis Instagram Creator Studio.
Pour les autres formats courts (TikTok, YouTube Shorts) qui suivent des règles similaires, voir Transcription TikTok — sibling short-form avec workflow burn-in optimisé.
Quel format de sous-titres pour quelle plateforme ?
Chaque plateforme traite les sous-titres différemment. Instagram Reels et YouTube Shorts n’acceptent pas de fichiers SRT séparés à l’upload — les sous-titres doivent être incrustés directement dans la vidéo. Les vidéos longform et plateformes desktop privilégient le SRT.
| Plateforme | Format de livraison | Note |
|---|---|---|
| YouTube (longform) | SRT | Upload dans YouTube Studio → Sous-titres. Le VTT est également accepté. |
| YouTube Shorts | Incrustation (burn-in) | Les SRT séparés sont rognés par l’interface verticale — incrustez directement dans la vidéo pour la fiabilité. |
| Instagram Reels | Incrustation | Instagram n’accepte pas d’upload SRT sur les Reels (help.instagram.com). Uniquement burn-in. |
| TikTok | Burn-in ou base SRT | L’éditeur TikTok accepte un SRT comme base ; la plupart des créateurs incrustent pour le contrôle du style. |
| LinkedIn Video | SRT | Upload SRT depuis le compositeur vidéo LinkedIn. |
| Facebook Video | SRT | Upload via Creator Studio → Sous-titres. |
| Vimeo | SRT ou VTT | Le lecteur Vimeo supporte les deux ; le SRT est le plus simple. |
| Plateformes de podcast | TXT | TXT pour les show notes et transcriptions d’épisodes (Apple Podcasts, Spotify). |
| LMS d’entreprise | SRT ou VTT | La plupart des LMS (Cornerstone, Docebo, Canvas) acceptent les deux. VTT au besoin pour le positionnement. |
Vérifié le 3 août 2026 contre les pages d’aide officielles de YouTube, Instagram, TikTok, LinkedIn et Vimeo.
Personnaliser les sous-titres incrustés (burn-in)
Quand vous incrustez les sous-titres dans la vidéo (hardcoded subtitles), vous contrôlez chaque détail visuel. Presets typiques pour les Reels et YouTube Shorts :
- • Police : Inter, Roboto, Montserrat ou Impact (style broadcast). Polices personnalisées possibles par upload.
- • Taille : 24 à 48 pt sur frame vertical 1080×1920 ; 32 à 60 pt pour styles sociaux agressifs.
- • Couleur : texte blanc avec contour noir, ou couleur de marque avec ombre portée pour une haute lisibilité.
- • Position : tiers inférieur (standard), centré ou tiers supérieur — pour éviter les overlays d’interface TikTok / Reels.
- • Karaoké / mot mis en évidence : le mot en cours est surligné — comme dans les presets CapCut et VEED.
- • Fond : transparent, opaque ou pastille semi-transparente derrière chaque cue.
Les sous-titres incrustés sont surtout utiles pour les vidéos verticales courtes (Reels, Shorts, TikTok), car plus de 85 % des utilisateurs scrollent sans son et les plateformes n’acceptent pas de sous-titres externes à cet endroit.
Couverture linguistique et précision
VexaScribe utilise OpenAI Whisper Large-v3, qui couvre 99 langues. La précision varie selon la langue et la qualité audio. Le tableau ci-dessous donne le taux d’erreur sur les mots (WER) sur le benchmark FLEURS — plus c’est bas, mieux c’est.
| Langue | WER Whisper Large-v3 |
|---|---|
| Français (FLEURS) | ~4-5 % |
| Anglais | ~4,2 % |
| Espagnol | ~4 % |
| Allemand | ~4,5 % |
| Italien | ~5 % |
| Néerlandais | ~6 % |
| Portugais | ~5 % |
| Polonais | ~6 % |
| Turc | ~7 % |
| Japonais | ~7 % |
| Arabe | ~8 % |
Source : Radford et al., Robust Speech Recognition via Large-Scale Weak Supervision, arXiv:2212.04356, tableau 5. WER mesuré sur les benchmarks FLEURS / CommonVoice. Les enregistrements réels avec bruit de fond, accents marqués ou terminologie spécialisée présentent naturellement un WER plus élevé.
Retoucher les sous-titres (éditeur)
Chaque projet de sous-titres s’ouvre dans un éditeur avec prévisualisation vidéo synchronisée. Vous pouvez :
- • Corriger d’un clic les mots mal compris — les horodatages s’ajustent automatiquement.
- • Découper ou fusionner les cues sur des frontières de mots pour améliorer la lisibilité.
- • Renommer les locuteurs (« Animateur », « Invitée 1 ») — les labels sont conservés à l’export SRT.
- • Ajuster la durée d’une cue pour respecter les pauses dramatiques ou dialogues rapides.
- • Ajouter des notations non-verbales comme [applaudissements] ou [musique] pour l’accessibilité.
- • Réexporter en SRT, VTT, TXT ou MP4 rendu — sans re-calculer la transcription.
Voir aussi notre page Transcrire un audio pour le workflow général de transcription.
Fonctionnalités clés
Tout ce qu’il faut pour produire des sous-titres professionnels depuis vidéo ou audio — dans un seul outil.
99 langues dont le français
Whisper Large-v3 avec ~4-5 % de WER en français (FLEURS). Détection automatique — pas besoin de sélectionner la langue.
SRT, VTT, TXT et burn-in
Tous les formats standards depuis un seul upload. Compatible YouTube, Vimeo, LinkedIn, DaVinci Resolve, Premiere Pro et CapCut.
Jusqu’à 50 locuteurs
Diarisation automatique qui étiquette chaque locuteur — précision optimale entre 2 et 6 locuteurs.
Horodatages au mot près
Les débuts et fins de cue tombent sur des frontières de mots réelles, pas sur des interpolations au milieu d’un segment.
Éditeur avec preview vidéo
Corrections d’un clic, renommage de locuteurs, découpage de cues — modifications visibles instantanément dans le preview.
Fichiers jusqu’à 5 Go
Longues captations de conférences, cours magistraux ou interviews traités sans découpage manuel.
Formats courts ? Pour les sous-titres automatiques adaptés aux formats courts (TikTok, Reels, Shorts), voir Transcription TikTok.
Questions fréquentes
Comment générer des sous-titres à partir d’un audio ?
Téléchargez votre fichier audio ou vidéo sur VexaScribe par glisser-déposer ou via l’explorateur de fichiers. Notre moteur de transcription IA traite le fichier, détecte les mots prononcés avec des horodatages précis et génère un fichier de sous-titres. Une fois terminé, exportez au format SRT ou VTT — les deux sont compatibles avec YouTube, TikTok, LinkedIn et la plupart des éditeurs vidéo. L’ensemble du processus ne prend que quelques minutes pour la plupart des fichiers.
Quels formats de sous-titres VexaScribe prend-il en charge ?
VexaScribe exporte les sous-titres aux formats SRT (SubRip) et VTT (WebVTT). Le SRT est le format le plus largement pris en charge et fonctionne avec YouTube, Premiere Pro, DaVinci Resolve, Final Cut Pro et la plupart des plateformes de réseaux sociaux. Le VTT est le format web natif utilisé par les lecteurs vidéo HTML5 et est également accepté par YouTube et d’autres plateformes.
Quelle est la précision des sous-titres générés par IA ?
La précision dépend de la qualité audio, du bruit de fond et de la clarté du locuteur. Pour des enregistrements clairs avec un bruit de fond minimal, VexaScribe offre généralement une haute précision adaptée à un usage professionnel. Vous pouvez vérifier et modifier les sous-titres dans l’éditeur intégré avant l’exportation. Pour du contenu avec des accents forts ou du jargon technique, une relecture rapide est recommandée.
Puis-je générer des sous-titres dans différentes langues ?
Oui, VexaScribe génère des sous-titres en 99 langues, dont l’anglais, l’espagnol, le français, l’allemand, le portugais, l’italien, le chinois, le japonais, le coréen, l’arabe, l’hindi et bien d’autres. La langue est détectée automatiquement à partir de l’audio, ou vous pouvez la spécifier manuellement pour de meilleurs résultats.
Quelle est la différence entre les fichiers de sous-titres SRT et VTT ?
Le SRT (SubRip) est le format de sous-titres le plus utilisé — simple, universel et accepté par pratiquement toutes les plateformes vidéo et éditeurs. Le VTT (WebVTT) est le format web natif plus récent qui prend en charge des options de style supplémentaires comme la couleur de police et le positionnement. Pour la plupart des cas d’utilisation, le SRT est le choix le plus sûr. Choisissez le VTT si vous avez besoin de lecture web ou de styles personnalisés.
Puis-je modifier les sous-titres avant de les télécharger ?
Oui. Après la transcription, vous pouvez vérifier et modifier la transcription complète dans l’éditeur intégré de VexaScribe. Corrigez les mots, ajustez le timing, renommez les locuteurs, puis exportez la version corrigée en SRT ou VTT. Cela vous donne des sous-titres de qualité professionnelle sans travail manuel de synchronisation.
Quels formats vidéo et audio puis-je télécharger ?
VexaScribe accepte tous les formats audio courants (MP3, WAV, M4A, FLAC, OGG, AAC) et les formats vidéo (MP4, MOV, AVI, MKV, WebM). Pour les fichiers vidéo, nous extrayons automatiquement la piste audio. Les fichiers jusqu’à 5 Go sont pris en charge.
Combien coûte la génération de sous-titres ?
La génération de sous-titres utilise la même tarification que la transcription. L’essai gratuit comprend 30 minutes. Les forfaits payants commencent à 2 $/mois pour 200 minutes (Starter), 5 $/mois pour 1 000 minutes (Basic), 10 $/mois pour 2 500 minutes (Pro) et 20 $/mois pour 6 000 minutes (Studio). Une vidéo d’une heure coûte environ 0,30 $ à sous-titrer avec le forfait Basic.
Comment les cues de sous-titres sont-elles dimensionnées ? Sont-elles lisibles à l’écran ?
VexaScribe traite chaque export de sous-titres avec un algorithme de découpage de cues au niveau du mot. Les cues sont limitées à environ 80 caractères et 5 secondes (plafond strict de 10 secondes) — correspondant à la plage de sous-titres web lisibles utilisée par Descript, Sonix et Vimeo. Les découpages préfèrent d’abord les frontières de phrase, puis les virgules, puis les frontières de mot. Les étiquettes de locuteur sont préservées à chaque découpage. Les fichiers s’importent proprement dans YouTube, Premiere Pro, Final Cut Pro, DaVinci Resolve et VLC sans nettoyage manuel.
Les sous-titres restent-ils synchronisés avec la parole réelle ?
Oui. VexaScribe utilise de vrais horodatages au niveau du mot provenant du moteur de transcription — les temps de début et de fin des cues atterrissent sur des frontières de mots réelles, et non sur des approximations interpolées sur un long segment. Les pauses dramatiques dans la parole (discours motivants, livres audio) sont préservées : la cue reste à l’écran pendant le silence au lieu de produire un flash de moins d’une seconde suivi d’un écran vide.
Quelle différence entre subtitles et closed captions ?
Les « subtitles » (sous-titres) transcrivent uniquement la parole — ils supposent que le spectateur entend les sons. Les « closed captions » (CC, ou sous-titres pour sourds et malentendants — SME) incluent en plus les descriptions sonores : [musique dramatique], [porte qui claque], [rires], identification du locuteur hors champ. Les CC sont légalement requises pour l’accessibilité de nombreux contenus (voir WCAG 2.1 SC 1.2.2). VexaScribe génère par défaut des subtitles ; ajoutez manuellement les descriptions sonores dans l’éditeur pour produire des CC conformes.
Comment ajouter des sous-titres SRT à une vidéo MP4 (burn-in ou piste séparée) ?
Deux méthodes : (1) Piste séparée (soft subtitles) — la piste SRT est jointe au MP4 comme piste indépendante (mkvmerge, FFmpeg avec -c:s mov_text). Le spectateur peut activer/désactiver les sous-titres. Recommandé pour YouTube, Vimeo, Plex. (2) Incrustés (burn-in / hardcoded) — les sous-titres sont gravés dans les pixels via FFmpeg (« -vf subtitles=fichier.srt »). Impossibles à désactiver mais garantis d’apparaître partout, y compris sur TikTok, Instagram Reels et X où les pistes soft ne fonctionnent pas. Générez le SRT avec VexaScribe, puis choisissez soft ou hard selon la plateforme cible.
Comment ajouter des sous-titres à une vidéo automatiquement ?
Pour ajouter des sous-titres à une vidéo automatiquement, téléversez votre fichier MP4, MOV, MKV ou WebM sur VexaScribe. Le moteur détecte automatiquement le français (métropolitain, québécois, belge, suisse ou africain), génère des horodatages au niveau du mot, puis vous laisse créer des sous-titres exportables en SRT ou VTT — ou directement incrustés (burn-in) dans la vidéo. Le workflow complet prend 4 étapes : upload vidéo, détection de langue automatique, génération SRT/burn-in, export ou prévisualisation. Aucun re-timing manuel requis : c’est la manière la plus rapide de faire des sous-titres pour YouTube, LinkedIn ou une vidéo pédagogique.
Qu’est-ce que le sous-titrage IA ?
Le sous-titrage IA (ia sous-titrage video) désigne la génération automatique de sous-titres par un modèle d’apprentissage profond — dans le cas de VexaScribe, OpenAI Whisper Large-v3, une architecture encoder-decoder Transformer entraînée sur 680 000 heures d’audio multilingue (Radford et al., arXiv:2212.04356). Le modèle produit des horodatages au niveau du mot, puis un algorithme de découpage applique les règles Netflix (max 80 caractères par cue, max 5 secondes à l’écran) pour garantir la lisibilité. Les sous-titres automatiques IA atteignent aujourd’hui une précision proche de la transcription humaine sur audio propre — environ 4-5 % de WER en français sur le benchmark FLEURS.
Comment créer un fichier SRT gratuitement ?
Pour créer un fichier SRT gratuitement, utilisez les 30 minutes d’essai gratuit de VexaScribe — sans carte bancaire. Téléversez votre audio ou vidéo, laissez Whisper Large-v3 transcrire (5 à 10 minutes par heure d’audio), puis cliquez sur « Exporter → SRT ». Le fichier .srt encodé en UTF-8 est prêt pour YouTube Studio, Premiere Pro, DaVinci Resolve ou VLC — avec les accents français correctement encodés. Vous pouvez aussi générer un fichier SRT à partir d’un enregistrement Zoom, d’un podcast MP3 ou d’une vidéo MP4. C’est la manière la plus simple de créer des sous-titres SRT sans logiciel à installer.
Existe-t-il un générateur de sous-titres automatiques gratuit ?
Oui. VexaScribe propose un générateur de sous-titres automatiques gratuit avec 30 minutes incluses par compte — largement suffisant pour tester la qualité sur plusieurs Reels, TikTok ou un épisode de podcast court. Aucune carte bancaire n’est demandée pour l’inscription. Les limites honnêtes : au-delà des 30 minutes gratuites, il faut passer sur un forfait payant (dès 2 $/mois pour 200 minutes). L’export SRT, VTT et TXT est inclus dans tous les plans, y compris gratuit. Contrairement à certains outils « gratuits » avec filigrane forcé, VexaScribe n’ajoute aucun watermark sur les exports.
Comment créer des sous-titres pour Instagram Reels ?
Instagram Reels n’accepte pas de fichier SRT séparé à l’upload (help.instagram.com, vérifié le 5 août 2026) — les sous-titres doivent être incrustés directement dans la vidéo. Workflow VexaScribe : (1) téléversez votre Reels vertical 9:16 en MP4, (2) laissez Whisper transcrire le texte reels instagram, (3) exportez la vidéo avec sous-titres burn-in — police, taille et position personnalisables pour éviter les overlays d’interface Instagram. Pour l’IGTV longform et les vidéos Feed classiques, l’export SRT est accepté. Pour les Reels, seul le burn-in fonctionne. La transcription reels instagram par VexaScribe garantit la synchronisation au mot près, essentielle pour le style karaoké populaire sur Reels.
Pages associées
MP3 en texte
Convertir des fichiers MP3 directement en texte — pour podcasts, dictées, mémos vocaux.
Vidéo en texte
Convertir MP4, MOV, MKV ou WebM en texte — la piste audio est extraite automatiquement.
Transcrire un audio
Transcrire tous les formats audio — WAV, M4A, FLAC, OGG et plus.
Transcription de réunion
Transcrire les enregistrements Zoom, Teams et Google Meet avec labels de locuteur.
Transcription TikTok
Sous-titres burn-in pour formats verticaux courts — TikTok, Reels et Shorts.
VexaScribe utilise OpenAI Whisper Large-v3 pour la conversion parole-texte. Sur le benchmark FLEURS, le modèle atteint environ 4-5 % de taux d’erreur sur les mots pour le français (Radford et al., « Robust Speech Recognition via Large-Scale Weak Supervision », arXiv:2212.04356, tableau 5). La précision réelle dépend de la qualité audio, du nombre de locuteurs, des accents et de la terminologie spécialisée. « OpenAI » et « Whisper » sont des marques de leurs propriétaires respectifs. YouTube, TikTok, Instagram, LinkedIn, Vimeo, Premiere Pro, Final Cut Pro et DaVinci Resolve sont des marques de leurs propriétaires respectifs — sans aucun lien commercial avec VexaScribe.