Generatore di Sottotitoli — SRT e VTT automatici da video o audio (gratis)

Carica il video o l'audio e ottieni in pochi minuti sottotitoli precisi in 99 lingue con timestamp a livello di parola. Esporta in SRT, VTT o TXT — oppure imprimili direttamente nel video con il tuo stile personalizzato. 30 minuti gratuiti, senza carta di credito (subtitle generator in italiano).

30 minuti gratuitiSRT / VTT / TXT / Burn-in99 lingue (Whisper Large-v3)Fino a 50 parlanti

Formati supportati:

MP3WAVM4AFLACMP4MOVMKVWebM

In breve

Il generatore di sottotitoli VexaScribe (auto subtitle generator) trasforma qualsiasi file audio o video in SRT, VTT, TXT o sottotitoli impressi — grazie a OpenAI Whisper Large-v3 in 99 lingue. Sull’italiano il modello raggiunge circa 5,5 % di Word Error Rate (WER) sul benchmark FLEURS. 30 minuti gratuiti, poi da 2 $/mese per 200 minuti fino a 20 $/mese per 6.000 minuti — equivalenti a circa 0,60 $ – 0,20 $ per ora di video.

Cos’è un generatore di sottotitoli?

Un generatore di sottotitoli è uno strumento basato su IA che riconosce il parlato nei file audio o video, lo converte in testo e lo sincronizza con timestamp precisi. Il risultato è un file di sottotitoli (di norma SRT o VTT) che può essere sovrapposto al video — oppure «impresso» direttamente nell’immagine (burn-in / hardcoded subtitles), diventando parte integrante del fotogramma.

Per creator, team marketing, redazioni ed enti di formazione, i sottotitoli automatici sostituiscono ore di lavoro manuale. VexaScribe utilizza OpenAI Whisper Large-v3 — un modello di riconoscimento vocale addestrato su 680.000 ore di audio in 99 lingue, con una delle migliori accuratezze del settore anche per l’italiano.

Sottotitoli vs closed caption — qual è la differenza?

In italiano i due termini vengono spesso usati come sinonimi, ma esiste una distinzione importante — soprattutto per l’accessibilità (Legge Stanca, WCAG 2.1):

FormatoContenutoUtilizzo
Sottotitoli (Subtitles)Solo dialogo — per chi può sentire l’audioTraduzione, feed social senza audio
Closed caption (CC / sottotitoli per sordi)Dialogo + [musica], [applausi], [campanello], etichette dei parlantiAccessibilità WCAG 2.1 SC 1.2.2 / 1.2.4, Legge Stanca

VexaScribe genera entrambe le versioni: sottotitoli semplici oppure — con pochi clic nell’editor — versioni accessibili con etichette dei parlanti e marcatori non verbali come [applausi] o [musica].

Esempio di output: sottotitoli SRT e VTT

Ecco come appare un sottotitolo esportato da una registrazione italiana — timestamp in formato SRT (secondi,millisecondi), UTF-8, direttamente compatibile con YouTube Studio, Premiere Pro, DaVinci Resolve e VLC.

Formati di export:
TXTDOCXSRT
1
00:00:00,000 --> 00:00:05,000
Bentornati al podcast. Oggi parliamo di sottotitoli generati con IA.
2
00:00:05,000 --> 00:00:10,000
Esatto — i sottotitoli automatici sono migliorati moltissimo negli ultimi anni.
3
00:00:10,000 --> 00:00:15,000
Whisper Large-v3 raggiunge circa il cinque e mezzo per cento di Word Error Rate sull'italiano.
4
00:00:15,000 --> 00:00:20,000
Un valore molto vicino a quello dei trascrittori umani professionisti.
5
00:00:20,000 --> 00:00:25,000
Per i canali social spesso non serve nemmeno una revisione manuale.
6
00:00:25,000 --> 00:00:30,000
Per il TG o le conferenze tecniche conviene comunque un passaggio nell'editor.

Prezzi trasparenti — nessun vincolo

30 minuti=~0 $ (prova)
200 minuti / mese=~2 $
1.000 minuti / mese=~5 $
2.500 minuti / mese=~10 $
6.000 minuti / mese=~20 $

Un video di un'ora costa circa 0,30 $ nel piano Basic (5 $/mese) per il sottotitolaggio — inclusi export SRT, VTT e TXT. Nessun vincolo contrattuale, disdetta mensile.

Vedi tutti i prezzi →

Sottotitolaggio manuale vs VexaScribe

Sottotitolaggio manuale (Aegisub, Subtitle Edit)

  • 5–8 ore di lavoro per ogni ora di audio — cue impostate e temporizzate a mano
  • Errori di timing evidenti a ogni taglio del video
  • Ogni lingua va tradotta e ri-temporizzata separatamente
  • Nessun rilevamento del cambio di parlante — va marcato manualmente
  • Caratteri accentati (à è ì ò ù) e problemi di encoding frequenti negli .srt

Ideale per Progetti artistici, clip brevissime o casi con audio di qualità estremamente scarsa

VexaScribe (automatico con Whisper Large-v3)

  • 5–10 minuti per ora di audio — automatico, con timing a livello di parola
  • 99 lingue da un singolo upload, rilevamento automatico della lingua
  • Fino a 50 parlanti identificati ed etichettati automaticamente
  • Export SRT e VTT UTF-8 puliti, accentate italiane correttamente codificate
  • Editor per correzioni, split delle cue e rinomina dei parlanti

Ideale per Canali YouTube, Reels social, podcast, e-learning, video marketing, registrazioni di conferenze

Come funziona il generatore di sottotitoli (3 passaggi)

1

1. Carica il video o l'audio

Trascina il file: MP3, WAV, M4A, FLAC (audio) o MP4, MOV, MKV, WebM (video) fino a 5 GB. Per i video la traccia audio viene estratta automaticamente.

2

2. L'IA riconosce la lingua e temporizza le cue

Whisper Large-v3 rileva automaticamente l'italiano (comprese varianti regionali) e produce timestamp a livello di parola. L'elaborazione richiede il 20–40 % della durata del file.

3

3. Scarica SRT / VTT o imprimi nel video

Esporta come SRT, VTT o TXT — oppure imprimi i sottotitoli direttamente nel video con font, colore, posizione ed effetto karaoke personalizzati (burn-in).

Quale formato di sottotitoli per quale piattaforma?

Ogni piattaforma gestisce i sottotitoli in modo diverso. Instagram Reels e YouTube Shorts non accettano file SRT esterni tramite upload nativo — qui è necessario imprimere i sottotitoli direttamente nel video. I video longform e le piattaforme desktop preferiscono SRT.

PiattaformaFormato di consegnaNota
YouTube (Longform)SRTCarica in YouTube Studio → Sottotitoli. Accetta anche VTT.
YouTube ShortsBurn-inI file SRT esterni vengono tagliati dall'interfaccia verticale — per affidabilità, imprimi direttamente nel video.
Instagram ReelsBurn-inInstagram non accetta upload SRT sui Reels (help.instagram.com). Solo burn-in.
TikTokBurn-in o base SRTL'editor TikTok accetta una base SRT; la maggior parte dei creator imprime per controllare lo stile.
LinkedIn VideoSRTUpload SRT nel compositore video LinkedIn.
Facebook VideoSRTCarica tramite Creator Studio → Sottotitoli.
VimeoSRT o VTTIl player Vimeo supporta entrambi; SRT è il più semplice.
Piattaforme podcastTXTTXT per note dell'episodio e trascrizioni (Apple Podcasts, Spotify).
LMS aziendaliSRT o VTTLa maggior parte degli LMS (Cornerstone, Docebo, Canvas) accetta entrambi. VTT se serve posizionamento.

Verificato il 3 agosto 2026 sulle pagine di supporto ufficiali di YouTube, Instagram, TikTok, LinkedIn e Vimeo.

Personalizzare i sottotitoli impressi (burn-in)

Quando imprimi i sottotitoli direttamente nel video (hardcoded subtitles), hai il controllo totale su ogni dettaglio visivo. Preset tipici per Reels social e YouTube Shorts:

  • Font: Inter, Roboto, Montserrat o Impact (stile broadcast). Puoi caricare i tuoi font.
  • Dimensione: 24–48 pt su frame verticale 1080×1920; 32–60 pt per stili social aggressivi.
  • Colore: testo bianco con contorno nero, oppure colore brand con ombra per massima leggibilità.
  • Posizione: terzo inferiore (standard), centrato o terzo superiore — per evitare gli overlay UI di TikTok e Reels.
  • Karaoke / evidenziazione parola: la parola pronunciata al momento viene evidenziata — come nei preset di CapCut e VEED.
  • Sfondo: trasparente, pieno o pillola semitrasparente dietro ogni cue.

I sottotitoli impressi sono particolarmente utili per i video verticali brevi (Reels, Shorts, TikTok), perché oltre l’85 % degli utenti scorre senza audio e queste piattaforme non accettano sottotitoli esterni in quel formato.

Copertura linguistica e accuratezza

VexaScribe utilizza OpenAI Whisper Large-v3, che copre 99 lingue. L’accuratezza varia in base alla lingua e alla qualità dell’audio. La tabella seguente mostra il Word Error Rate (WER) sul benchmark FLEURS — più basso, meglio è.

LinguaWhisper Large-v3 WER
Italiano (FLEURS)~5,5 %
Inglese~4,2 %
Spagnolo~4 %
Francese~4 %
Tedesco~4,5 %
Portoghese~5 %
Olandese~6 %
Polacco~6 %
Turco~7 %
Giapponese~7 %
Arabo~8 %

Fonte: Radford et al., Robust Speech Recognition via Large-Scale Weak Supervision, arXiv:2212.04356, Tabella 5. WER misurato sui benchmark FLEURS / CommonVoice. Registrazioni reali con rumore di fondo, accenti marcati o terminologia tecnica mostrano naturalmente valori WER più alti.

Modificare i sottotitoli (editor)

Ogni progetto di sottotitoli si apre in un editor con anteprima video sincronizzata. Puoi:

  • • Correggere le parole trascritte male con un clic — i timestamp si adeguano da soli.
  • • Dividere o unire le cue sui confini di parola per una lettura più fluida.
  • • Rinominare i parlanti (es. «Conduttore», «Ospite 1») — le etichette restano nell’export SRT.
  • • Regolare la durata delle cue per gestire pause drammatiche o dialoghi rapidi.
  • • Aggiungere annotazioni non verbali come [applausi] o [musica] per l’accessibilità.
  • • Esportare di nuovo in SRT, VTT, TXT o MP4 renderizzato — senza rieseguire la trascrizione.

Funzionalità principali

Tutto ciò che serve per sottotitoli professionali da video o audio — in un solo strumento.

99 lingue incluso l'italiano

Whisper Large-v3 con ~5,5 % WER sull'italiano (FLEURS). Rilevamento automatico della lingua — nessuna configurazione manuale.

SRT, VTT, TXT e burn-in

Tutti i formati di sottotitoli standard da un singolo upload. Per YouTube, Vimeo, LinkedIn, DaVinci Resolve, Premiere Pro e CapCut.

Fino a 50 parlanti

Il rilevamento automatico etichetta ogni parlante — massima accuratezza tra 2 e 6 parlanti.

Timestamp a livello di parola

Inizio e fine di ogni cue cadono su confini di parola reali, non su interpolazioni di segmenti lunghi.

Editor con anteprima video

Correzioni con un clic, rinomina dei parlanti, split delle cue — modifiche visibili subito nell'anteprima.

File fino a 5 GB

Registrazioni lunghe di conferenze, lezioni o interviste elaborate senza dover essere spezzate.

Domande frequenti

Come genero i sottotitoli dall’audio?

Carica il tuo file audio o video su VexaScribe tramite drag-and-drop o il file browser. Il nostro motore di trascrizione IA elabora il file, rileva le parole pronunciate con timestamp precisi e genera un file di sottotitoli. Una volta completato, esporta in formato SRT o VTT — entrambi sono compatibili con YouTube, TikTok, LinkedIn e la maggior parte degli editor video. L'intero processo richiede pochi minuti per la maggior parte dei file.

Quali formati di sottotitoli supporta VexaScribe?

VexaScribe esporta sottotitoli nei formati SRT (SubRip) e VTT (WebVTT). SRT è il formato più ampiamente supportato e funziona con YouTube, Premiere Pro, DaVinci Resolve, Final Cut Pro e la maggior parte delle piattaforme social. VTT è il formato web nativo utilizzato dai player video HTML5 ed è accettato anche da YouTube e altre piattaforme.

Quanto sono precisi i sottotitoli generati dall'IA?

La precisione dipende dalla qualità audio, dal rumore di fondo e dalla chiarezza del parlante. Per registrazioni chiare con rumore di fondo minimo, VexaScribe offre generalmente un'alta precisione adatta all'uso professionale. Puoi rivedere e modificare i sottotitoli nell'editor integrato prima dell'esportazione. Per contenuti con accenti marcati o gergo tecnico, si consiglia una rapida revisione.

Posso generare sottotitoli in lingue diverse?

Sì, VexaScribe genera sottotitoli in 99 lingue tra cui italiano, inglese, spagnolo, francese, tedesco, portoghese, cinese, giapponese, coreano, arabo, hindi e molte altre. La lingua viene rilevata automaticamente dall'audio, oppure puoi specificarla manualmente per ottenere i migliori risultati.

Qual è la differenza tra file di sottotitoli SRT e VTT?

SRT (SubRip) è il formato di sottotitoli più utilizzato — semplice, universale e accettato da praticamente ogni piattaforma video ed editor. VTT (WebVTT) è il formato web nativo più recente che supporta opzioni di stile aggiuntive come colore del carattere e posizionamento. Per la maggior parte dei casi d'uso, SRT è la scelta più sicura. Scegli VTT se hai bisogno di riproduzione web o stili personalizzati.

Posso modificare i sottotitoli prima del download?

Sì. Dopo la trascrizione, puoi rivedere e modificare l'intera trascrizione nell'editor integrato di VexaScribe. Correggi le parole, regola i tempi, rinomina i parlanti e poi esporta la versione corretta come SRT o VTT. Questo ti offre sottotitoli di qualità professionale senza il lavoro manuale di sincronizzazione.

Quali formati video e audio posso caricare?

VexaScribe accetta tutti i formati audio comuni (MP3, WAV, M4A, FLAC, OGG, AAC) e formati video (MP4, MOV, AVI, MKV, WebM). Per i file video, estraiamo automaticamente la traccia audio. Sono supportati file fino a 5 GB.

Quanto costa la generazione dei sottotitoli?

La generazione dei sottotitoli utilizza gli stessi prezzi della trascrizione. La prova gratuita include 30 minuti. I piani a pagamento partono da 2 $/mese per 200 minuti (Starter), 5 $/mese per 1.000 minuti (Basic), 10 $/mese per 2.500 minuti (Pro) e 20 $/mese per 6.000 minuti (Studio). Un video di 1 ora costa circa 0,30 $ per i sottotitoli con il piano Basic.

Come vengono dimensionate le cue dei sottotitoli? Sono leggibili sullo schermo?

VexaScribe elabora ogni esportazione di sottotitoli con un algoritmo di suddivisione delle cue a livello di parola. Le cue sono limitate a circa 80 caratteri e 5 secondi (limite massimo di 10 secondi) — corrispondendo all'intervallo di sottotitoli web leggibili usato da Descript, Sonix e Vimeo. Le divisioni preferiscono prima i confini di frase, poi le virgole, poi i confini di parola. Le etichette dei parlanti sono preservate in ogni divisione. I file si importano puliti in YouTube, Premiere Pro, Final Cut Pro, DaVinci Resolve e VLC senza pulizia manuale.

I sottotitoli restano sincronizzati con il parlato reale?

Sì. VexaScribe usa timestamp reali a livello di parola dal motore di trascrizione — i tempi di inizio e fine delle cue cadono su confini di parole reali, non su approssimazioni interpolate su un lungo segmento. Le pause drammatiche nel parlato (discorsi motivazionali, audiolibri) sono preservate: la cue resta sullo schermo durante il silenzio invece di produrre un lampeggio inferiore al secondo seguito da uno schermo vuoto.

VexaScribe utilizza OpenAI Whisper Large-v3 per la conversione voce-testo. Sul benchmark FLEURS il modello raggiunge circa il 5,5 % di Word Error Rate sull'italiano (Radford et al., «Robust Speech Recognition via Large-Scale Weak Supervision», arXiv:2212.04356, Tabella 5). L'accuratezza reale dipende da qualità audio, numero di parlanti, accenti e terminologia tecnica. «OpenAI» e «Whisper» sono marchi dei rispettivi titolari. YouTube, TikTok, Instagram, LinkedIn, Vimeo, Premiere Pro, Final Cut Pro e DaVinci Resolve sono marchi dei rispettivi proprietari — non hanno alcun rapporto commerciale con VexaScribe.