Generador de Subtítulos — SRT y VTT automáticos desde vídeo o audio (gratis)
Sube tu vídeo o audio y obtén subtítulos precisos en 99 idiomas con marcas de tiempo a nivel de palabra en minutos. Exporta como SRT, VTT o TXT — o incrústalos directamente en el vídeo con tu propio estilo. 30 minutos gratis, sin tarjeta de crédito (subtitle generator en español).
Formatos compatibles:
En resumen
El generador de subtítulos de VexaScribe (auto subtitle generator) convierte cualquier archivo de audio o vídeo en SRT, VTT, TXT o subtítulos incrustados — impulsado por OpenAI Whisper Large-v3 en 99 idiomas. En español, el modelo alcanza aproximadamente un 5 % de tasa de error de palabra (WER)según el benchmark FLEURS. 30 minutos gratis, luego desde 2 $/mes por 200 minutos hasta 20 $/mes por 6.000 minutos — equivalente a entre 0,60 $ y 0,20 $ por hora de vídeo.
¿Qué es un generador de subtítulos?
Un generador de subtítulos es una herramienta impulsada por IA que reconoce el habla en archivos de audio o vídeo, la convierte en texto y le asigna marcas de tiempo precisas. El resultado es un archivo de subtítulos (típicamente SRT o VTT) que puede mostrarse sincronizado con la imagen — o incrustarse directamente en el vídeo (burn-in / hardcoded subtitles), pasando a formar parte fija del fotograma.
Para creadores, equipos de marketing, redacciones y universidades, la subtitulación automática sustituye al trabajo manual, a menudo de varias horas. VexaScribe utiliza OpenAI Whisper Large-v3 — un modelo de reconocimiento de voz entrenado con 680.000 horas de audio en 99 idiomas, con una de las mejores precisiones del sector para el español (tanto de España como de Latinoamérica).
Subtítulos vs. subtítulos para sordos (SDH / closed captions)
En el mundo hispanohablante los términos se usan a menudo como sinónimos, pero existe una diferencia importante — sobre todo de cara a la accesibilidad según WCAG 2.1 y la normativa UNE 153010:
| Formato | Contenido | Uso |
|---|---|---|
| Subtítulos (subtitles) | Solo diálogo — para espectadores que pueden oír el audio | Traducción, vídeos sin sonido en redes sociales |
| Subtítulos para sordos (SDH / closed captions) | Diálogo + [música], [aplausos], [timbre], etiquetas de hablante | Accesibilidad WCAG 2.1 SC 1.2.2 / 1.2.4, UNE 153010 |
VexaScribe genera ambos: subtítulos simples o — con unos pocos clics en el editor — versiones accesibles con etiquetas de hablante y eventos no verbales como [aplausos] o [música].
Ejemplo de salida: subtítulos SRT y VTT
Así se ve un subtítulo exportado desde una grabación en español — marcas de tiempo en formato SRT (segundos,milisegundos), UTF-8, directamente compatible con YouTube Studio, Premiere Pro, DaVinci Resolve y VLC.
Precios honestos — sin permanencias
Un vídeo de una hora cuesta alrededor de 0,30 $ para subtitular en el plan Basic (5 $/mes) — incluye exportación a SRT, VTT y TXT. Sin permanencia, cancela cuando quieras.
Ver todos los precios →Subtitulado manual vs. VexaScribe
Subtitulado manual (Aegisub, Subtitle Edit)
- ✗5–8 horas de trabajo por hora de audio — colocar y sincronizar cada cue a mano
- ✗Cualquier corte de edición obliga a resincronizar los tiempos
- ✗Cada idioma exige traducirse y volver a sincronizarse por separado
- ✗Sin detección de cambios de hablante — hay que marcarlos manualmente
- ✗Problemas de codificación con tildes, ñ y signos de apertura ¿ ¡ en .srt
Ideal para Proyectos artísticos, clips muy cortos o casos con audio de calidad extremadamente baja
VexaScribe (automático con Whisper Large-v3)
- ✓5–10 minutos por hora de audio — automático con tiempos a nivel de palabra
- ✓99 idiomas desde una sola subida, el idioma se detecta solo
- ✓Hasta 50 hablantes identificados y etiquetados automáticamente
- ✓Exportación SRT y VTT en UTF-8 limpio, tildes y ñ correctas
- ✓Editor para retocar, dividir cues y renombrar hablantes
Ideal para Canales de YouTube, Reels y TikTok, podcasts, e-learning, vídeos de marketing, grabaciones de conferencias
Cómo funciona el generador de subtítulos (3 pasos)
1. Sube el vídeo o audio
Arrastra y suelta el archivo: MP3, WAV, M4A, FLAC (audio) o MP4, MOV, MKV, WebM (vídeo) hasta 5 GB. En los vídeos se extrae la pista de audio automáticamente.
2. La IA detecta el idioma y sincroniza las cues
Whisper Large-v3 detecta el español (España y todas las variantes de Latinoamérica) automáticamente y produce marcas de tiempo a nivel de palabra. El procesamiento tarda entre un 20 y un 40 % de la duración del archivo.
3. Descarga SRT / VTT o incrusta
Exporta como SRT, VTT o TXT — o incrusta los subtítulos con tu propia tipografía, color, posición y efecto karaoke directamente en el vídeo (burn-in).
¿Qué formato de subtítulos para cada plataforma?
Cada plataforma trata los subtítulos de forma diferente. Instagram Reels y YouTube Shorts no aceptan archivos SRT sidecar en la subida nativa — ahí los subtítulos tienen que incrustarse directamente en el vídeo. Los vídeos largos y las plataformas de escritorio prefieren SRT. Para vídeos de Instagram y Reels, consulta nuestra guía de transcripción de Instagram.
| Plataforma | Formato de entrega | Nota |
|---|---|---|
| YouTube (Longform) | SRT | Subir en YouTube Studio → Subtítulos. VTT también es aceptado. |
| YouTube Shorts | Burn-in (incrustado) | Los SRT sidecar son recortados por la UI vertical — incrusta directamente en el vídeo para fiabilidad. |
| Instagram Reels | Burn-in | Instagram no acepta subida de SRT en Reels (help.instagram.com). Solo incrustado. |
| TikTok | Burn-in o base SRT | El editor de TikTok acepta un SRT base; la mayoría de creadores incrustan para controlar el estilo. |
| LinkedIn Video | SRT | Subida de SRT en el compositor de vídeo de LinkedIn. |
| Facebook Video | SRT | Subir vía Creator Studio → Subtítulos. |
| Vimeo | SRT o VTT | El reproductor de Vimeo soporta ambos; SRT es lo más sencillo. |
| Plataformas de podcast | TXT | TXT para notas del programa y transcripciones de episodios (Apple Podcasts, Spotify). |
| LMS corporativos | SRT o VTT | La mayoría de LMS (Cornerstone, Docebo, Canvas) aceptan ambos. VTT si necesitas posicionamiento. |
Verificado el 3 de agosto de 2026 con las páginas oficiales de ayuda de YouTube, Instagram, TikTok, LinkedIn y Vimeo.
Estilizar subtítulos incrustados (burn-in)
Cuando incrustas los subtítulos directamente en el vídeo (hardcoded subtitles), tienes control total sobre cada detalle visual. Ajustes típicos para Reels de redes sociales y YouTube Shorts:
- • Tipografía: Inter, Roboto, Montserrat o Impact (estilo broadcast). Fuentes personalizadas mediante subida.
- • Tamaño: 24–48 pt en fotograma vertical 1080×1920; 32–60 pt para estilos agresivos de redes sociales.
- • Color: texto blanco con contorno negro o color de marca con sombra para máxima legibilidad.
- • Posición: tercio inferior (estándar), centrado o tercio superior — para evitar los overlays de UI de TikTok/Reels.
- • Karaoke / palabra resaltada: se resalta la palabra que se está pronunciando — al estilo de los presets de CapCut y VEED.
- • Fondo: transparente, opaco o cápsula semitransparente detrás de cada cue.
Los subtítulos incrustados son especialmente útiles para vídeos verticales cortos (Reels, Shorts, TikTok), ya que más del 85 % de los usuarios ven sin sonido y las plataformas no aceptan subtítulos externos en esos formatos.
Cobertura de idiomas y precisión
VexaScribe usa OpenAI Whisper Large-v3, que cubre 99 idiomas. La precisión varía según el idioma y la calidad del audio. La siguiente tabla muestra la tasa de error de palabra (WER) en el benchmark FLEURS — cuanto más baja, mejor.
| Idioma | Whisper Large-v3 WER |
|---|---|
| Español (FLEURS) | ~4,5–5 % |
| Inglés | ~4,2 % |
| Portugués | ~5 % |
| Francés | ~4 % |
| Italiano | ~5 % |
| Alemán | ~4,5 % |
| Neerlandés | ~6 % |
| Polaco | ~6 % |
| Turco | ~7 % |
| Japonés | ~7 % |
| Árabe | ~8 % |
Fuente: Radford et al., Robust Speech Recognition via Large-Scale Weak Supervision, arXiv:2212.04356, Tabla 5. WER medido en los benchmarks FLEURS / CommonVoice. Las grabaciones reales con ruido de fondo, acentos marcados o terminología técnica muestran valores de WER más altos.
Editar los subtítulos (editor integrado)
Cada proyecto de subtitulado se abre en un editor con previsualización de vídeo sincronizada. Puedes:
- • Corregir palabras mal reconocidas con un clic — las marcas de tiempo se ajustan automáticamente.
- • Dividir o unir cues en los límites de palabra para mejorar la legibilidad.
- • Renombrar hablantes (p. ej., "Moderador", "Invitado 1") — las etiquetas se mantienen en el SRT exportado.
- • Ajustar la duración de cada cue para respetar pausas dramáticas o diálogos rápidos.
- • Insertar notación no verbal como [aplausos] o [música] para accesibilidad.
- • Reexportar como SRT, VTT, TXT o MP4 renderizado — sin recalcular la transcripción.
Funciones clave
Todo lo que necesitas para conseguir subtítulos profesionales desde vídeo o audio — en una sola herramienta.
99 idiomas, incluido español
Whisper Large-v3 con ~5 % WER en español (FLEURS). Detección automática del idioma — no hay que cambiar nada a mano.
SRT, VTT, TXT y burn-in
Todos los formatos habituales desde una sola subida. Para YouTube, Vimeo, LinkedIn, DaVinci Resolve, Premiere Pro y CapCut.
Hasta 50 hablantes
La detección automática de hablantes etiqueta a cada uno — máxima precisión con 2 a 6 hablantes.
Marcas de tiempo a nivel de palabra
El inicio y el final de cada cue caen sobre límites de palabra reales, no sobre puntos medios interpolados.
Editor con previsualización de vídeo
Correcciones con un clic, renombrar hablantes, dividir cues — los cambios se ven al instante en la previsualización.
Archivos de hasta 5 GB
Grabaciones largas de conferencias, clases o entrevistas se procesan sin trocearlas.
Preguntas frecuentes
¿Cómo genero subtítulos a partir de audio?
Sube tu archivo de audio o vídeo a VexaScribe arrastrando y soltando o usando el explorador de archivos. Nuestro motor de transcripción IA procesa el archivo, detecta las palabras habladas con marcas de tiempo precisas y genera un archivo de subtítulos. Una vez completado, exporta en formato SRT o VTT — ambos son compatibles con YouTube, TikTok, LinkedIn y la mayoría de editores de vídeo. El proceso completo toma solo unos minutos para la mayoría de archivos.
¿Qué formatos de subtítulos soporta VexaScribe?
VexaScribe exporta subtítulos en formatos SRT (SubRip) y VTT (WebVTT). SRT es el formato más ampliamente soportado y funciona con YouTube, Premiere Pro, DaVinci Resolve, Final Cut Pro y la mayoría de plataformas de redes sociales. VTT es el formato nativo web utilizado por reproductores de vídeo HTML5 y también es aceptado por YouTube y otras plataformas.
¿Qué tan precisos son los subtítulos generados por IA?
La precisión depende de la calidad del audio, el ruido de fondo y la claridad del hablante. Para grabaciones claras con ruido de fondo mínimo, VexaScribe generalmente ofrece alta precisión adecuada para uso profesional. Puedes revisar y editar los subtítulos en el editor integrado antes de exportar. Para contenido con acentos fuertes o jerga técnica, se recomienda una revisión rápida.
¿Puedo generar subtítulos en diferentes idiomas?
Sí, VexaScribe genera subtítulos en 99 idiomas incluyendo inglés, español, francés, alemán, portugués, italiano, chino, japonés, coreano, árabe, hindi y muchos más. El idioma se detecta automáticamente del audio, o puedes especificarlo manualmente para obtener los mejores resultados.
¿Cuál es la diferencia entre archivos de subtítulos SRT y VTT?
SRT (SubRip) es el formato de subtítulos más utilizado — simple, universal y aceptado por prácticamente todas las plataformas de vídeo y editores. VTT (WebVTT) es el formato web nativo más reciente que soporta estilos adicionales como color de fuente y posicionamiento. Para la mayoría de casos, SRT es la opción más segura. Elige VTT si necesitas reproducción web o estilos personalizados.
¿Puedo editar los subtítulos antes de descargarlos?
Sí. Después de la transcripción, puedes revisar y editar la transcripción completa en el editor integrado de VexaScribe. Corrige palabras, ajusta el tiempo, renombra hablantes y luego exporta la versión corregida como SRT o VTT. Esto te da subtítulos de calidad profesional sin trabajo manual de sincronización.
¿Qué formatos de vídeo y audio puedo subir?
VexaScribe acepta todos los formatos de audio comunes (MP3, WAV, M4A, FLAC, OGG, AAC) y formatos de vídeo (MP4, MOV, AVI, MKV, WebM). Para archivos de vídeo, extraemos la pista de audio automáticamente. Se admiten archivos de hasta 5 GB.
¿Cuánto cuesta la generación de subtítulos?
La generación de subtítulos usa los mismos precios que la transcripción. La prueba gratuita incluye 30 minutos. Los planes de pago comienzan en 2 $/mes por 200 minutos (Starter), 5 $/mes por 1.000 minutos (Basic), 10 $/mes por 2.500 minutos (Pro) y 20 $/mes por 6.000 minutos (Studio). Un vídeo de 1 hora cuesta aproximadamente 0,30 $ para subtitular en el plan Basic.
¿Cómo se dimensionan las cues de subtítulos? ¿Son legibles en pantalla?
VexaScribe procesa cada exportación de subtítulos mediante un algoritmo de división de cues a nivel de palabra. Las cues están limitadas a aproximadamente 80 caracteres y 5 segundos (límite máximo de 10 segundos) — coincidiendo con el rango de subtítulos web legibles usado por Descript, Sonix y Vimeo. Las divisiones prefieren primero los límites de oración, luego las comas, luego los límites de palabra. Las etiquetas de hablante se preservan en cada división. Los archivos se importan limpiamente en YouTube, Premiere Pro, Final Cut Pro, DaVinci Resolve y VLC sin limpieza manual.
¿Los subtítulos se mantienen sincronizados con el habla real?
Sí. VexaScribe usa marcas de tiempo reales a nivel de palabra del motor de transcripción — los tiempos de inicio y fin de las cues caen sobre límites de palabra reales, no sobre aproximaciones interpoladas a lo largo de un segmento largo. Las pausas dramáticas en el habla (charlas motivacionales, audiolibros) se preservan: la cue permanece en pantalla durante el silencio en lugar de producir un parpadeo de menos de un segundo seguido de pantalla en blanco.
¿Puedo generar subtítulos automáticos gratis?
Sí. VexaScribe ofrece 30 minutos gratis sin tarjeta de crédito, con exportación a SRT y VTT incluida. Para uso continuo, el plan Starter cuesta 2 $/mes por 200 minutos. Alternativa 100% gratuita: instalar Whisper localmente (gratis pero requiere Python y conocimientos técnicos). YouTube genera subtítulos automáticos gratis pero menos precisos y no se descargan como SRT.
¿Funciona con vídeos en español de varios países?
Sí. La IA detecta automáticamente la variante del español (ibérico, mexicano, argentino, colombiano, chileno, andaluz, etc.) y transcribe con precisión similar en todas. Para acentos muy marcados o jerga regional, la precisión puede bajar ligeramente — el editor integrado permite corregir antes de exportar.
Páginas relacionadas
MP3 a texto
Convierte archivos MP3 directamente en texto — para podcasts, dictados y notas de voz.
Vídeo a texto
Convierte MP4, MOV, MKV o WebM en texto — la pista de audio se extrae automáticamente.
Transcribir audio
Transcribe todos los formatos de audio — WAV, M4A, FLAC, OGG y más.
Transcripción de reuniones
Transcribe grabaciones de Zoom, Teams y Google Meet con etiquetas de hablante.
VexaScribe usa OpenAI Whisper Large-v3 para el reconocimiento de voz. En el benchmark FLEURS, el modelo alcanza aproximadamente un 5 % de tasa de error de palabra para el español (Radford et al., «Robust Speech Recognition via Large-Scale Weak Supervision», arXiv:2212.04356, Tabla 5). La precisión real depende de la calidad del audio, el número de hablantes, los acentos y la terminología técnica. «OpenAI» y «Whisper» son marcas de sus respectivos propietarios. YouTube, TikTok, Instagram, LinkedIn, Vimeo, Premiere Pro, Final Cut Pro y DaVinci Resolve son marcas de sus respectivos titulares — no existe ninguna relación comercial con VexaScribe.