Características de VexaScribe
VexaScribe — transcripción con IA en 99 idiomas. Detección de hablantes, marcas de tiempo, resúmenes con IA y traducción integrada de transcripciones (133 idiomas). Sube archivos o envía un bot de reunión a Zoom, Meet o Teams. Desde $2/mes.
Qué es VexaScribe, en 80 palabras
VexaScribe es una aplicación web que convierte audio y video en transcripciones buscables, con marcas de tiempo y etiquetas de hablantes, usando OpenAI Whisper. Suelta un archivo (hasta 5 GB), pega un enlace de YouTube / TikTok / Instagram / URL directa, o envía un bot a tu reunión de Zoom, Google Meet o Teams. Obtén una transcripción en 99 idiomas en ~5–10 minutos por hora de audio, un resumen opcional con IA con puntos de acción y exportación a TXT, DOCX, SRT, VTT o JSON. 30 minutos gratis, después $2–$20/mes. Sin tarjeta de crédito para empezar.
Características principales
99 idiomas soportados
Transcribe audio y video en 99 idiomas con detección automática de idioma. Del inglés al japonés, del español al árabe — te tenemos cubierto.
Detección de hablantes
La detección automática de hablantes identifica y etiqueta las diferentes voces. Perfecto para entrevistas, podcasts y reuniones con varios participantes.
Marcas de tiempo
Cada transcripción incluye marcas de tiempo precisas. Haz clic en cualquier marca de tiempo para saltar a ese momento en tu audio. Esencial para navegación y subtítulos de video.
5 formatos de exportación
Exporta como TXT (texto plano), DOCX (Word), SRT o VTT (subtítulos de video) o JSON (datos estructurados con marcas de tiempo). Elige el formato que se adapte a tu flujo de trabajo.
Procesamiento rápido
La transcripción con IA se completa en minutos, no en horas. Una grabación de 1 hora se procesa normalmente en 5–10 minutos.
Editor integrado
Revisa y edita tus transcripciones directamente en el navegador. Corrige errores, renombra hablantes y pule tu transcripción antes de exportar.
Bot de reunión
Envía un bot con IA a tus reuniones de Zoom, Google Meet o Teams. Graba, transcribe y genera resúmenes estructurados con puntos de acción y decisiones. Usa 3× créditos de transcripción.
Resúmenes con IA
Convierte cualquier transcripción en puntos clave estructurados, puntos de acción, marcadores de capítulo y decisiones. Funciona en reuniones, clases, entrevistas y podcasts. Incluido en todos los planes de pago.
Traducción de transcripción
Traduce cualquier transcripción a 133 idiomas mediante Google Translate — sin coste adicional, sin necesidad de cuenta de terceros. Disponible en todos los planes.
Subida masiva — 50 archivos a la vez
Sube hasta 50 archivos de audio o video de una sola vez. Todos se procesan en paralelo — no uno por uno. Mezcla formatos libremente y descarga todo como un ZIP.
Chat con IA sobre tu transcripción
Haz preguntas en lenguaje natural sobre cualquier transcripción que poseas y obtén respuestas respaldadas por citas directas del audio. “¿Qué puntos de acción se asignaron?”, “¿Qué decidió Sarah?”, “Encuentra la cita más potente sobre X” — preguntas que normalmente te obligarían a volver a ver una grabación se convierten en una sola consulta. Cada respuesta viene con citas con marca de tiempo cliqueables que llevan al reproductor de audio al momento exacto en que se dijo la cita. Las citas se validan en el servidor contra la transcripción real — la IA está limitada a tu grabación y no puede inventar una marca de tiempo o una cita. Las conversaciones se conservan durante 90 días, con contexto multi-turno y soporte de 99 idiomas (pregunta en un idioma sobre una grabación en otro). Disponible en planes de pago.
Formatos soportados
Formatos de audio
Formatos de video
Formatos de exportación (5)
Texto plano
Documento de Word
Subtítulos
Subtítulos web
Datos estructurados
Casos de uso
Transcripción de reuniones
Un bot con IA se une a reuniones de Zoom, Meet o Teams
Transcripción de podcasts
Convierte episodios en notas del programa y publicaciones de blog
Transcripción de entrevistas
Transcribe con detección de hablantes
Transcripción de clases
Convierte grabaciones de clase en apuntes de estudio
Video a texto
Extrae transcripciones y crea subtítulos
MP3 a texto
Convierte archivos de audio en documentos de texto
Transcripción de audio
Conversión general de audio a texto
Impulsado por IA avanzada
VexaScribe usa modelos de reconocimiento de voz de última generación entrenados con millones de horas de audio. La misma tecnología detrás de los asistentes de voz, adaptada para una transcripción precisa.
Precisión para audio claro
Idiomas soportados
Tiempo de procesamiento por hora
Disponibilidad de características por plan
Todos los planes incluyen una prueba gratuita. No se requiere tarjeta de crédito para empezar.
| Característica | Prueba gratuita | Starter ($2/mes) | Pro ($10/mes) |
|---|---|---|---|
| Transcripción de audio y video | ✓ | ✓ | ✓ |
| 99 idiomas soportados | ✓ | ✓ | ✓ |
| Detección de hablantes | ✓ | ✓ | ✓ |
| Marcas de tiempo | ✓ | ✓ | ✓ |
| Exportación: TXT, DOCX, SRT, VTT, JSON | ✓ | ✓ | ✓ |
| Traducción de transcripción (133 idiomas) | ✓ | ✓ | ✓ |
| Editor integrado | ✓ | ✓ | ✓ |
| Resúmenes con IA | — | ✓ | ✓ |
| Bot de reunión (Zoom, Meet, Teams) | — | ✓ | ✓ |
| Transcripción masiva | ✓ | ✓ | ✓ |
Transcribir desde una URL — sin necesidad de descargar
Pega un enlace y obtén una transcripción. Nosotros nos encargamos de la descarga en segundo plano. Misma precisión, mismo resultado, mismo coste por minuto que subir un archivo — te ahorras el paso de “descargar el video primero, luego subirlo”.
| Fuente | Estado | Qué acepta |
|---|---|---|
| YouTube | ✓ Activo | Cualquier URL de video público. Se extrae el audio y se transcribe con detección de hablantes. Recurre a los subtítulos si falla la descarga del audio. |
| TikTok | ✓ Activo | Cualquier URL de video público de TikTok — funcionan tanto clips cortos estilo Reels como videos más largos. |
| ✓ Activo | Reels públicos, publicaciones de video e historias en video. Las publicaciones de foto devuelven un error claro de “sin contenido de video”. | |
| URL directa | ✓ Activo | Cualquier enlace HTTPS a un archivo de audio o video — MP3 de podcast, enlace S3, compartido de Google Drive, descarga de bot de Telegram, Dropbox, etc. |
| Spotify | ⏳ Próximamente | Reconocido pero aún no implementado. Pega un enlace y aparecerá un aviso de “Vota por antes” para que podamos priorizar según la demanda. |
Modelo de coste: Las subidas por URL se descuentan del mismo grupo mensual de minutos que las subidas de archivos — 1 minuto de audio = 1 minuto de tu plan. Sin un nivel separado para URLs.
Lo que VexaScribe no hace
Cinco cosas para las que VexaScribe realmente no está diseñado, con la herramienta que sí recomendaríamos en cada caso. Si tu caso de uso está en esta lista, ahórrate el registro de prueba.
Sin subtitulado en vivo en tiempo real
Las transcripciones se generan después de subir el archivo, no mientras hablas. Un archivo de 1 hora tarda entre 5 y 10 minutos en procesarse — perfecto para reuniones que revisas después, malo para eventos en vivo.
Usa en su lugar: Otter Live, los subtítulos integrados de Google Meet o Web Captioner para subtitulado en vivo gratuito basado en navegador.
Sin API REST pública
VexaScribe es una aplicación web para personas, no un servicio backend. No hay API para desarrolladores, ni SDK, ni webhook para subidas programáticas.
Usa en su lugar: API de OpenAI Whisper ($0.006/min), Deepgram Nova-3 (~$0.0043/min) o AssemblyAI (~$0.012/min).
Sin edición de video
Puedes exportar subtítulos SRT/VTT para llevarlos a tu editor, pero VexaScribe no cortará clips, no eliminará muletillas ni incrustará subtítulos en el video.
Usa en su lugar: Descript o Vrew para edición de video basada en transcripción; Premiere/Final Cut/DaVinci para flujos de trabajo NLE tradicionales.
Sin ajuste de vocabulario personalizado
No puedes subir un diccionario de nombres de marca, medicamentos o jerga técnica para sesgar el modelo. Whisper se usa tal cual, sin ajuste fino por cuenta.
Usa en su lugar: El “word boost” de AssemblyAI o el parámetro “keywords” de Deepgram para dominios con muchos nombres propios.
Sin autoalojamiento local / empresarial
El audio se procesa en nuestra nube — no hay despliegue aislado (air-gapped) ni con BAA de HIPAA disponible. Para contenido abogado-cliente, terapia clínica o clasificado donde una filtración crea responsabilidad legal directa, ninguna herramienta en la nube (incluida la nuestra) es la elección correcta.
Usa en su lugar: instala OpenAI Whisper localmente (gratis, se ejecuta en tu máquina, el audio nunca sale), o para precisión del 100% de nivel legal usa transcripción humana (Rev, GoTranscript) a $1.25–$1.99/min.
Precisión honesta — qué significan realmente las cifras
VexaScribe usa OpenAI Whisper (específicamente modelos de clase large-v3). Las páginas de marketing adoran decir “99% de precisión” — eso no es honesto. La precisión real de Whisper depende mucho de la calidad del audio, el acento y el número de hablantes. Esto es lo que puedes esperar.
Precisión de transcripción (Whisper)
- Inglés de estudio limpio, un solo hablante~92–97%
- Inglés con acento (no nativo, regional)~85–92%
- Entornos ruidosos (cafés, teléfono, exterior)~80–90%
- Español, francés, alemán, italiano, portugués, neerlandés limpios~88–94%
- Coreano, japonés, indonesio, turco, árabe, polaco~85–92%
Fuente: Open ASR Leaderboard + benchmarks del paper de Whisper (LibriSpeech, FLEURS, Common Voice).
Precisión de detección de hablantes
- 2 hablantes, sin solapamiento95%+
- 3–4 hablantes, solapamiento ocasional~88–94%
- 5–6 hablantes, dinámica de reunión~80–90%
- 7–15 hablantes, panel o grupo focal~70–82%
- Hasta 50 hablantes (máximo soportado)variable
Mejor precisión con 2–6 hablantes distintos. Puedes renombrar Hablante 1/2/3 en el editor después.
Lo que marca la diferencia
Tres cosas que importan más que elegir la “mejor” herramienta de transcripción:
- Un micrófono decente (un auricular USB o un micrófono de solapa supera al integrado del portátil por 5–15 puntos de precisión).
- Un hablante a la vez — el solapamiento arruina tanto la transcripción como la detección de hablantes.
- Bajo ruido de fondo. Graba en una habitación cerrada, no al lado de un ventilador o una rejilla de aire acondicionado.
Si necesitas precisión del 100% de nivel legal (escritos judiciales, investigación regulada), usa servicios de transcripción humana como Rev o GoTranscript a $1.25–$1.99/min. La IA te lleva a ~95% al 1–2% del coste — perfecto para la mayoría de casos, incorrecto para algunos.
FAQ de características
¿Qué idiomas soporta VexaScribe y qué tan precisos son?
99 idiomas, todos impulsados por OpenAI Whisper. La precisión depende del idioma y de la calidad del audio: ~92-97% en audio limpio en inglés (según el Open ASR Leaderboard), ~88-94% en español, francés, alemán, italiano, portugués y neerlandés limpios, y ~85-92% en coreano, japonés, indonesio, turco, polaco y árabe. Los acentos muy marcados, los hablantes solapados o los entornos ruidosos bajan esas cifras entre 5 y 10 puntos. El idioma se detecta automáticamente o puedes forzarlo manualmente.
¿VexaScribe tiene una API REST pública?
Todavía no — VexaScribe es una aplicación web, no un producto de API. Si necesitas integrar transcripción en tu propio software, usa la API de OpenAI Whisper ($0.006/min), Deepgram (~$0.0043/min en Nova-3) o AssemblyAI (~$0.012/min). Las tres tienen SDK y documentación adecuados. Si quieres un flujo de trabajo no-code que suba archivos y descargue transcripciones, VexaScribe es la opción correcta — solo que no vía API.
¿Qué formatos de archivo puede transcribir VexaScribe?
Audio: MP3, WAV, M4A, FLAC, OGG, AAC, WMA, OPUS. Video: MP4, MOV, AVI, MKV, WebM, WMV, FLV. La pista de audio se extrae automáticamente de los archivos de video — sin un paso de conversión separado. Exportaciones: TXT, DOCX, SRT, VTT, JSON.
¿Qué tan grande puede ser el archivo que suba?
Hasta 5 GB por archivo, que es aproximadamente 90 horas de MP3 a 128 kbps o unas 8 horas de video 1080p. Eso está muy por encima del límite de 25 MB de la mayoría de sitios gratuitos de conversión y del límite de ~200 MB del nivel gratuito de Otter. Para archivos de más de 5 GB, divide el archivo en Audacity o ffmpeg y sube las partes por separado.
¿VexaScribe entrena modelos de IA con mi audio?
No. Tu audio y transcripciones no se usan para entrenar ningún modelo — ni el nuestro ni el de OpenAI (usamos Whisper vía API, que no se entrena con las entradas). Puedes eliminar cualquier archivo desde tu panel en cualquier momento, y tanto el audio como la transcripción se eliminan. El audio se cifra en tránsito (TLS) y en reposo. Para contenido abogado-cliente, clínico o clasificado donde una filtración crearía responsabilidad legal directa, instala OpenAI Whisper localmente en su lugar — ninguna herramienta en la nube, incluida la nuestra, vale ese riesgo.
¿Qué se incluye en la prueba gratuita?
30 minutos de crédito de transcripción, los 99 idiomas, detección de hablantes, marcas de tiempo, todos los formatos de exportación (TXT/DOCX/SRT/VTT/JSON), el editor integrado, la subida masiva (hasta 50 archivos) y la traducción de transcripciones a 133 idiomas. No se requiere tarjeta de crédito. Los resúmenes con IA y el bot de reunión (Zoom/Meet/Teams) son solo de pago — empiezan desde $2/mes en el plan Starter.
¿Listo para empezar a transcribir?
Prueba VexaScribe gratis con 30 minutos de transcripción. No se requiere tarjeta de crédito.