Recursos do VexaScribe

VexaScribe — transcrição por IA em 99 idiomas. Detecção de locutor, marcações de tempo, resumos por IA e tradução integrada de transcrições (133 idiomas). Envie arquivos ou mande um bot de reunião para o Zoom, Meet ou Teams. A partir de $2/mês.

O que é o VexaScribe, em 80 palavras

O VexaScribe é um aplicativo web que transforma áudio e vídeo em transcrições pesquisáveis, com marcações de tempo e locutores identificados, usando o OpenAI Whisper. Solte um arquivo (até 5 GB), cole um link do YouTube / TikTok / Instagram / URL direta, ou envie um bot para sua reunião no Zoom, Google Meet ou Teams. Receba uma transcrição em 99 idiomas em cerca de 5–10 minutos por hora de áudio, resumo opcional por IA com itens de ação, e exportação para TXT, DOCX, SRT, VTT ou JSON. 30 minutos grátis, depois $2–$20/mês. Sem cartão de crédito para começar.

Recursos principais

99 idiomas suportados

Transcreva áudio e vídeo em 99 idiomas com detecção automática de idioma. Do inglês ao japonês, do espanhol ao árabe — cobrimos tudo.

Detecção de locutor

A detecção automática de locutor identifica e rotula vozes diferentes. Perfeito para entrevistas, podcasts e reuniões com vários participantes.

Marcações de tempo

Toda transcrição inclui marcações de tempo precisas. Clique em qualquer marcação para pular para aquele momento no áudio. Essencial para navegação e legendas de vídeo.

5 formatos de exportação

Exporte como TXT (texto simples), DOCX (Word), SRT ou VTT (legendas de vídeo) ou JSON (dados estruturados com marcações de tempo). Escolha o formato que se encaixa no seu fluxo de trabalho.

Processamento rápido

A transcrição por IA fica pronta em minutos, não em horas. Uma gravação de 1 hora costuma ser processada em 5 a 10 minutos.

Editor integrado

Revise e edite suas transcrições diretamente no navegador. Corrija erros, renomeie locutores e aperfeiçoe sua transcrição antes de exportar.

Bot de reunião

Envie um bot de IA para suas reuniões no Zoom, Google Meet ou Teams. Ele grava, transcreve e gera resumos estruturados com itens de ação e decisões. Usa 3× créditos de transcrição.

Resumos por IA

Transforme qualquer transcrição em pontos-chave estruturados, itens de ação, marcadores de capítulo e decisões. Funciona em reuniões, aulas, entrevistas e podcasts. Incluído em todos os planos pagos.

Tradução de transcrições

Traduza qualquer transcrição para 133 idiomas via Google Translate — sem custo extra, sem precisar de conta em terceiros. Disponível em todos os planos.

Upload em massa — 50 arquivos de uma vez

Envie até 50 arquivos de áudio ou vídeo de uma só vez. Todos processados em paralelo — não um por um. Misture formatos livremente e baixe tudo como um ZIP.

Chat com IA sobre sua transcrição

Faça perguntas em linguagem natural sobre qualquer transcrição sua e receba respostas embasadas em citações diretas do áudio. "Quais itens de ação foram atribuídos?", "O que a Sarah decidiu?", "Encontre a citação mais forte sobre X" — perguntas que normalmente exigiriam reassistir a gravação viram uma única consulta. Cada resposta vem com citações clicáveis com marcação de tempo que levam o player de áudio ao momento exato em que a citação foi dita. As citações são validadas no servidor contra a transcrição real — a IA é limitada à sua gravação e não pode inventar uma marcação de tempo ou citação. As conversas ficam salvas por 90 dias, com contexto de múltiplos turnos e suporte a 99 idiomas (pergunte em um idioma sobre uma gravação em outro). Disponível nos planos pagos.

Formatos suportados

Formatos de áudio

MP3WAVM4AFLACOGGAACWMAOPUS

Formatos de vídeo

MP4MOVAVIMKVWebMWMVFLV

Formatos de exportação (5)

TXT

Texto simples

DOCX

Documento Word

SRT

Legendas

VTT

Legendas web

JSON

Dados estruturados

Impulsionado por IA avançada

O VexaScribe usa modelos de reconhecimento de fala de última geração, treinados em milhões de horas de áudio. A mesma tecnologia por trás dos assistentes de voz, adaptada para transcrição precisa.

95%

Precisão para áudio claro

99

Idiomas suportados

5–10 min

Tempo de processamento por hora

Disponibilidade de recursos por plano

Todos os planos incluem um teste grátis. Não é preciso cartão de crédito para começar.

RecursoTeste grátisStarter ($2/mês)Pro ($10/mês)
Transcrição de áudio e vídeo
99 idiomas suportados
Detecção de locutor
Marcações de tempo
Exportação: TXT, DOCX, SRT, VTT, JSON
Tradução de transcrições (133 idiomas)
Editor integrado
Resumos por IA
Bot de reunião (Zoom, Meet, Teams)
Transcrição em massa

Transcreva a partir de uma URL — sem precisar baixar

Cole um link e receba a transcrição. Nós cuidamos do download em segundo plano. Mesma precisão, mesmo resultado, mesmo custo por minuto de um upload de arquivo — você pula a etapa de “baixar o vídeo primeiro e depois enviar”.

FonteStatusO que ele aceita
YouTube✓ AtivoQualquer URL de vídeo público. O áudio é extraído e transcrito com detecção de locutor. Recorre às legendas caso o download do áudio falhe.
TikTok✓ AtivoQualquer URL de vídeo público do TikTok — funcionam tanto clipes curtos no estilo Reels quanto vídeos mais longos.
Instagram✓ AtivoReels públicos, publicações em vídeo e Stories em vídeo. Publicações de fotos retornam um erro claro de “sem conteúdo de vídeo”.
URL direta✓ AtivoQualquer link HTTPS para um arquivo de áudio ou vídeo — MP3 de podcast, link S3, compartilhamento do Google Drive, download de bot do Telegram, Dropbox, etc.
Spotify⏳ Em breveReconhecido, mas ainda não implementado. Cole um link e aparece um aviso “Votar para priorizar” para que possamos priorizar conforme a demanda.

Modelo de custo: Uploads por URL consomem o mesmo pool mensal de minutos que uploads de arquivos — 1 minuto de áudio = 1 minuto do seu plano. Não há um nível separado para URLs.

O que o VexaScribe não faz

Cinco coisas para as quais o VexaScribe genuinamente não foi feito, com a ferramenta que realmente recomendaríamos em cada caso. Se o seu caso de uso está nesta lista, poupe-se do cadastro de teste.

Sem legendagem ao vivo em tempo real

As transcrições são geradas após o upload, não enquanto você fala. Um arquivo de 1 hora leva de 5 a 10 minutos para ser processado — ótimo para reuniões que você revisa depois, errado para eventos ao vivo.

Use em vez disso: Otter Live, as legendas nativas do Google Meet ou o Web Captioner para legendas ao vivo grátis no navegador.

Sem API REST pública

O VexaScribe é um aplicativo web para pessoas, não um serviço de backend. Não há API para desenvolvedores, nem SDK, nem webhook para uploads programáticos.

Use em vez disso: OpenAI Whisper API ($0.006/min), Deepgram Nova-3 (~$0.0043/min) ou AssemblyAI (~$0.012/min).

Sem edição de vídeo

Você pode exportar legendas em SRT/VTT para levar ao seu editor, mas o VexaScribe não corta trechos, não remove palavras de preenchimento e não queima legendas no vídeo.

Use em vez disso: Descript ou Vrew para edição de vídeo baseada em transcrição; Premiere/Final Cut/DaVinci para fluxos de trabalho NLE tradicionais.

Sem ajuste de vocabulário personalizado

Você não pode enviar um dicionário de nomes de marcas, nomes de medicamentos ou jargão técnico para direcionar o modelo. O Whisper é usado como está, sem ajuste fino por conta.

Use em vez disso: O “word boost” do AssemblyAI ou o parâmetro “keywords” do Deepgram para domínios com muitos nomes próprios.

Sem instalação local / self-hosting corporativo

O áudio é processado em nossa nuvem — não há implantação air-gapped ou com contrato HIPAA-BAA assinado. Para conteúdo advogado-cliente, terapia clínica ou material confidencial em que um vazamento gere responsabilidade jurídica direta, nenhuma ferramenta em nuvem (incluindo a nossa) é a escolha certa.

Use em vez disso: instale o OpenAI Whisper localmente (grátis, roda na sua máquina, o áudio nunca sai), ou para 100% de precisão de nível jurídico use transcrição humana (Rev, GoTranscript) por $1.25–$1.99/min.

Precisão honesta — o que os números realmente significam

O VexaScribe usa o OpenAI Whisper (especificamente modelos da classe large-v3). Páginas de marketing adoram dizer “99% de precisão” — isso não é honesto. A precisão real do Whisper depende muito da qualidade do áudio, do sotaque e do número de locutores. Aqui está o que esperar.

Precisão da transcrição (Whisper)

  • Inglês limpo de estúdio, um único locutor~92–97%
  • Inglês com sotaque (não nativo, regional)~85–92%
  • Ambientes ruidosos (cafés, telefone, ao ar livre)~80–90%
  • Espanhol, francês, alemão, italiano, português e holandês limpos~88–94%
  • Coreano, japonês, indonésio, turco, árabe, polonês~85–92%

Fonte: Open ASR Leaderboard + benchmarks do paper do Whisper (LibriSpeech, FLEURS, Common Voice).

Precisão da detecção de locutor

  • 2 locutores, sem sobreposição95%+
  • 3–4 locutores, sobreposição ocasional~88–94%
  • 5–6 locutores, dinâmica de reunião~80–90%
  • 7–15 locutores, painel ou grupo focal~70–82%
  • Até 50 locutores (máximo suportado)variável

Melhor precisão com 2–6 locutores distintos. Você pode renomear Locutor 1/2/3 no editor depois.

O que realmente faz diferença

Três coisas que importam mais do que escolher a “melhor” ferramenta de transcrição:

  1. Um microfone decente (headset USB ou lapela supera o embutido do notebook em 5–15 pontos de precisão).
  2. Um locutor por vez — sobreposição destrói tanto a transcrição quanto a detecção de locutor.
  3. Pouco ruído de fundo. Grave em uma sala fechada, não ao lado de um ventilador ou saída de ar-condicionado.

Se você precisa de 100% de precisão de nível jurídico (petições judiciais, pesquisa regulamentada), use serviços de transcrição humana como Rev ou GoTranscript por $1.25–$1.99/min. A IA te leva a ~95% por 1–2% do custo — ótimo para a maioria dos casos, errado para alguns.

FAQ de recursos

Quais idiomas o VexaScribe suporta e qual a precisão deles?

99 idiomas, todos impulsionados pelo OpenAI Whisper. A precisão depende do idioma e da qualidade do áudio: ~92–97% em áudio limpo em inglês (segundo o Open ASR Leaderboard), ~88–94% em espanhol, francês, alemão, italiano, português e holandês limpos, e ~85–92% em coreano, japonês, indonésio, turco, polonês e árabe. Fala com sotaque forte, locutores sobrepostos ou ambientes ruidosos derrubam esses números em 5–10 pontos. O idioma é detectado automaticamente ou você pode forçá-lo manualmente.

O VexaScribe tem uma API REST pública?

Ainda não — o VexaScribe é um aplicativo web, não um produto de API. Se você precisa integrar transcrição ao seu próprio software, use a OpenAI Whisper API ($0.006/min), o Deepgram (~$0.0043/min no Nova-3) ou o AssemblyAI (~$0.012/min). Todos os três têm SDKs e documentação adequados. Se você quer um fluxo no-code que envia arquivos e baixa transcrições, o VexaScribe é a escolha certa — só não via API.

Quais formatos de arquivo o VexaScribe consegue transcrever?

Áudio: MP3, WAV, M4A, FLAC, OGG, AAC, WMA, OPUS. Vídeo: MP4, MOV, AVI, MKV, WebM, WMV, FLV. A faixa de áudio é extraída automaticamente dos arquivos de vídeo — sem etapa de conversão separada. Exportações: TXT, DOCX, SRT, VTT, JSON.

Qual o tamanho máximo de arquivo que posso enviar?

Até 5 GB por arquivo, o que dá aproximadamente 90 horas de MP3 a 128 kbps ou cerca de 8 horas de vídeo em 1080p. É muito além do limite de 25 MB da maioria dos sites conversores gratuitos e do teto de ~200 MB do nível grátis do Otter. Para arquivos maiores que 5 GB, divida o arquivo no Audacity ou no ffmpeg e envie as partes separadamente.

O VexaScribe treina modelos de IA com meu áudio?

Não. Seu áudio e suas transcrições não são usados para treinar nenhum modelo — nem o nosso nem o da OpenAI (usamos o Whisper via API, que não treina com as entradas). Você pode excluir qualquer arquivo do seu painel a qualquer momento, e tanto o áudio quanto a transcrição são removidos. O áudio é criptografado em trânsito (TLS) e em repouso. Para conteúdo advogado-cliente, clínico ou confidencial em que um vazamento geraria responsabilidade jurídica direta, instale o OpenAI Whisper localmente — nenhuma ferramenta em nuvem, incluindo a nossa, vale esse risco.

O que está incluído no teste grátis?

30 minutos de crédito de transcrição, todos os 99 idiomas, detecção de locutor, marcações de tempo, todos os formatos de exportação (TXT/DOCX/SRT/VTT/JSON), o editor integrado, upload em massa (até 50 arquivos) e tradução de transcrições para 133 idiomas. Sem cartão de crédito. Resumos por IA e o bot de reunião (Zoom/Meet/Teams) são apenas para planos pagos — esses começam em $2/mês no plano Starter.

Pronto para começar a transcrever?

Experimente o VexaScribe grátis com 30 minutos de transcrição. Sem cartão de crédito.