Vídeo para Texto: Transcrever Vídeo em Texto e Legendas SRT
Faça upload do vídeo — MP4, MOV, MKV, WEBM, AVI, até 5 GB — e receba transcrição com 92-97% de precisão real em português brasileiro, identificação de falantes, timestamps, e exportação em TXT, DOCX, SRT ou VTT. Sem extrair áudio antes, sem instalar nada, sem plugin. Precisão medida pelo Distil-Whisper Common Voice Brasil (WER 8.22%), não os “99%” de marketing. 30 minutos grátis, sem cartão de crédito.
Por Equipe Editorial VexaScribe · Atualizado em
Transcrever Vídeo em 4 Passos
Sem extrair áudio primeiro, sem instalar nada. Upload, aguarda, exporta.
Faça upload do arquivo de vídeo
Arraste MP4, MOV, MKV, WEBM ou AVI diretamente — até 5 GB. Sem pré-conversão, sem extração manual de áudio. Modernas ferramentas de transcrição extraem o áudio do container do vídeo automaticamente.
Aguarde o processamento
Cerca de 10-15% da duração do vídeo. Vídeo de 30 min processa em ~3-5 min; 1h em 5-10 min; 3h (aula longa, podcast em vídeo) em 25-30 min. Feche a aba do navegador — a transcrição fica salva na sua conta.
Revise falantes e nomes próprios
Diarização IA identifica automaticamente até 50 falantes (SPEAKER 1, SPEAKER 2). Renomeie uma vez para nome real (Host, Convidado, Professor) — atualiza em todo arquivo. Confira nomes próprios, marcas e jargão contra o vídeo.
Exporte TXT, DOCX, SRT ou VTT
Uma passada de transcrição dá TXT (texto puro), DOCX (Word), SRT/VTT (legendas para YouTube/Vimeo/Premiere), ou PDF. Sem re-upload para trocar de formato.
Custo: 1 hora de vídeo custa cerca de US$0,30 (~R$1,50-3) no plano Starter (US$2/mês, 200 minutos). Para transcrever um canal inteiro (100+ vídeos), o Studio (US$20/mês, 6.000 minutos) cobre a maioria dos casos a ~R$0,50 por vídeo.
Como Extrair Áudio de Vídeo? (Você Não Precisa)
Uma pergunta comum: preciso extrair o áudio do vídeo antes de transcrever? Resposta curta: não. Ferramentas modernas de transcrição (VexaScribe, Whisper, Deepgram, AssemblyAI, Rev) aceitam arquivos de vídeo diretamente e extraem a track de áudio internamente. A dica de “extrair áudio primeiro” vem de ferramentas antigas (Google Cloud Speech v1, IBM Watson pré-2020) que só aceitavam áudio.
Se você ainda quiser extrair manualmente por outro motivo (arquivar só áudio, editar no DAW), use uma dessas ferramentas:
- FFmpeg (grátis, linha de comando):
ffmpeg -i video.mp4 -vn -acodec copy audio.aacextrai o áudio sem re-codificar. - VLC (grátis, interface): Mídia → Converter/Salvar → escolha perfil de áudio (MP3, WAV).
- Handbrake (grátis): permite exportar só a track de áudio na aba Audio.
- Audacity (grátis): importa MP4/MKV, exporta em MP3/WAV.
Mas para transcrição, pule essa etapa — faça upload do MP4/MOV/MKV direto no VexaScribe. Um passo a menos, mesma qualidade de transcrição.
Formatos de Vídeo Suportados
Regra prática: se o arquivo abre no VLC ou QuickTime, transcrevemos.
| Formato | O que significa | Suporte |
|---|---|---|
| MP4 | H.264 ou H.265 — padrão para celulares, gravadores de tela e a maioria dos editores. | Universal |
| MOV | Apple QuickTime — gravações de iPhone, captura de tela de Mac. | Universal |
| WEBM | Gravações de navegador, exports do YouTube, captura via OBS. | Universal |
| MKV | Alta qualidade, arquivos ripados, gravações profissionais. | Universal |
| AVI | Windows antigo, ainda comum em ambiente corporativo. | Universal |
| WMV | Windows Media legado. | Suporta |
| FLV | Flash legacy, ainda em CMS antigos. | Suporta |
| MPEG/MPG | Camcorders antigos, captação de satélite. | Suporta |
| ProRes RAW / codecs de edição | Intermediários não comprimidos do Final Cut/DaVinci — às vezes sem track de áudio. | Exporte MP4 primeiro |
O limite de 5 GB por arquivo cobre cerca de 4-6 horas de vídeo 1080p ou 8-10 horas de 720p. Vídeos maiores: comprima para 720p com Handbrake (grátis) — resolução do vídeo não afeta a qualidade da transcrição, só o tamanho.
Precisão Real em Português Brasileiro (Não “99%” de Marketing)
Precisão real do Whisper Large-v3 em pt-BR áudio limpo: 92-97% (WER 3-8%), conforme benchmark Distil-Whisper Common Voice Brasil (WER 8.22%). Varia por condição de áudio:
| Condição do áudio no vídeo | Precisão real |
|---|---|
| Microfone headset em sala silenciosa (podcast em vídeo, Zoom) | 95-97% |
| Microfone de câmera em sala silenciosa (vlog, aula gravada) | 92-95% |
| Vídeo com música de fundo | 85-92% |
| Múltiplos falantes em sobreposição | 78-88% |
| Sotaque regional forte (nordestino profundo, norte) | 86-92% |
Para dados completos por sotaque regional (paulista, sudeste, nordeste, norte) e comparação com Deepgram e AssemblyAI, veja nosso guia de precisão do Whisper em português.
Casos de Uso Comuns
Os seis usos mais comuns de transcrição de vídeo entre usuários brasileiros:
Não é bem um vídeo? Use a Ferramenta Certa
Você só tem o URL do YouTube (não o arquivo) — use Transcrição do YouTube. Cole o URL diretamente — sem etapa de download. Fluxo mais curto.
Você só quer o arquivo SRT (sem o documento em texto) — use Gerador de Legendas. Pula o editor de transcrição — recebe o .srt pronto para YouTube/Vimeo.
Você tem só áudio (MP3, WAV, M4A) — use Transcrever Áudio. Mesmo motor, guia focado em arquivos de áudio.
Você quer resumo do vídeo, não transcrição completa — use Resumo de Aula. Extrai pontos-chave e estrutura em vez do texto literal completo.
LGPD — Vídeo com Pessoas Identificáveis
Sob a LGPD (Lei nº 13.709/2018), vídeos que mostram ou capturam voz de pessoas identificáveis contêm dados pessoais. A transcrição herda a mesma proteção. VexaScribe: upload criptografado, sem revisão humana, sem uso de conteúdo para treinar modelos, exclusão a qualquer momento. Para vídeo altamente sensível (jurídico, médico, entrevistas com pessoas vulneráveis), considere Whisper instalado localmente — 100% offline, sem envio de dados para nuvem alguma.
Vídeo pronto?
Identificação de falantes, timestamps, 99 idiomas, TXT/DOCX/SRT/VTT. 30 minutos grátis, sem cartão de crédito, planos a partir de US$2/mês (~R$10).
Transcrever Vídeo GrátisPerguntas Frequentes
Como transcrever vídeo em texto?
Quatro passos: (1) faça upload do arquivo de vídeo (MP4, MOV, MKV, WEBM, AVI — até 5 GB, cobre vídeos de 4-6 horas); (2) aguarde o processamento (~10-15% da duração — vídeo de 1h processa em 5-10 min); (3) revise a identificação automática de falantes e nomes próprios; (4) exporte em TXT/DOCX (documento), SRT/VTT (legendas para YouTube/Vimeo) ou PDF. Sem etapa manual de extração de áudio — o VexaScribe extrai o áudio do container do vídeo internamente. Precisão real 92-97% em áudio limpo em português brasileiro (Whisper Large-v3, verificado pelo Open ASR Leaderboard).
Como extrair áudio de vídeo antes de transcrever?
Você não precisa. Ferramentas modernas de transcrição (VexaScribe, Whisper, Deepgram, AssemblyAI) aceitam arquivos de vídeo diretamente e extraem o áudio internamente. A dica de "extrair áudio primeiro" vem de ferramentas antigas (Google Cloud Speech v1, IBM Watson pré-2020) que só aceitavam áudio. Se você AINDA quiser extrair manualmente por outro motivo: FFmpeg é a ferramenta padrão (`ffmpeg -i video.mp4 -vn -acodec copy audio.aac`), VLC também exporta áudio (Mídia → Converter/Salvar), e Handbrake permite exportar só a track de áudio. Mas para transcrição, pule essa etapa — faça upload do MP4/MOV direto.
Quais formatos de vídeo são suportados?
MP4 (H.264 e H.265 — mais comum), MOV (Apple QuickTime, gravações de iPhone/Mac), MKV (alta qualidade), WEBM (YouTube exports, gravações de navegador), AVI (Windows antigo), WMV, FLV, MPG/MPEG. Também aceita ProRes RAW e alguns codecs de edição profissional. Regra prática: se o arquivo abre no VLC ou QuickTime, transcrevemos. Tamanho máximo: 5 GB por arquivo — cobre cerca de 4-6 horas de vídeo 1080p ou 8-10 horas de vídeo 720p.
Qual a precisão real da transcrição de vídeo em português?
Precisão real do Whisper Large-v3 em pt-BR áudio limpo: 92-97% (WER 3-8%), conforme benchmark Distil-Whisper Common Voice Brasil (WER 8.22%). Varia por sotaque: paulista 94-96%, sudeste 92-95%, nordeste 88-92%, norte 86-90%. Áudio de vídeo com música de fundo, ambiente ruidoso ou múltiplos falantes em sobreposição cai para 78-90%. Ferramentas que anunciam "99% de precisão" para pt-BR estão medindo cenário ideal — o WER real medido em benchmarks públicos é 3-8% em áudio limpo. Para saber mais, veja nosso guia de precisão do Whisper em português.
Posso gerar legendas SRT do vídeo?
Sim — o VexaScribe exporta a transcrição em SRT ou VTT com timestamps precisos, prontos para subir ao YouTube, Vimeo, ou importar em editores de vídeo (Premiere, Final Cut, DaVinci Resolve, CapCut). Um único processamento produz tanto o documento em texto (TXT/DOCX) quanto o arquivo de legendas (SRT/VTT). Se você quer APENAS as legendas em SRT (sem o documento em texto), veja nosso gerador de legendas — fluxo mais curto para o mesmo objetivo.
Como transcrever vídeo do YouTube em texto?
Se você tem o URL do YouTube (seu ou de terceiros), use nossa página de transcrição do YouTube — cole o URL e receba a transcrição sem baixar o vídeo. Se você já baixou o vídeo (MP4/MOV) e prefere fazer upload, o VexaScribe processa igualmente. Para conteúdo próprio no YouTube: prefira o arquivo master original (fora do YouTube), que costuma ter melhor qualidade que o stream comprimido do YouTube.
Vídeo com múltiplos falantes tem identificação separada?
Sim. Diarização automática identifica até 50 falantes por vídeo (melhor precisão com 2-6 vozes distintas). Ideal para entrevistas em vídeo (host + convidado, ~95% de precisão de rotulação), painéis com 3-4 participantes (90-95%), roundtables com 5+ vozes (80-90%). Falantes aparecem como "SPEAKER 1", "SPEAKER 2" — renomeie uma vez no editor e todas as ocorrências atualizam.
Funciona com vídeos longos (aulas, podcasts em vídeo, palestras)?
Sim. Vídeos de 2, 3 ou até 4 horas (comum em aulas online, podcasts em vídeo, palestras gravadas, lives longas) são processados em uma única passada, sem necessidade de dividir. Tempos realistas: 1h ≈ 5-10 min de processamento; 2h ≈ 15-20 min; 3h ≈ 25-30 min. Você pode fechar a aba do navegador — a transcrição salva automaticamente. Limite de 5 GB por arquivo cobre cerca de 4-6 horas de vídeo 1080p.
É seguro transcrever vídeo? Como fica a LGPD?
Sob a LGPD (Lei nº 13.709/2018), gravações de vídeo que incluem pessoas identificáveis contêm dados pessoais. A transcrição herda a mesma proteção. VexaScribe: upload criptografado, sem revisão humana, arquivos podem ser apagados a qualquer momento, sem uso de conteúdo para treinar modelos. Para vídeo sensível (jurídico, médico, entrevistas com pessoas vulneráveis), considere Whisper instalado localmente no seu computador — 100% offline, sem envio de dados para nuvem alguma. Verifique política de retenção de qualquer serviço antes de subir vídeo com dados pessoais.