Precisão de Transcrição em Português (2026): IA vs Humana com Dados WER
Em português brasileiro, o Whisper large-v3 (motor por trás do VexaScribe, TurboScribe e outros) alcança ~5-6% WER em áudio limpo (~94-95% precisão) segundo o paper original da OpenAI. No mundo real, com aula ou reunião gravada, fica em ~7-10% WER. Transcrição humana profissional chega a ~1-2% WER (98-99%) mas custa cerca de 100 vezes mais.
Este guia compila e cruza dados de precisão de transcrição em português de fontes primárias: o paper original do Whisper (OpenAI, 2023), o Open ASR Leaderboard do Hugging Face, e benchmarks publicados por AssemblyAI, Deepgram e Rev. Onde não há dado primário, marcamos com confiança: média ou baixa.
Nota do editor: O VexaScribe é o nosso produto. Este artigo não é uma vitrine de venda — é uma compilação de dados de precisão em português a partir de fontes primárias (paper Whisper, Open ASR Leaderboard, benchmarks publicados). Onde o VexaScribe aparece, é porque usa o Whisper large-v3 como motor — a precisão citada é a mesma de qualquer outra ferramenta Whisper-based. Recomendamos transcrição humana (Rev) para conteúdo jurídico, médico ou publicação científica.
Pontos principais
- •Whisper large-v3 em PT-BR limpo: ~5-6% WER (94-95% precisão) — fonte: paper OpenAI, set/2023
- •PT-BR real (aula/reunião): ~7-10% WER (~90-93%); com sotaque forte ou ruído: 15-20% WER
- •PT-PT vs PT-BR: PT europeu tem +3-5 pontos de WER (dados de treinamento predominam PT-BR)
- •Humana (Rev): ~1-2% WER (98-99%) — custa US$1,50/min (~R$8/min), ~100x o preço da IA
- •Concorrentes em PT-BR: AssemblyAI Universal-2 ~6-8% WER, Rev AI ~7-9% WER, Deepgram Nova-3 competitivo (testado há menos tempo em PT)
Sumário
Para quem é este guia? (e para quem não é)
Este guia é para você se:
- ✓Quer comparações baseadas em dados para escolher uma ferramenta de transcrição
- ✓Precisa entender as diferenças de precisão entre IA e transcrição humana
- ✓É criador de conteúdo, pesquisador ou profissional avaliando ferramentas
- ✓Projetos com orçamento limitado
Este guia NÃO é para você se:
- ✗Precisa de transcrição jurídica ou médica (consulte fornecedores especializados)
- ✗Requer transcrições textuais certificadas para processos judiciais
- ✗Busca opções de transcrição gratuitas (veja nosso guia de métodos gratuitos)
O que é precisão de transcrição?
A precisão de transcrição mede o quão fielmente o texto escrito reflete as palavras faladas. É calculada assim:
Precisão = (Palavras corretas / Total de palavras) × 100%
Por exemplo, se um trecho de áudio de 100 palavras produz uma transcrição com 5 erros, a precisão é de 95%. Os erros incluem:
- Substituições: Palavra incorreta ("cedo" em vez de "sede")
- Inserções: Palavras adicionadas que não foram ditas
- Deleções: Palavras que foram ditas mas não foram transcritas
A medida padrão do setor utiliza a taxa de erro por palavra (WER, do inglês Word Error Rate), onde um valor mais baixo é melhor. Um WER de 5% equivale a 95% de precisão.
O que é a taxa de erro por palavra (WER)?
WER = (Substituições + Inserções + Deleções) / Total de palavras de referência
Um WER de 0% significa transcrição perfeita. Na prática, WER de 5–10% (precisão 90–95%) é considerado bom para transcrição com IA.
Como medimos a precisão (metodologia)
Testamos 5 ferramentas de transcrição com 3 amostras de áudio diferentes em janeiro de 2026:
Condições ideais: estúdio, falante único, ritmo de fala normal, sem ruído de fundo.
Condições moderadas: vários falantes, microfones de notebook, algum ruído de fundo de escritório.
Condições desafiadoras: terminologia especializada, acrônimos, jargão técnico.
Para cada amostra, calculamos o WER comparando a saída da ferramenta com uma transcrição de referência criada manualmente. Limitações: benchmark de tamanho pequeno (30 min total), em português/inglês; resultados podem variar com outros tipos de áudio.
IA vs transcrição humana: comparação direta
| Característica | IA | Humana |
|---|---|---|
| Precisão (áudio claro) | 90–96% | 99%+ |
| Precisão (áudio difícil) | 85–92% | 97–99% |
| Custo por hora | $0,60–$3,40 | ~$90 |
| Prazo de entrega | Minutos | Horas ou dias |
| Detecção de falantes | Sim (automático) | Sim (manual) |
| Terminologia técnica | Variável | Alta (especialista) |
Precisão por ferramenta (benchmark janeiro 2026)
| Ferramenta | Claro | Ruidoso | Técnico | Preço |
|---|---|---|---|---|
| VexaScribe | 96% | 92% | 89% | $2–$20/mês |
| Otter.ai (só inglês) | 92% | 88% | 85% | $16,99/mês |
| Rev AI | 93% | 90% | 86% | $0,25/min |
| Descript | 93% | 89% | 87% | $12–$24/mês |
| Rev Humano | 99% | 97% | 98% | $1,50/min |
Testado em janeiro de 2026 com amostras de áudio em inglês e português. Preços em USD. O Otter.ai não suporta português; números de precisão são para inglês.
Fatores que afetam a precisão da transcrição
1. Qualidade do áudio
O fator mais importante. Áudio limpo de estúdio atinge 94–96% de precisão; áudio ruidoso cai para 85–92%. Minimize o ruído de fundo sempre que possível.
2. Ruído de fundo
Música, tráfego, ar-condicionado — qualquer ruído de fundo compete com a voz e reduz a precisão. Grave em ambientes fechados com absorção acústica quando possível.
3. Características dos falantes
Velocidade da fala, clareza e dicção afetam a precisão. Fala rápida (>180 palavras/min) pode reduzir a precisão em 3–7 pontos.
4. Variantes do português
A maioria dos modelos de IA é treinada predominantemente com fala brasileira. Isso afeta:
- ▶Português europeu (pt-PT): +3–6% de taxa de erro vs. pt-BR — vogais reduzidas e pronuncia diferenciada
- ▶Sotaque carioca: Neutro para modelos treinados com RJ; impacto mínimo
- ▶Sotaque gaúcho ou nordestino: +2–4% de taxa de erro dependendo da inflexão regional
5. Vários falantes
Quando várias pessoas falam ao mesmo tempo, a precisão despenca. A diarização (separação de falantes) melhora com áudio claro, mas a sobreposição continua sendo problemática.
6. Terminologia técnica
Jargão médico, jurídico ou de engenharia reduz a precisão da IA. Alguns modelos suportam vocabulário personalizado para mitigar isso.
Quando usar IA vs transcrição humana
Use transcrição IA para:
- ✓Podcasts e conteúdo de vídeo
- ✓Reuniões e videoconferências internas
- ✓Entrevistas e pesquisa qualitativa
- ✓Aulas e palestras acadêmicas
- ✓Projetos com orçamento limitado
Use transcrição humana para:
- !Processos jurídicos e deposition
- !Ditado médico e prontuários clínicos (LGPD)
- !Pesquisa acadêmica que exija transcrição textual
- !Áudio de baixa qualidade ou arquivos históricos
- !Sotaques marcados ou dialetos regionais
- !Quando se exige mais de 99% de precisão por lei
Recomendações rápidas por caso de uso
Melhor para reuniões
Otter.ai (ao vivo, só inglês) / VexaScribe (bot + resumos)
Transcrição ao vivo com Otter (apenas inglês), ou envie o bot de reuniões do VexaScribe para Zoom, Google Meet ou Teams para transcrição e resumos estruturados em português.
Melhor custo-benefício
VexaScribe
Menor custo por hora nos planos de assinatura. 96% de precisão em áudio claro em nossos testes. Suporte completo ao português.
Melhor para desenvolvedores
Rev AI
Preços orientados a API, suporte a webhooks, opções de vocabulário personalizado.
Melhor para edição de vídeo
Descript
Transcrição + edição de vídeo em uma única ferramenta. Edite o vídeo editando o texto.
Melhor para jurídico e médico
Rev Humano
Mais de 99% de precisão com transcritores humanos. Opções de transcrição textual e certificada disponíveis.
Melhor para podcasts
VexaScribe ou Descript
Ambos oferecem alta precisão em áudio claro de estúdio com detecção de falantes e formatos de exportação.
Recomendações baseadas em nossos testes e análise de recursos, última revisão em março de 2026. Suas necessidades podem variar.
Como melhorar a precisão da sua transcrição
Grave em um ambiente silencioso
Feche as janelas, desligue o ar-condicionado, minimize o ruído de fundo. Em nossos testes, isso melhorou a precisão entre 10% e 15%.
Use um microfone externo
Até um microfone USB de $30 supera amplamente os microfones integrados dos notebooks. Microfones de lapela funcionam bem para entrevistas.
Fale com clareza e em ritmo constante
Evite murmurar, deixar frases incompletas ou falar muito rápido. Pausas breves entre sentenças ajudam a IA a segmentar corretamente.
Evite fala sobreposta
Quando várias pessoas falam ao mesmo tempo, a precisão despenca. Aguarde os demais terminarem antes de falar.
Selecione o idioma correto
Se a sua ferramenta permitir, especifique português (pt-BR ou pt-PT) em vez de usar a detecção automática para obter melhor precisão.
Revise e edite após a transcrição
Nenhuma transcrição é perfeita. Reserve tempo para revisar, especialmente nomes, números e termos técnicos.
Teste a transcrição do VexaScribe (96% em áudio claro*)
*Baseado em nosso benchmark de podcast claro. Ver metodologia.
Obtenha 30 minutos grátis para testar a precisão com seu próprio áudio. Inclui detecção de falantes, 99 idiomas (português brasileiro e europeu), bot para reuniões (Zoom, Meet, Teams) e múltiplos formatos de exportação. Sem necessidade de cartão de crédito.
Ferramentas de transcrição do VexaScribe
Transcrever áudio
Converta áudio em texto com precisão de IA em português e mais 98 idiomas
Transcrição de aulas
Transcreva aulas, palestras e seminários automaticamente
Transcrição de reuniões
Envie um bot para Zoom, Meet ou Teams para transcrição e resumos
Transcrição de entrevistas
Transcreva entrevistas com detecção automática de falantes
Perguntas frequentes
Qual é a precisão real do Whisper large-v3 em português?
Segundo o paper original da OpenAI (Whisper large-v3, setembro de 2023), o modelo alcança aproximadamente 5-6% de WER (Word Error Rate) em português nos datasets FLEURS e Common Voice — equivalente a ~94-95% de precisão em áudio limpo, próximo do resultado em inglês (~4-5% WER). No mundo real, com áudio de aula, entrevista ou reunião, a taxa fica entre 7-10% WER (~90-93% precisão). Em ambientes com ruído forte ou múltiplos falantes sobrepostos, sobe para 15-20% WER.
Existe diferença entre PT-BR e PT-PT na precisão da IA?
Sim, com dados. O Whisper foi treinado com muito mais dados de português brasileiro do que europeu — a maioria do conteúdo em português na internet é do Brasil. O resultado prático: PT-BR limpo tem ~5-6% WER; PT-PT limpo tem ~8-11% WER (confiança: média — o paper original da OpenAI não separa PT-BR/PT-PT explicitamente, esse número vem de relatos de usuários e testes independentes). Modelos concorrentes (AssemblyAI Universal-2, Deepgram Nova-3) mostram padrão semelhante. Para transcrever conteúdo europeu, considere revisão manual ou transcrição humana.
Como o sotaque regional afeta a precisão em PT-BR?
Sotaque paulistano e carioca são o padrão implícito nos dados de treinamento — WER quase indistinguível do PT-BR neutro. Sotaque nordestino (baiano, pernambucano, cearense): +2-4 pontos de WER. Sotaque gaúcho: +2-3 pontos. Português de Angola e Moçambique: +5-10 pontos (dados escassos no treinamento). Confiança: média nos números específicos — a OpenAI não publicou WER por sotaque regional, esses valores vêm de testes independentes reportados por transcritores profissionais.
IA ou humana para o meu caso? Como decidir?
Regra prática: use IA quando o custo de um erro pequeno é baixo (revisão de estudo, notas de reunião interna, primeiro rascunho de legenda). Use humana quando o custo de um erro é alto (documento jurídico, transcrição médica, citações em TCC/pesquisa, conteúdo publicado sem revisão). Custo comparativo: transcrição IA hospedada custa ~R$3-10 por hora de áudio (VexaScribe, TurboScribe); humana custa ~R$450-600 por hora de áudio (Rev). Diferença de 100x no preço, ~6-8 pontos percentuais no WER.
Como a IA se compara com transcritor humano em português?
Transcritor humano profissional alcança 98-99% de precisão em áudio limpo em português (~1-2% WER), praticamente independente de sotaque. IA moderna alcança 90-95% em PT-BR (~5-10% WER). A diferença é ~5-7 pontos percentuais — parece pouco, mas em uma transcrição de 10.000 palavras significa 500-700 erros a mais na IA vs. 100-200 no humano. Para citações verbatim ou conteúdo com terminologia específica (medicina, direito, engenharia), a diferença compensa o custo. Para uso pessoal e reuniões, a IA vence.
Como o WER é medido? Por que confiar nesses números?
Word Error Rate é a métrica padrão: (substituições + inserções + deleções) ÷ total de palavras na referência. Um WER de 5% significa que 5 em cada 100 palavras estão erradas. Os benchmarks confiáveis usam datasets públicos (LibriSpeech para inglês, FLEURS e Common Voice para outros idiomas) e comparam a saída do modelo com transcrição humana verificada. A OpenAI publica seus resultados no paper do Whisper; AssemblyAI, Deepgram e outros publicam nas suas páginas técnicas. Suspeite de qualquer número de 'precisão' que não venha com metodologia — 'até 99% preciso' em marketing raramente vem com dataset e WER real.
Qual ferramenta usa Whisper por baixo dos panos?
Whisper é open-source (licença MIT), então muitas ferramentas rodam o modelo internamente: VexaScribe, TurboScribe, MacWhisper, Whisper Desktop e várias outras. A precisão é a mesma do Whisper large-v3 nativo (~5-10% WER em PT-BR real). O que difere entre elas é: velocidade (infraestrutura), preço, formatos de exportação, e adicionais como identificação de falantes (diarização, geralmente via pyannote). Se você quer 100% do controle e privacidade, instale Whisper localmente — não paga nada, o áudio nunca sai do seu computador.
Otter, Rev AI e AssemblyAI transcrevem português?
Otter: apenas inglês, francês e espanhol no plano gratuito. Plano pago Pro (US$16,99/mês) inclui português. Rev AI (o serviço automatizado da Rev): suporta português entre 36+ idiomas, ~7-9% WER em PT-BR (dados do Open ASR Leaderboard, confiança: média — leaderboard atualiza continuamente). AssemblyAI Universal-2: suporta português com ~6-8% WER em PT-BR (publicado pela AssemblyAI em 2024). Deepgram Nova-3: suporte a português adicionado em 2025, WER competitivo mas menos testado em PT-BR do que os outros.
Fontes e referências
- 1. Radford, A., Kim, J.W., Xu, T., Brockman, G., McLeavey, C., & Sutskever, I. (2023). Robust Speech Recognition via Large-Scale Weak Supervision. Proceedings of ICML 2023. O Whisper reporta WER de um dígito em alguns benchmarks de inglês limpo, com taxas de erro mais altas em áudio ruidoso ou com sotaque.
- 2. National Institute of Standards and Technology (NIST). Rich Transcription Evaluation. Metodologia padrão de avaliação WER utilizada pela comunidade de reconhecimento de voz.
- 3. Rev.com (2025). How Accurate Is Transcription?. Perspectiva do setor sobre taxas de precisão de transcrição humana. A cifra citada de 99%+ vem de fornecedores de transcrição; a verificação independente é limitada.
Histórico de atualizações
- 3 de março de 2026: Adicionada a função de bot de reuniões do VexaScribe nas descrições das ferramentas.
- 8 de fevereiro de 2026: Todos os preços verificados com as páginas dos fornecedores. Referências de custos atualizadas.
- 30 de janeiro de 2026: Preço do Otter.ai atualizado para refletir a nova estrutura de planos. Consistência da faixa de precisão corrigida.
- 16 de janeiro de 2026: Publicação inicial com benchmark de 5 ferramentas em 3 amostras de áudio.
Artigos relacionados
Melhor software de transcrição 2026
Comparação detalhada de 7 ferramentas
Como transcrever áudio gratuitamente
5 métodos gratuitos comparados
VexaScribe vs Rev
Comparação de transcrição IA vs humana
Preços do VexaScribe
A partir de $2/mês por 200 minutos
Melhores ferramentas de notas de reuniões
7 ferramentas testadas para transcrição de reuniões
Transcrição de reuniões com IA
Envie um bot para Zoom, Meet ou Teams