Transcrição de Entrevista com Identificação de Falantes — para Jornalistas, Pesquisadores e RH
Faça upload da gravação da entrevista — áudio ou vídeo, até 5 GB — e receba transcrição com 92-97% de precisão, identificação automática de falantes, timestamps e opções verbatim ou clean copy. 30 minutos grátis. Funciona para pesquisa qualitativa, jornalismo, entrevistas comportamentais de RH, e casos jurídicos e investigativos — com as convenções de formatação que cada fluxo espera. Precisão real medida pelo Open ASR Leaderboard, não os “99%” de marketing.
Por Equipe Editorial VexaScribe · Atualizado em
Como Transcrever uma Entrevista em 4 Passos
Mesmo fluxo, seja gravado em celular, headset, Zoom, ou câmera DSLR.
Envie a gravação
Áudio (MP3, WAV, M4A, FLAC, OGG, AAC) ou vídeo (MP4, MOV, WEBM, MKV, AVI). Até 5 GB por arquivo. Sem pré-conversão.
Escolha verbatim ou clean copy
Verbatim mantém palavras de preenchimento (né, tipo, ah), falsos começos e sinais não-verbais — obrigatório para pesquisa qualitativa, análise de discurso e material testemunhal. Clean copy é editado para leitura — melhor para narrativa jornalística e notas internas.
Revise rótulos de falantes e nomes
Diarização IA rotula entrevistador vs entrevistado automaticamente (SPEAKER 1, SPEAKER 2). Renomeie uma vez no editor e todas as ocorrências atualizam. Confira nomes próprios, organizações e jargão contra o áudio.
Exporte para seu fluxo
DOCX com numeração de linhas para NVivo/ATLAS.ti/MAXQDA (codificação qualitativa), TXT (texto puro), PDF (arquivamento), SRT (se a entrevista virar vídeo).
Custo: uma entrevista de 1 hora custa cerca de US$0,30 no plano Starter (US$2/mês, 200 minutos) — equivalente a ~R$5-10 por entrevista em 2026. Compare com transcrição humana profissional no Brasil (R$120-300 por 1 hora, ver seção abaixo).
Quem Usa Transcrição de Entrevista
Mesma ferramenta, expectativas de formatação diferentes. Encaixe seu fluxo:
Jornalistas
Identificação automática de falantes para atribuição precisa de citações, timestamps ao segundo para verificação editorial, modo verbatim para citações on-the-record vs clean copy para narrativa.
Fluxo para entrevistas em podcast →Pesquisadores qualitativos
Rótulos de falantes consistentes em todo o corpus (SPEAKER 1, SPEAKER 2 → P1, P2 uniforme), exportação numerada por linha para NVivo/ATLAS.ti/MAXQDA, retenção verbatim de pausas e sinais não-verbais quando análise de discurso exige.
Detalhes para pesquisa qualitativa →RH e entrevistas comportamentais
Registro com timestamp para avaliação de candidato e codificação no formato STAR. Diarização automática mantém perguntas do entrevistador separadas das respostas do candidato sem tagging manual.
Jurídico, policial e investigativo
Timestamps por palavra para citação de evidências, modo verbatim para precisão de nível testemunhal. Para transcrição juntada como prova em processo, revisão humana profissional geralmente é necessária — veja a seção IA vs humano abaixo.
Como Formatar uma Transcrição de Entrevista
As decisões de formatação que importam para transcrições de entrevista — e o que as convenções verbatim vs clean copy realmente mudam:
| Elemento | Verbatim | Clean copy | Quando importa |
|---|---|---|---|
| Rótulos de falantes | SPEAKER 1:, SPEAKER 2: (padrão) | Entrevistador:, [Nome]: ou atribuição por primeiro nome | Renomeie uma vez no editor — atualiza em todas as ocorrências. |
| Timestamps | A cada turno de fala: [00:03:42] | A cada 5 minutos ou em mudanças de tópico | Timestamps ao nível de palavra disponíveis para trabalho com muitas citações. |
| Palavras de preenchimento (né, tipo, ah) | Mantidas | Removidas | Verbatim é obrigatório para análise de discurso e conversação. |
| Falsos começos e repetições | Mantidos ("Eu— eu acho que—") | Editados para a frase pretendida | Verbatim é obrigatório para pesquisa linguística. |
| Sinais não-verbais | [risos], [pausa 3s], [inaudível] | Removidos exceto quando load-bearing | Etnografia e pesquisa clínica tipicamente mantêm. |
| Quebras de parágrafo | Por turno de fala | Por turno de fala ou mudança de tópico | Quebras consistentes facilitam a codificação qualitativa. |
| Numeração de linha | No export | No export | Exigido pela maioria dos softwares de codificação qualitativa. |
Regra prática: use verbatim para pesquisa, jurídico e testemunho; clean copy para narrativa jornalística, resumos internos de RH e entradas em base de conhecimento. A transcrição é editável no navegador — você pode alternar entre convenções depois sem re-transcrever.
Como Fica a Transcrição de Entrevista
Exemplo em clean copy de entrevista qualitativa. Note rótulos consistentes de falantes, timestamps ao segundo, quebras de parágrafo por turno:
[00:00:00] ENTREVISTADOR: Para começar, você poderia me contar um pouco sobre seu papel e há quanto tempo está nele? [00:00:07] PARTICIPANTE: Claro. Trabalho com design de produto há uns oito anos — os últimos quatro na empresa atual. Lidero uma equipe de seis pessoas. [00:00:16] ENTREVISTADOR: E quando eu perguntei antes sobre o dia a dia, você mencionou se sentir esticada. Pode me contar como é uma semana típica? [00:00:23] PARTICIPANTE: É, então — [pausa 2s] — acho que a parte mais difícil é a troca de contexto. Segunda-feira é geralmente planejamento, terça e quarta é trabalho focado de design, e aí quinta e sexta estou basicamente em reuniões com engenharia e stakeholders. [00:00:41] ENTREVISTADOR: Quando você diz "troca de contexto é a parte mais difícil", o que especificamente torna difícil?
O modo verbatim mantém "é, então — [pausa 2s] —" e as palavras de preenchimento mostradas com pausas. O modo clean copy acima é o padrão.
Transcrição de Entrevista para Pesquisa Qualitativa
Pesquisa qualitativa tem exigências específicas que transcrição genérica nem sempre atende. O que muda:
- Exportação para software de codificação: NVivo, ATLAS.ti e MAXQDA aceitam DOCX com numeração de linhas. Exporte DOCX numerado por linha para importação direta.
- Atribuição consistente de falantes: um corpus de 20 entrevistas precisa do mesmo esquema de rotulagem em todos os arquivos. SPEAKER 1 / SPEAKER 2 permanece consistente; renomeie para tags baseadas em papel (P1, P2, E) se seu codebook exigir.
- Verbatim obrigatório para análise de discurso: se você está codificando dinâmica de conversação (turnos de fala, sobreposição, hedging), modo verbatim não é opcional. Palavras de preenchimento e pausas são os dados.
- Notas reflexivas ficam separadas: memos do pesquisador e notas de reflexividade não devem viver na transcrição — use a função de memos do seu software de codificação ou um log separado.
- Etapa de anonimização (LGPD): para material sensível a comitê de ética/IRB, passe a transcrição exportada por uma etapa de redação (ou use busca-e-substituição verbatim) antes de importar para software de codificação. Transcrição IA não anonimiza automaticamente.
IA vs Transcrição Humana Profissional (Brasil)
Comparação honesta de custo e precisão, com valores reais do mercado brasileiro:
| Dimensão | IA (este fluxo) | Serviço humano (Brasil) | Veredito |
|---|---|---|---|
| Precisão em áudio limpo de entrevista (headset, sala silenciosa) | 92-97% | 99%+ | Diferença raramente compensa o gap de custo, exceto para transcrição de valor testemunhal. |
| Precisão em áudio de telefone / longe / ruidoso | 78-90% | 95-99% | Humano vence claramente. Considere IA + revisão manual. |
| Custo por hora (Brasil) | R$5-15 (VexaScribe) | R$120-300 (Meu Redator, Ateliê do Texto) | Gap de 15-40× em preço. Custo humano permanece alto mesmo para entrevistas internas. |
| Tempo de entrega | 5-10 minutos | 12-48 horas | IA vence humano em tempo até primeira citação em 2 ordens de grandeza. |
| Rótulos de falantes | Automáticos (até 50 falantes) | Manuais | Diarização IA é confiável para 2-6 falantes. Humano ainda vence em fala sobreposta. |
| Notação de sinais não-verbais | Alguns ([risos], [pausa]) | Notação etnográfica completa | Análise de discurso e conversação ainda tipicamente exige transcrição humana. |
Caminho híbrido que pesquisadores brasileiros usam em 2026: transcrição IA (~R$5-10/hora) + 20-30 minutos de revisão manual chega a ~99% de precisão por ~R$55-110 total — vs R$120-300 por transcrição humana pura. Para orientação passo a passo, veja como transcrever áudio (5 métodos comparados).
Transcrição de Entrevista Grátis — O Que 30 Min Dão
Versão honesta: 30 minutos grátis cobrem uma entrevista padrão. Não renova mensalmente — é um teste. Para transcrição de entrevista grátis recorrente, as opções realmente gratuitas:
- Whisper da OpenAI instalado localmente — grátis para sempre, offline, ilimitado. Requer Python + GPU decente. Melhor para entrevistas confidenciais onde upload em nuvem cria risco de LGPD.
- Otter.ai free tier — 300 min/mês, mas limitado a 30 min por conversa. Boa para entrevistas curtas estruturadas, quebra em narrativas de 60 min.
- TurboScribe free tier — 3 arquivos/dia, limite de 30 min cada.
LGPD — Dados Pessoais em Transcrição de Entrevista
Sob a Lei Geral de Proteção de Dados (Lei nº 13.709/2018), gravações de entrevista contêm dados pessoais — voz é dado biométrico, e o conteúdo tipicamente inclui nomes, opiniões, dados identificadores. A transcrição herda a mesma proteção. Requisitos práticos:
Consentimento informado (TCLE)
Deixe claro no Termo de Consentimento Livre e Esclarecido que a transcrição será feita por IA em nuvem. Especialmente crítico para pesquisa com aprovação de comitê de ética (CEP) — o parecer precisa cobrir esse fluxo.
Anonimização antes de importar
Substitua nomes por [P1], cidades por [Cidade], organizações por [Org] antes de importar para software de codificação. Etapa manual — IA não anonimiza automaticamente.
Retenção e exclusão
O VexaScribe permite apagar arquivos e transcrições a qualquer momento; não usamos áudios ou transcrições para treinar modelos. Verifique a política de retenção do serviço escolhido — serviços sem política clara são incompatíveis com LGPD.
Para dados altamente sensíveis
Entrevistas jurídicas, médicas, com crianças/adolescentes ou com dados de saúde: considere Whisper local (offline, sem envio para nuvem alguma). Elimina completamente a questão de compartilhamento de dados com processador externo.
Pronto para transcrever a entrevista?
Identificação de falantes, timestamps, toggle verbatim/clean copy, exportação DOCX/TXT/SRT. 30 minutos grátis, sem cartão de crédito, planos a partir de US$2/mês.
Transcrever Entrevista GrátisPerguntas Frequentes
Como transcrever uma entrevista?
Quatro passos: (1) faça upload da gravação (áudio MP3/WAV/M4A ou vídeo MP4/MOV, até 5 GB); (2) escolha entre modo verbatim (mantém hesitações, pausas e falas incompletas — obrigatório para análise qualitativa e jurídica) ou clean copy (edita para leitura — bom para jornalismo e RH); (3) revise a identificação automática de falantes — a IA rotula como "SPEAKER 1", "SPEAKER 2", você renomeia uma vez para ENTREVISTADOR/PARTICIPANTE e todas as ocorrências atualizam; (4) exporte em DOCX (com numeração de linha para NVivo/ATLAS.ti/MAXQDA), TXT (texto puro), PDF (arquivamento) ou SRT (se a entrevista virar vídeo). Processamento típico: 5-10 minutos por 1 hora de entrevista.
Como formatar uma transcrição de entrevista?
Duas convenções padrão: verbatim (mantém palavras de preenchimento como 'né', 'tipo', 'ah'; falsos começos; pausas com [pausa 3s]; sinais não-verbais como [risos]) — obrigatório para pesquisa qualitativa, análise de discurso e transcrições jurídicas/testemunhais. Clean copy (removidas hesitações e falsos começos, texto editado para leitura) — melhor para narrativas jornalísticas e notas internas de RH. Rótulos consistentes de falantes (SPEAKER 1, SPEAKER 2 padrão; renomeados para Entrevistador/Participante ou P1/P2/E). Timestamps a cada turno de fala no verbatim; a cada 5 minutos no clean copy. Quebra de parágrafo a cada turno. Numeração de linha no export para software de codificação qualitativa.
Qual a melhor ferramenta de transcrição de entrevista para pesquisa qualitativa?
Requisitos específicos da pesquisa qualitativa: rotulagem de falantes consistente entre entrevistas do corpus (não só dentro de um arquivo), modo verbatim para análise de discurso, exportação numerada por linha para NVivo/ATLAS.ti/MAXQDA, e 92-97% de precisão em áudio de headset. O VexaScribe atende todos os quatro. Otter.ai tem toggle verbatim, mas limita arquivos grátis a 30 minutos. Rev tem modo verbatim de IA e opção humana. Transcrição humana profissional (Meu Redator, Ditaí, Ateliê do Texto — R$2-8/min) permanece o padrão para análise de conversação em nível de turno de construção e para fala com sotaque forte em análise dialetal.
Quanto custa transcrever uma entrevista no Brasil?
Depende do método. IA (VexaScribe, ~R$0,08-0,15/min efetivo pelos planos internacionais, ou US$0,60/hora no plano Starter): entrevista de 1 hora sai em ~R$5-10. Transcrição humana profissional no Brasil: R$2-5/min padrão (Meu Redator ~R$2/min, Ateliê do Texto e Mundo Escrito em faixas similares), R$5-8/min para casos difíceis (áudio ruim, terminologia técnica, alta urgência). Entrevista de 1 hora custa R$120-300 humana vs R$5-10 IA + R$50-100 de revisão manual = R$55-110 no total pelo caminho híbrido. Para um projeto de pesquisa com 20 entrevistas, humano puro custa R$2.400-6.000 vs ~R$110-220 com IA + revisão.
Transcrição de entrevista para pesquisa qualitativa segue LGPD?
Sim — e é uma preocupação real para pesquisadores brasileiros. Sob a LGPD (Lei nº 13.709/2018), gravações de entrevista contêm dados pessoais (voz, opiniões, dados identificadores mencionados) e a transcrição herda a mesma proteção. Requisitos práticos: (1) consentimento informado do participante para transcrição via IA em nuvem — deixe claro no TCLE; (2) anonimização antes de importar para software de codificação (substituir nomes por [P1], [Cidade], etc.); (3) política de retenção clara do serviço escolhido — o VexaScribe permite deletar arquivos a qualquer momento e não usa áudios para treinar modelos; (4) para dados altamente sensíveis (jurídico, médico, entrevistas com vulneráveis), considere Whisper local (offline, sem envio para nuvem).
A precisão da transcrição de IA é boa o suficiente para pesquisa?
Depende do padrão. Em áudio limpo de headset, IA moderna (Whisper Large-v3) atinge 92-97% de precisão real conforme o Open ASR Leaderboard — não os "99%" de marketing. Áudio com sotaques regionais fortes, terminologia técnica, ou múltiplos falantes em sobreposição cai para 78-92%. Para análise temática típica em pesquisa qualitativa: 92-97% + 15-20 minutos de revisão manual por entrevista é o padrão em 2026 — mesmo nível de precisão que transcrição humana pura, por 1/50 do custo em tempo real. Para análise de conversação em nível de turno de construção ou análise dialetal fina, transcrição humana permanece o padrão.
Posso exportar transcrição para NVivo, ATLAS.ti ou MAXQDA?
Sim. O VexaScribe exporta em DOCX e TXT com numeração de linhas — formato aceito diretamente por NVivo, ATLAS.ti e MAXQDA. Rótulos de falantes consistentes em todo o corpus (você renomeia SPEAKER 1 → P1 uma vez, atualiza em todos os arquivos). Para análise de codificação em nível de linha, execute uma etapa de anonimização (substituir nomes por [Nome], organizações por [Org]) antes de importar para o software de codificação — a IA de transcrição não anonimiza automaticamente.
Funciona com entrevistas em várias línguas ou sotaques regionais fortes?
Sim. 99 idiomas suportados via Whisper Large-v3, detectados automaticamente do áudio. Inclui português brasileiro nativo com boa qualidade em sotaques de todas as regiões (mais fraco em sotaques rurais muito fechados — expectativa de 85-90% de precisão nesses casos, vs 92-97% para fala urbana clara). Para entrevistas bilíngues (português + inglês/espanhol), o Whisper detecta a mudança mas a precisão cai em trechos de código-switching rápido. Modo tradução para inglês disponível; para outros pares de idiomas, transcreva na fonte e traduza o texto em uma etapa separada.
Transcrição de entrevista policial ou investigativa serve como prova em tribunal?
Depende da jurisdição e do uso. Para investigação interna, arquivamento de caso, ou material de referência, transcrição de IA (~92-95% em áudio limpo policial, ~78-88% em áudio de sala típico) é adequada. Para transcrição de valor testemunhal ou juntada como prova em processo, o padrão brasileiro geralmente exige transcritor certificado com fé pública ou perito — a transcrição de IA + revisão manual serve como base de trabalho, mas o documento final tipicamente precisa de reconhecimento humano. Combine IA (rapidez) + revisão humana profissional (validade) para o melhor dos dois mundos.
Páginas Relacionadas
Como Transcrever um Áudio (Guia)
Ferramenta genérica de transcrição de áudio com comparação de 5 métodos.
Transcrição de Podcast
Para entrevistas em formato de podcast (áudio ou vídeo).
Transcrição do YouTube
Entrevistas em vídeo no YouTube — cole o URL, receba a transcrição.
O Que é Transcrição?
Definição, tipos (verbatim vs clean copy), preços no Brasil, uso em pesquisa e jornalismo.
Alternativas ao Otter
Se você usa Otter para reuniões e precisa de pt-BR: 12 alternativas comparadas.