Início/Transcrição de Entrevista
Atualizado em julho de 2026

Transcrição de Entrevista com Identificação de Falantes — para Jornalistas, Pesquisadores e RH

Faça upload da gravação da entrevista — áudio ou vídeo, até 5 GB — e receba transcrição com 92-97% de precisão, identificação automática de falantes, timestamps e opções verbatim ou clean copy. 30 minutos grátis. Funciona para pesquisa qualitativa, jornalismo, entrevistas comportamentais de RH, e casos jurídicos e investigativos — com as convenções de formatação que cada fluxo espera. Precisão real medida pelo Open ASR Leaderboard, não os “99%” de marketing.

Por Equipe Editorial VexaScribe · Atualizado em

Como Transcrever uma Entrevista em 4 Passos

Mesmo fluxo, seja gravado em celular, headset, Zoom, ou câmera DSLR.

1

Envie a gravação

Áudio (MP3, WAV, M4A, FLAC, OGG, AAC) ou vídeo (MP4, MOV, WEBM, MKV, AVI). Até 5 GB por arquivo. Sem pré-conversão.

2

Escolha verbatim ou clean copy

Verbatim mantém palavras de preenchimento (né, tipo, ah), falsos começos e sinais não-verbais — obrigatório para pesquisa qualitativa, análise de discurso e material testemunhal. Clean copy é editado para leitura — melhor para narrativa jornalística e notas internas.

3

Revise rótulos de falantes e nomes

Diarização IA rotula entrevistador vs entrevistado automaticamente (SPEAKER 1, SPEAKER 2). Renomeie uma vez no editor e todas as ocorrências atualizam. Confira nomes próprios, organizações e jargão contra o áudio.

4

Exporte para seu fluxo

DOCX com numeração de linhas para NVivo/ATLAS.ti/MAXQDA (codificação qualitativa), TXT (texto puro), PDF (arquivamento), SRT (se a entrevista virar vídeo).

Custo: uma entrevista de 1 hora custa cerca de US$0,30 no plano Starter (US$2/mês, 200 minutos) — equivalente a ~R$5-10 por entrevista em 2026. Compare com transcrição humana profissional no Brasil (R$120-300 por 1 hora, ver seção abaixo).

Quem Usa Transcrição de Entrevista

Mesma ferramenta, expectativas de formatação diferentes. Encaixe seu fluxo:

Jornalistas

Identificação automática de falantes para atribuição precisa de citações, timestamps ao segundo para verificação editorial, modo verbatim para citações on-the-record vs clean copy para narrativa.

Fluxo para entrevistas em podcast

Pesquisadores qualitativos

Rótulos de falantes consistentes em todo o corpus (SPEAKER 1, SPEAKER 2 → P1, P2 uniforme), exportação numerada por linha para NVivo/ATLAS.ti/MAXQDA, retenção verbatim de pausas e sinais não-verbais quando análise de discurso exige.

Detalhes para pesquisa qualitativa

RH e entrevistas comportamentais

Registro com timestamp para avaliação de candidato e codificação no formato STAR. Diarização automática mantém perguntas do entrevistador separadas das respostas do candidato sem tagging manual.

Jurídico, policial e investigativo

Timestamps por palavra para citação de evidências, modo verbatim para precisão de nível testemunhal. Para transcrição juntada como prova em processo, revisão humana profissional geralmente é necessária — veja a seção IA vs humano abaixo.

Como Formatar uma Transcrição de Entrevista

As decisões de formatação que importam para transcrições de entrevista — e o que as convenções verbatim vs clean copy realmente mudam:

ElementoVerbatimClean copyQuando importa
Rótulos de falantesSPEAKER 1:, SPEAKER 2: (padrão)Entrevistador:, [Nome]: ou atribuição por primeiro nomeRenomeie uma vez no editor — atualiza em todas as ocorrências.
TimestampsA cada turno de fala: [00:03:42]A cada 5 minutos ou em mudanças de tópicoTimestamps ao nível de palavra disponíveis para trabalho com muitas citações.
Palavras de preenchimento (né, tipo, ah)MantidasRemovidasVerbatim é obrigatório para análise de discurso e conversação.
Falsos começos e repetiçõesMantidos ("Eu— eu acho que—")Editados para a frase pretendidaVerbatim é obrigatório para pesquisa linguística.
Sinais não-verbais[risos], [pausa 3s], [inaudível]Removidos exceto quando load-bearingEtnografia e pesquisa clínica tipicamente mantêm.
Quebras de parágrafoPor turno de falaPor turno de fala ou mudança de tópicoQuebras consistentes facilitam a codificação qualitativa.
Numeração de linhaNo exportNo exportExigido pela maioria dos softwares de codificação qualitativa.

Regra prática: use verbatim para pesquisa, jurídico e testemunho; clean copy para narrativa jornalística, resumos internos de RH e entradas em base de conhecimento. A transcrição é editável no navegador — você pode alternar entre convenções depois sem re-transcrever.

Como Fica a Transcrição de Entrevista

Exemplo em clean copy de entrevista qualitativa. Note rótulos consistentes de falantes, timestamps ao segundo, quebras de parágrafo por turno:

[00:00:00] ENTREVISTADOR: Para começar, você poderia me contar um pouco sobre seu papel e há quanto tempo está nele?

[00:00:07] PARTICIPANTE: Claro. Trabalho com design de produto há uns oito anos — os últimos quatro na empresa atual. Lidero uma equipe de seis pessoas.

[00:00:16] ENTREVISTADOR: E quando eu perguntei antes sobre o dia a dia, você mencionou se sentir esticada. Pode me contar como é uma semana típica?

[00:00:23] PARTICIPANTE: É, então — [pausa 2s] — acho que a parte mais difícil é a troca de contexto. Segunda-feira é geralmente planejamento, terça e quarta é trabalho focado de design, e aí quinta e sexta estou basicamente em reuniões com engenharia e stakeholders.

[00:00:41] ENTREVISTADOR: Quando você diz "troca de contexto é a parte mais difícil", o que especificamente torna difícil?

O modo verbatim mantém "é, então — [pausa 2s] —" e as palavras de preenchimento mostradas com pausas. O modo clean copy acima é o padrão.

Transcrição de Entrevista para Pesquisa Qualitativa

Pesquisa qualitativa tem exigências específicas que transcrição genérica nem sempre atende. O que muda:

  • Exportação para software de codificação: NVivo, ATLAS.ti e MAXQDA aceitam DOCX com numeração de linhas. Exporte DOCX numerado por linha para importação direta.
  • Atribuição consistente de falantes: um corpus de 20 entrevistas precisa do mesmo esquema de rotulagem em todos os arquivos. SPEAKER 1 / SPEAKER 2 permanece consistente; renomeie para tags baseadas em papel (P1, P2, E) se seu codebook exigir.
  • Verbatim obrigatório para análise de discurso: se você está codificando dinâmica de conversação (turnos de fala, sobreposição, hedging), modo verbatim não é opcional. Palavras de preenchimento e pausas são os dados.
  • Notas reflexivas ficam separadas: memos do pesquisador e notas de reflexividade não devem viver na transcrição — use a função de memos do seu software de codificação ou um log separado.
  • Etapa de anonimização (LGPD): para material sensível a comitê de ética/IRB, passe a transcrição exportada por uma etapa de redação (ou use busca-e-substituição verbatim) antes de importar para software de codificação. Transcrição IA não anonimiza automaticamente.
Quando IA para pesquisa qualitativa é adequada: entrevistas semi-estruturadas com áudio limpo de headset, 2-4 falantes, vocabulário padrão. Quando transcrição humana ainda vale o custo: análise de conversação em nível de turno de construção, fala dialectal ou com sotaque forte em idiomas de baixo recurso, e qualquer transcrição que apareça verbatim em periódico revisado por pares.

IA vs Transcrição Humana Profissional (Brasil)

Comparação honesta de custo e precisão, com valores reais do mercado brasileiro:

DimensãoIA (este fluxo)Serviço humano (Brasil)Veredito
Precisão em áudio limpo de entrevista (headset, sala silenciosa)92-97%99%+Diferença raramente compensa o gap de custo, exceto para transcrição de valor testemunhal.
Precisão em áudio de telefone / longe / ruidoso78-90%95-99%Humano vence claramente. Considere IA + revisão manual.
Custo por hora (Brasil)R$5-15 (VexaScribe)R$120-300 (Meu Redator, Ateliê do Texto)Gap de 15-40× em preço. Custo humano permanece alto mesmo para entrevistas internas.
Tempo de entrega5-10 minutos12-48 horasIA vence humano em tempo até primeira citação em 2 ordens de grandeza.
Rótulos de falantesAutomáticos (até 50 falantes)ManuaisDiarização IA é confiável para 2-6 falantes. Humano ainda vence em fala sobreposta.
Notação de sinais não-verbaisAlguns ([risos], [pausa])Notação etnográfica completaAnálise de discurso e conversação ainda tipicamente exige transcrição humana.

Caminho híbrido que pesquisadores brasileiros usam em 2026: transcrição IA (~R$5-10/hora) + 20-30 minutos de revisão manual chega a ~99% de precisão por ~R$55-110 total — vs R$120-300 por transcrição humana pura. Para orientação passo a passo, veja como transcrever áudio (5 métodos comparados).

Transcrição de Entrevista Grátis — O Que 30 Min Dão

Versão honesta: 30 minutos grátis cobrem uma entrevista padrão. Não renova mensalmente — é um teste. Para transcrição de entrevista grátis recorrente, as opções realmente gratuitas:

  • Whisper da OpenAI instalado localmente — grátis para sempre, offline, ilimitado. Requer Python + GPU decente. Melhor para entrevistas confidenciais onde upload em nuvem cria risco de LGPD.
  • Otter.ai free tier — 300 min/mês, mas limitado a 30 min por conversa. Boa para entrevistas curtas estruturadas, quebra em narrativas de 60 min.
  • TurboScribe free tier — 3 arquivos/dia, limite de 30 min cada.
Para pesquisadores rodando 20+ entrevistas num projeto, o plano Starter (US$2/mês, 200 minutos) cobre a maioria dos corpora de estudo único a cerca de US$0,20 por entrevista — ~R$1-2 por entrevista. Transcrição humana pura no Brasil para o mesmo corpus custaria R$2.400-6.000 nas faixas típicas de R$120-300/hora.

LGPD — Dados Pessoais em Transcrição de Entrevista

Sob a Lei Geral de Proteção de Dados (Lei nº 13.709/2018), gravações de entrevista contêm dados pessoais — voz é dado biométrico, e o conteúdo tipicamente inclui nomes, opiniões, dados identificadores. A transcrição herda a mesma proteção. Requisitos práticos:

Consentimento informado (TCLE)

Deixe claro no Termo de Consentimento Livre e Esclarecido que a transcrição será feita por IA em nuvem. Especialmente crítico para pesquisa com aprovação de comitê de ética (CEP) — o parecer precisa cobrir esse fluxo.

Anonimização antes de importar

Substitua nomes por [P1], cidades por [Cidade], organizações por [Org] antes de importar para software de codificação. Etapa manual — IA não anonimiza automaticamente.

Retenção e exclusão

O VexaScribe permite apagar arquivos e transcrições a qualquer momento; não usamos áudios ou transcrições para treinar modelos. Verifique a política de retenção do serviço escolhido — serviços sem política clara são incompatíveis com LGPD.

Para dados altamente sensíveis

Entrevistas jurídicas, médicas, com crianças/adolescentes ou com dados de saúde: considere Whisper local (offline, sem envio para nuvem alguma). Elimina completamente a questão de compartilhamento de dados com processador externo.

Pronto para transcrever a entrevista?

Identificação de falantes, timestamps, toggle verbatim/clean copy, exportação DOCX/TXT/SRT. 30 minutos grátis, sem cartão de crédito, planos a partir de US$2/mês.

Transcrever Entrevista Grátis

Perguntas Frequentes

Como transcrever uma entrevista?

Quatro passos: (1) faça upload da gravação (áudio MP3/WAV/M4A ou vídeo MP4/MOV, até 5 GB); (2) escolha entre modo verbatim (mantém hesitações, pausas e falas incompletas — obrigatório para análise qualitativa e jurídica) ou clean copy (edita para leitura — bom para jornalismo e RH); (3) revise a identificação automática de falantes — a IA rotula como "SPEAKER 1", "SPEAKER 2", você renomeia uma vez para ENTREVISTADOR/PARTICIPANTE e todas as ocorrências atualizam; (4) exporte em DOCX (com numeração de linha para NVivo/ATLAS.ti/MAXQDA), TXT (texto puro), PDF (arquivamento) ou SRT (se a entrevista virar vídeo). Processamento típico: 5-10 minutos por 1 hora de entrevista.

Como formatar uma transcrição de entrevista?

Duas convenções padrão: verbatim (mantém palavras de preenchimento como 'né', 'tipo', 'ah'; falsos começos; pausas com [pausa 3s]; sinais não-verbais como [risos]) — obrigatório para pesquisa qualitativa, análise de discurso e transcrições jurídicas/testemunhais. Clean copy (removidas hesitações e falsos começos, texto editado para leitura) — melhor para narrativas jornalísticas e notas internas de RH. Rótulos consistentes de falantes (SPEAKER 1, SPEAKER 2 padrão; renomeados para Entrevistador/Participante ou P1/P2/E). Timestamps a cada turno de fala no verbatim; a cada 5 minutos no clean copy. Quebra de parágrafo a cada turno. Numeração de linha no export para software de codificação qualitativa.

Qual a melhor ferramenta de transcrição de entrevista para pesquisa qualitativa?

Requisitos específicos da pesquisa qualitativa: rotulagem de falantes consistente entre entrevistas do corpus (não só dentro de um arquivo), modo verbatim para análise de discurso, exportação numerada por linha para NVivo/ATLAS.ti/MAXQDA, e 92-97% de precisão em áudio de headset. O VexaScribe atende todos os quatro. Otter.ai tem toggle verbatim, mas limita arquivos grátis a 30 minutos. Rev tem modo verbatim de IA e opção humana. Transcrição humana profissional (Meu Redator, Ditaí, Ateliê do Texto — R$2-8/min) permanece o padrão para análise de conversação em nível de turno de construção e para fala com sotaque forte em análise dialetal.

Quanto custa transcrever uma entrevista no Brasil?

Depende do método. IA (VexaScribe, ~R$0,08-0,15/min efetivo pelos planos internacionais, ou US$0,60/hora no plano Starter): entrevista de 1 hora sai em ~R$5-10. Transcrição humana profissional no Brasil: R$2-5/min padrão (Meu Redator ~R$2/min, Ateliê do Texto e Mundo Escrito em faixas similares), R$5-8/min para casos difíceis (áudio ruim, terminologia técnica, alta urgência). Entrevista de 1 hora custa R$120-300 humana vs R$5-10 IA + R$50-100 de revisão manual = R$55-110 no total pelo caminho híbrido. Para um projeto de pesquisa com 20 entrevistas, humano puro custa R$2.400-6.000 vs ~R$110-220 com IA + revisão.

Transcrição de entrevista para pesquisa qualitativa segue LGPD?

Sim — e é uma preocupação real para pesquisadores brasileiros. Sob a LGPD (Lei nº 13.709/2018), gravações de entrevista contêm dados pessoais (voz, opiniões, dados identificadores mencionados) e a transcrição herda a mesma proteção. Requisitos práticos: (1) consentimento informado do participante para transcrição via IA em nuvem — deixe claro no TCLE; (2) anonimização antes de importar para software de codificação (substituir nomes por [P1], [Cidade], etc.); (3) política de retenção clara do serviço escolhido — o VexaScribe permite deletar arquivos a qualquer momento e não usa áudios para treinar modelos; (4) para dados altamente sensíveis (jurídico, médico, entrevistas com vulneráveis), considere Whisper local (offline, sem envio para nuvem).

A precisão da transcrição de IA é boa o suficiente para pesquisa?

Depende do padrão. Em áudio limpo de headset, IA moderna (Whisper Large-v3) atinge 92-97% de precisão real conforme o Open ASR Leaderboard — não os "99%" de marketing. Áudio com sotaques regionais fortes, terminologia técnica, ou múltiplos falantes em sobreposição cai para 78-92%. Para análise temática típica em pesquisa qualitativa: 92-97% + 15-20 minutos de revisão manual por entrevista é o padrão em 2026 — mesmo nível de precisão que transcrição humana pura, por 1/50 do custo em tempo real. Para análise de conversação em nível de turno de construção ou análise dialetal fina, transcrição humana permanece o padrão.

Posso exportar transcrição para NVivo, ATLAS.ti ou MAXQDA?

Sim. O VexaScribe exporta em DOCX e TXT com numeração de linhas — formato aceito diretamente por NVivo, ATLAS.ti e MAXQDA. Rótulos de falantes consistentes em todo o corpus (você renomeia SPEAKER 1 → P1 uma vez, atualiza em todos os arquivos). Para análise de codificação em nível de linha, execute uma etapa de anonimização (substituir nomes por [Nome], organizações por [Org]) antes de importar para o software de codificação — a IA de transcrição não anonimiza automaticamente.

Funciona com entrevistas em várias línguas ou sotaques regionais fortes?

Sim. 99 idiomas suportados via Whisper Large-v3, detectados automaticamente do áudio. Inclui português brasileiro nativo com boa qualidade em sotaques de todas as regiões (mais fraco em sotaques rurais muito fechados — expectativa de 85-90% de precisão nesses casos, vs 92-97% para fala urbana clara). Para entrevistas bilíngues (português + inglês/espanhol), o Whisper detecta a mudança mas a precisão cai em trechos de código-switching rápido. Modo tradução para inglês disponível; para outros pares de idiomas, transcreva na fonte e traduza o texto em uma etapa separada.

Transcrição de entrevista policial ou investigativa serve como prova em tribunal?

Depende da jurisdição e do uso. Para investigação interna, arquivamento de caso, ou material de referência, transcrição de IA (~92-95% em áudio limpo policial, ~78-88% em áudio de sala típico) é adequada. Para transcrição de valor testemunhal ou juntada como prova em processo, o padrão brasileiro geralmente exige transcritor certificado com fé pública ou perito — a transcrição de IA + revisão manual serve como base de trabalho, mas o documento final tipicamente precisa de reconhecimento humano. Combine IA (rapidez) + revisão humana profissional (validade) para o melhor dos dois mundos.