Como funciona o reconhecimento de fala: do som ao texto

O reconhecimento de fala transforma uma onda sonora contínua em palavras separadas, e faz isso em uma sequência fixa de etapas. O sinal do microfone é amostrado em números, esses números viram um espectrograma, uma rede neural associa o espectrograma ao texto mais provável e uma etapa de formatação deixa esse texto legível. Todo sistema moderno — o teclado do celular, um app de notas de reunião, um aplicativo de ditado — segue alguma versão desse processo.

A resposta curta para «como ele sabe o que eu disse» é: ele não sabe, ele estima. O modelo entrega o texto mais provável para o som que recebeu, com base no que viu durante o treinamento. Esse fato sozinho explica a maior parte do comportamento que você percebe na prática: por que expressões comuns saem perfeitas, por que o sobrenome de um colega não sai, e por que uma pausa com ruído pode virar uma frase que ninguém disse.

Este artigo percorre o processo etapa por etapa, sem matemática e sem entrar no funcionamento interno de nenhum fornecedor específico.

Etapa 1: como um microfone transforma som em números?

O som é uma onda de pressão. O microfone a converte em tensão elétrica, e um conversor analógico-digital mede essa tensão milhares de vezes por segundo. Cada medição é uma amostra.

Música costuma ser gravada a 44.100 ou 48.000 amostras por segundo. O reconhecimento de fala raramente precisa de tanto: as frequências que carregam a fala ficam principalmente abaixo de 8 kHz, então a maioria dos sistemas trabalha com 16.000 amostras por segundo (16 kHz). O artigo científico do Whisper, por exemplo, afirma que todo o áudio é reamostrado para 16.000 Hz antes de qualquer outra coisa. O áudio de telefone costuma ser de 8 kHz, e esse é um dos motivos pelos quais gravações de ligações são mais difíceis de transcrever: parte do sinal de fala nunca foi captada.

Nesta etapa não há palavras, nem letras, nem detecção de silêncio. Há só uma longa lista de números: um minuto de áudio a 16 kHz são 960.000 deles.

Etapa 2: o que é um espectrograma e por que não usar a onda bruta?

A forma de onda bruta diz qual é a intensidade do sinal a cada instante, mas a informação que distingue um som da fala de outro está nas frequências. Um «s» é uma rajada de ruído de alta frequência; uma vogal como «a» tem faixas de energia fortes e estáveis mais abaixo.

Por isso o sistema corta o áudio em janelas curtas e sobrepostas — tipicamente de cerca de 25 milissegundos cada, deslocadas de 10 em 10 milissegundos — e mede quanta energia cada janela tem em cada frequência. Colocadas lado a lado, essas medições formam um espectrograma: o tempo em um eixo, a frequência no outro e a intensidade como brilho.

A maioria dos sistemas usa um espectrograma log-Mel. «Mel» significa que as faixas de frequência são espaçadas do jeito que a audição humana percebe a altura do som (a escala Mel): densas nas frequências baixas, esparsas nas altas. «Log» comprime a intensidade como o ouvido faz. Os modelos originais do Whisper usam 80 canais Mel em janelas de 25 ms com passo de 10 ms; o modelo large-v3 passou para 128. Em qualquer caso, um segundo de áudio vira cerca de 100 colunas de números, uma entrada muito mais compacta e informativa do que 16.000 amostras brutas.

Etapa 3: como o modelo passa do som para as palavras?

É aqui que as abordagens mais mudaram nos últimos quinze anos.

O processo clássico: modelo acústico, dicionário e modelo de linguagem

Durante décadas, os sistemas de reconhecimento eram montados a partir de peças separadas. Um modelo acústico estimava quais sons da fala (fonemas) eram prováveis em cada quadro, um dicionário de pronúncia listava como cada palavra se forma a partir de fonemas, e um modelo de linguagem avaliava quais sequências de palavras eram plausíveis. Modelos ocultos de Markov amarravam tudo ao longo do tempo. Por volta de 2012, as redes neurais profundas substituíram os antigos modelos de mistura gaussiana dentro desse processo e reduziram bastante as taxas de erro — o ponto de virada costuma ser datado pelo artigo conjunto de Hinton e colegas de quatro grupos de pesquisa.

Modelos de ponta a ponta

Os sistemas modernos, na maioria, treinam uma única rede neural que vai direto do espectrograma ao texto. Três arquiteturas dominam:

Abordagem Como alinha som e texto Ponto forte típico
CTC (Graves et al., 2006) Emite um rótulo ou um «branco» para cada quadro e depois junta as repetições Rápido, simples, bom para streaming
Transdutor, RNN-T (Graves, 2012) Decide a cada passo se emite um token ou lê o próximo quadro Streaming com baixa latência
Codificador-decodificador com atenção Um codificador lê o segmento inteiro e um decodificador escreve o texto token por token Alta precisão em falas completas

O Whisper é um exemplo do terceiro tipo: um Transformer codificador-decodificador que lê blocos de 30 segundos e escreve texto. A transcrição em streaming — palavras aparecendo enquanto você ainda está falando — favorece os dois primeiros, porque eles conseguem emitir resultado antes de a frase terminar.

A saída normalmente não são palavras inteiras, e sim tokens de subpalavra: pedaços como «trans», «cri», «ção». Isso permite que o modelo escreva palavras que nunca viu inteiras, e é por isso que o nome de um produto novo pode sair como uma combinação de fragmentos plausível, mas errada.

De onde vem o conhecimento da língua

Um modelo de ponta a ponta não tem um dicionário separado, mas mesmo assim tem uma noção forte de quais sequências de palavras são prováveis — aprendida com o texto que acompanha o seu áudio de treinamento. A escala faz diferença: os modelos originais do Whisper foram treinados com 680.000 horas de áudio rotulado, das quais 117.000 horas cobriam 96 idiomas além do inglês; o large-v3 usou 1 milhão de horas de áudio com rotulagem fraca mais 4 milhões de horas de áudio com pseudorrótulos. Idiomas e sotaques raros nos dados de treinamento são reconhecidos com menos precisão, pelo mesmo motivo que nomes raros.

Etapa 4: decodificação — a escolha do texto final

A rede não entrega uma única resposta. A cada passo, ela dá uma probabilidade para cada token possível. A decodificação é a busca pela melhor sequência como um todo: a decodificação gulosa (greedy) pega o token mais provável a cada vez, enquanto a busca em feixe (beam search) mantém várias frases candidatas ao mesmo tempo e escolhe a melhor já completa.

É também aqui que entram as dicas de vocabulário. Muitos mecanismos aceitam uma lista de termos esperados ou um texto curto de contexto (prompt); o guia de prompts da OpenAI para o Whisper, por exemplo, mostra um prompt que lista nomes de produtos e empresas para orientar a grafia. Uma dica desloca as probabilidades em direção a essas palavras, mas não salva um áudio que o modelo de fato não consegue ouvir.

Etapa 5: pontuação e formatação

A saída bruta do reconhecimento costuma parecer «então a reunião é às três e meia no dia cinco de março». Transformá-la em «Então a reunião é às 3h30 no dia 5 de março.» é outro trabalho:

Alguns modelos, incluindo o Whisper, aprendem a gerar texto já pontuado porque as transcrições de treinamento eram pontuadas. Outros rodam um modelo dedicado depois do reconhecimento. De um jeito ou de outro, erros de formatação são uma classe diferente dos erros de reconhecimento: as palavras podem estar certas e o texto continuar difícil de ler.

Por que o reconhecimento de fala comete erros?

Conhecer o processo torna os erros típicos previsíveis:

  1. Palavras raras perdem para as comuns. Um sobrenome, o codinome de um projeto interno ou uma ferramenta recém-lançada soam como algo mais frequente, e o mais frequente vence. Dicas de vocabulário são a solução direta.
  2. Sinal que falta não se recupera. O microfone de um notebook do outro lado da sala, áudio de telefone a 8 kHz ou duas pessoas falando ao mesmo tempo eliminam informação antes de o modelo vê-la.
  3. Modelos generativos podem alucinar. Um decodificador que escreve o texto token por token às vezes produz frases fluentes durante silêncio ou ruído. O artigo Careless Whisper, apresentado na FAccT em 2024, encontrou frases inteiras inventadas em cerca de 1% das transcrições do Whisper que analisou. Remover o silêncio antes do reconhecimento reduz o problema.
  4. Quem falou é outro problema. O reconhecimento produz palavras; atribuí-las a quem falou é a diarização de locutores, um modelo diferente com os seus próprios erros.

A precisão costuma ser expressa pela taxa de erro de palavras (WER, word error rate): substituições, omissões e inserções divididas pelo número de palavras realmente ditas. Ela é útil para comparar sistemas no mesmo áudio, mas os números de fornecedores diferentes não são diretamente comparáveis: as gravações de teste são outras, e também as regras de normalização que decidem se «3h30» e «três e meia» contam como a mesma coisa.

O que isso significa na hora de escolher uma ferramenta

Para o uso do dia a dia, algumas conclusões práticas decorrem desse processo:

No Speak-Y, o ditado funciona em mais de 67 idiomas com pontuação automática, e o modo reunião grava as chamadas localmente sem nenhum bot entrar, transcreve por locutor e, por padrão, mantém as transcrições no seu dispositivo — os prós e contras da gravação sem bot estão em como gravar reuniões sem bots. Com as transcrições prontas, a próxima pergunta é o que fazer com elas: um servidor MCP local permite que assistentes de IA como Claude ou Cursor as pesquisem e leiam, o que é explicado desde o básico em o que é um servidor MCP.

FAQ

Como funciona o reconhecimento de fala, em um parágrafo?

Um microfone transforma a pressão do ar em uma sequência de números, normalmente 16.000 amostras por segundo no reconhecimento de fala. O software converte trechos curtos e sobrepostos desse sinal em um espectrograma, uma imagem de quais frequências estão fortes a cada momento. Uma rede neural lê o espectrograma e prevê a sequência de palavras ou pedaços de palavras mais provável, e uma etapa final acrescenta pontuação, maiúsculas e formatação de números.

O que é um espectrograma e por que o reconhecimento de fala o usa?

Um espectrograma mostra como a energia de um som se distribui entre as frequências ao longo do tempo. Os sistemas de reconhecimento costumam usar um espectrograma log-Mel, que espaça as frequências do jeito que a audição humana as percebe. O Whisper, da OpenAI, por exemplo, calcula um espectrograma log-Mel de 80 canais em janelas de 25 milissegundos com passo de 10 milissegundos, o que dá ao modelo 100 quadros de características por segundo de áudio.

Por que o reconhecimento de fala erra nomes e termos técnicos?

O modelo escolhe o texto mais provável para o som que ouve, e essa probabilidade vem dos dados de treinamento. Um sobrenome raro ou o nome de um produto novo apareceu pouco ou nunca nesses dados, então vence uma palavra comum de som parecido. Dicas de vocabulário ajudam: muitos mecanismos aceitam uma lista de termos esperados ou um texto curto de contexto que puxa a saída para essas grafias.

O reconhecimento de fala pode inventar palavras que ninguém disse?

Sim. Modelos que geram o texto token por token podem produzir frases fluentes durante silêncio ou ruído. Um estudo apresentado na FAccT em 2024, Careless Whisper, constatou que cerca de 1% das transcrições do Whisper na sua amostra continham frases inteiras alucinadas. Cortar o silêncio antes do reconhecimento e revisar as transcrições importantes reduz o risco.

O que é a taxa de erro de palavras (WER)?

A taxa de erro de palavras (word error rate, WER) é a métrica padrão de precisão: substituições mais omissões mais inserções, divididas pelo número de palavras da transcrição de referência. Quanto menor, melhor, e ela pode passar de 100% quando um sistema insere muitas palavras a mais. Os valores de WER só são comparáveis quando vêm do mesmo áudio de teste e das mesmas regras de normalização do texto.