O reconhecimento de fala transforma uma onda sonora contínua em palavras separadas, e faz isso em uma sequência fixa de etapas. O sinal do microfone é amostrado em números, esses números viram um espectrograma, uma rede neural associa o espectrograma ao texto mais provável e uma etapa de formatação deixa esse texto legível. Todo sistema moderno — o teclado do celular, um app de notas de reunião, um aplicativo de ditado — segue alguma versão desse processo.
A resposta curta para «como ele sabe o que eu disse» é: ele não sabe, ele estima. O modelo entrega o texto mais provável para o som que recebeu, com base no que viu durante o treinamento. Esse fato sozinho explica a maior parte do comportamento que você percebe na prática: por que expressões comuns saem perfeitas, por que o sobrenome de um colega não sai, e por que uma pausa com ruído pode virar uma frase que ninguém disse.
Este artigo percorre o processo etapa por etapa, sem matemática e sem entrar no funcionamento interno de nenhum fornecedor específico.
O som é uma onda de pressão. O microfone a converte em tensão elétrica, e um conversor analógico-digital mede essa tensão milhares de vezes por segundo. Cada medição é uma amostra.
Música costuma ser gravada a 44.100 ou 48.000 amostras por segundo. O reconhecimento de fala raramente precisa de tanto: as frequências que carregam a fala ficam principalmente abaixo de 8 kHz, então a maioria dos sistemas trabalha com 16.000 amostras por segundo (16 kHz). O artigo científico do Whisper, por exemplo, afirma que todo o áudio é reamostrado para 16.000 Hz antes de qualquer outra coisa. O áudio de telefone costuma ser de 8 kHz, e esse é um dos motivos pelos quais gravações de ligações são mais difíceis de transcrever: parte do sinal de fala nunca foi captada.
Nesta etapa não há palavras, nem letras, nem detecção de silêncio. Há só uma longa lista de números: um minuto de áudio a 16 kHz são 960.000 deles.
A forma de onda bruta diz qual é a intensidade do sinal a cada instante, mas a informação que distingue um som da fala de outro está nas frequências. Um «s» é uma rajada de ruído de alta frequência; uma vogal como «a» tem faixas de energia fortes e estáveis mais abaixo.
Por isso o sistema corta o áudio em janelas curtas e sobrepostas — tipicamente de cerca de 25 milissegundos cada, deslocadas de 10 em 10 milissegundos — e mede quanta energia cada janela tem em cada frequência. Colocadas lado a lado, essas medições formam um espectrograma: o tempo em um eixo, a frequência no outro e a intensidade como brilho.
A maioria dos sistemas usa um espectrograma log-Mel. «Mel» significa que as faixas de frequência são espaçadas do jeito que a audição humana percebe a altura do som (a escala Mel): densas nas frequências baixas, esparsas nas altas. «Log» comprime a intensidade como o ouvido faz. Os modelos originais do Whisper usam 80 canais Mel em janelas de 25 ms com passo de 10 ms; o modelo large-v3 passou para 128. Em qualquer caso, um segundo de áudio vira cerca de 100 colunas de números, uma entrada muito mais compacta e informativa do que 16.000 amostras brutas.
É aqui que as abordagens mais mudaram nos últimos quinze anos.
Durante décadas, os sistemas de reconhecimento eram montados a partir de peças separadas. Um modelo acústico estimava quais sons da fala (fonemas) eram prováveis em cada quadro, um dicionário de pronúncia listava como cada palavra se forma a partir de fonemas, e um modelo de linguagem avaliava quais sequências de palavras eram plausíveis. Modelos ocultos de Markov amarravam tudo ao longo do tempo. Por volta de 2012, as redes neurais profundas substituíram os antigos modelos de mistura gaussiana dentro desse processo e reduziram bastante as taxas de erro — o ponto de virada costuma ser datado pelo artigo conjunto de Hinton e colegas de quatro grupos de pesquisa.
Os sistemas modernos, na maioria, treinam uma única rede neural que vai direto do espectrograma ao texto. Três arquiteturas dominam:
| Abordagem | Como alinha som e texto | Ponto forte típico |
|---|---|---|
| CTC (Graves et al., 2006) | Emite um rótulo ou um «branco» para cada quadro e depois junta as repetições | Rápido, simples, bom para streaming |
| Transdutor, RNN-T (Graves, 2012) | Decide a cada passo se emite um token ou lê o próximo quadro | Streaming com baixa latência |
| Codificador-decodificador com atenção | Um codificador lê o segmento inteiro e um decodificador escreve o texto token por token | Alta precisão em falas completas |
O Whisper é um exemplo do terceiro tipo: um Transformer codificador-decodificador que lê blocos de 30 segundos e escreve texto. A transcrição em streaming — palavras aparecendo enquanto você ainda está falando — favorece os dois primeiros, porque eles conseguem emitir resultado antes de a frase terminar.
A saída normalmente não são palavras inteiras, e sim tokens de subpalavra: pedaços como «trans», «cri», «ção». Isso permite que o modelo escreva palavras que nunca viu inteiras, e é por isso que o nome de um produto novo pode sair como uma combinação de fragmentos plausível, mas errada.
Um modelo de ponta a ponta não tem um dicionário separado, mas mesmo assim tem uma noção forte de quais sequências de palavras são prováveis — aprendida com o texto que acompanha o seu áudio de treinamento. A escala faz diferença: os modelos originais do Whisper foram treinados com 680.000 horas de áudio rotulado, das quais 117.000 horas cobriam 96 idiomas além do inglês; o large-v3 usou 1 milhão de horas de áudio com rotulagem fraca mais 4 milhões de horas de áudio com pseudorrótulos. Idiomas e sotaques raros nos dados de treinamento são reconhecidos com menos precisão, pelo mesmo motivo que nomes raros.
A rede não entrega uma única resposta. A cada passo, ela dá uma probabilidade para cada token possível. A decodificação é a busca pela melhor sequência como um todo: a decodificação gulosa (greedy) pega o token mais provável a cada vez, enquanto a busca em feixe (beam search) mantém várias frases candidatas ao mesmo tempo e escolhe a melhor já completa.
É também aqui que entram as dicas de vocabulário. Muitos mecanismos aceitam uma lista de termos esperados ou um texto curto de contexto (prompt); o guia de prompts da OpenAI para o Whisper, por exemplo, mostra um prompt que lista nomes de produtos e empresas para orientar a grafia. Uma dica desloca as probabilidades em direção a essas palavras, mas não salva um áudio que o modelo de fato não consegue ouvir.
A saída bruta do reconhecimento costuma parecer «então a reunião é às três e meia no dia cinco de março». Transformá-la em «Então a reunião é às 3h30 no dia 5 de março.» é outro trabalho:
Alguns modelos, incluindo o Whisper, aprendem a gerar texto já pontuado porque as transcrições de treinamento eram pontuadas. Outros rodam um modelo dedicado depois do reconhecimento. De um jeito ou de outro, erros de formatação são uma classe diferente dos erros de reconhecimento: as palavras podem estar certas e o texto continuar difícil de ler.
Conhecer o processo torna os erros típicos previsíveis:
A precisão costuma ser expressa pela taxa de erro de palavras (WER, word error rate): substituições, omissões e inserções divididas pelo número de palavras realmente ditas. Ela é útil para comparar sistemas no mesmo áudio, mas os números de fornecedores diferentes não são diretamente comparáveis: as gravações de teste são outras, e também as regras de normalização que decidem se «3h30» e «três e meia» contam como a mesma coisa.
Para o uso do dia a dia, algumas conclusões práticas decorrem desse processo:
No Speak-Y, o ditado funciona em mais de 67 idiomas com pontuação automática, e o modo reunião grava as chamadas localmente sem nenhum bot entrar, transcreve por locutor e, por padrão, mantém as transcrições no seu dispositivo — os prós e contras da gravação sem bot estão em como gravar reuniões sem bots. Com as transcrições prontas, a próxima pergunta é o que fazer com elas: um servidor MCP local permite que assistentes de IA como Claude ou Cursor as pesquisem e leiam, o que é explicado desde o básico em o que é um servidor MCP.
Um microfone transforma a pressão do ar em uma sequência de números, normalmente 16.000 amostras por segundo no reconhecimento de fala. O software converte trechos curtos e sobrepostos desse sinal em um espectrograma, uma imagem de quais frequências estão fortes a cada momento. Uma rede neural lê o espectrograma e prevê a sequência de palavras ou pedaços de palavras mais provável, e uma etapa final acrescenta pontuação, maiúsculas e formatação de números.
Um espectrograma mostra como a energia de um som se distribui entre as frequências ao longo do tempo. Os sistemas de reconhecimento costumam usar um espectrograma log-Mel, que espaça as frequências do jeito que a audição humana as percebe. O Whisper, da OpenAI, por exemplo, calcula um espectrograma log-Mel de 80 canais em janelas de 25 milissegundos com passo de 10 milissegundos, o que dá ao modelo 100 quadros de características por segundo de áudio.
O modelo escolhe o texto mais provável para o som que ouve, e essa probabilidade vem dos dados de treinamento. Um sobrenome raro ou o nome de um produto novo apareceu pouco ou nunca nesses dados, então vence uma palavra comum de som parecido. Dicas de vocabulário ajudam: muitos mecanismos aceitam uma lista de termos esperados ou um texto curto de contexto que puxa a saída para essas grafias.
Sim. Modelos que geram o texto token por token podem produzir frases fluentes durante silêncio ou ruído. Um estudo apresentado na FAccT em 2024, Careless Whisper, constatou que cerca de 1% das transcrições do Whisper na sua amostra continham frases inteiras alucinadas. Cortar o silêncio antes do reconhecimento e revisar as transcrições importantes reduz o risco.
A taxa de erro de palavras (word error rate, WER) é a métrica padrão de precisão: substituições mais omissões mais inserções, divididas pelo número de palavras da transcrição de referência. Quanto menor, melhor, e ela pode passar de 100% quando um sistema insere muitas palavras a mais. Os valores de WER só são comparáveis quando vêm do mesmo áudio de teste e das mesmas regras de normalização do texto.