Cómo funciona el reconocimiento de voz: del sonido al texto

El reconocimiento de voz convierte una onda sonora continua en palabras separadas, y lo hace siguiendo una serie fija de pasos. La señal del micrófono se muestrea en números, esos números se convierten en un espectrograma, una red neuronal asocia el espectrograma con el texto más probable y un paso de formato hace que ese texto sea legible. Todos los sistemas actuales —el teclado del móvil, un asistente de notas para reuniones, una aplicación de dictado— siguen alguna versión de este proceso.

La respuesta corta a «¿cómo sabe lo que he dicho?» es: no lo sabe, lo estima. El modelo devuelve el texto más probable para el sonido que recibió, según lo que vio durante el entrenamiento. Ese único hecho explica casi todo lo que se observa en la práctica: por qué las frases habituales salen perfectas, por qué el apellido de un compañero no, y por qué una pausa con ruido puede convertirse en una frase que nadie dijo.

Este artículo recorre el proceso etapa por etapa, sin matemáticas y sin entrar en el funcionamiento interno de ningún proveedor concreto.

Paso 1: ¿cómo convierte un micrófono el sonido en números?

El sonido es una onda de presión. El micrófono la convierte en voltaje, y un convertidor analógico-digital mide ese voltaje miles de veces por segundo. Cada medición es una muestra.

La música suele grabarse a 44 100 o 48 000 muestras por segundo. El reconocimiento de voz rara vez necesita tanto: las frecuencias que transportan el habla están sobre todo por debajo de 8 kHz, así que la mayoría de los sistemas trabajan a 16 000 muestras por segundo (16 kHz). El artículo de investigación de Whisper, por ejemplo, indica que todo el audio se remuestrea a 16 000 Hz antes de cualquier otra operación. El audio telefónico suele ser de 8 kHz, y esa es una de las razones por las que las grabaciones de llamadas son más difíciles de transcribir: parte de la señal de voz nunca llegó a captarse.

En esta fase no hay palabras, ni letras, ni detección de silencios. Solo hay una larga lista de números: un minuto de audio a 16 kHz son 960 000.

Paso 2: ¿qué es un espectrograma y por qué no usar la onda directamente?

La forma de onda en bruto indica la intensidad de la señal en cada instante, pero la información que distingue un sonido del habla de otro está en sus frecuencias. Una «s» es una ráfaga de ruido de alta frecuencia; una vocal como la «a» tiene bandas de energía fuertes y estables más abajo.

Por eso el sistema corta el audio en ventanas cortas superpuestas —de unos 25 milisegundos cada una, desplazadas 10 milisegundos— y mide cuánta energía tiene cada ventana en cada frecuencia. Colocadas una junto a otra, estas mediciones forman un espectrograma: el tiempo en un eje, la frecuencia en el otro y la intensidad como brillo.

La mayoría de los sistemas usan un espectrograma log-Mel. «Mel» significa que las bandas de frecuencia se espacian según cómo percibe el oído humano la altura del sonido (la escala Mel): densas en las frecuencias bajas y dispersas en las altas. «Log» comprime la intensidad como lo hace el oído. Los modelos originales de Whisper usan 80 canales Mel en ventanas de 25 ms con un desplazamiento de 10 ms; su modelo large-v3 pasó a 128. En ambos casos, un segundo de audio se convierte en unas 100 columnas de números, una entrada mucho más compacta e informativa que 16 000 muestras en bruto.

Paso 3: ¿cómo pasa el modelo del sonido a las palabras?

Aquí es donde más han cambiado los enfoques en los últimos quince años.

El proceso clásico: modelo acústico, diccionario y modelo de lenguaje

Durante décadas, los sistemas de reconocimiento se construían a partir de piezas separadas. Un modelo acústico estimaba qué sonidos del habla (fonemas) eran probables en cada trama, un diccionario de pronunciación indicaba cómo se forma cada palabra a partir de fonemas y un modelo de lenguaje puntuaba qué secuencias de palabras eran plausibles. Los modelos ocultos de Márkov lo unían todo en el tiempo. Hacia 2012, las redes neuronales profundas sustituyeron a los antiguos modelos de mezclas gaussianas dentro de este proceso y redujeron notablemente las tasas de error; el punto de inflexión suele fecharse en el artículo conjunto de Hinton y colegas de cuatro grupos de investigación.

Modelos de extremo a extremo

Los sistemas actuales entrenan casi siempre una única red neuronal que va directamente del espectrograma al texto. Predominan tres diseños:

Enfoque Cómo alinea sonido y texto Punto fuerte habitual
CTC (Graves et al., 2006) Emite una etiqueta o un «blanco» por cada trama y luego fusiona las repeticiones Rápido, sencillo, apto para streaming
Transductor, RNN-T (Graves, 2012) Decide en cada paso si emite un token o lee la trama siguiente Streaming con baja latencia
Codificador-decodificador con atención Un codificador lee el segmento entero y un decodificador escribe el texto token a token Alta precisión en enunciados completos

Whisper es un ejemplo del tercer tipo: un Transformer codificador-decodificador que lee fragmentos de 30 segundos y escribe texto. La transcripción en streaming —las palabras que aparecen mientras usted todavía está hablando— favorece a los dos primeros, porque pueden emitir resultados antes de que termine la frase.

La salida no suele estar formada por palabras completas, sino por tokens de subpalabra: fragmentos como «trans», «crip», «ción». Eso permite al modelo escribir palabras que nunca vio enteras, y explica por qué el nombre de un producto nuevo puede salir como una combinación de fragmentos plausible pero incorrecta.

De dónde sale el conocimiento del idioma

Un modelo de extremo a extremo no tiene un diccionario aparte, pero aun así tiene una idea clara de qué secuencias de palabras son probables, aprendida del texto que acompaña a su audio de entrenamiento. La escala importa: los modelos originales de Whisper se entrenaron con 680 000 horas de audio etiquetado, de las que 117 000 horas cubrían 96 idiomas distintos del inglés; large-v3 usó 1 millón de horas de audio con etiquetado débil más 4 millones de horas de audio con pseudoetiquetas. Los idiomas y acentos poco representados en los datos de entrenamiento se reconocen con menos precisión, por la misma razón que los nombres poco comunes.

Paso 4: la decodificación, o cómo se elige el texto final

La red no devuelve una sola respuesta. En cada paso da una probabilidad para cada token posible. La decodificación es la búsqueda de la mejor secuencia en conjunto: la decodificación voraz (greedy) toma cada vez el token más probable, mientras que la búsqueda en haz (beam search) mantiene varias frases candidatas a la vez y elige la mejor una vez completa.

Aquí es también donde actúan las pistas de vocabulario. Muchos motores aceptan una lista de términos esperados o un breve texto de contexto (prompt); la guía de OpenAI sobre prompts para Whisper, por ejemplo, muestra uno que enumera nombres de productos y empresas para orientar la grafía. Una pista desplaza las probabilidades hacia esas palabras, pero no puede rescatar un audio que el modelo realmente no llega a oír.

Paso 5: puntuación y formato

La salida en bruto del reconocimiento suele parecerse a «entonces la reunión es a las tres y media el cinco de marzo». Convertirla en «Entonces la reunión es a las 3:30 el 5 de marzo.» es un trabajo aparte:

Algunos modelos, Whisper entre ellos, aprenden a producir directamente texto puntuado porque sus transcripciones de entrenamiento lo estaban. Otros aplican un modelo específico después del reconocimiento. En cualquier caso, los errores de formato son de otra clase que los de reconocimiento: las palabras pueden ser correctas y el texto seguir siendo difícil de leer.

¿Por qué se equivoca el reconocimiento de voz?

Conocer el proceso hace que los errores típicos sean previsibles:

  1. Las palabras raras pierden frente a las comunes. Un apellido, el nombre en clave de un proyecto interno o una herramienta recién salida suenan como algo más frecuente, y lo más frecuente gana. Las pistas de vocabulario son la solución directa.
  2. La señal que falta no se recupera. El micrófono de un portátil al otro lado de la sala, el audio telefónico a 8 kHz o dos personas hablando a la vez eliminan información antes de que el modelo la vea.
  3. Los modelos generativos pueden alucinar. Un decodificador que escribe el texto token a token a veces produce frases fluidas durante silencios o ruido. El artículo Careless Whisper, presentado en FAccT en 2024, encontró frases u oraciones enteras inventadas en aproximadamente el 1 % de las transcripciones de Whisper que examinó. Eliminar los silencios antes del reconocimiento lo reduce.
  4. Quién habló es otro problema. El reconocimiento produce palabras; asignarlas a cada hablante es la diarización de hablantes, un modelo distinto con sus propios errores.

La precisión se expresa normalmente con la tasa de error por palabra (WER, word error rate): sustituciones, eliminaciones e inserciones divididas por el número de palabras realmente pronunciadas. Sirve para comparar sistemas con el mismo audio, pero las cifras de distintos proveedores no son directamente comparables: las grabaciones de prueba difieren, y también las reglas de normalización que deciden si «3:30» y «tres y media» cuentan como lo mismo.

Qué implica esto al elegir una herramienta

Para el uso diario, del proceso se desprenden algunas conclusiones prácticas:

En Speak-Y, el dictado funciona en más de 67 idiomas con puntuación automática, y el modo reunión graba las llamadas en local sin que entre ningún bot, transcribe por hablante y guarda por defecto las transcripciones en su dispositivo; las ventajas e inconvenientes de grabar sin bot se explican en cómo grabar reuniones sin bots. Una vez que existen las transcripciones, la siguiente pregunta es qué hacer con ellas: un servidor MCP local permite que asistentes de IA como Claude o Cursor las busquen y las lean, algo que se explica desde cero en qué es un servidor MCP.

FAQ

¿Cómo funciona el reconocimiento de voz, en un párrafo?

Un micrófono convierte la presión del aire en una secuencia de números, normalmente 16 000 muestras por segundo para el reconocimiento de voz. El software transforma fragmentos cortos y superpuestos de esa señal en un espectrograma, una imagen de qué frecuencias suenan con fuerza en cada momento. Una red neuronal lee el espectrograma y predice la secuencia de palabras o fragmentos de palabra más probable, y un paso final añade la puntuación, las mayúsculas y el formato de los números.

¿Qué es un espectrograma y por qué lo usa el reconocimiento de voz?

Un espectrograma muestra cómo se reparte la energía de un sonido entre las frecuencias a lo largo del tiempo. Los sistemas de reconocimiento suelen usar un espectrograma log-Mel, que espacia las frecuencias como lo hace el oído humano. Whisper, de OpenAI, por ejemplo, calcula un espectrograma log-Mel de 80 canales en ventanas de 25 milisegundos con un desplazamiento de 10 milisegundos, lo que da al modelo 100 tramas de características por segundo de audio.

¿Por qué el reconocimiento de voz se equivoca con nombres y términos técnicos?

El modelo elige el texto más probable para el sonido que oye, y esa probabilidad sale de los datos de entrenamiento. Un apellido poco común o el nombre de un producto nuevo apareció poco o nada en esos datos, así que gana una palabra frecuente que suena parecido. Las pistas de vocabulario ayudan: muchos motores aceptan una lista de términos esperados o un breve texto de contexto que inclina la salida hacia esas grafías.

¿Puede el reconocimiento de voz inventar palabras que nadie dijo?

Sí. Los modelos que generan el texto token a token pueden producir frases fluidas durante silencios o ruido. Un estudio presentado en FAccT en 2024, Careless Whisper, encontró que aproximadamente el 1 % de las transcripciones de Whisper de su muestra contenían frases u oraciones enteras alucinadas. Recortar los silencios antes del reconocimiento y revisar las transcripciones importantes reduce el riesgo.

¿Qué es la tasa de error por palabra (WER)?

La tasa de error por palabra (word error rate, WER) es la métrica de precisión estándar: sustituciones más eliminaciones más inserciones, divididas por el número de palabras de la transcripción de referencia. Cuanto más baja, mejor, y puede superar el 100 % cuando un sistema inserta muchas palabras de más. Las cifras de WER solo son comparables si proceden del mismo audio de prueba y de las mismas reglas de normalización del texto.