Letra R Nivel: Basico Lectura: 1 min

¿Qué es Reconocimiento de voz (ASR · Automatic Speech Recognition)?

Definición rápida

El reconocimiento de voz (ASR, Automatic Speech Recognition) es la tecnología de inteligencia artificial que convierte el habla en texto escrito. Es lo que permite dictar mensajes, transcribir reuniones o dar órdenes a un asistente de voz.

Por Carlos Miñana · Actualizado el 24 de septiembre de 2026
¿Qué es Reconocimiento de voz?

Qué es el reconocimiento de voz

Durante años fue una tecnología frágil que fallaba con acentos o ruido. Los modelos actuales, como Whisper de OpenAI o los de Google y otros proveedores, transcriben con gran precisión, en muchos idiomas y con puntuación automática.

Cómo funciona

  1. El audio se divide en fragmentos y se convierte en una representación numérica.
  2. Un modelo predice qué palabras corresponden a esos sonidos.
  3. Se añaden puntuación, mayúsculas y, a veces, identificación de quién habla.

Ejemplo real

Una consultora graba sus reuniones con clientes. Un flujo automático transcribe cada grabación, un LLM genera un resumen con acuerdos y tareas, y el resultado llega por email a todos los participantes. Nadie tiene que tomar notas.

Para qué te sirve en tu negocio

Errores comunes

Preguntas frecuentes

¿Qué es Whisper?

Un modelo de reconocimiento de voz de OpenAI, disponible también como modelo abierto.

¿Qué diferencia hay con el TTS?

El reconocimiento de voz pasa de voz a texto; el TTS, de texto a voz.

¿Funciona bien en español?

Sí, con muy buena precisión en los modelos actuales.

¿Tienes un proyecto con IA en mente?
Te ayudo a aterrizarlo en tu negocio.
¡Te escucho!