Letra R Nivel: Avanzado Lectura: 1 min

¿Qué es RLHF (Reinforcement Learning from Human Feedback)?

Definición rápida

RLHF (Reinforcement Learning from Human Feedback o aprendizaje por refuerzo a partir de retroalimentación humana) es una técnica de entrenamiento en la que personas valoran las respuestas de un modelo de IA y esas valoraciones se usan para que el modelo aprenda a responder de forma más útil, clara y segura.

Por Carlos Miñana · Actualizado el 24 de septiembre de 2026
¿Qué es RLHF?

Qué es RLHF

Un modelo de lenguaje recién entrenado con texto de internet sabe mucho, pero no sabe comportarse como un asistente: puede ser confuso, grosero o poco útil. RLHF fue una de las claves del salto de calidad que llevó a ChatGPT: enseñó a los modelos a responder como la gente espera.

Cómo funciona

  1. El modelo genera varias respuestas a una misma pregunta.
  2. Personas evaluadoras las ordenan de mejor a peor.
  3. Con esas preferencias se entrena un «modelo de recompensa» que aprende qué respuestas gustan más.
  4. El modelo principal se ajusta con aprendizaje por refuerzo para maximizar esa recompensa.

Ejemplo real

Ante la pregunta «¿cómo despido a un empleado?», un modelo sin RLHF podría dar una respuesta fría o incompleta. Tras RLHF, tiende a explicar los pasos legales, el tipo de despido, la documentación necesaria y a recomendar asesoría laboral, porque las personas evaluadoras premiaron ese tipo de respuestas.

Para qué te sirve en tu negocio

No lo vas a aplicar tú, pero explica por qué los asistentes se comportan como lo hacen: por qué a veces son demasiado complacientes, por qué rechazan ciertas peticiones o por qué tienen un tono concreto. Todo eso sale en gran parte de este entrenamiento.

Errores comunes

Preguntas frecuentes

¿Qué diferencia hay entre RLHF y fine-tuning?

El fine-tuning enseña con ejemplos de respuestas correctas; RLHF, con preferencias humanas entre varias respuestas.

¿Qué es DPO?

Una alternativa más sencilla a RLHF que aprende directamente de las preferencias sin modelo de recompensa.

¿Qué es Constitutional AI?

Un enfoque de Anthropic que usa principios escritos y feedback de la propia IA para reducir la dependencia de evaluadores humanos.

¿Tienes un proyecto con IA en mente?
Te ayudo a aterrizarlo en tu negocio.
¡Te escucho!