Qué es RLHF
Un modelo de lenguaje recién entrenado con texto de internet sabe mucho, pero no sabe comportarse como un asistente: puede ser confuso, grosero o poco útil. RLHF fue una de las claves del salto de calidad que llevó a ChatGPT: enseñó a los modelos a responder como la gente espera.
Cómo funciona
- El modelo genera varias respuestas a una misma pregunta.
- Personas evaluadoras las ordenan de mejor a peor.
- Con esas preferencias se entrena un «modelo de recompensa» que aprende qué respuestas gustan más.
- El modelo principal se ajusta con aprendizaje por refuerzo para maximizar esa recompensa.
Ejemplo real
Ante la pregunta «¿cómo despido a un empleado?», un modelo sin RLHF podría dar una respuesta fría o incompleta. Tras RLHF, tiende a explicar los pasos legales, el tipo de despido, la documentación necesaria y a recomendar asesoría laboral, porque las personas evaluadoras premiaron ese tipo de respuestas.
Para qué te sirve en tu negocio
No lo vas a aplicar tú, pero explica por qué los asistentes se comportan como lo hacen: por qué a veces son demasiado complacientes, por qué rechazan ciertas peticiones o por qué tienen un tono concreto. Todo eso sale en gran parte de este entrenamiento.
Errores comunes
- Pensar que el modelo «entiende» lo correcto: aprende qué respuestas prefieren las personas.
- Ignorar sus efectos secundarios, como darte la razón demasiado a menudo.
- Confundirlo con el fine-tuning clásico: RLHF usa preferencias, no solo ejemplos.
Preguntas frecuentes
¿Qué diferencia hay entre RLHF y fine-tuning?
El fine-tuning enseña con ejemplos de respuestas correctas; RLHF, con preferencias humanas entre varias respuestas.
¿Qué es DPO?
Una alternativa más sencilla a RLHF que aprende directamente de las preferencias sin modelo de recompensa.
¿Qué es Constitutional AI?
Un enfoque de Anthropic que usa principios escritos y feedback de la propia IA para reducir la dependencia de evaluadores humanos.
