Tres años después de que RLHF se hiciera popular, el paisaje del alineamiento de modelos es más rico. Repaso de RLHF, DPO y los métodos más recientes como KTO o ORPO, con criterios para elegir.
El aprendizaje por refuerzo es la técnica de IA en la que un agente aprende a tomar decisiones óptimas por prueba y error, sin datos etiquetados: actúa en un entorno, recibe una recompensa o penalización según el resultado y ajusta su estrategia para maximizar la recompensa acumulada a largo plazo.
6 min2484,3
Usamos cookies propias y de terceros para analizar el tráfico del sitio. Puedes aceptarlas, rechazarlas o configurar tu elección.
Más información sobre las cookies
Preferencias de cookies
NecesariasImprescindibles para el funcionamiento del sitio. Siempre activas.
AnalíticasNos ayudan a entender cómo se usa el sitio (Google Analytics).