Categorías

Inteligencia Artificial

DPO y alternativas a RLHF: estado práctico en 2026

Direct Preference Optimization (DPO) y sus variantes, IPO, KTO y SimPO, han desplazado a RLHF como método preferido para alinear modelos de lenguaje: eliminan el modelo de recompensa separado, reducen el coste de entrenamiento y son más fáciles de reproducir. RLHF conserva ventaja solo en modelos frontera con presupuesto muy grande.