Categorías

Inteligencia Artificial

DPO y alternativas a RLHF: estado práctico en 2026

Direct Preference Optimization (DPO) y sus variantes, IPO, KTO y SimPO, han desplazado a RLHF como método preferido para alinear modelos de lenguaje: eliminan el modelo de recompensa separado, reducen el coste de entrenamiento y son más fáciles de reproducir. RLHF conserva ventaja solo en modelos frontera con presupuesto muy grande.

Inteligencia Artificial

Datos sintéticos para entrenamiento en 2026: cuándo funcionan

Los datos sintéticos han dejado de ser un sustituto precario de los datos reales para convertirse en un componente central del entrenamiento moderno de modelos: el patrón más fiable amplía un núcleo real de 500 ejemplos con miles de parafraseos sintéticos, siempre que se valide diversidad, corrección y distribución, y se mantenga al menos un 30% de datos reales para evitar el colapso del modelo.