Los datos sintéticos han dejado de ser un sustituto precario de los datos reales para convertirse en un componente central del entrenamiento moderno de modelos: el patrón más fiable amplía un núcleo real de 500 ejemplos con miles de parafraseos sintéticos, siempre que se valide diversidad, corrección y distribución, y se mantenga al menos un 30% de datos reales para evitar el colapso del modelo.
Direct Preference Optimization (DPO) y sus variantes, IPO, KTO y SimPO, han desplazado a RLHF como método preferido para alinear modelos de lenguaje: eliminan el modelo de recompensa separado, reducen el coste de entrenamiento y son más fáciles de reproducir. RLHF conserva ventaja solo en modelos frontera con presupuesto muy grande.
Tres años después de que RLHF se hiciera popular, el paisaje del alineamiento de modelos es más rico. Repaso de RLHF, DPO y los métodos más recientes como KTO o ORPO, con criterios para elegir.
El aprendizaje por refuerzo es la técnica de IA en la que un agente aprende a tomar decisiones óptimas por prueba y error, sin datos etiquetados: actúa en un entorno, recibe una recompensa o penalización según el resultado y ajusta su estrategia para maximizar la recompensa acumulada a largo plazo.
6 min2484,3
Usamos cookies propias y de terceros para analizar el tráfico del sitio. Puedes aceptarlas, rechazarlas o configurar tu elección.
Más información sobre las cookies
Preferencias de cookies
NecesariasImprescindibles para el funcionamiento del sitio. Siempre activas.
AnalíticasNos ayudan a entender cómo se usa el sitio (Google Analytics).