Inteligencia Artificial
Evaluación de alineamiento: RLHF, DPO y alternativas recientes
Tres años después de que RLHF se hiciera popular, el paisaje del alineamiento de modelos es más rico. Repaso de RLHF, DPO y los métodos más recientes como KTO o ORPO, con criterios para elegir.