Alinea un modelo ya afinado con datos de preferencia usando DPO, ORPO, KTO o SimPO; para cuando existen pares de preferencia o feedback, o hay que elegir método o depurar un run de DPO.
- Costo de contexto al activarse
- 2k tok
- Tamaño del paquete
- 2 archivos
- Última actualización
- el mes pasado
