Aquesta secció introdueix DNO-Prct, una implementació pràctica i escalable d'Optimització Directa Nash. Utilitza aprenentatge contrastiu iteratiu, similar a DPO, però està dissenyat per a entrenament en lots en política amb preferències generals. En utilitzar senyals de recompensa de manera implícita i estructurar comparacions en parells, DNO-Prct permet una millora eficient per si mateix i s'apropa a l'equilibri de Nash en models de preferències d'IA complexos.




