This section introduces DNO-Prct, a practical and scalable implementation of Direct Nash Optimization. It uses iterative contrastive learning, similar to DPO, but is designed for on-policy batch training with general preferences. By using reward signals implicitly and structuring pairwise comparisons, DNO-Prct enables efficient self-improvement and approaches Nash equilibrium in complex AI preference models.





