Els experiments avaluen l'algorisme DNO (específicament, DNO-Prct) utilitzant un procés d'entrenament iteratiu que combina puntuacions GPT-4-Turbo amb comparacions aparellades curades. UltraFeedback forma el conjunt de dades central, amb assaigs addicionals a gran escala. L'avaluació es realitza utilitzant AlpacaEval 2.0, MT-Bench i OpenLLM Leaderboard. Els resultats ressalten com DNO s'apropa al rendiment d'avantguarda a través d'una modelització de preferències eficient i escalable.





