Els experiments avaluen l'algorisme DNO (específicament, DNO-Prct) utilitzant un procés d'entrenament iteratiu que combina la puntuació GPT-4-Turbo amb comparacions aparellades curades. UltraFeedback forma el conjunt de dades principal, amb assaigs addicionals a gran escala. L'avaluació es realitza utilitzant AlpacaEval 2.0, MT-Bench i OpenLLM Leaderboard. Els resultats destaquen com DNO s'apropa al rendiment d'avantguarda a través d'una modelització de preferències eficient i escalable.





