Intel·ligència Artificial Autoentrenada: Així Funciona

Els experiments avaluen l'algorisme DNO (DNO-Prct) utilitzant puntuació GPT-4-Turbo i comparacions aparellades. Els resultats destaquen l'aproximació de DNO al rendiment d'avantguarda mitjançant modelització de preferències eficient i escalable.

miércoles, 16 de abril de 2025 • 1 min de lectura • Equip Q2BSTUDIO

Intel·ligència-Artificial-

Els experiments avaluen l'algorisme DNO (específicament, DNO-Prct) utilitzant un procés d'entrenament iteratiu que combina la puntuació GPT-4-Turbo amb comparacions aparellades curades. UltraFeedback forma el conjunt de dades principal, amb assaigs addicionals a gran escala. L'avaluació es realitza utilitzant AlpacaEval 2.0, MT-Bench i OpenLLM Leaderboard. Els resultats destaquen com DNO s'apropa al rendiment d'avantguarda a través d'una modelització de preferències eficient i escalable.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.