IA Autoentrenada: Descobreix el seu funcionament

Experiments que avaluen l'algorisme DNO-Prct utilitzant puntuacions GPT-4-Turbo, comparacions aparellades curades i el conjunt de dades UltraFeedback. L'avaluació es realitza amb AlpacaEval 2.0, MT-Bench i OpenLLM Leaderboard, mostrant com DNO s'apropa al rendiment d'avantguarda mitjançant

miércoles, 16 de abril de 2025 • 1 min de lectura • Equip Q2BSTUDIO

Intel·ligència-Artificial-

Els experiments avaluen l'algorisme DNO (específicament, DNO-Prct) utilitzant un procés d'entrenament iteratiu que combina puntuacions GPT-4-Turbo amb comparacions aparellades curades. UltraFeedback forma el conjunt de dades central, amb assaigs addicionals a gran escala. L'avaluació es realitza utilitzant AlpacaEval 2.0, MT-Bench i OpenLLM Leaderboard. Els resultats ressalten com DNO s'apropa al rendiment d'avantguarda a través d'una modelització de preferències eficient i escalable.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.