IA Autoentrenada: Descubre su funcionamiento

Experimentos que evalúan el algoritmo DNO-Prct utilizando puntuaciones GPT-4-Turbo, comparaciones emparejadas curadas y el conjunto de datos UltraFeedback. La evaluación se realiza con AlpacaEval 2.0, MT-Bench y OpenLLM Leaderboard, mostrando cómo DNO se acerca al rendimiento de vanguardia mediante

miércoles, 16 de abril de 2025 • 1 min de lectura • Equipo Q2BSTUDIO

Inteligencia-Artificial-

Los experimentos evaluán el algoritmo DNO (específicamente, DNO-Prct) utilizando un proceso de entrenamiento iterativo que combina puntuaciones GPT-4-Turbo con comparaciones emparejadas curadas. UltraFeedback forma el conjunto de datos central, con ensayos adicionales a gran escala. La evaluación se realiza utilizando AlpacaEval 2.0, MT-Bench y OpenLLM Leaderboard. Los resultados resaltan cómo DNO se acerca al rendimiento de vanguardia a través de una modelización de preferencias eficiente y escalable.

NUESTROS SERVICIOS

Cómo podemos ayudarte

¿Tienes un proyecto en mente?

Cuéntanos tu visión y la convertimos en una solución de software. Sea cual sea el alcance, hacemos realidad tu idea.