EvoCUA-1.5: Aprendizaje por refuerzo online para agentes multiturno

EvoCUA-1.5 introduce aprendizaje por refuerzo online para agentes multiturno. Logra un 63,2% de éxito en OSWorld, superando modelos de mayor tamaño.

martes, 28 de julio de 2026 • 5 min de lectura • Equipo Q2BSTUDIO

Aprendizaje por refuerzo online multiturno con EvoCUA-1.5

El avance de los agentes de inteligencia artificial capaces de interactuar con entornos informáticos de forma autónoma ha dado un salto cualitativo con la llegada de EvoCUA-1.5, un sistema de aprendizaje por refuerzo online diseñado específicamente para tareas multiturno en escritorios virtuales. A diferencia de enfoques anteriores que se basaban en imitación de trayectorias estáticas, este modelo introduce un ciclo de mejora continua donde el agente aprende directamente de la interacción con entornos ejecutables, recibiendo recompensas verificables al completar objetivos. Este paradigma no solo supera las limitaciones de los datos offline, sino que plantea desafíos técnicos únicos: observaciones que cambian con cada paso, recompensas escasas y retrasos en la retroalimentación del entorno. Para abordarlos, EvoCUA-1.5 incorpora tres innovaciones clave: la optimización por pasos (STEPO), un filtrado basado en políticas con calibración de tasa de éxito, y el currículum adaptativo dinámico (DTAC). Todo ello se apoya en una infraestructura totalmente asíncrona que gestiona la latencia y el desfase de datos.

Desde una perspectiva empresarial, entender cómo funcionan estos mecanismos es crucial para cualquier compañía que busque automatizar procesos complejos —como la gestión de sistemas, el soporte técnico o la navegación por aplicaciones legacy— mediante agentes inteligentes. En Q2BSTUDIO, desarrollamos soluciones de IA a medida que integran técnicas de aprendizaje por refuerzo para entornos dinámicos. La capacidad de un agente para operar sobre múltiples pasos, recordar el contexto y recuperarse de errores es exactamente lo que diferencia a un asistente útil de uno frágil. Nuestro equipo aplica principios similares a los de EvoCUA-1.5 cuando diseñamos flujos de trabajo automatizados que requieren interacción con múltiples ventanas, formularios web o consolas de administración.

La primera pieza, STEPO (Step-Level Policy Optimization), resuelve un problema fundamental en el aprendizaje por refuerzo multiturno: cómo descomponer una trayectoria larga en pasos individuales sin perder la noción de la ventaja acumulada. En lugar de tratar cada episodio como un bloque monolítico, STEPO asigna a cada paso una ventaja calculada a partir del valor de los estados futuros, preservando el equilibrio entre exploración y explotación. Esto permite que el agente aprenda de cada acción, incluso cuando la recompensa final tarda en llegar. Para una empresa que implemente un agente de atención al cliente, esto se traduce en una mejora gradual de las respuestas, sin necesidad de supervisión constante.

El segundo componente es un mecanismo de filtrado y calibración sobre tareas sintéticas verificables. El sistema genera miles de escenarios de prueba —como abrir un archivo, cambiar una configuración o extraer datos de una aplicación— y solo retiene aquellas trayectorias que superan un umbral de probabilidad de éxito. Posteriormente, se calibra la tasa de aciertos para evitar que el agente se sobreespecialice en tareas fáciles. Esta estrategia es análoga a las pruebas de regresión en el desarrollo de software a medida: cada funcionalidad se verifica de forma aislada antes de integrarse en el flujo principal. En nuestro trabajo de aplicaciones a medida, aplicamos un enfoque similar al validar comportamientos de agentes en entornos controlados antes de desplegarlos en producción.

El tercer pilar es DTAC (Dynamic Tri-Adaptive Curriculum), un currículum adaptativo que combina tres estrategias: tareas aprendibles (aquellas en las que el agente aún puede mejorar), repetición positiva de tareas difíciles (para consolidar habilidades), y exposición controlada a tareas inviables (para evitar que el agente desperdicie recursos en objetivos imposibles). Este equilibrio dinámico recuerda a la forma en que los ingenieros de cloud en AWS y Azure diseñan pipelines de CI/CD: se priorizan los cambios que aportan más valor sin saturar el sistema. Para un agente de ciberseguridad, por ejemplo, DTAC permite que se enfrente primero a amenazas simuladas moderadas antes de exponerlo a ataques reales, mejorando su robustez sin comprometer la seguridad del entorno.

La infraestructura que sustenta todo el proceso es una arquitectura asíncrona con control de obsolescencia y mini-grupos de lotes. En un entorno empresarial, esto es equivalente a tener un sistema distribuido que maneja múltiples instancias de agentes en paralelo, recogiendo experiencias y actualizando la política sin cuellos de botella. Las empresas que integran Business Intelligence con Power BI o soluciones de automatización de procesos necesitan precisamente esa escalabilidad: poder lanzar cientos de pruebas simultáneas, procesar los resultados en tiempo real y ajustar los modelos sin interrumpir el servicio.

Los resultados experimentales de EvoCUA-1.5 son elocuentes: alcanza un 63,2% de éxito en el benchmark OSWorld-Verified, superando a modelos abiertos de 32B-35B parámetros y acercándose a modelos mucho más grandes. Esto demuestra que la eficiencia del aprendizaje online puede compensar la falta de tamaño del modelo, un hallazgo relevante para empresas que buscan implementar agentes sin incurrir en costes desorbitados de computación. En Q2BSTUDIO, consideramos que la clave no está solo en el volumen de parámetros, sino en la calidad del proceso de entrenamiento y en la capacidad de adaptarse a entornos cambiantes.

Por último, cabe destacar que este tipo de tecnologías no solo son aplicables a escritorios virtuales. Cualquier sistema que requiera interacciones secuenciales —desde un CRM hasta un panel de control industrial— puede beneficiarse de los principios de EvoCUA-1.5. La combinación de aprendizaje por refuerzo online con currículums adaptativos abre la puerta a asistentes que verdaderamente aprenden de la experiencia, mejorando con cada tarea completada. Nuestra experiencia en ciberseguridad y pentesting nos ha enseñado que los agentes de IA deben ser entrenados en condiciones realistas para ser efectivos; este enfoque multiturno es el camino correcto.

En conclusión, EvoCUA-1.5 representa un hito en el aprendizaje por refuerzo para agentes multiturno, ofreciendo un marco práctico que combina teoría y eficiencia computacional. Para las empresas que desean adoptar estas capacidades, contar con un socio tecnológico que entienda tanto la parte algorítmica como la integración en infraestructuras cloud y on-premise es esencial. En Q2BSTUDIO, ofrecemos servicios de desarrollo de software a medida, inteligencia artificial, ciberseguridad, cloud computing y business intelligence para ayudar a las organizaciones a construir agentes que no solo ejecuten tareas, sino que aprendan y se adapten como lo haría un colaborador humano.

¿UNA PAUSA?

Juega un momento antes de irte

NUESTROS SERVICIOS

Cómo podemos ayudarte

¿Tienes un proyecto en mente?

Cuéntanos tu visión y la convertimos en una solución de software. Sea cual sea el alcance, hacemos realidad tu idea.