MORPHEUS: benchmark persistente para aprendizaje por refuerzo continuo

MORPHEUS: el benchmark que obliga a los agentes de RL a adaptarse sin reinicios. Evalúa 6 métricas clave.

martes, 14 de julio de 2026 • 6 min de lectura • Equipo Q2BSTUDIO

Evalúa agentes de RL en simulaciones empresariales persistentes

En el campo del aprendizaje por refuerzo, la mayoría de los benchmarks tradicionales reinician el mundo tras cada episodio. Esta dinámica simplifica la experimentación pero se aleja de la realidad empresarial, donde los sistemas operan de forma continua y las decisiones pasadas condicionan el futuro. Para cerrar esta brecha, surge MORPHEUS, una plataforma de simulación persistente diseñada para el aprendizaje por refuerzo continuo (CRL). MORPHEUS se fundamenta en la Hipótesis del Mundo Grande, que sostiene que la complejidad del entorno siempre supera la capacidad representacional de cualquier agente. Como resultado, el entorno parece no estacionario incluso cuando sus reglas subyacentes son fijas. Para forzar el aprendizaje continuo, la plataforma exige tres propiedades: persistencia, no estacionariedad y complejidad operativa. La persistencia implica que las decisiones previas se acumulan y afectan la dinámica futura. La no estacionariedad asegura que cualquier política fija acabará siendo subóptima. Y la complejidad operativa significa que no existe una política óptima fija que pueda predefinirse. Cada entorno en MORPHEUS se implementa como un plugin autónomo en TypeScript, que exporta Descriptores Operacionales (OD), un planificador de simulación, datos semilla y documentación. Un OD define el plan de ejecución paso a paso para una capacidad concreta. Los agentes actúan a través de una API de capacidades, y cada llamada dispara la ejecución de un OD.

La no estacionariedad se introduce mediante dos motores. El primero inyecta fallos tipificados entre los pasos de un OD, utilizando once tipos de fallo como datos faltantes, fallos de dependencia o límites de tasa. Estos fallos se aplican a cuatro tasas predefinidas: ligera (5%), realista (8%), moderada (15%) y agresiva (30%). El segundo motor es un controlador de cambio de configuración asíncrono que modifica las tasas de fallo y la demanda en marcas de tiempo fijas, funcionando de manera independiente al bucle de entrenamiento. De esta forma se impide que el agente utilice la periodicidad de las actualizaciones como un reloj proxy. La recompensa que recibe el agente se compone de tres verificadores operativos nativos: señales de eventos de fallo, estado del libro financiero y rendimiento de recursos. La recompensa compuesta pondera estos elementos con pesos por defecto de 0.5 para fallos y 0.25 para los otros dos. Esta métrica permite evaluar el comportamiento del agente en términos de eficiencia, coste y productividad.

Dado que el espacio de acciones es extenso, entrenar un agente de aprendizaje por refuerzo puro desde cero resulta impracticable. Por ello, MORPHEUS adopta un pipeline de dos etapas. Primero, un modelo frontier (Gemini 3.1 Pro) recoge trayectorias usando el framework ReAct. Estas trayectorias sirven para ajustar un modelo Qwen3-14B mediante aprendizaje supervisado (SFT). A partir de ese checkpoint compartido, todos los experimentos de aprendizaje por refuerzo online utilizan PPO como optimizador base. Este enfoque aísla el comportamiento de aprendizaje continuo de la competencia operativa básica, permitiendo una comparación justa entre algoritmos. Para evaluar el rendimiento más allá de la recompensa acumulada, los investigadores proponen seis métricas: recompensa por configuración, velocidad de adaptación, olvido, tiempo de recuperación, estabilidad y brecha de rendimiento. La velocidad de adaptación es la métrica principal, midiendo los pasos necesarios para que la media móvil de la recompensa alcance la mitad del límite superior teórico. Complementariamente, se utilizan la ventaja relativa de adaptación (RAA) y la plasticidad medida por rango efectivo.

Los resultados comparativos entre cuatro familias de algoritmos (PPO sin mecanismo de aprendizaje continuo, HER con replay de experiencias pasadas, EWC con consolidación de pesos y LCM con modelo de contexto latente) revelan que ninguna estrategia domina por completo. En la tarea de asignación dinámica de recursos con deriva estructurada, EWC obtiene la mejor recompensa pero LCM se adapta más rápido. En una segunda tarea de planificación con deriva y efectos retrasados, HER alcanza la mayor recompensa mientras que LCM pierde ventaja por el retardo de la señal. Las brechas de rendimiento medias se sitúan cerca de 1.0 para todos los métodos, indicando un déficit significativo en el estado estable, no un simple ajuste fino. Es notable que PPO y HER tienden a adaptarse solo en la primera configuración y luego fallan en regímenes posteriores, incluso sin etiquetas de cambio.

MORPHEUS ofrece casos de uso muy relevantes para distintos perfiles profesionales. Para ingenieros de inteligencia artificial, permite probar si un agente detecta cambios de régimen sin etiquetas explícitas, por ejemplo cuando la demanda pasa de baja a ráfaga. Para científicos de datos, plantea el desafío de la asignación de crédito retardada, como sucede con la entrega a tiempo (OTIF) que solo se observa días después de la decisión. Para desarrolladores de software, el formato de plugin TypeScript facilita intercambiar recompensas o modificar la observabilidad sin alterar la dinámica subyacente. Este tipo de entornos persistentes reflejan con mayor fidelidad los sistemas empresariales reales, donde no existen reinicios y las decisiones se acumulan.

Las fortalezas de MORPHEUS incluyen mundos persistentes sin reinicios, cambios de régimen parametrizables y reproducibles, y recompensas derivadas de verificadores operativos nativos que no requieren anotación externa. El código de evaluación se ha liberado en código abierto. Sin embargo, también presenta debilidades: solo dos de los cinco entornos disponibles han sido evaluados hasta ahora, el límite superior teórico asume cero fallos y resulta optimista, los cambios son desencadenados externamente y no por decisiones compuestas, y los pesos de la recompensa son variables de investigación no validadas en la industria. A pesar de estas limitaciones, MORPHEUS representa un paso importante hacia benchmarks más realistas para el aprendizaje por refuerzo continuo.

Desde una perspectiva empresarial, la filosofía de MORPHEUS conecta directamente con las necesidades de organizaciones que operan sistemas complejos sin posibilidad de reinicio. Por ejemplo, en empresas como Q2BSTUDIO, que desarrolla aplicaciones a medida y soluciones de inteligencia artificial para empresas, la capacidad de entrenar agentes que se adaptan continuamente a entornos cambiantes es crucial. Además, la infraestructura que soporta estos sistemas suele apoyarse en servicios cloud AWS y Azure, y requiere garantías de ciberseguridad para proteger datos sensibles. Las empresas también pueden beneficiarse de servicios inteligencia de negocio como power bi para monitorizar el rendimiento de estos agentes en tiempo real, complementando las métricas nativas de MORPHEUS. Asimismo, el desarrollo de agentes IA personalizados y software a medida permite adaptar los algoritmos de aprendizaje a escenarios específicos, maximizando la eficiencia operativa.

En conclusión, MORPHEUS establece un nuevo estándar para la evaluación de algoritmos de aprendizaje por refuerzo continuo al eliminar los reinicios episódicos e introducir no estacionariedad realista. Aunque ningún algoritmo domina aún en todas las tareas, la plataforma proporciona un banco de pruebas riguroso que acerca la investigación a las condiciones del mundo real. Las empresas que busquen implementar soluciones de inteligencia artificial adaptativa encontrarán en MORPHEUS un marco de referencia, y en colaboraciones con expertos en desarrollo de software a medida, cloud y ciberseguridad, el camino para trasladar estos avances a sus operaciones diarias.

NUESTROS SERVICIOS

Cómo podemos ayudarte

¿Tienes un proyecto en mente?

Cuéntanos tu visión y la convertimos en una solución de software. Sea cual sea el alcance, hacemos realidad tu idea.