MAG: Nuevo benchmark para agentes web multimodales y generación de guías

Descubre MAG, el primer benchmark que unifica ejecución de tareas y escritura de guías para agentes web multimodales. Evaluación con screenshots y

martes, 28 de julio de 2026 • 6 min de lectura • Equipo Q2BSTUDIO

Benchmark unificado para acciones y guías en agentes web automatizados

El avance de los asistentes digitales y los agentes automatizados ha puesto sobre la mesa un desafío recurrente: cómo lograr que una máquina no solo ejecute tareas en una interfaz web, sino que también sea capaz de explicar paso a paso lo que está haciendo, como lo haría un humano experto frente a un usuario novato. Hasta ahora, la investigación en agentes web se ha dividido en dos frentes separados: por un lado, sistemas que ejecutan acciones sobre el DOM o el árbol de accesibilidad de una página; por otro, modelos que generan texto de guía o tutoriales. Ambos enfoques ignoran la realidad de que los usuarios interactúan con pantallas renderizadas, no con código fuente, y que una tarea compleja rara vez consiste en un solo clic, sino en una secuencia de acciones que se despliega a través de múltiples estados de página. Es aquí donde surge MAG (Multimodal Action and Guide), el primer benchmark unificado que evalúa simultáneamente la capacidad de un agente para completar una tarea web y para redactar una guía textual que describa el proceso, todo ello sobre capturas de pantalla reales. Este enfoque no solo representa un salto cualitativo en la medición de inteligencia artificial aplicada a interfaces, sino que también abre oportunidades concretas para empresas que desarrollan soluciones digitales, como aplicaciones a medida o sistemas de automatización inteligente.

MAG propone dos esquemas de anclaje sobre las capturas de pantalla: Set-of-Mark, que selecciona elementos visuales mediante marcadores, y coordenadas de píxel en bruto. De esta forma, el agente debe interpretar la imagen tal como la ve un ser humano, sin depender de metadatos ocultos del DOM. El benchmark incluye un harness completo que abarca desde la anotación asistida por LLM y verificación humana, hasta el entrenamiento, la evaluación en entornos vivos y métricas conjuntas para acciones y guías. Los resultados iniciales son reveladores: incluso el modelo más potente actualmente disponible completa menos del 40% de las tareas, lo que deja un margen enorme para la innovación. Por ejemplo, un modelo supervisado de 9B parámetros apenas logra un 6,9% de éxito, que se eleva al 13,2% tras aplicar un método de entrenamiento GRPO aumentado con trayectorias de expertos. Esta mejora, aunque significativa, sigue siendo insuficiente para entornos productivos, lo que indica que la investigación en agentes multimodales está aún en una fase temprana.

La relevancia empresarial de MAG es inmediata. Las compañías que invierten en IA y automatización necesitan herramientas que no solo ejecuten tareas, sino que también generen documentación clara para onboarding de usuarios, cumplimiento normativo o formación interna. Un agente que pueda realizar una secuencia de acciones en una plataforma cloud y, al mismo tiempo, redactar una guía visual paso a paso, reduciría drásticamente los costes de soporte y aceleraría la adopción de nuevas funcionalidades. Desde Q2BSTUDIO, como empresa de desarrollo de software y tecnología, observamos este avance con gran interés. Nuestro equipo trabaja habitualmente en proyectos que integran cloud AWS/Azure, ciberseguridad y BI/Power BI, y sabemos que la capacidad de un sistema para auto-documentarse es un factor diferencial. Por ejemplo, imaginemos un agente que despliega una infraestructura en AWS, configura políticas de seguridad y, además, genera una guía para el equipo de operaciones: eso es exactamente lo que MAG pretende evaluar y mejorar.

El benchmark también pone de relieve la necesidad de modelos multimodales más robustos. Los agentes actuales, basados principalmente en texto (DOM, árbol de accesibilidad), fallan al enfrentarse a interfaces gráficas complejas con elementos dinámicos, pop-ups o cambios de estado que no se reflejan en el código subyacente. MAG fuerza al modelo a procesar la imagen completa, incluyendo colores, iconos, disposición espacial y contenido visual, algo que los humanos hacemos de forma natural. Esto tiene implicaciones directas para el desarrollo de automatización de procesos: las tareas que antes requerían scripts frágiles sobre selectores HTML podrían ser reemplazadas por agentes que entienden la interfaz como una imagen, haciéndolos mucho más resistentes a cambios de diseño. Además, la generación de guías en lenguaje natural permite que los resultados sean comprensibles para cualquier stakeholder, no solo para desarrolladores.

Desde una perspectiva técnica, MAG introduce una metodología de anotación innovadora que combina la potencia de los grandes modelos de lenguaje (LLMs) con la precisión humana. En lugar de etiquetar manualmente cada paso, un LLM propone anotaciones iniciales que luego son verificadas y corregidas por humanos, reduciendo el coste y el tiempo de preparación de datos. El harness incluye también un entorno de evaluación en vivo, donde el agente interactúa con páginas web reales y se mide tanto el éxito de la tarea (por ejemplo, completar una compra) como la calidad de la guía generada (claridad, completitud, orden de pasos). Las métricas conjuntas son un avance importante, porque un agente puede completar una tarea pero generar una guía confusa, o viceversa. MAG pondera ambos aspectos, reflejando mejor el valor real para un usuario final.

Otro hallazgo relevante del estudio es que el entrenamiento con GRPO (Group Relative Policy Optimization) y trayectorias de expertos casi duplica la tasa de éxito de un modelo pequeño (de 6,9% a 13,2%). Esto sugiere que la calidad de los datos de entrenamiento —específicamente, las demostraciones de humanos realizando tareas— es más crítica que el tamaño del modelo. Para empresas como Q2BSTUDIO, que desarrollan software a medida con componentes de IA, esta lección es clave: invertir en la recolección de trayectorias de usuarios reales puede ser más efectivo que simplemente escalar modelos. De hecho, muchos de nuestros proyectos de automatización incluyen fases de observación donde capturamos cómo los empleados realizan tareas repetitivas, para luego entrenar agentes que las repliquen. MAG ofrece un framework para validar formalmente ese tipo de enfoques.

El futuro de los agentes web multimodales pasa por la integración de visión y lenguaje en un solo flujo, y MAG es el primer banco de pruebas serio para medir ese progreso. A medida que modelos como GPT-4o, Gemini o Claude mejoran en comprensión visual, veremos agentes capaces de navegar interfaces complejas con mayor autonomía. Sin embargo, el benchmark revela que aún queda un largo camino: el mejor modelo actual no llega al 40% de éxito, y la calidad de las guías también es mejorable. Esto abre un espacio de oportunidad para startups y empresas tecnológicas que quieran especializarse en la capa de 'agentes explicativos', combinando visión por computador, procesamiento de lenguaje natural y razonamiento secuencial. En Q2BSTUDIO, seguimos de cerca estas tendencias para integrarlas en nuestras soluciones de IA, cloud y ciberseguridad, siempre con el objetivo de ofrecer a nuestros clientes herramientas que no solo funcionen, sino que también formen y empoderen a sus equipos.

En resumen, MAG no es solo un benchmark académico: es un reflejo de hacia dónde se dirige la interacción humano-máquina. Las empresas que adopten pronto este paradigma —agentes que actúan y explican— tendrán una ventaja competitiva en términos de eficiencia operativa, satisfacción del usuario y cumplimiento normativo. Desde el desarrollo de aplicaciones a medida hasta la implantación de dashboards de BI, pasando por la automatización de procesos en la nube, la capacidad de generar guías automáticas a partir de acciones reales transformará la forma en que diseñamos y mantenemos el software. En Q2BSTUDIO estamos preparados para acompañar a nuestros clientes en esa transformación, aportando experiencia técnica y visión estratégica.

¿UNA PAUSA?

Juega un momento antes de irte

NUESTROS SERVICIOS

Cómo podemos ayudarte

¿Tienes un proyecto en mente?

Cuéntanos tu visión y la convertimos en una solución de software. Sea cual sea el alcance, hacemos realidad tu idea.