Quan JSON no és suficient: fiabilitat semàntica d'agents LLM

Descobreix per què la validesa de l'esquema JSON no és suficient per a agents LLM en comandes. OrderBench revela altes taxes d'error semàntic.

jueves, 23 de julio de 2026 • 6 min de lectura • Equip Q2BSTUDIO

La validez del esquema no garantiza la corrección semántica

La inteligencia artificial generativa ha abierto una nueva frontera en la interacción hombre-máquina: los agentes basados en modelos de lenguaje (LLM) actúan cada vez más como compiladores de transacciones. Un usuario expresa una intención en lenguaje natural y el modelo emite un objeto estructurado —normalmente JSON— que una API puede ejecutar. Este flujo promete simplicidad y velocidad, pero oculta un riesgo profundo: la validez sintáctica no garantiza la corrección semántica. Un JSON bien formado puede ser una orden peligrosa, un pago erróneo o una autorización no deseada.

El estudio reciente “OrderBench: A Deterministic Benchmark for Restaurant Ordering Agents” (arXiv:2607.18261v1) ilustra precisamente esta brecha. Los investigadores diseñaron un entorno controlado para evaluar agentes de pedidos en restaurantes, separando la validez de esquema (estructura JSON correcta) de la corrección semántica (el plato correcto, las restricciones de alérgenos, el precio exacto). Los resultados son contundentes: incluso los modelos más potentes alcanzan un 100% de validez de esquema, pero la tasa de éxito semántico se queda en torno al 80%. En modelos más débiles, las aceptaciones no seguras —pero sintácticamente válidas— llegan a dos dígitos. Es decir, un agente puede responder con un JSON perfectamente formateado que, sin embargo, solicita un plato que el cliente no pidió o ignora una alergia grave. El artículo concluye con una advertencia de ingeniería concreta: la salida estructurada es una capa de interfaz necesaria, pero no sustituye a la verificación de dominio ni a la ejecución con cierre por fallo (fail-closed).

Para las empresas que integran agentes LLM en sus operaciones —ya sea en atención al cliente, gestión de pedidos o automatización de procesos— esta lección es crítica. Confiar únicamente en la validación de esquemas JSON o en los modos de “salida estructurada” de los proveedores es caer en una falsa sensación de seguridad. La fiabilidad semántica exige un enfoque multicapa: primero, un modelo de lenguaje robusto; segundo, reglas de negocio que verifiquen cada decisión; tercero, mecanismos de seguridad que impidan la ejecución de transacciones no validadas semánticamente. En Q2BSTUDIO, cuando desarrollamos aplicaciones a medida para sectores como la restauración, la logística o las finanzas, incorporamos este principio desde el diseño. No basta con que el JSON sea válido; necesitamos que la orden refleje exactamente la intención del usuario y respete las restricciones del negocio.

Uno de los servicios clave que ofrecemos es la creación de agentes de IA personalizados, capaces de interpretar lenguaje natural y traducirlo a transacciones seguras. Pero ese agente nunca actúa en solitario. Lo envolvemos en una capa de inteligencia artificial que incluye validación semántica en tiempo real: comprobación de inventario, precios, restricciones de horario, política de devoluciones, normativa legal, etc. Además, integramos estos sistemas en entornos cloud como AWS o Azure, garantizando escalabilidad y disponibilidad. Por supuesto, la ciberseguridad es un pilar fundamental: cada transacción debe ser auditada y protegida contra inyecciones o manipulaciones, especialmente cuando el agente tiene capacidad de ejecutar acciones en sistemas corporativos (ERP, CRM, pasarelas de pago). Por eso también ofrecemos servicios de ciberseguridad y pentesting, adaptados a arquitecturas con agentes LLM. Y cuando el objetivo es extraer inteligencia de negocio a partir de esas transacciones, nuestras soluciones de BI / Power BI permiten visualizar la calidad semántica de las interacciones y detectar patrones de error.

El caso concreto de un sistema de pedidos en un restaurante es un excelente laboratorio para entender esta problemática. Imaginemos un agente que recibe la solicitud: “Quiero una pizza margarita sin gluten y una Coca-Cola Zero”. El modelo puede generar un JSON sintácticamente perfecto: {'items':[{'name':'Pizza Margarita','gluten_free':true,'quantity':1},{'name':'Coca-Cola Zero','quantity':1}]}. Pero ese JSON podría ser semánticamente incorrecto si, por ejemplo, la pizza margarita del restaurante no tiene opción sin gluten y el sistema la asigna a un plato alternativo que el usuario no ha aceptado. O peor, si el JSON incluye un campo “price” con un valor calculado erróneamente, generando una transacción fraudulenta. La validación de esquema no detecta nada de esto. Solo una verificación semántica —que compare el plato solicitado con el catálogo real, que compruebe alérgenos, que calcule el precio correcto con impuestos y descuentos— puede garantizar la ejecución segura.

En Q2BSTUDIO abordamos estos desafíos combinando nuestra experiencia en cloud AWS/Azure con lógica de negocio personalizada. Para un cliente del sector de la restauración, desplegamos una arquitectura donde el agente LLM se ejecuta en un contenedor serverless, emitiendo un JSON preliminar. Ese JSON no se envía directamente a la cocina; antes pasa por un “validador semántico” que consulta una base de datos de productos, verifica disponibilidad, aplica reglas de negocio (límite de cantidad, horario de servicio, combinaciones prohibidas) y solo entonces genera una transacción confirmada. Si el validador detecta una ambigüedad o un posible error, el agente solicita aclaración al usuario mediante un diálogo natural, en un bucle de corrección. Este proceso asegura que la tasa de éxito semántico se acerque al 100% sin sacrificar la experiencia de usuario. Todo ello se despliega sobre infraestructura cloud escalable, con políticas de seguridad que evitan que un JSON malicioso pueda llegar al sistema de producción.

La lección de OrderBench trasciende el ámbito de los restaurantes. Cualquier agente LLM que genere órdenes de compra, reservas, transacciones financieras o configuraciones de infraestructura corre el mismo riesgo. La comunidad de ingeniería ha empezado a denominar a este problema como “allineación sintáctica vs. semántica”. La primera es relativamente fácil de resolver con técnicas como la generación guiada por esquemas o los modos JSON de los proveedores. La segunda, en cambio, requiere una comprensión profunda del negocio y un diseño de sistemas a prueba de fallos. Por eso, cuando una empresa decide incorporar agentes de IA en sus procesos críticos, no puede limitarse a integrar la API de un modelo. Necesita un desarrollo de software a medida que construya las capas de validación, monitoreo y rollback. En Q2BSTUDIO, llevamos años diseñando arquitecturas de software personalizadas que priorizan la fiabilidad y la seguridad, y ahora aplicamos esa misma filosofía a los agentes LLM. Nuestros proyectos de automatización de procesos, por ejemplo, incluyen siempre un “guard rail” semántico que intercepta cualquier salida del modelo antes de que afecte al negocio.

El futuro de los agentes LLM no pasa solo por mejorar la capacidad de los modelos, sino por construir sistemas que los envuelvan en capas de verificación y control. El JSON es la sintaxis; la semántica la pone el negocio. Ignorar esta distinción es exponerse a fallos costosos, tanto económicos como reputacionales. Desde Q2BSTUDIO, recomendamos a cualquier organización que esté evaluando el uso de transacciones compiladas por LLM que realice una auditoría semántica de sus flujos, que implemente pruebas deterministas como las de OrderBench adaptadas a su dominio, y que no escatime en inversión en capas de verificación. La inteligencia artificial puede ser el motor, pero la confianza la construye la ingeniería.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.