Más allá de Sally-Anne: Teoría de la Mente en LLMs con Puntos Schelling

Descubre cómo el nuevo benchmark EAST evalúa la Teoría de la Mente en LLMs mediante puntos Schelling epistémicos, revelando brechas en el razonamiento social.

martes, 28 de julio de 2026 • 3 min de lectura • Equipo Q2BSTUDIO

Evaluación de ToM con EAST en modelos de lenguaje

La evaluación de la Teoría de la Mente (ToM) en modelos de lenguaje de gran escala (LLMs) ha dependido tradicionalmente de pruebas estáticas como el test de Sally-Anne, donde se espera que el modelo infiera creencias falsas. Sin embargo, investigaciones recientes señalan que estos tests pueden ser superados por la memorización de patrones en los datos de entrenamiento, sin que el modelo desarrolle una capacidad social profunda. Para ir más allá de este enfoque, surge el Epistemic Asymmetry Schelling Task (EAST), un juego de diálogo entre dos LLMs que obliga a los agentes a coordinarse en puntos de referencia semánticos bajo diferentes niveles de transparencia epistémica. Este diseño mide si los modelos pueden aplicar la ToM de manera funcional, en lugar de simplemente responder a preguntas típicas de benchmarks. Los resultados revelan una brecha significativa: solo los modelos de frontera logran navegar correctamente las demandas epistémicas, mientras que los fallos de coordinación se deben principalmente a errores en el seguimiento de conocimiento compartido versus privado.

Esta dificultad tiene implicaciones directas en el desarrollo de IA empresarial. Si los modelos no pueden distinguir lo que sabe un interlocutor de lo que sabe el grupo, difícilmente podrán colaborar de manera efectiva en entornos reales. Por ejemplo, en sistemas de agentes autónomos que deben negociar términos o compartir información sensible, un LLM con ToM limitada podría revelar datos privados o malinterpretar instrucciones contextuales. Aquí es donde la ingeniería de software a medida cobra relevancia: en Q2BSTUDIO diseñamos soluciones que integran modelos de lenguaje con mecanismos de control epistémico, asegurando que la IA no solo entienda el lenguaje, sino también el contexto social y técnico de la organización.

El concepto de “puntos Schelling”, tomado de la teoría de juegos, se refiere a soluciones obvias en las que dos partes convergen sin comunicación explícita. En el EAST, los LLMs deben encontrar esos puntos bajo condiciones de información asimétrica, un requisito clave para aplicaciones como la automatización de procesos donde diferentes sistemas deben sincronizarse. Por ejemplo, un agente de IA que gestiona pedidos en la nube de AWS o Azure necesita coordinar con otro agente que maneja inventario, sabiendo qué información es común y cuál es exclusiva de cada parte. Un fallo en esta distinción puede llevar a duplicidad de pedidos o pérdida de datos, comprometiendo la ciberseguridad y la eficiencia operativa.

Desde una perspectiva técnica, los resultados del EAST sugieren que la ToM funcional requiere no solo un gran modelo, sino también una arquitectura que permita el rastreo explícito de estados epistémicos. Esto tiene paralelismos con el desarrollo de Business Intelligence (BI) y Power BI, donde la fiabilidad de los informes depende de que el sistema distinga entre datos públicos, privados y agregados. En Q2BSTUDIO combinamos estas capacidades con servicios cloud de AWS y Azure, ofreciendo entornos donde la IA puede operar con garantías de privacidad y precisión. Asimismo, la incorporación de agentes IA en flujos de trabajo empresariales exige que estos agentes reconozcan cuándo compartir información y cuándo retenerla, una habilidad que los benchmarks tradicionales no miden.

La brecha entre los modelos frontier y los más pequeños indica que aún hay camino por recorrer para lograr una inteligencia artificial realmente colaborativa. Las empresas que invierten en aplicaciones a medida pueden beneficiarse de integrar tareas de coordinación similares al EAST en sus pruebas de calidad, asegurando que los LLMs seleccionados no solo superen tests estáticos, sino que demuestren una comprensión robusta de las dinámicas sociales. En Q2BSTUDIO ofrecemos consultoría y desarrollo para implementar estos controles, desde la selección del modelo hasta la integración en infraestructuras cloud, pasando por la ciberseguridad de los datos intercambiados. El futuro de la IA pasa por superar el test de Sally-Anne y alcanzar una verdadera teoría de la mente operativa, y nosotros estamos preparados para acompañar ese salto.

¿UNA PAUSA?

Juega un momento antes de irte

NUESTROS SERVICIOS

Cómo podemos ayudarte

¿Tienes un proyecto en mente?

Cuéntanos tu visión y la convertimos en una solución de software. Sea cual sea el alcance, hacemos realidad tu idea.