Més enllà de Sally-Anne: Teoria de la Ment en LLMs amb Punts Schelling

Descobreix com el benchmark EAST avalua la Teoria de la Ment en LLMs amb punts Schelling epistèmics, mostrant mancances en el raonament social.

martes, 28 de julio de 2026 • 3 min de lectura • Equip Q2BSTUDIO

Evaluación de ToM con EAST en modelos de lenguaje

L’avaluació de la Teoria de la Ment (ToM) en models de llenguatge de gran escala (LLMs) ha depès tradicionalment de proves estàtiques com el test de Sally-Anne, on s’espera que el model infereixi creences falses. Tanmateix, investigacions recents assenyalen que aquests tests poden ser superats per la memorització de patrons en les dades d’entrenament, sense que el model desenvolupi una capacitat social profunda. Per anar més enllà d’aquest enfocament, sorgeix l’Epistemic Asymmetry Schelling Task (EAST), un joc de diàleg entre dos LLMs que obliga els agents a coordinar-se en punts de referència semàntics sota diferents nivells de transparència epistèmica. Aquest disseny mesura si els models poden aplicar la ToM de manera funcional, en lloc de simplement respondre a preguntes típiques de benchmarks. Els resultats revelen una bretxa significativa: només els models de frontera aconsegueixen navegar correctament les demandes epistèmiques, mentre que les fallades de coordinació es deuen principalment a errors en el seguiment del coneixement compartit versus privat.

Aquesta dificultat té implicacions directes en el desenvolupament d’IA empresarial. Si els models no poden distingir el que sap un interlocutor del que sap el grup, difícilment podran col·laborar de manera efectiva en entorns reals. Per exemple, en sistemes d’agents autònoms que han de negociar termes o compartir informació sensible, un LLM amb ToM limitada podria revelar dades privades o malinterpretar instruccions contextuals. Aquí és on l’enginyeria de programari a mida cobra rellevància: a Q2BSTUDIO dissenyem solucions que integren models de llenguatge amb mecanismes de control epistèmic, assegurant que la IA no només entengui el llenguatge, sinó també el context social i tècnic de l’organització.

El concepte de “punts Schelling”, pres de la teoria de jocs, es refereix a solucions òbvies en què dues parts convergeixen sense comunicació explícita. En l’EAST, els LLMs han de trobar aquests punts sota condicions d’informació asimètrica, un requisit clau per a aplicacions com l’automatització de processos on diferents sistemes s’han de sincronitzar. Per exemple, un agent d’IA que gestiona comandes al núvol d’AWS o Azure necessita coordinar-se amb un altre agent que gestiona inventari, sabent quina informació és comuna i quina és exclusiva de cada part. Una fallada en aquesta distinció pot portar a duplicitat de comandes o pèrdua de dades, comprometent la ciberseguretat i l’eficiència operativa.

Des d’una perspectiva tècnica, els resultats de l’EAST suggereixen que la ToM funcional requereix no només un gran model, sinó també una arquitectura que permeti el seguiment explícit d’estats epistèmics. Això té paral·lelismes amb el desenvolupament de Business Intelligence (BI) i Power BI, on la fiabilitat dels informes depèn que el sistema distingeixi entre dades públiques, privades i agregades. A Q2BSTUDIO combinem aquestes capacitats amb serveis al núvol d’AWS i Azure, oferint entorns on la IA pot operar amb garanties de privacitat i precisió. Així mateix, la incorporació d’agents d’IA en fluxos de treball empresarials exigeix que aquests agents reconeguin quan compartir informació i quan retenir-la, una habilitat que els benchmarks tradicionals no mesuren.

La bretxa entre els models frontier i els més petits indica que encara hi ha camí per recórrer per aconseguir una intel·ligència artificial realment col·laborativa. Les empreses que inverteixen en aplicacions a mida poden beneficiar-se d’integrar tasques de coordinació similars a l’EAST en les seves proves de qualitat, assegurant que els LLMs seleccionats no només superin tests estàtics, sinó que demostrin una comprensió robusta de les dinàmiques socials. A Q2BSTUDIO oferim consultoria i desenvolupament per implementar aquests controls, des de la selecció del model fins a la integració en infraestructures al núvol, passant per la ciberseguretat de les dades intercanviades. El futur de la IA passa per superar el test de Sally-Anne i assolir una veritable teoria de la ment operativa, i nosaltres estem preparats per acompanyar aquest salt.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.