EgoGapBench: selecció d'accions egocèntriques en entorns multiagent

EgoGapBench mesura selecció d'accions egocèntriques multiagent. Humans encerten; models fallen. Pot la IA entendre la perspectiva pròpia?

jueves, 2 de julio de 2026 • 2 min de lectura • Equip Q2BSTUDIO

Els MLLMs fallen en la selecció d'accions egocèntriques

la intel·ligència artificial avança a passes de gegant, però un dels reptes més subtils i complexos continua sent la comprensió de la perspectiva egocèntrica en entorns multiagent. Mentre que els models multimodals de llenguatge (MLLMs) poden etiquetar objectes o descriure escenes amb precisió, fallen a l'hora de seleccionar l'acció correcta des del punt de vista d'un agent específic quan hi ha altres individus visibles. Aquest problema, conegut com a selecció d'accions egocèntriques (EAS), ha estat aïllat gràcies al nou benchmark EgoGapBench, que demostra que els humans resolen la tasca amb fiabilitat, mentre que els sistemes d'IA —tant de codi obert com propietaris— es queden enrere i tendeixen a copiar les accions d'altres agents. Aquesta troballa revela que la capacitat de 'posar-se a la pell' d'un agent no s'adquireix només amb dades en primera persona; es requereix un entrenament específic en raonament perspectiu.

Per a les empreses que desenvolupen sistemes autònoms o assistents virtuals, aquesta limitació té implicacions pràctiques directes. Un agent d'IA que interactua en un espai compartit amb persones ha de saber no només què hi ha a l'escena, sinó quina decisió li correspon a ell, respectant rols i evitant interferències. Per exemple, en un magatzem logístic on diversos robots cooperen, o en un assistent d'atenció al client que ha de diferenciar entre l'usuari i altres interlocutors, la selecció egocèntrica d'accions marca la diferència entre un sistema funcional i un que genera confusió. Aquí és on el coneixement sobre benchmarks com EgoGapBench pot guiar el disseny de solucions d'IA per a empreses més robustes i contextuals.

A Q2BSTUDIO entenem que la veritable intel·ligència artificial no només processa dades, sinó que interpreta contextos dinàmics. El nostre equip desenvolupa aplicacions a mida que integren agents IA capaços de raonar sobre perspectives, així com sistemes d'intel·ligència de negoci (Power BI) que extreuen informació accionable a partir de fluxos de dades complexos. A més, oferim serveis cloud AWS i Azure per escalar aquests models, i ciberseguretat per protegir la infraestructura. La investigació sobre selecció d'accions egocèntriques ens recorda que la IA s'ha d'entrenar no només en reconeixement de patrons, sinó en la comprensió de la intencionalitat i el punt de vista, una àrea on el programari a mida i la personalització són clau.

En resum, EgoGapBench no és només un repte acadèmic; és una crida d'atenció per a la indústria. La pròxima generació de sistemes intel·ligents requerirà combinar visió, llenguatge i raonament perspectiu. A Q2BSTUDIO estem preparats per acompanyar les organitzacions en aquest camí, oferint solucions que integren serveis d'intel·ligència de negoci, automatització i agents IA entrenats per prendre decisions des de la perspectiva correcta. Perquè, al final, la tecnologia no només ha de veure el món, sinó saber actuar-hi.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.