L'avaluació d'agents d'intel·ligència artificial generativa ha fet un salt qualitatiu amb l'aparició d'entorns que combinen interacció social i accions fonamentades. En lloc de provar models únicament en tasques aïllades, els nous benchmarks exigeixen que els agents sàpiguen quan buscar coneixement, a qui preguntar i com actuar basant-se en informació obtinguda de múltiples fonts. Aquest enfocament resulta essencial per desenvolupar IA per a empreses que operin en contextos reals, on el saber està distribuït entre diferents rols i les conseqüències de cada decisió depenen de comunicacions precises i execucions verificables.
El concepte d'entorns socials distribuïts descriu precisament aquesta realitat: el coneixement rellevant per a una tasca es reparteix entre participants aïllats per rols, i les accions amb impacte només es poden realitzar a través d'ells. La comunicació es converteix així en un mecanisme d'exploració sobre el coneixement particionat, mentre que l'acció fonamentada representa l'explotació de l'estat de l'entorn. Aquesta dicotomia obliga els agents a equilibrar indagació i execució, un desafiament que els benchmarks tradicionals no contemplaven.
Incognita, un framework construït sobre Concordia, aborda aquesta necessitat separant la interacció social de l'execució pràctica. En la seva arquitectura, un agent avaluador enruta missatges cap a usuaris o entitats especialitzades; aquests especialistes medien en les operacions permeses; un subentorn determinista executa les accions acceptades sobre un estat canònic; i un avaluador offline qualifica els resultats amb recompenses heretades. Per exemple, Incognita-Retail transforma el benchmark tau-bench retail en un entorn multi-entitat, conservant la semàntica de recompensa final. Aquest disseny permet mesurar comportaments com l'elicitació de coneixement ocult, la selecció de fonts adequades, els intents d'escriptura fonamentada i la detecció de finalitzacions prematures.
Els experiments amb tres models generatius sobre 18 tasques estratificades per amplitud social, en 540 assajos, revelen progressos significatius però també limitacions. La taxa d'èxit va pujar del 0% al 8,9% i 17,2% en els models més avançats, mentre que els finals prematurs van caure del 100% al 87% i 58%. Els models més potents van elicitar més coneixement ocult, van contactar més entitats i van intentar més escriptures fonamentades, però la fiabilitat general segueix sent baixa. Això confirma que els entorns socials distribuïts exposen comportaments emergents —com l'elicitació d'informació, la selecció de fonts i els intents d'acció— abans que s'assoleixi un èxit consistent. Per a les empreses que busquen implementar agents IA en processos crítics, aquests resultats subratllen la importància d'avaluar no només el resultat final, sinó també el procés d'interacció i presa de decisions.
A Q2BSTUDIO entenem que la construcció de sistemes multiagent robustos requereix una combinació d'experiència en desenvolupament, infraestructura i anàlisi de dades. Per això oferim serveis d'intel·ligència artificial que permeten dissenyar, avaluar i desplegar agents capaços d'operar en entorns socials complexos. A més, la nostra capacitat per crear aplicacions a mida i programari a mida garanteix que cada solució s'adapti a les necessitats específiques del negoci, integrant mòduls de comunicació i execució similars als que proposa Incognita. Per donar suport a aquests desplegaments, comptem amb serveis cloud aws i azure que proporcionen l'escalabilitat i fiabilitat necessàries, així com amb serveis intel·ligència de negoci basats en power bi per monitoritzar i optimitzar el rendiment dels agents en temps real. I no oblidem la seguretat: les nostres solucions inclouen ciberseguretat i pentesting per protegir les interaccions i les dades sensibles en entorns multiagent.
La investigació amb Incognita demostra que l'avaluació rigorosa en entorns socials distribuïts és clau per avançar cap a una intel·ligència artificial més fiable i efectiva. A Q2BSTUDIO ajudem les empreses a traduir aquestes troballes en solucions pràctiques, combinant innovació tecnològica amb un enfocament centrat en el valor de negoci. Tant si necessita desenvolupar IA per a empreses, implementar agents IA o enfortir la seva infraestructura amb serveis cloud i de ciberseguretat, el nostre equip està preparat per acompanyar-lo en cada pas.




