Perplexity presenta WANDR: un benchmark obert per a agents d'investigació

Perplexity estrena WANDR, un benchmark obert que avalua agents d'IA en tasques de recerca ampla i profunda amb evidència verificable.

lunes, 20 de julio de 2026 • 7 min de lectura • Equip Q2BSTUDIO

Así funciona el nuevo benchmark de investigación para IA

La irrupció dels agents autònoms d'investigació està redefinint el ritme al qual les organitzacions processen informació estratègica. Durant els darrers mesos, hem assistit a una transició accelerada des de models conversacionals que responen preguntes puntuals cap a sistemes capaços d'executar fluxos de treball complexos de recopilació i validació de dades. Aquest canvi de paradigma no és merament tecnològic; representa una transformació operativa que afecta directament els departaments d'intel·ligència competitiva, els analistes de mercat i els equips de due diligence. Les empreses ja no busquen únicament assistents que redactin respostes elegants, sinó col·laboradors digitals capaços d'explorar fonts disperses, sintetitzar hallazgos i estructurar col·leccions documentals que serveixin com a base per a decisions d'alt impacte. No obstant això, la maduresa d'aquestes eines exigeix mecanismes d'avaluació que transcendeixin les proves sintètiques tradicionals i s'aproximin als escenaris reals del treball professional.

Fins fa poc, la majoria de referents en la indústria es centraven a verificar si un model era capaç d'emetre una única resposta correcta davant d'un interrogant aïllat. Aquesta aproximació resulta insuficient quan el que es necessita és construir un corpus documental robust, on cada afirmació estigui recolzada per fonts verificables i cada entitat descoberta compleixi criteris de qualitat estrictes. En l'entorn corporatiu actual, una resposta parcial o una narrativa ben construïda sobre fonaments inestables poden generar riscos reputacionals, regulatoris i financers. Per això, la comunitat tecnològica reclama estàndards que mesurin no només l'elegància de l'output, sinó la integritat del procés d'investigació subjacent. En aquest context emergeix una proposta impulsada per Perplexity sota la denominació WANDR, un benchmark obert dissenyat per sotmetre els agents a tasques de recollida massiva d'evidència, on el volum de dades recuperades importa tant com la solidesa de la seva fonamentació.

L'essència de WANDR resideix a combinar dues dimensions que rarament es mesuren de forma simultània en les proves convencionals. D'una banda, l'amplitud del descobriment: la capacitat del sistema per identificar conjunts extensos i sovint oberts d'entitats rellevants, superant l'enfocament dels exemples merament il·lustratius. De l'altra, la profunditat investigativa: el requisit que cada element identificat sigui examinat amb prou detall per justificar la seva inclusió mitjançant referències concretes i cites comprovables. Quan ambdues exigències s'integren, el repte deixa de ser una simple cerca de respostes per convertir-se en un exercici d'arquitectura del coneixement. Un agent que es limiti a oferir anècdotes o resums ben redactats sobre bases incompletes no superarà les proves, la qual cosa reflecteix fidelment les necessitats de les organitzacions que depenen de dades fiables per dissenyar estratègies d'expansió, avaluar competidors o validar oportunitats d'inversió.

Per materialitzar aquesta filosofia, el benchmark estructura les seves tasques mitjançant esquemes jeràrquics de validació que simulen fluxos reals de treball professional. Imaginem una cadena on el sistema ha de localitzar primer un conjunt d'organitzacions que compleixin paràmetres específics, després identificar perfils o esdeveniments específics dins de cada una, i finalment aportar documentació fehacient que corrobori cada vinculació establerta. Cada trajecte complet dins d'aquesta estructura es verifica de manera independent, de manera que no n'hi ha prou amb completar parcialment la missió o lliurar resultats a mitges. Aquest enfocament permet representar des de llistats plans fins a matrius de cerca niades, adaptant-se a la complexitat variable que troben els analistes en el seu dia a dia. La independència de cada branca avaluable garanteix que el sistema mantingui la rigorositat fins i tot quan l'escala de la tasca creix de forma exponencial.

La rellevància d'aquest tipus d'avaluacions per al teixit empresarial és immediata i multidimensional. Un departament d'intel·ligència de mercat no es pot conformar a conèixer tres competidors emergents; necessita cartografiar la totalitat d'actors rellevants dins d'un nínxol geogràfic o sectorial, aportant indicadors que recolzin el seu posicionament financer i la seva quota de mercat. Un equip d'auditoria legal requereix traçar xarxes de propietat, executius i finançament entre desenes de societats, documentant cada eslabó amb registres oficials i comunicats de premsa verificables. De la mateixa manera, els processos de selecció de talent a escala exigeixen identificar perfils qualificats i validar les seves trajectòries mitjançant fonts accessibles públicament, descartant candidatures que no comptin amb recolzament documental. En tots aquests casos, el valor no resideix en la fluïdesa del text generat, sinó en l'exactitud, la cobertura i la traçabilitat de la informació compilada.

Davant d'aquesta realitat, les empreses que desitgen integrar capacitats d'investigació automatitzada en les seves operacions han d'apostar per infraestructures tecnològiques sòlides, escalables i adaptades als seus processos específics. Des de Q2BSTUDIO, entenem que desplegar agents IA en entorns productius implica molt més que connectar una API de llenguatge natural a un chatbot corporatiu. És necessari dissenyar aplicacions a mida que orquestin la interacció entre models generatius, bases de dades corporatives, motors de recuperació externa i sistemes de gestió documental, garantint que cada pas del procés sigui auditable i reproduïble. La implementació d'aquestes solucions exigeix arquitectures en cloud AWS/Azure que permetin escalar la computació i l'emmagatzematge segons la complexitat de les tasques, així com protocols de ciberseguretat que protegeixin tant les dades consultades com les metadades generades durant la investigació, preservant la confidencialitat del client i el compliment normatiu.

Els resultats preliminars obtinguts pels sistemes avaluats sota aquest nou estàndard, incloent-hi les proves públiques difoses en el marc de WANDR, revelen un panorama heterogeni que confirma la joventut del sector. Tot i que algunes plataformes comercials lideren les mètriques globals, cap assoleix nivells de resolució complets, la qual cosa evidencia que la investigació automatitzada d'ample espectre continua sent un terreny en evolució. Els anàlisis detallats mostren que la majoria de solucions tenen dificultats pronunciades quan la profunditat jeràrquica augmenta, ja que cada nivell addicional introdueix punts de fallida potencials que els models actuals no gestionen amb soltesa. Curiosament, localitzar documents potencialment útils resulta relativament accessible per als sistemes més avançats; el veritable coll d'ampolla apareix en intentar extreure d'aquests documents l'evidència completa i precisa que sustenti totes les condicions exigides per la tasca, demostrant que la comprensió profunda del context continua sent un repte pendent.

Aquesta distinció entre recuperació superficial i validació rigorosa té implicacions directes per a com les organitzacions han d'abordar els seus projectes de transformació digital. No n'hi ha prou a disposar d'un motor de cerca potent si posteriorment no existeix un mecanisme de verificació que confirmi que els extractes seleccionats justifiquin íntegrament les afirmacions derivades. Aquí és on el disseny de sistemes híbrids pren protagonisme. Les arquitectures que combinen components probabilístics d'intel·ligència artificial amb mòduls de computació determinista —capaços d'executar operacions repetitives de filtratge, deduplicació i unió fora del context del model lingüístic— demostren un rendiment superior en entorns exigents. Aquest tipus d'abordatge, basat a programar la lògica d'investigació com un flux estructurat més que com una simple conversa, redueix la latència, optimitza els costos associats i millora substancialment la fiabilitat dels resultats finals.

Per a les companyies que basen la seva avantatge competitiva en la velocitat d'anàlisi, comptar amb eines que permetin diagnosticar amb precisió on es produeix la pèrdua de qualitat resulta estratègic. Una avaluació granular que distingeixi entre errors de descobriment inicial, deficiències en l'enriquiment de dades o fallades en l'extracció probatòria permet als equips d'enginyeria prioritzar millores de forma quirúrgica. Aquesta capacitat d'auditoria interna resulta especialment valuosa quan els outputs dels agents alimenten posteriorment quadres de comandament i sistemes de BI/Power BI orientats a la presa de decisions executives. La coherència entre les dades recopilades automàticament i els informes de negoci depèn que cada eslabó de la cadena d'investigació sigui susceptible d'inspecció, correcció i traçat, evitant que decisions crítiques es prenguin sobre bases inexactes.

L'horitzó que es dibuixa a partir d'aquestes innovacions apunta cap a una professionalització creixent dels ecosistemes d'intel·ligència artificial aplicada al coneixement. Els benchmarks oberts no només serveixen per classificar sistemes en una taula de posicions; constitueixen una eina de maduració per a tota la indústria, establint un llenguatge comú sobre el que significa realitzar una investigació exhaustiva i fonamentada en l'àmbit professional. Per als responsables tecnològics, això implica revisar les seves fulles de ruta i assegurar que les inversions en IA no es limiten a interfaces conversacionals o assistents virtuals, sinó que abastin pipelines complets d'adquisició, verificació, enriquiment i presentació d'informació. Només així serà possible traslladar el potencial dels models generatius a resultats tangibles de negoci.

En definitiva, l'aparició d'estàndards d'avaluació com WANDR, que mesurin la capacitat dels agents per treballar amb conjunts extensos d'evidència, marca un punt d'inflexió en l'adopció empresarial d'aquestes tecnologies. Les organitzacions que apostin per desenvolupar capacitats internes en aquest àmbit —recolzades en partners tecnològics especialitzats, infraestructures cloud robustes i una visió integral de la seguretat i el govern de la dada— estaran millor posicionades per capitalitzar els avantatges de l'automatització intel·ligent. El futur del treball basat en coneixement no serà reemplaçat per models que simplement parlin amb soltesa, sinó per aquells capaços de construir, documentar i defensar cada peça d'informació que lliurin, generant valor real i mesurable per als seus usuaris.

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.