Perplexity AI llança WANDR: benchmark obert per a agents d'investigació profunda

Perplexity AI presenta WANDR, un benchmark obert que avalua agents d'investigació en descobriment ampli i evidència profunda. Descobreix els resultats.

lunes, 20 de julio de 2026 • 7 min de lectura • Equip Q2BSTUDIO

Evalúa agentes de IA que buscan amplio y profundo con evidencia

La irrupció dels agents d'intel·ligència artificial està redefinint els límits del treball basat en el coneixement. Durant els darrers mesos, hem assistit a una transició accelerada on els sistemes autònoms no només responen preguntes puntuals, sinó que executen fluxos complets d'investigació que abans requerien hores d'anàlisi humana. No obstant això, aquesta evolució ha exposat una bretxa crítica en l'ecosistema tecnològic: l'absència d'estàndards d'avaluació que mesurin la qualitat de processos complexos de recopilació i validació d'informació. Mentre que els benchmarks tradicionals se centren a verificar una única resposta correcta, l'entorn empresarial real exigeix eines capaces de navegar per oceans de dades, identificar entitats rellevants i documentar cada afirmació amb fonts verificables.

En aquest escenari emergeix una proposta disruptiva que promet establir nous paràmetres en la indústria. Perplexity AI ha presentat WANDR, un benchmark obert dissenyat específicament per avaluar agents d'investigació que han d'operar simultàniament amb amplitud i profunditat. A diferència de les proves convencionals que es conformen amb verificar la precisió d'un dada aïllada, WANDR sotmet els sistemes a reptes que replica el treball analític real: construir col·leccions extenses de registres recolzats per evidència documental. Aquesta aproximació representa un avanç fonamental perquè reconeix que el valor del coneixement empresarial no resideix únicament a trobar respostes, sinó a garantir que cada peça d'informació estigui fonamentada en fonts accessibles i verificables.

La metodologia subjacent a aquest benchmark introdueix conceptes tècnics que mereixen atenció detallada. El sistema utilitza jerarquies de qualificació composables on cada tasca defineix rutes de validació independents. Imaginem un escenari on un analista de mercat necessita identificar un conjunt ampli de competidors, per a cadascun d'ells localitzar executius clau i, finalment, vincular cada perfil amb documentació probatòria. WANDR replica aquesta complexitat mitjançant estructures arbòries que avaluen cada trajectòria de forma autònoma, exigint que els agents no només descobreixin entitats, sinó que aprofundeixin en cadascuna fins obtenir evidència concreta. Aquest enfocament elimina la possibilitat que un sistema es limiti a oferir exemples anecdòtics o narracions ben redactades però mancades de sustent empresarial sòlid.

Des d'una perspectiva empresarial, la rellevància de comptar amb benchmarks com WANDR transcendeix l'àmbit acadèmic. Les organitzacions que operen en sectors regulats, finances, consultoria estratègica o intel·ligència competitiva depenen de processos de due diligence que requereixen exactitud absoluta. Un agent d'IA que pugui demostrar la seva capacitat sota aquestes mètriques rigoroses es converteix en un actiu estratègic capaç de reduir temps d'investigació, minimitzar riscos operatius i potenciar la presa de decisions basada en dades. No obstant això, implementar aquestes solucions en entorns corporatius exigeix infraestructura tecnològica robusta, arquitectures cloud escalables i mecanismes de seguretat que protegeixin la integritat de les dades processades.

A Q2BSTUDIO entenem que l'adopció d'agents d'intel·ligència artificial en fluxos de treball empresarials requereix molt més que accés a models de llenguatge. Com a empresa especialitzada en desenvolupament de software i tecnologia, acompanyem organitzacions de diversos sectors en la construcció d'aplicacions a mida que integren capacitats cognitives avançades. El nostre enfocament combina el disseny de solucions custom software amb arquitectures modernes que permeten desplegar agents IA capaços d'interactuar amb fonts heterogènies, processar volums massius d'informació i presentar resultats estructurats que compleixen amb els estàndards de qualitat exigits per benchmarks emergents com WANDR.

La dimensió tècnica d'aquests sistemes obre interrogants sobre la infraestructura necessària per sostenir-los. Els agents d'investigació que aspiren a assolir mètriques competitives en avaluacions d'ample espectre necessiten accés a ecosistemes cloud que garanteixin elasticitat computacional i emmagatzematge distribuït. La implementació d'aquestes solucions en entorns empresarials crítics exigeix a més protocols de ciberseguretat que salvaguardin tant les dades consultades com les metadades generades durant el procés d'investigació. La intersecció entre intel·ligència artificial, computació en el núvol i seguretat informàtica constitueix un eix central que determinarà quines organitzacions aconseguiran capitalitzar veritablement el potencial de la investigació automatitzada.

Els resultats preliminars observats en l'ecosistema de benchmarks d'aquest tipus revelen patrons instructius. Els sistemes líders actualment mostren fortalesses significatives en la fase de descobriment inicial, aconseguint identificar percentatges elevats d'entitats rellevants. No obstant això, la veritable complexitat emergeix en l'etapa d'enriquiment i validació evidencial. Convertir una pàgina web identificada en una font documental completa que recolzi totes les dimensions d'una afirmació constitueix el coll d'ampolla principal. Aquesta realitat tècnica té implicacions directes per a les empreses que desenvolupen o integren agents IA: és necessari invertir en capacitats d'extracció semàntica, verificació creuada automàtica i generació de citacions estructurades que resisteixin auditories independents.

El disseny de referència oberta de WANDR ofereix avantatges col·laterals importants per al desenvolupament tecnològic. En disposar de cinc-cents tasques realistes generades a partir de patrons d'ús productiu, els equips d'enginyeria poden diagnosticar amb precisió on es produeixen les pèrdues de qualitat en els seus pipelines d'investigació. La granularitat del sistema de puntuació permet distingir entre fallades de descobriment, errors d'enriquiment o deficiències en l'extracció d'evidència. Aquesta capacitat de localització precisa accelera els cicles de millora contínua i permet a les organitzacions prioritzar inversions en els components arquitectònics que realment impacten el rendiment del sistema.

Des de l'angle de la intel·ligència de negoci, els agents d'investigació validats sota estàndards rigorosos habiliten noves categories de productes i serveis. Un departament d'intel·ligència competitiva pot automatitzar el monitoratge sistemàtic de moviments executius en la seva indústria. Un equip de fusions i adquisicions pot accelerar la construcció de memoràndums de due diligence amb cobertura exhaustiva d'empreses objectiu. Fins i tot les àrees de talent es poden beneficiar de sistemes que identifiquin candidats qualificats recolzant cada recomanació amb trajectòries documentades. Aquests casos d'ús convergeixen en una necessitat compartida: plataformes tecnològiques integrals que combinin agents IA amb capacitats d'anàlisi de dades, visualització i governança de la informació.

En aquest context de transformació digital accelerada, les solucions de Business Intelligence adquireixen una dimensió renovada. Integrar els outputs d'agents d'investigació amb eines de BI com Power BI permet crear dashboards dinàmics on la informació recopilada no roman estàtica, sinó que es vincula amb les seves fonts originals i s'actualitza a mesura que evolucionen els fets. Les organitzacions que aconsegueixin orquestrar aquest ecosistema —unint recol·lecció automatitzada, validació evidencial i visualització analítica— establiran avantatges competitius sostenibles en mercats on la velocitat i la precisió del coneixement determinen l'èxit estratègic.

Q2BSTUDIO posiciona el seu expertise precisament en la confluència d'aquestes disciplines. Els nostres projectes integren desenvolupament de software especialitzat amb serveis d'intel·ligència artificial aplicada a processos complexos de negoci. Dissenyem arquitectures que aprofiten les capacitats de cloud AWS/Azure per garantir que els agents d'investigació operin amb l'escala i resiliència que exigeixen entorns corporatius. Paral·lelament, les nostres pràctiques de ciberseguretat asseguren que tota la cadena de valor de la informació —des de la consulta a fonts externes fins a la presentació de resultats finals— es mantingui dins de perímetres de seguretat robustos i compliment normatiu.

L'aparició de benchmarks oberts com WANDR també planteja reflexions sobre el futur del desenvolupament de software en l'àmbit de la IA. Els equips d'enginyeria ja no es poden limitar a avaluar els seus sistemes mitjançant proves unitàries o mètriques de satisfacció de l'usuari. És imperatiu adoptar metodologies d'avaluació contínua que simulin condicions reals d'ús, amb volums significatius de dades i criteris de verificació objectius. Aquesta evolució cap a l'avaluació basada en evidència impulsa una major maduresa en el cicle de vida del software, on la qualitat es mesura per la capacitat del sistema de produir coneixement actionable i verificable, no merament plausible.

Mirant cap endavant, és probable que observem una proliferació de benchmarks especialitzats que cobreixin verticals específiques: des de la investigació biomèdica fins a l'anàlisi regulatori, passant per la intel·ligència financera. Cada domini implicarà reptes particulars en termes d'ontologies de dades, fonts autoritzades i criteris de validesa. Les empreses tecnològiques que desitgin liderar aquesta transició hauran d'invertir en capacitats d'enginyeria de dades, afinament de models especialitzats i disseny d'interfícies que permetin als usuaris finals interactuar amb els agents de forma supervisada i controlada. L'era de la investigació assistida per intel·ligència artificial tot just comença, i els seus fonaments es construeixen sobre pilars de transparència, verificabilitat i obertura metodològica.

En conclusió, la presentació de WANDR marca un hit significatiu en la maduració dels agents d'investigació. En elevar el llistó de l'avaluació cap a estàndards que exigeixen amplitud, profunditat i recolzament evidencial, aquest benchmark no només mesura l'estat actual de la tecnologia, sinó que traça una fulla de ruta per a les seves pròximes generacions. Per a les organitzacions empresarials, representa una invitació a repensar com integren la intel·ligència artificial en els seus processos de coneixement, assegurant que l'adopció d'aquestes eines es realitzi sobre bases tècniques sòlides i verificables. El futur del treball intel·lectual no serà reemplaçat per algoritmes, però sí que serà profundament transformat per aquells sistemes que demostrin, de manera transparent i mesurable, la seva capacitat per ampliar l'abast i la precisió del judici humà.

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.