L'ecosistema dels agents d'intel·ligència artificial ha evolucionat de manera vertiginosa en els últims anys. Cada cop més empreses integren agents autònoms capaços d'executar tasques complexes mitjançant habilitats empaquetades —combinacions de codi i llenguatge natural— que permeten a un model de llenguatge actuar en dominis específics. No obstant això, aquest creixement comporta un problema crític: com garantir que cada actualització d'una habilitat no introdueixi regressions? Fins ara, l'avaluació ha estat predominantment anecdòtica: un desenvolupador demana a l'agent que 'provi l'habilitat', observa una demo i forma una impressió subjectiva. No hi ha reproductibilitat ni comparabilitat entre versions, i en mercats d'habilitats on un sol fallada silenciós pot trencar desenes de fluxos de treball, aquesta pràctica és insostenible.
En aquest context neix AEVAL (Agentic Evaluation), un marc de proves integrat al pipeline d'integració contínua que transforma l'avaluació en un procés determinista i reproduïble. Cada canvi en una habilitat desencadena un esdeveniment de prova: l'habilitat s'executa contra un contracte d'avaluació declarat pel desenvolupador (eval.config) dins d'un executor automatitzat, i emet un senyal de qualitat estructurada i basada en evidències que el sistema de CI pot enrutar. L'ingredient clau és la separació estructural entre l'executor i el qualificador, evitant un mode de fallada subtil però generalitzat: un agent que corregeix silenciosament els seus propis errors durant l'execució i després avalua els seus resultats pedaçats com a exitosos.
Aquesta aportació és especialment rellevant per a empreses com Q2BSTUDIO, que construeixen solucions d'IA per a clients de diversos sectors. En el nostre treball diari, desenvolupem aplicacions a mida que integren agents intel·ligents, i sabem que la fiabilitat és un pilar innegociable. Una habilitat d'agent mal provada pot comprometre processos crítics en logística, atenció al client o anàlisi financera. Per això, models com AEVAL ens inspiren a implementar metodologies rigoroses d'avaluació que aïllin el biaix d'autocorrecció i lliurin resultats auditables.
Analitzem en detall els components d'AEVAL. Primer, el protocol d'avaluació determinista: cada habilitat té el seu propi contracte per canvi, i cada execució genera un esquema d'artefactes (logs, traces, sortides intermèdies). Això permet que qualsevol integrador —sigui un desenvolupador humà o un bot de CI— pugui inspeccionar l'evidència de la prova. Segon, la formalització del biaix d'autocorrecció com un mode de fallada diferenciat. En avaluadors ingenus, l'agent pot intentar una tasca diverses vegades, corregir errors sobre la marxa i finalment declarar èxit encara que el primer intent fos incorrecte. Això amaga la veritable qualitat de l'habilitat. AEVAL introdueix una regla de qualificació de primer intent: només la resposta inicial compta; les autocorreccions es registren però no es consideren per a l'aprovació. Tercer, la separació executor/qualificador amb seguiment explícit de correccions. I quart, un sistema escalonat de suggeriments de correcció basats en evidències: nivell LV1 (causal) identifica la causa arrel de la fallada; nivell LV2 (qualitat) proposa millores en el codi o en el prompt de l'habilitat. Tot es publica com a comentaris en línia a la sol·licitud de fusió (merge request), facilitant la revisió per parells.
Els resultats validats en habilitats reals dins d'un stack d'agent productiu, sobre diversos SDKs d'agent, mostren un canvi dramàtic: les taxes d'aprovació del 100% espúries es converteixen en senyals de fallada reproduïbles al primer intent, amb un registre auditable de cada correcció de l'executor. Això no només millora la confiança en el desplegament continu, sinó que també permet als mercats d'habilitats oferir garanties de qualitat objectives.
Com es relaciona això amb els serveis que oferim a Q2BSTUDIO? La nostra experiència en IA ens ha ensenyat que la qualitat d'un agent no és només una qüestió de precisió del model, sinó de robustesa en l'execució. Quan ajudem els nostres clients a desenvolupar aplicacions a mida amb agents, apliquem principis similars als d'AEVAL: proves deterministes, separació de responsabilitats i generació d'evidències per a cada iteració. A més, la integració amb plataformes cloud com AWS o Azure permet escalar aquestes proves de manera rendible, i els quadres de comandament a Power BI faciliten la monitorització de la salut dels agents en producció. La ciberseguretat també és un aspecte crític: un agent que s'autocorregeix sense control pot exposar vulnerabilitats; la separació executor/qualificador mitiga aquest risc deixant un rastre immutable de cada acció.
En definitiva, AEVAL representa un avenç conceptual i pràctic per a l'enginyeria d'agents. Adoptar un enfocament sistemàtic d'avaluació no és un luxe, sinó una necessitat per a qualsevol organització que vulgui desplegar agents d'IA en entorns empresarials amb garanties. A Q2BSTUDIO, estem compromesos amb l'excel·lència tècnica i la innovació responsable, i veiem en metodologies com aquesta un camí clar cap a fluxos d'agents més fiables i auditables. Si la teva empresa està valorant integrar intel·ligència artificial en els seus processos, t'invitem a explorar com les nostres solucions de cloud AWS/Azure, ciberseguretat i BI/Power BI poden complementar una estratègia d'agents sòlida i sostenible.





