AgentLens: Avaluació de Trajectòries per a Agents de Codi

AgentLens avalua agents de codi per la seva trajectòria completa, no només el resultat, i ofereix explicacions llegibles. Millora la fiabilitat de la teva IA.

viernes, 31 de julio de 2026 • 5 min de lectura • Equip Q2BSTUDIO

Más allá del aprobado: agentes de código analizados

AgentLens: Avaluació de Trajectòries per a Agents de Codi és un benchmark concebut per mesurar allò que les proves tradicionals ignoren. En els darrers anys, la indústria del programari ha adoptat agents d'IA capaços d'escriure, revisar i depurar codi de manera autònoma. Però la majoria de les avaluacions existents es limiten a comprovar si l'agent completa una tasca en un entorn aïllat. Aquesta visió simplista és enganyosa en projectes reals, on la ruta que segueix l'agent, els errors que comet i la manera de recuperar-se determinen la seva utilitat en producció. AgentLens no es conforma amb el resultat: examina tota la trajectòria.

La proposta combina verificació formal amb revisions narratives generades per models de llenguatge. Primer, utilitza comprovacions objectives quan la tasca té una resposta correcta verificable. Segon, incorpora anàlisi de la interacció de l'agent amb les seves eines, la seva adhesió a les instruccions i la seva capacitat d'autoavaluació. Finalment, planteja comparatives cara a cara entre diferents versions o models, de manera que cada execució produeix una explicació llegible del motiu pel qual s'obté una puntuació concreta. Això transforma l'avaluació en una font de diagnòstic, no en un simple rànquing.

Per a una empresa de desenvolupament de programari com Q2BSTUDIO, aquest enfocament és especialment valuós. Quan construïm aplicacions a mida, no podem permetre que un agent d'IA sigui una caixa negra. Necessitem saber quina decisió va prendre a cada pas, per què va descartar una alternativa i com va reaccionar davant d'una fallada inesperada. La traçabilitat que ofereix AgentLens s'assembla a la que exigim en qualsevol altre component crític: registres detallats, context i capacitat d'auditoria. Sense aquesta visibilitat, és impossible confiar en l'automatització.

El benchmark també connecta amb una realitat quotidiana en els equips d'enginyeria: la regressió silenciosa. Un agent pot aprovar totes les proves sintètiques avui i fallar demà en una tasca similar perquè un canvi en el seu model subjacent va alterar el seu comportament. En executar AgentLens periòdicament, és possible detectar aquestes regressions abans que afectin els usuaris. A Q2BSTUDIO integrem aquesta lògica en els nostres pipelines de qualitat, juntament amb pràctiques d'integració contínua i desplegament en cloud AWS/Azure. El núvol facilita la instrumentació i l'emmagatzematge de trajectòries completes, cosa que converteix cada execució en un actiu d'informació per a l'equip.

La ciberseguretat també es beneficia d'aquesta metodologia. Quan un agent d'IA interactua amb sistemes interns, cada acció representa una superfície de risc. Les revisions de trajectòria permeten identificar comportaments anòmals, accessos innecessaris o usos indeguts de credencials. AgentLens no és una eina de pentesting, però la seva filosofia d'observabilitat encaixa amb els requisits de seguretat de les organitzacions modernes. En projectes que requereixen auditoria contínua, disposar d'un registre interpretable del que va fer un agent i per què ho va fer resulta tan important com les mateixes proves funcionals.

Un altre àmbit on l'avaluació per trajectòria marca la diferència és la intel·ligència de negoci. Els agents de codi no només programen; també preparen dades, creen consultes i generen visualitzacions. Un sistema de BI/Power BI pot ser assistit per un agent que construeix informes sota demanda. La qualitat d'aquest agent no es mesura únicament per si l'informe final compleix un esquema, sinó per com explora les dades, quins supòsits aplica i com comunica les seves troballes a l'usuari. La revisió narrativa que proposa AgentLens ofereix exactament aquest nivell de detall.

La comparació cara a cara és un dels components més potents. En lloc de dependre d'una mètrica agregada, els equips poden presentar la mateixa tasca a dos agents i comparar les seves estratègies. Això és molt útil durant el desenvolupament d'un agent d'IA propi, quan es vol validar una nova versió abans de llançar-la. L'avaluació no es limita a dir quin model guanya; explica per què guanya. Aquesta explicació permet als enginyers ajustar prompts, eines o criteris de decisió amb un nivell de precisió que abans era inabastable.

El concepte de trajectòria no només s'aplica a l'execució d'un agent durant unes hores. També hauria d'abastar tot el cicle de vida del programari: des de la definició del requisit fins al manteniment evolutiu. Un agent que treballa sobre una base de codi heretada necessita entendre el context, no limitar-se a generar pedaços. L'avaluació ha d'incloure la qualitat del missatge que retorna al desenvolupador, la claredat de les seves preguntes i la seva capacitat per sol·licitar ajuda quan no té prou informació. AgentLens recull aquests comportaments i els converteix en dades accionables.

La publicació d'AgentLens com a projecte de codi obert obre un camp d'experimentació enorme. Qualsevol equip pot descarregar-lo, adaptar-lo al seu stack tecnològic i contribuir amb nous casos d'ús. Això és molt rellevant per a la comunitat de desenvolupament de programari en espanyol, que necessitem més eines d'avaluació amb explicacions clares i no només números. La transparència del benchmark permet que les decisions sobre quin agent contractar o configurar es prenguin amb criteri, i no pel simple resultat d'una prova automatitzada.

Un altre punt que cal destacar és la diferència entre mesurar el rendiment i mesurar el comportament. Les mètriques clàssiques, com el percentatge de tasques completades o el temps mitjà de resolució, ofereixen una fotografia superficial. L'avaluació per trajectòria, en canvi, captura el raonament pràctic de l'agent: com organitza les subtasques, quan decideix preguntar a l'usuari, si documenta els seus canvis o si deixa efectes col·laterals. Aquestes variables són les que separen un assistent experimental d'una eina fiable per a producció. A Q2BSTUDIO, quan apliquem aquesta perspectiva a projectes d'aplicacions a mida (custom software), aconseguim una visió molt més realista del valor que la IA pot aportar al negoci.

El futur dels agents de codi passa per la confiança. I la confiança no es construeix amb una nota d'aprovat o suspès, sinó amb la capacitat d'inspeccionar cada pas del procés. AgentLens contribueix a aquesta visió en unir la verificació formal amb la narrativa generada per IA. En una empresa com Q2BSTUDIO, on desenvolupem aplicacions a mida, serveis cloud i solucions d'intel·ligència artificial, l'avaluació per trajectòries s'està convertint en un estàndard intern de qualitat. No volem saber només si alguna cosa funciona; volem saber per què funciona, com es comporta davant l'error i de quina manera pot millorar.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.