Tothom persegueix benchmarks d'IA, gairebé ningú mesura la veritat

Els benchmarks d'IA no garanteixen que un model digui la veritat. Descobreix per què la veracitat és la mètrica que importa.

miércoles, 8 de julio de 2026 • 3 min de lectura • Equip Q2BSTUDIO

Els benchmarks mesuren habilitat, no veracitat

la indústria de la intel·ligència artificial viu obsessionada amb les taules de classificació. Cada nou model arriba acompanyat d'una cascada de xifres: percentatges a MMLU, encerts a HumanEval, puntuacions a GSM8K i SWE-Bench. Els comunicats de premsa celebren dècimes de millora, els titulars proclamen un nou estat de l'art, i el mercat assumeix que un número més alt equival a un sistema més fiable. No obstant, aquesta equació és profundament enganyosa. El que mesuren aquests benchmarks no és la veritat, sinó habilitats acotades: raonament lògic en entorns controlats, destresa matemàtica limitada i recuperació de patrons que ja van aparèixer a les dades d'entrenament. Cap d'ells verifica si una afirmació concreta, d'aquelles que el model solta amb total fluïdesa en una conversa real, es sosté sobre evidència comprovable. Pots tenir un model que frega el 95% a les proves estàndard i, alhora, observar-lo inventar una cita bibliogràfica amb noms i revistes d'aparença versemblant. No és una anomalia: és el resultat de mesurar allò que no importa.

La confusió entre intel·ligència i veracitat té conseqüències pràctiques. La intel·ligència, tal com la defineixen les proves actuals, és reconeixement de patrons; la veritat, en canvi, exigeix evidència externa, traçable i actualitzable. Preguntes com ''quina és la capital de França?' són senzilles perquè la resposta està massivament present a les dades d'entrenament. Però quan un executiu pregunta ''què va canviar ahir a la política interna de recursos humans de l'empresa?', el coneixement estàtic del model no serveix de res. L'única forma d'encertar és recuperar el document original i llegir-lo. Just aquí és on els benchmarks tradicionals fallen completament, i on conceptes com l'ancoratge factual (grounding) adquireixen tot el seu sentit.

L'arribada de la generació augmentada per recuperació (RAG) ha transformat aquesta conversa. En lloc de confiar exclusivament en la memòria del model, RAG inverteix el procés: primer s'obté la informació rellevant d'una font fiable, i després es genera la resposta a partir d'aquest contingut. El criteri d'avaluació canvia dràsticament: ja no n'hi ha prou que la resposta sigui correcta, sinó que cada afirmació ha de poder rastrejar-se fins al material lliurat. Investigacions com RAGTruth, amb prop de 18.000 respostes anotades a nivell de paraula, demostren que fins i tot els millors models al·lucinen sovint, i que els detectors entrenats per trobar aquestes al·lucinacions solen subestimar la magnitud del problema. Google DeepMind, amb el seu benchmark FACTS Grounding, ha mostrat que cap model frontera supera el 70% de precisió factual quan se li exigeix mantenir-se estrictament dins del document proporcionat. La indústria tot just comença a prendre's seriosament aquesta segona pregunta.

Per a les empreses que realment despleguen intel·ligència artificial en entorns productius, la puntuació d'un benchmark és irrellevant. El que realment importa és si la resposta es pot auditar, si cada afirmació té una font verificable, si el model sap reconèixer quan no sap alguna cosa, i si el seu nivell de confiança es correspon amb la realitat. Això no es reflecteix en una taula de classificació. A Q2BSTUDIO, com a empresa de desenvolupament de programari a mida, entenem que la tecnologia ha de construir confiança, no només semblar intel·ligent. Per això treballem amb IA per a empreses que integra agents d'IA, serveis cloud AWS i Azure, ciberseguretat i solucions d'intel·ligència de negoci amb Power BI, prioritzant sempre la traçabilitat i la fiabilitat de cada resposta. El futur de la intel·ligència artificial no es decideix en un rànquing, sinó en la capacitat de demostrar que allò que diu és cert. I aquesta és una mètrica que tot just estem començant a construir.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.