El benchmarking de models de llenguatge (LLMs) s’ha convertit en una eina fonamental per mesurar la capacitat real d’aquestes intel·ligències artificials. Tot i això, un factor subtil però determinant —el format del prompt— pot alterar significativament els resultats. Recentment, el concepte d’Índex de Sensibilitat de Format (FSI, per les sigles en anglès) ha emergit com una mètrica crítica per avaluar no només el rendiment brut, sinó l’estabilitat de les respostes davant de canvis purament estilístics a l’entrada. Aquest indicador mesura el rang de precisió que un mateix model obté en variar únicament l’envoltura del prompt, és a dir, com s’estructura la instrucció sense modificar el contingut semàntic.
Per comprendre la seva importància, imaginem una organització que desplega assistents conversacionals basats en LLMs per a atenció al client. Si el mateix agent d’IA obté puntuacions dispars segons si la pregunta es presenta entre cometes, claudàtors o en format de llista, la confiança en el seu rendiment real s’esvaeix. El FSI quantifica aquesta variabilitat i, juntament amb el Parseability Sensitivity Index (PSI), que mesura la capacitat del model per extreure respostes estructurades, permet a empreses com Q2BSTUDIO dissenyar solucions robustes i predictibles. En aquest article explorem els fonaments tècnics del FSI, la seva relació amb la ciberseguretat, el núvol i els agents intel·ligents, i com una empresa de desenvolupament de programari pot aprofitar-lo per oferir aplicacions a mida amb major fiabilitat.
La investigació original, basada en més de 140.000 generacions a OpenRouter, abasta 7 tasques de pregunta-resposta, 5 famílies de wrappers i 4 models instructius des de 7B fins a 72B paràmetres. Els resultats mostren que el FSI mitjà varia fins a 30 vegades entre models, i que aquesta variació s’explica en gran part per fallades de compliment —quan el model ignora instruccions de format o genera respostes no parseables. És a dir, un model amb alta precisió mitjana pot ser inútil si el seu PSI és baix, perquè les respostes no poden ser processades automàticament. Aquesta troballa és clau per a aplicacions empresarials que requereixen extracció de dades, automatització de processos o integració amb sistemes de BI/Power BI.
Des d’una perspectiva tècnica, el FSI es calcula com la diferència entre la precisió màxima i mínima obtinguda en variar l’envoltura del prompt. Per exemple, si un model mostra un 85% d’encerts amb el format 'Pregunta: ... Resposta:' i només un 55% amb 'Instrucció: ...', el seu FSI és de 30 punts percentuals. Un FSI baix indica que el model és robust davant de canvis de format, una cosa essencial en entorns reals on els usuaris redacten preguntes de maneres impredictibles. Per contra, un FSI alt revela una sensibilitat que pot portar a conclusions errònies en rànquings de models. De fet, els autors argumenten que reportar precisió sense incloure la variància del wrapper i el nivell de compliment és estadísticament fràgil.
Per a les empreses que desenvolupen programari a mida, aquest concepte té implicacions pràctiques immediates. En construir agents d’IA per a atenció al client, assistents virtuals o sistemes d’anàlisi de documents, cal provar els models no només amb un prompt fix, sinó amb una bateria de formats representatius. Q2BSTUDIO, com a companyia especialitzada en desenvolupament d’aplicacions multiplataforma, integra aquestes proves de sensibilitat en els seus processos de qualitat. A més, en desplegar solucions al núvol AWS o Azure, l’escalabilitat ha d’anar acompanyada de robustesa: un model que es comporta bé en proves controlades però falla en producció per variacions de format pot causar errors costosos.
La ciberseguretat també es veu afectada. Si un model és molt sensible al format, un atacant podria manipular l’entrada per provocar respostes incorrectes o extreure informació sensible. Per exemple, canviar l’estructura d’un prompt que sol·licita autenticació podria fer que el model interpretés malament els permisos. Per això, mesurar el FSI i el PSI es converteix en una pràctica de seguretat proactiva. Les empreses que ofereixen serveis de ciberseguretat i pentesting han de considerar aquestes mètriques en auditar sistemes basats en LLMs.
En l’àmbit de la intel·ligència empresarial, els models de llenguatge s’utilitzen per generar informes, resumir dades o respondre preguntes sobre dashboards de Power BI. Si el model no parseja correctament les respostes (PSI alt), la dada extreta pot ser inservible. Una arquitectura d’agents IA que combini LLMs amb eines de BI ha d’incloure una capa de validació de format. Per això, Q2BSTUDIO recomana implementar proves de FSI en la fase de selecció del model, abans d’integrar-lo en pipelines de dades.
Els agents IA autònoms, cada cop més populars, depenen de la capacitat del model per seguir instruccions de format de manera consistent. Un agent que ha de cridar APIs o executar codi necessita que el LLM produeixi sortides perfectament parseables. Aquí, el PSI és tan important com la precisió. Les empreses que desenvolupen automatització de processos han d’assegurar-se que els models subjacents tinguin un PSI baix, és a dir, que generin respostes estructurades independentment del prompt.
En conclusió, l’Índex de Sensibilitat de Format (FSI) i el seu complement PSI representen un avenç metodològic necessari per a l’avaluació rigorosa de LLMs. Ignorar la variabilitat induïda pel format del prompt pot portar a conclusions enganyoses i a sistemes fràgils en producció. Empreses com Q2BSTUDIO incorporen aquestes mètriques en els seus processos de desenvolupament d’aplicacions a mida, solucions al núvol, ciberseguretat i BI, oferint així tecnologies més fiables i alineades amb les necessitats reals del negoci. Adoptar un enfocament basat en FSI és, en definitiva, una inversió en qualitat i precisió per a qualsevol organització que aposti per la intel·ligència artificial.



