La classificació de vulnerabilitats de seguretat informàtica és una tasca crucial però tediosa. Cada entrada al catàleg Common Vulnerabilities and Exposures (CVE) ha d’etiquetar-se amb una o més categories de Common Weakness Enumeration (CWE) per facilitar-ne l’anàlisi i la mitigació. Actualment, gran part d’aquest procés es fa manualment, cosa que alenteix la resposta davant les amenaces i obre la porta a errors humans. Un enfocament basat en intel·ligència artificial pot automatitzar aquesta tasca, però l’elecció del model de classificació és determinant. En aquest article analitzem dues formulacions oposades: el model multiclasse, que assigna una única categoria CWE per CVE, i el model multietiqueta, que en permet assignar diverses. Totes dues han estat avaluades amb diferents variants del transformador BERT sobre espais d’etiquetes de diferent mida.
La classificació multiclasse simplifica el problema en obligar que cada CVE pertanyi a una sola classe. Això resulta eficient quan les vulnerabilitats són molt específiques, però no reflecteix la realitat de molts casos híbrids. Per contra, la classificació multietiqueta reconeix que una mateixa fallada pot encaixar en múltiples debilitats, oferint una representació més fidel. No obstant això, entrenar un model multietiqueta és més complex, ja que ha d’aprendre a predir conjunts d’etiquetes i gestionar dependències entre elles. En els experiments publicats recentment, l’enfocament multiclasse va obtenir una macro-F1 més alta en tots els escenaris, tot i que l’avantatge es va reduir dràsticament en disminuir el nombre de classes. Amb 25 categories, la diferència va caure a només dos punts percentuals, i una optimització de llindar al costat multietiqueta va permetre igualar els resultats. Això suggereix que, amb un espai reduït d’etiquetes, ambdós enfocaments són pràcticament intercanviables.
Els codificadors emprats van ser BERT Base, SecureBERT i CySecBERT. Els dos darrers estan preentrenats en corpus de ciberseguretat, cosa que podria donar-los avantatge en la comprensió de descripcions tècniques. CySecBERT va mostrar el millor rendiment global, amb millores estadísticament significatives especialment en la configuració multietiqueta. Aquest resultat reforça la idea que un model especialitzat en el domini de la seguretat informàtica capta millor les subtileses dels informes de vulnerabilitats. Per a empreses que desenvolupen aplicacions a mida en l’àmbit de la ciberseguretat, disposar d’un sistema d’etiquetatge automàtic basat en CySecBERT pot accelerar els processos d’auditoria i compliment normatiu.
Una troballa rellevant de l’estudi és que els patrons d’error són molt similars entre els tres codificadors, amb una correlació de Pearson superior a 0,92. Les confusions més freqüents segueixen la jerarquia de CWE: el model tendeix a confondre una categoria amb una altra que està a la mateixa branca de l’arbre taxonòmic. Això indica que l’estructura d’error depèn més del disseny de la pròpia taxonomia que del model concret. Quan es va aplicar una avaluació relaxada que perdona les confusions dins d’una mateixa família de debilitats, la macro-F1 va saltar d’aproximadament el 81% al 90%. Aquesta dada és vital per als equips de ciberseguretat: les mètriques estrictes poden infravalorar la qualitat real d’un classificador a nivell de branca.
Quines implicacions té això per a una empresa de desenvolupament de programari com Q2BSTUDIO? El nostre equip integra solucions d’intel·ligència artificial en plataformes de ciberseguretat per a clients que necessiten protegir les seves infraestructures al núvol AWS o Azure. Un sistema de mapeig CVE-CWE automatitzat, basat en models BERT especialitzats, es pot incrustar en pipelines d’anàlisi de vulnerabilitats. A més, combinem aquests classificadors amb agents d’IA que fan cerques contextuals i generen informes intel·ligents. Per exemple, quan es detecta una nova CVE, l’agent pot consultar el model multietiqueta, assignar les CWE pertinents i després alimentar un quadre de comandament a Power BI perquè els analistes visualitzin tendències i prioritzin pedaços. Tot això es desenvolupa sobre arquitectures al núvol escalables, garantint baixa latència i alta disponibilitat.
L’elecció entre multiclasse i multietiqueta no és trivial. Si l’objectiu és una assignació ràpida i més precisió en entorns amb moltes categories, el model multiclasse pot ser preferible. Però quan es requereix granularitat i les vulnerabilitats són complexes, l’enfocament multietiqueta ofereix una representació més completa. La investigació mostra que, amb un nombre reduït de classes, ambdues opcions convergeixen. A Q2BSTUDIO, en dissenyar solucions de ciberseguretat personalitzades, avaluem aquestes alternatives segons les necessitats específiques del client. La nostra expertesa en intel·ligència artificial ens permet optimitzar els llindars de decisió i seleccionar el codificador més adequat per a cada cas d’ús, ja sigui SecureBERT per a documents tècnics o CySecBERT per a descripcions d’exploits.
Mirant cap al futur, la integració d’agents d’IA autònoms promet revolucionar el mapeig CVE-CWE. Aquests agents no només classificaran, sinó que també enriquiran els registres amb context addicional, com pedaços disponibles o impactes en sistemes concrets. Les empreses que ja treballen amb aplicacions a mida i núvol AWS/Azure es poden beneficiar d’aquests avenços sense necessitat de grans inversions. A Q2BSTUDIO, combinem BI/Power BI amb models de llenguatge per oferir panells interactius que permeten als equips de seguretat prendre decisions informades en temps real. L’automatització de processos de programari, com l’etiquetatge de vulnerabilitats, redueix costos i accelera la resposta davant incidents.
En conclusió, el debat entre multiclasse i multietiqueta amb BERT per al mapeig CVE-CWE no té un guanyador absolut; depèn del context. Els resultats experimentals demostren que la taxonomia subjacent influeix més que l’arquitectura del model, i que una avaluació relaxada ofereix una imatge més realista del rendiment. Per a les organitzacions que busquen implementar solucions d’intel·ligència artificial en ciberseguretat, és fonamental entendre aquests matisos i comptar amb un soci tecnològic que sàpiga aplicar-los. Q2BSTUDIO, amb la seva experiència en desenvolupament de programari a mida, cloud computing i agents d’IA, està preparada per ajudar els seus clients a fer el salt cap a una gestió de vulnerabilitats més intel·ligent i automatitzada.




