En el món de l'anàlisi de binaris, la detecció de similitud de codi ha estat tradicionalment un camp on la precisió i la interpretabilitat rarament anaven de la mà. Els mètodes clàssics basats en característiques artesanals —com ara ràtios d'operacions o freqüències d'instruccions— oferien transparència, però la seva superficialitat els feia insuficients per a tasques complexes com la identificació de vulnerabilitats en diferents arquitectures o nivells d'optimització. D'altra banda, els enfocaments moderns basats en embeddings han aconseguit robustesa i generalització, però a costa de convertir el codi en vectors opacs que dificulten la verificació ràpida i l'escalat sense pèrdua de precisió. Aquest dilema ha portat la comunitat a plantejar-se una pregunta fonamental: és possible obtenir representacions que siguin alhora interpretables, escalables i precises?
La resposta sembla arribar des d'un enfocament híbrid que combina models de llenguatge amb agents de raonament estructurat. En lloc de confiar únicament en característiques predefinides o en representacions vectorials, es proposa un sistema que analitza el codi assemblador extraient elements semàntics com ara tipus d'entrada i sortida, efectes secundaris, constants notables i fins i tot intencions algorítmiques. Aquestes característiques, generades per un agent basat en llenguatge, són molt més riques que les creades manualment i, alhora, completament llegibles per humans. Això permet que els equips de seguretat i desenvolupament puguin entendre quina part del codi s'està comparant, per què es considera similar i com es relaciona amb altres fragments, facilitant auditories i tasques de manteniment.
Des del punt de vista pràctic, les implicacions són enormes. Per a una empresa com Q2BSTUDIO, que es dedica al desenvolupament d'aplicacions a mida, disposar d'eines que no només identifiquin codi binari similar sinó que expliquin el raonament darrere d'aquesta identificació suposa un salt qualitatiu en ciberseguretat i qualitat de programari. Per exemple, en analitzar binaris de diferents versions d'un mateix producte o de diferents plataformes (x86, ARM, etc.), els agents d'IA poden generar informes que detallin no només que dues funcions són equivalents, sinó que ambdues realitzen una mateixa operació criptogràfica, o que comparteixen un comportament sospitós de fuita de dades. Això és especialment rellevant en entorns on la traçabilitat i la justificació són requisits normatius o de compliment.
L'escalabilitat d'aquesta aproximació no es queda enrere. A diferència dels embeddings, que requereixen costoses cerques de veïns propers en espais d'alta dimensionalitat —i sovint necessiten aproximacions que redueixen la precisió—, les característiques interpretables es poden indexar mitjançant índexs invertits o relacionals, permetent cerques ràpides i exactes. Segons les dades disponibles, sense cap entrenament previ, aquest mètode assoleix un recall@1 del 42% en tasques de cross-architecture i 62% en cross-optimization, comparables a mètodes amb embeddings entrenats (39% i 34% respectivament). I quan es combina amb embeddings, supera significativament l'estat de l'art, demostrant que la coexistència de precisió, escalabilitat i interpretabilitat és possible.
Per a una companyia que treballa en l'àmbit de la ciberseguretat, aquesta capacitat de fusionar el millor de dos mons té un valor estratègic incalculable. Els equips de pentesting i anàlisi de malware necessiten entendre no només quin codi és maliciós, sinó per què ho és. Amb les característiques interpretables, es poden construir dashboards que enllacin binaris sospitosos amb funcions similars ja catalogades, i alhora alimentar sistemes d'IA que automatitzin la classificació. A més, la integració amb plataformes cloud com AWS o Azure permet desplegar aquests agents com a serveis serverless, escalant sota demanda i reduint costos operatius.
Un altre aspecte clau és la sinergia amb eines de Business Intelligence. En convertir l'anàlisi de codi binari en conjunts de dades estructurades (tipus, constants, efectes), es poden aplicar tècniques de BI i Power BI per generar visibilitat sobre l'evolució del codi, patrons de reutilització, o la propagació de vulnerabilitats al llarg del temps. Això transforma un procés tècnic tradicionalment aïllat en un actiu d'intel·ligència de negoci.
A Q2BSTUDIO, entenem que la innovació no consisteix només a adoptar l'última tecnologia, sinó a fer-la útil i comprensible per a qui pren decisions. Per això, el nostre enfocament combina agents d'IA amb enginyeria de programari a mida, integrant solucions de ciberseguretat, cloud i BI en un ecosistema coherent. Ja sigui per analitzar binaris de dispositius IoT, aplicacions mòbils o programari legacy, disposar de característiques interpretables permet als desenvolupadors i analistes treballar amb confiança, sabent que cada decisió està recolzada per dades clares i traçables.
En definitiva, el futur de la detecció de similitud de codi binari no passa per triar entre embeddings o característiques artesanals, sinó per un tercer camí que aprofiti la potència dels models de llenguatge per generar descripcions semàntiques. Aquestes descripcions, en ser directament llegibles i cercables, eliminen la barrera de l'opacitat i obren la porta a una nova generació d'eines de reverse engineering més intel·ligents, ràpides i fiables. I mentre aquesta tecnologia madura, Q2BSTUDIO ja treballa per incorporar-la als seus serveis de desenvolupament, ciberseguretat i intel·ligència artificial, oferint als seus clients un valor diferencial en cada projecte.





