L'avanç dels agents d'intel·ligència artificial ha assolit un nivell on són capaços d'escriure, compilar i optimitzar de forma iterativa kernels de baix nivell per a diferents plataformes de maquinari. No obstant, fins ara la majoria de benchmarks se centraven exclusivament en entorns CUDA i Triton, deixant sense un estàndard d'avaluació comú a ecosistemes com el de les NPU de Huawei. En aquest context neix CANN Bench, un benchmark obert dissenyat específicament per avaluar el codi de kernels generats per IA a les NPU Ascend de Huawei.
CANN Bench no és una simple llista de proves. El seu llançament actual inclou 53 operadors i 1.060 casos de prova organitzats en quatre nivells de dificultat, des de primitives simples (elementwise) fins a kernels complexos com els de MoE dispatch i FlashAttention, cobrint formats de precisió FP16, BF16, FP32 i INT8. El que realment diferencia aquest benchmark és el seu sistema de puntuació tridimensional ponderada, que tracta la compilació, la correcció funcional i el rendiment com a eixos independents. Això proporciona un senyal de recompensa sòlid i robust per als agents generadors de kernels, evitant que optimitzin només una dimensió en detriment d'altres.
El rendiment s'avalua contra una línia base de PyTorch sobre Ascend (amb configuració estàndard) i contra un límit analític per cas anomenat HAP (Hardware-Anchored Performance), que reflecteix el màxim teòric assolible en el maquinari real. D'aquesta manera, les puntuacions indiquen el marge real d'optimització i no artefactes de mesura. A més, el sistema d'avaluació ha estat dissenyat des de zero per resistir el 'reward hacking', és a dir, per evitar que un agent manipuli les mètriques sense millorar realment el codi.
L'aparició de CANN Bench arriba en un moment crucial. La comunitat de desenvolupament de software està adoptant cada cop més agents d'IA per automatitzar tasques complexes, des de la generació de codi fins a l'optimització de rendiment. No obstant, la diversitat de maquinari exigeix solucions a mida. A Q2BSTUDIO, com a empresa especialitzada en desenvolupament de software i tecnologia, entenem que la intel·ligència artificial s'ha d'integrar amb plataformes concretes i necessitats específiques. Per això oferim serveis d'aplicacions a mida que poden incorporar models d'IA, infraestructura cloud (AWS, Azure) i mesures de ciberseguretat personalitzades.
El benchmark CANN Bench resulta especialment rellevant per a empreses que desenvolupen solucions basades en maquinari Ascend, ja que proporciona un barem quantitatiu, reproduïble i mantingut a llarg termini per mesurar la capacitat dels agents d'IA a l'hora de generar kernels d'operadors. Aquesta mesura no només beneficia els investigadors, sinó també els integradors de sistemes que necessiten garantir el màxim rendiment de les seves aplicacions. Per exemple, en projectes de BI (Business Intelligence) amb Power BI, on el processament de grans volums de dades sobre maquinari accelerat pot marcar la diferència, o en entorns de ciberseguretat que requereixen algorismes d'inferència ràpids i eficients.
A més, la filosofia de co-construcció comunitària de CANN Bench, integrada al repositori oficial de CANN, assegura que el benchmark evolucionarà amb les noves generacions de maquinari i programari. Això és clau per mantenir la rellevància a mesura que els agents d'IA es tornen més sofisticats. A Q2BSTUDIO apostem per la innovació contínua i ajudem els nostres clients a adoptar aquestes tecnologies, ja sigui mitjançant la migració al núvol (AWS/Azure), l'automatització de processos o la implementació de solucions d'intel·ligència artificial a mida.
En definitiva, CANN Bench representa una fita en l'avaluació de kernels generats per IA, proporcionant un marc just i complet que transcendeix les limitacions dels benchmarks tradicionals. Per als desenvolupadors i empreses que treballen amb maquinari Ascend, aquesta eina suposa un avantatge competitiu en permetre optimitzacions precises i verificables. I per a l'ecosistema en general, és un recordatori que l'estandardització i la transparència són pilars fonamentals en l'era dels agents autònoms de programari.





