COBS: Atenció per blocs dispersos d'ordre acumulant en LLMs

Descobreix COBS, un mètode d'atenció que utilitza expansió cumulant de segon ordre per igualar gairebé la qualitat d'atenció densa, reduint 15x el tràfic de

miércoles, 29 de julio de 2026 • 4 min de lectura • Equip Q2BSTUDIO

La expansión cumulante optimiza la atención en modelos de lenguaje

Els models de llenguatge de gran escala (LLMs) han transformat la intel·ligència artificial, però la seva eficiència es veu limitada pel coll d'ampolla en la lectura de la memòria cau de clau-valor (KV). Mentre que solucions com l'atenció densa ofereixen precisió, el seu cost computacional és prohibitiu. D'altra banda, l'atenció dispersa per blocs emergeix com una alternativa amigable amb el maquinari, tot i que fins ara no aconseguia igualar la qualitat de l'atenció densa. Un estudi recent sobre DeepSeek Native Sparse Attention (NSA) i la seva proposta COBS (Cumulant Order Block Sparse Attention) canvia aquest panorama. En aquest article, analitzem com COBS tanca la bretxa entre eficiència i precisió, i explorem les seves implicacions per al desenvolupament de programari empresarial, especialment en solucions d'IA i aplicacions a mida.

El mecanisme d'atenció als LLMs permet que el model pondere la rellevància de diferents parts de l'entrada. En l'atenció densa, cada token calcula la similitud amb tots els tokens anteriors, generant un trànsit de lectura massiu a la memòria cau KV. L'atenció dispersa per blocs redueix aquest trànsit processant només blocs seleccionats de la seqüència. Tanmateix, el problema rau en la selecció: com escollir els blocs correctes sense llegir totes les claus? NSA introdueix un disseny de tres branques que aïlla aquesta etapa de selecció, facilitant-ne l'estudi. La clau és el concepte de 'massa d'atenció', la suma de les puntuacions d'atenció d'un bloc. Si aconseguim seleccionar els blocs amb major massa d'atenció, l'atenció dispersa pot igualar la densa. Però calcular aquesta massa requereix llegir cada clau, cosa que ens porta a un problema d'aproximació.

COBS proposa una solució elegant: mitjançant una expansió de cumulants, demostra que els mètodes existents només utilitzen una aproximació de primer ordre per estimar la massa d'atenció, explicant la seva manca de precisió. COBS emmagatzema una estadística de segon ordre comprimida per bloc —una mena de covariància— que permet una estimació molt més precisa. Al benchmark de context llarg RULER (32k tokens), COBS eleva la puntuació mitjana del NSA base de 0.2999 a 0.8195, acostant-se a l'atenció densa (0.9040) i tancant aproximadament el 86% de la bretxa. Tot amb només 1.21 vegades el trànsit de lectura de NSA i 15.15 vegades menys que l'atenció densa. A més, el model preserva el comportament en contextos curts i obté una menor pèrdua de log-versemblança posicional.

Des d'una perspectiva empresarial, aquesta innovació té un impacte directe en el desenvolupament d'aplicacions que integren LLMs. A Q2BSTUDIO, com a empresa de desenvolupament de programari i tecnologia, entenem que l'eficiència computacional és crítica per desplegar models d'IA en entorns productius. L'atenció dispersa per blocs d'ordre cumulant permet reduir costos d'infraestructura sense sacrificar qualitat, essencial per a clients que requereixen aplicacions a mida amb capacitats de processament de llenguatge natural avançat. Imagineu un sistema d'anàlisi de documents legals que necessiti processar seqüències de milers de tokens; amb COBS, els temps de resposta milloren dràsticament, facilitant la seva integració en fluxos de treball empresarials.

A més, l'eficiència en la memòria cau KV es tradueix en un menor consum de memòria al núvol. Per a empreses que operen en entorns cloud com AWS o Azure, això suposa una reducció significativa en els costos de càlcul i emmagatzematge. A Q2BSTUDIO oferim serveis de cloud AWS/Azure que permeten als nostres clients escalar les seves solucions d'IA sense pressupostos desorbitats. La ciberseguretat també es beneficia: en minimitzar la transferència de dades, es redueixen els vectors d'atac a la canonada d'inferència. Els nostres equips integren pràctiques de ciberseguretat a cada fase del desenvolupament.

Un altre àmbit rellevant és la intel·ligència de negoci (BI). La combinació de LLMs eficients amb eines com Power BI permet generar anàlisis contextuals en temps real. Per exemple, un tauler de control que resumeixi automàticament informes financers històrics pot executar-se amb models que utilitzin COBS, oferint respostes precises sense retards. A Q2BSTUDIO desenvolupem solucions de BI/Power BI que aprofiten aquestes innovacions per transformar dades en coneixement accionable.

Els agents d'IA, que requereixen múltiples passos de raonament amb contextos llargs, també es beneficien. Un agent que hagi de mantenir una conversa extensa o processar un document complet pot fer-ho de manera fluïda gràcies a la reducció del trànsit de lectura. Això obre la porta a assistents virtuals més capaços en sectors com atenció al client, sanitat o logística. A Q2BSTUDIO estem desenvolupant agents IA personalitzats que integren aquestes tècniques per oferir automatització intel·ligent.

En conclusió, COBS representa un avenç significatiu en l'atenció dispersa per blocs, demostrant que és possible assolir la qualitat de l'atenció densa amb una fracció del cost computacional. Per a les empreses que busquen incorporar LLMs als seus productes, tecnologies com aquesta són clau per mantenir la competitivitat sense disparar els costos. Des del desenvolupament d'aplicacions a mida fins a la implementació al núvol, passant per la ciberseguretat i la intel·ligència de negoci, Q2BSTUDIO ofereix l'expertesa necessària per aprofitar aquestes innovacions. Si la vostra organització està explorant l'ús de models de llenguatge avançats, no dubteu a contactar-nos per discutir com podem ajudar-vos a dissenyar solucions eficients i escalables.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.