GSRQ: Quantització Residual de Forma-Guanys per a Cau KV de Menys d'1 Bit

Descobreix GSRQ, un nou mètode de quantització que redueix la memòria cau KV en LLMs a menys d'1 bit, millorant la precisió a LongBench d'11.34 a 33.54.

jueves, 2 de julio de 2026 • 2 min de lectura • Equip Q2BSTUDIO

GSRQ: La quantització de forma-guany millora dràsticament la memòria cau KV

La memòria cau de clau-valor (KV cache) s'ha convertit en un dels principals colls d'ampolla en implementar models de llenguatge de gran escala (LLMs) amb finestres de context esteses. A mesura que creix la longitud de les seqüències, l'emmagatzematge necessari per als parells KV es dispara de forma lineal, encarint tant la inferència com el desplegament en producció. Tècniques com la quantització vectorial (VQ) i, en particular, la quantització residual (RQ) han demostrat ser prometedores per comprimir aquesta memòria per sota d'1 bit per element. No obstant això, els mètodes tradicionals basats en K-means amb distància euclidiana presenten un problema subtil en espais d'alta dimensionalitat: la mitjana de centroides pot induir una contracció de la norma, cosa que debilita l'alineació angular i dificulta la preservació direccional dels vectors. Per resoldre-ho, sorgeix una nova variant anomenada Gain-Shape K-means (GSKM), que separa el guany (norma) de la forma (direcció). En integrar aquesta tècnica en un pipeline de quantització residual, s'obté Gain-Shape Residual Quantization (GSRQ). En models com LLaMA-3-8B, GSRQ millora substancialment la precisió en tasques de LongBench, aconseguint un salt d'11.34 a 33.54 d'exactitud mitjana a 1 bit, un increment de més de 22 punts percentuals respecte a línies base com VQLLM. Aquest avenç és rellevant per a qualsevol organització que busqui implementar intel·ligència artificial per a empreses amb models de llenguatge de gran escala, ja que permet reduir dràsticament el consum de memòria sense sacrificar rendiment. A Q2BSTUDIO entenem que l'optimització d'infraestructura és clau per desplegar solucions d'IA de forma eficient. Per això, oferim serveis cloud AWS i Azure que faciliten la gestió de càrregues de treball intensives en memòria, així com desenvolupament d'aplicacions a mida i programari a mida per integrar aquestes tecnologies en entorns productius. A més, combinem aquestes capacitats amb intel·ligència de negoci mitjançant Power BI i amb agents IA que automatitzen processos complexos. La nostra experiència en ciberseguretat garanteix que qualsevol implementació d'LLMs al núvol compleixi amb els més alts estàndards de protecció de dades. Si la teva empresa necessita aprofitar el potencial dels models de llenguatge amb contextos llargs sense disparar els costos d'infraestructura, t'invitem a explorar com les nostres solucions de serveis intel·ligència de negoci i ia per a empreses poden adaptar-se a les teves necessitats.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.