JoLT: compressió gairebé sense pèrdua de caixet KV per a LLMs

Descobreix JoLT, un mètode que comprimeix la caixet KV fins a 3x sense pèrdua de precisió. Optimitza la inferència de LLMs com a Mistral-7B i LLaMA-2-13B. Llegeix més!

miércoles, 15 de julio de 2026 • 5 min de lectura • Equip Q2BSTUDIO

Redueix memòria de la caixet KV sense perdre precisió

La inferència de models de llenguatge a gran escala (LLMs) ha obert un ventall de possibilitats en intel·ligència artificial per a empreses, però també ha posat de manifest un coll d'ampolla crític: la memòria necessària per a la caixet de clau-valor (KV cache). A mesura que els contextos s'allarguen i els lots es fan més grans, aquesta caixet pot arribar a superar en pes el propi model, limitant el rendiment. En aquest escenari, la compressió eficient de la KV cache s'ha convertit en una prioritat per a equips de desenvolupament i empreses que despleguen LLMs en producció. Una de les propostes més prometedores és JoLT (Johnson–Lindenstrauss low-rank Tucker), un enfocament que assoleix una compressió gairebé sense pèrdua, reduint entre 2 i 3 vegades el consum de memòria sense afectar la precisió en tasques com raonament matemàtic o recuperació d'informació.

La importància de la KV cache rau en el el el el que emmagatzema les representacions intermèdies de cada token en la seqüència al llarg de totes les capes i caps d' atenció. Amb models com Mistral-7B o LLaMA-2-13B, el cost de memòria pot disparar-se ràpidament. Mètodes anteriors es dividien en dues famílies: tècniques de baix rang (que factoritzen matrius bidimensionals) i de quantificació (que redueixen el nombre de bits per entrada). Tanmateix, cap explotava l' estructura tridimensional natural de la caixet: un tensor d' ordre tres amb eixos de caps, tokens i característiques. JoLT parteix d' aquesta visió tensorial i aplica una descomposició parcial de Tucker que comprimeix únicament els eixos de tokens i característiques, mentre preserva els eixos de caps i capes. Després, recupera l'energia descartada mitjançant una rotació de Johnson–Lindenstrauss sobre un residual de baixa precisió. El resultat és una compressió que, a 2x, reconstrueix la caixet amb un error de Frobenius relatiu de 0.009 per a claus i 0.006 per a valors, un ordre de magnitud millor que les tècniques de SVD entre capes o la quantificació a 4 bits.

Per a una empresa que integri models de llenguatge en els seus fluxos de treball, la reducció de memòria es tradueix en menors costos d' infraestructura i la possibilitat d' atendre més consultes concurrents. Per exemple, en implementar un assistent virtual amb ia per a empreses, l'estalvi en memòria permet usar maquinari més assequible o escalar horitzontalment sense disparar la despesa. JoLT també ofereix una variant anomenada FlashJoLT, que accelera la compressió inicial entre 5 i 13 vegades mitjançant SVD aleatoritzada, ideal per a entorns on el model s'actualitza amb freqüència i es necessita recalcular la caixet.

Darrere d' aquest tipus d' innovacions hi ha un treball profund d' enginyeria que combina àlgebra lineal, teoria de la informació i optimització. JoLT utilitza un dual lagrangià per assignar conjuntament els rangs de Tucker i els amples de bit residuals, per grup de capes i separadament per a claus i valors, sota un pressupost únic de bytes. Aquest enfocament permet un control fi sobre la relació qualitat-compressió, una cosa que qualsevol equip que desenvolupi aplicacions a mida basades en LLMs trobarà valuós. No es tracta només de reduir memòria, sinó de fer-ho sense sacrificar la fidelitat del model, tal com demostren les avaluacions en perplexitat, GSM8K i RULER (needle-in-a-haystack), on JoLT es manté dins del soroll estadístic de la línia base sense comprimir.

L'arribada de tècniques com JoLT reforça la tendència cap a serveis cloud aws i azure com a plataformes naturals per executar LLMs, ja que permeten optimitzar l'ús d'instàncies amb memòria limitada o compartir recursos entre múltiples models. Una empresa que contracti serveis intel·ligència de negoci amb capacitats de llenguatge natural pot beneficiar-se d'inferències més ràpides i barates, millorant l'experiència de l'usuari final. Fins i tot en l'àmbit de la ciberseguretat, on s'analitzen grans volums de logs o correus, la compressió de la KV catxa permet que els models processin seqüències més llargues sense degradació, facilitant la detecció d'amenaces en temps real.

Des de la perspectiva del desenvolupament, implementar solucions com JoTL requereix un profund coneixement dels mecanismes d' atenció i de les tècniques de descomposició tensorial. En Q2BSTUDIO, oferim programari a mesura que integra aquestes optimitzacions d'avantguarda, adaptant els models a les necessitats específiques de cada client. El nostre equip combina experiència en intel·ligència artificial, infraestructura cloud i desenvolupament d'aplicacions escalables, permetent a les empreses aprofitar al màxim el potencial dels LLMs sense que la memòria sigui un obstacle.

A més, la compressió gairebé sense pèrdua obre la porta a nous casos d'ús, com els agents IA que han de mantenir converses llargues o processar documents extensos. Amb JoTL, la caixet ocupa la meitat o un terç de l'espai, cosa que permet que un mateix servidor serveixi a més agents simultàniament. També facilita la creació de sistemes de power bi i business intelligence que responguin preguntes en llenguatge natural sobre grans volums de dades històriques, ja que la inferència en context llarg es torna viable econòmicament.

En l'àmbit pràctic, la implementació de JoLT no requereix canvis en l'arquitectura del model durant l'entrenament; actua únicament en temps d' inferència. Això la converteix en una opció atractiva per a empreses que ja tenen models desplegats i busquen optimitzar costos sense reentrenar. L'empresa de desenvolupament de programari i tecnologia Q2BSTUDIO pot ajudar en aquesta transició, oferint consultoria i desenvolupament d'intel·ligència artificial per a empreses, integrant tècniques de compressió com JoLT per maximitzar l'eficiència.

En resum, JoLT representa un avenç significatiu en la gestió de la memòria en inferència de LLMs, combinant descomposició tensorial amb rotacions estocàstiques i quantificació adaptativa. La seva capacitat per aconseguir compressions 2-3x amb pèrdua gairebé nul·la la situa com una eina clau per a qualsevol organització que vulgui escalar l'ús de models de llenguatge de forma rendible. La convergència d'aplicacions a mida en IA, serveis cloud aws i azure i serveis intel·ligència de negoci crea un ecosistema on solucions com JoLT marquen la diferència entre un projecte viable i un altre que naufraga per limitacions tècniques. En Q2BSTUDIO, estem preparats per acompanyar les empreses en aquest camí, transformant la teoria en solucions pràctiques que generin valor real.

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.