L'auge dels agents basats en grans models de llenguatge (LLM) ha portat un repte tècnic cada cop més urgent: la gestió eficient de la memòria cau de clau-valor (KV cache). Aquests agents gestionen contextos heterogenis que inclouen instruccions del sistema, plans generats, historial de converses, documents recuperats, sortides d'eines i raonaments intermedis. A mesura que el context s'allarga, el KV cache pot convertir-se en un coll d'ampolla que consumeix recursos de memòria de forma desproporcionada. Les polítiques de desallotjament tradicionals, basades en la recència o l'atenció global, tracten tots els tokens per igual, ignorant l'estructura semàntica que l'orquestrador de l'agent ja coneix. En aquest escenario sorgeix MemDecay, una política de desallotjament de KV cache sense entrenament, conscient de les regions semàntiques del prompt.
MemDecay assigna a cada token una prioritat base i una taxa de decaïment segons la regió a la qual pertany: el sistema, l'usuari, la memòria de treball, el raonament intermedi, etc. A més, refresca les puntuacions de retenció cada vegada que un token rep atenció, permetent que les regions crítiques —com les instruccions del sistema— es mantinguin accessibles durant tota l'execució. La política també ofereix la possibilitat de 'fixar' regions completes per garantir que no siguin desallotjades ni sota pressió de memòria. Per calibrar les taxes de decaïment, es proposa un procediment basat en les vides mitjanes d'atenció observades a cada regió, cosa que permet adaptar la política al comportament real del model.
Els experiments realitzats amb els models Qwen2.5-1.5B i 3B, en contextos d'aproximadament 450 i 1700 tokens, mostren diferències d'un ordre de magnitud en les vides mitjanes d'atenció entre regions: els tokens del sistema presenten vides mitjanes d'entre 148 i 189 passos de descodificació, mentre que els tokens de raonament intermedi (scratchpad) tot just arriben a 14–16 passos. En fixar la regió del sistema, MemDecay aconsegueix preservar fets clau del sistema amb la mateixa precisió que si s'usés tota la memòria cau, mentre que cap línia base aconsegueix retenir més de 13 de 24 fets. Amb el creixement del context, la retenció basada en recència col·lapsa, mentre que la retenció per regions es manté efectiva. No obstant això, la retenció basada en atenció acumulada funciona millor en contingut no fixat, i els experiments d'ablació identifiquen que la normalització de les puntuacions d'atenció és la principal limitació de la formulació actual.
Aquestes troballes no només demostren que l'estructura semàntica del prompt és un senyal robust per a la gestió del KV cache, sinó que també obren la porta a combinar-la amb mètriques d'importància basades en atenció. Per a les empreses que integren agents LLM en els seus processos de negoci, optimitzar l'ús de memòria és crític per reduir costos d'inferència i millorar la latència. A Q2BSTUDIO, com a empresa de desenvolupament de programari i tecnologia, oferim solucions a mida que ajuden els nostres clients a implementar agents eficients, ja sigui mitjançant aplicacions a mida que incorporen aquestes optimitzacions, o bé integrant serveis cloud com AWS o Azure que escalen automàticament la capacitat de còmput. A més, la seguretat de les dades gestionades per aquests agents és un aspecte fonamental; per això, les nostres solucions inclouen serveis de ciberseguretat i pentesting, així com eines d'intel·ligència de negoci (BI/Power BI) per monitoritzar el rendiment del sistema. La intel·ligència artificial i l'automatització de processos són pilars de la nostra oferta, i la gestió eficient de la memòria en models de llenguatge és una de les àrees on aportem un valor diferencial.
En definitiva, MemDecay representa un avenç conceptual significatiu en l'optimització de KV cache per a agents LLM, demostrant que el coneixement de l'estructura del prompt pot i ha de ser explotat. Per a les organitzacions que busquen desplegar agents escalables i econòmics, la combinació de polítiques de desallotjament intel·ligents, infraestructura cloud flexible i desenvolupament de programari a mida és la clau de l'èxit. A Q2BSTUDIO estem preparats per acompanyar els nostres clients en aquest camí, oferint serveis de consultoria, desenvolupament i integració que garanteixen que els seus agents d'IA funcionin amb la màxima eficiència.




