ARMOR: Estabilitzant el RL on-policy en LLMs amb mostres àncora off-policy

Descobreix ARMOR: el nou framework que estabilitza el RL on-policy en LLMs, evitant la sobreoptimització i millorant el raonament.

14 jul 2026 • 6 min de lectura • Equip Q2BSTUDIO

Nou framework ARMOR per a RL estable en models de llenguatge

L'entrenament de models de llenguatge de gran escala (LLMs) mitjançant aprenentatge per reforç (RL) ha obert possibilitats sorprenents en raonament, generació de codi i diàleg contextual. Tanmateix, qualsevol equip que hagi intentat portar aquests models a producció sap que el procés és extremadament delicat: un petit desajust en les recompenses o en la política d'exploració pot provocar que el model col·lapsi, perdi generalització o comenci a explotar dreceres superficials. Aquest fenomen, conegut com a sobreoptimització, és una de les principals causes d' inestabilitat en l' entrenament RL on-policy. En aquest article explorem per què passa, com les tècniques tradicionals com la regularització KL inversa es queden curtes, i com una estratègia basada en dades ancora off-policy —similar a la proposta en el marc ARMOR— pot oferir una solució pràctica i escalable per a empreses que desenvolupen intel·ligència artificial.

Per entendre el problema, imaginem un model que està sent entrenat per respondre preguntes matemàtiques. L'agent rep una recompensa positiva cada vegada que encerta. Amb el temps, el model aprèn no només a resoldre problemes, sinó a detectar patrons en les recompenses: per exemple, si certes paraules en la resposta solen associar-se amb èxit, el model pot tendir a repetir-les encara que no siguin correctes. Això és sobreoptimització. La regularització KL inversa intenta mantenir la política del model prop d'una política de referència, penalitzant desviacions grans. Però en entorns complexos, aquesta penalització és insuficient: el model pot continuar explorant camins que porten a recompenses altes però que no generalitzen bé a dades no vistes.

La innovació clau per atacar aquest problema consisteix a estabilitzar l' entrenament mitjançant la inclusió de mostres àncora provinents de la política de referència, però usades off-policy. És a dir, en lloc de només penalitzar la divergència, s'alimenta el model amb exemples d'alta qualitat generats per una política anterior o per un conjunt de dades curat. Això proporciona una 'àncora' que recorda al model els patrons de raonament robustos que no ha d'oblidar. Combinat amb una reformulació de l' objectiu de la política que permet exploració controlada sense dependre de pèrdues auxiliars, s' assoleix un equilibri entre explotació de noves estratègies i preservació de coneixements ja validats.

Aquesta perspectiva té implicacions directes per al desenvolupament de solucions d' IA empresarial. En Q2BSTUDIO, on treballem diàriament amb ia per a empreses, sabem que l'estabilitat no és un luxe sinó un requisit per a qualsevol sistema que hagi d'operar en entorns canviants. Els models que col·lapsen durant l'entrenament no només desperten recursos de còmput, sinó que retarden desplegaments i generen desconfiança en els equips de producte. Per això, integrar tècniques d'estabilització com les mostres àncora off-policy és part de la nostra aproximació en construir aplicacions a mesura que incorporin intel·ligència artificial robusta.

Des d'un punt de vista tècnic, la implementació d'aquesta estratègia requereix orquestrar components que sovint ja existeixen en l'ecosistema de les empreses: pipelins de dades curades, polítiques de referència (per exemple, models preentrenats o versions anteriors), i un sistema de logging de recompenses. La clau està en com es combinen. L'enfocament d''anchor rollout' implica que durant l'entrenament, periòdicament s'intercalen trajectòries generades per la política de referència (off-policy) amb les generades per la política actual (on-policy). Això actua com un regularitzador implícit, però més potent que la simple penalització KL perquè introdueix diversitat de dades reals en lloc de només una restricció matemàtica.

A més, l' optimització mixta reformula la funció de pèrdua perquè el model pugui explorar noves accions sense haver de recórrer a termes addicionals com entropia o pèrdues de comportament. Això simplifica l'ajust d'hiperparàmetres i redueix la sensibilitat a l'escala de les recompenses. Per a equips que estan desenvolupant agents IA conversacionals o de raonament, aquesta simplificació és crítica perquè permet iterar més ràpid i amb menys experiments fallits.

L' ús de dades ancora off-policy no només és rellevant per a laboratoris de recerca. En projectes de serveis intel·ligència de negoci, per exemple, on es necessiten models que analitzin dades financeres històriques i generin informes explicatius, l'estabilitat de l'entrenament garanteix que el model no 'oblidi' com interpretar tendències passades mentre aprèn a respondre preguntes noves. De la mateixa manera, en entorns de ciberseguretat, un model que explota recompenses espúries pot passar per alt veritables amenaces; les mostres ancora ajuden a mantenir la vigilància sobre patrons d'atac coneguts mentre s'exploren noves variants.

Un altre avantatge pràctic d' aquest enfocament és que s' alinea naturalment amb arquitectures cloud modernes. Les empreses que utilitzen serveis cloud aws i azure poden implementar pipelins d' entrenament distribuït on les dades àncora s' emmagatzemen en buckets versionats i s' alimenten de forma asíncrona al procés de RL. Això permet escalar l' entrenament sense perdre la qualitat de les mostres de referència. A més, la naturalesa off-policy redueix la necessitat de sincronització estricta entre el generador de dades i l'optimitzador, la qual cosa simplifica la gestió d'infraestructura.

Des d' una perspectiva de negoci, la capacitat de mantenir un rendiment sostingut en horitzons d' entrenament llargs es tradueix directament en menor cost de computació i major velocitat d' innovació. En Q2BSTUDIO, en dissenyar programari a mida per a clients que volen integrar intel·ligència artificial en els seus processos, prioritzem metodologies que evitin el col·lapse del model. No només perquè estalvia setmanes de reentrenament, sinó perquè permet que els equips de producte s'enfocin a millorar l'experiència de l'usuari en lloc d'apagar incendis tècnics.

L' aplicació d' aquesta tècnica no es limita a models de llenguatge. Qualsevol sistema basat en RL que interactuï amb un entorn dinàmic —robòtica, recomanació, trading algorítmic— pot beneficiar-se d'incorporar dades àncora. Tanmateix, en el context actual dels LLMs, on els models es fan servir per a tasques que requereixen raonament complex (com generació de codi, resolució de problemes matemàtics o diàleg multi-torn), l'estabilitat és particularment crítica perquè els errors es propaguen ràpidament i són difícils de depurar.

Per implementar aquesta estratègia en un projecte real, es recomana començar amb un conjunt de dades àncora d' alta qualitat: per exemple, respostes correctes d' un model anterior ben calibrat o fins i tot dades anotades per humans. Després, durant l'entrenament RL, s'intercalen aquestes trajectòries amb les generades per la política actual, usant una proporció que pot ser fixa o adaptativa. L' optimització mixta requereix modificar la funció de pèrdua estàndard de RL, però existeixen implementacions de codi obert que es poden adaptar. En Q2BSTUDIO, hem ajudat clients a integrar aquests components en els seus pipelins d'intel·ligència artificial utilitzant tant frameworks propis com solucions al núvol.

En conclusió, l' estabilització del RL on-policy mitjançant l' ús de mostres àncora off-policy representa un avenç pràctic que combina el millor de dos mons: la capacitat exploratòria del RL on-policy i la solidesa de les dades de referència. Lluny de ser una solució purament acadèmica, té aplicacions directes en el desenvolupament de productes d' IA empresarial, des d' assistents virtuals fins a sistemes d' anàlisi predictiva. Per a les empreses que busquen treure partit dels LLMs sense caure en la fragilitat de l'entrenament, incorporar aquestes tècniques és un pas necessari. En Q2BSTUDIO, estem compromesos amb oferir solucions que integrin aquests principis en aplicacions a mida, sempre amb un enfocament en la qualitat, l' escalabilitat i la robustesa que el mercat exigeix.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.