WSqD: Un programa de taxa d'aprenentatge sense horitzó per a models grans

WSqD: un programa de taxa d'aprenentatge sense horitzó que supera WSD en entrenament de models grans. Convergència òptima i extensió sense problemes.

martes, 28 de julio de 2026 • 4 min de lectura • Equip Q2BSTUDIO

Optimiza el entrenamiento de modelos grandes con WSqD

L'entrenament de models de llenguatge a gran escala (LLMs) és un dels processos més intensius en còmput de la intel·ligència artificial moderna. Escollir un programa de taxa d'aprenentatge (learning rate schedule) adequat pot marcar la diferència entre un model que convergeix ràpidament i un altre que malgasta setmanes de GPU. Durant anys, els programadors han recorregut a schedules com el cosine annealing, intrínsecament lligats a un horitzó fix d'entrenament. Això significa que si es vol estendre l'entrenament més enllà del punt final previst, la taxa d'aprenentatge ja ha decaigut a zero, i reprendre el procés requereix un ajust manual o reiniciar des d'un checkpoint anterior. El schedule Warmup-Stable-Decay (WSD) va abordar parcialment aquesta limitació mantenint una fase constant llarga abans d'un decay lineal curt, permetent reprendre l'entrenament des d'un checkpoint previ al decay. No obstant, WSD encara depèn d'un pic de taxa d'aprenentatge (peak learning rate) optimitzat per a l'horitzó original, cosa que el fa subòptim quan s'estén l'entrenament.

En aquest context, sorgeix WSqD (Warmup with Square-root base and linear Decay), un nou programa de taxa d'aprenentatge que elimina la dependència de l'horitzó per a la taxa base. En lloc de mantenir una fase constant, WSqD utilitza una base d'arrel quadrada inversa desplaçada després del warmup, mantenint un decay lineal final. En l'escenari convex estocàstic, WSqD assoleix de manera demostrable la taxa de convergència minimax-òptima de O(1/√T) per a l'última iteració. El més rellevant és que la taxa base és independent de l'horitzó d'entrenament; l'horitzó només es necessita per decidir quan començar el decay final. Això permet que el mateix pic de taxa d'aprenentatge funcioni de manera robusta en diferents durades, evitant la necessitat de reajustar hiperparàmetres en estendre l'entrenament.

Els experiments empírics sobre el corpus SlimPajama per a preentrenament de models de llenguatge mostren que WSqD iguala o supera a WSD i altres schedules ajustats acuradament en múltiples horitzons, reutilitzant un únic pic de taxa d'aprenentatge. Aquesta propietat és especialment valuosa en entorns de producció on els pressupostos de còmput i els terminis poden canviar sobre la marxa. Un equip d'investigació pot començar l'entrenament amb una estimació inicial de passos, i si els resultats primerencs són prometedors, estendre l'entrenament sense haver de reoptimitzar la taxa d'aprenentatge.

Des d'una perspectiva tècnica, WSqD s'inspira en l'optimització convexa estocàstica, on una taxa d'aprenentatge de la forma η/√(t) és òptima. La innovació rau a desplaçar aquesta funció perquè comenci des d'un valor alt després del warmup i després decaigui suaument fins a l'inici del cooldown lineal. Això proporciona una transició natural entre l'exploració (taxes altes) i l'explotació (decadència gradual). En comparació amb el schedule constant de WSD, que pot portar a un excés de variància en passos tardans si el pic és massa alt, la base decreixent de WSqD estabilitza l'entrenament a mesura que avancen els passos.

Per a les empreses que desenvolupen models grans, implementar schedules com WSqD pot integrar-se perfectament en fluxos de treball existents. A Intel·ligència Artificial, a Q2BSTUDIO dissenyem solucions d'entrenament a mida que optimitzen l'ús de recursos cloud. La capacitat de WSqD de funcionar sense reajustos allarga la vida útil dels experiments i redueix el temps d'inactivitat als clústers. A més, en donar suport a infraestructures com serveis cloud Azure i AWS, podem escalar dinàmicament els treballs d'entrenament, ajustant el pressupost de còmput sense perdre la coherència del schedule.

Més enllà de l'entrenament, l'optimització de models grans té implicacions en altres àrees de negoci. Un model ben entrenat és la base per a aplicacions personalitzades d'intel·ligència artificial, des d'assistents conversacionals fins a sistemes de recomanació. A Q2BSTUDIO oferim automatització de processos amb agents d'IA que es beneficien de models més eficients. D'altra banda, la ciberseguretat és fonamental per protegir les dades d'entrenament i els models desplegats; disposem de serveis de ciberseguretat i pentesting per garantir la integritat del pipeline. Així mateix, la monitorització del rendiment del model durant l'entrenament i la inferència es pot integrar amb eines de Business Intelligence com Power BI, que a la nostra pràctica de BI ajudem a configurar per extraure mètriques clau en temps real.

La flexibilitat de WSqD també obre la porta a estratègies d'entrenament continu (continual learning), on el model s'actualitza periòdicament amb noves dades sense perdre qualitat. En no dependre d'un horitzó fix, el schedule s'adapta naturalment a sessions d'entrenament asíncrones o interrupcions planificades. Això és especialment rellevant en entorns cloud on els costos s'optimitzen mitjançant instàncies spot, que poden ser recuperades en qualsevol moment. Amb un schedule com WSqD, l'entrenament es pot reprendre des de l'últim pas sense necessitat de recalibrar la taxa d'aprenentatge, reduint el malbaratament de còmput.

En definitiva, WSqD representa un avenç significatiu en la teoria i pràctica de l'optimització de models grans. La seva independència de l'horitzó i la seva optimalitat teòrica el converteixen en una opció atractiva tant per a investigadors com per a enginyers de producció. A Q2BSTUDIO, estem compromesos amb l'adopció de les tècniques més avançades per oferir solucions de programari a mida, integrant IA, cloud, ciberseguretat i BI en un ecosistema coherent. Explorar schedules com WSqD és només un exemple de com la innovació en algoritmes es pot traduir en avantatges competitives tangibles per als nostres clients.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.