Quan la precisió direccional mentrestant: Benchmark honest per a TimesFM amb LoRA

Descobreix com un benchmark honest demostra que el 80% de precisió direccional de TimesFM amb LoRA en accions és només un miracle de la taxa base.

miércoles, 15 de julio de 2026 • 6 min de lectura • Equip Q2BSTUDIO

Evitant la trampa de la taxa base: benchmark per a TimesFM amb LoRA

En el vertiginós món de les finances quantitatives, la temptació d'usar models d'intel·ligència artificial d'última generació per predir moviments borsaris és gairebé irresistible. No obstant això, un recent estudi revela una trampa metodològica que pot portar a conclusions perillosament enganyoses: la precisió direccional —el percentatge d'encerts en la direcció del preu— pot ser un miracle quan no es controla el biaix de la taxa base. Aquest article analitza a fons el problema, proposa un marc d'avaluació honest i extreu lliçons pràctiques per a empreses que busquen integrar IA per a empreses sense caure en falsos positius.

El cas concret que ens ocupa és l'ús de TimesFM, un model preentrenat de sèries temporals a gran escala, combinat amb adaptadors LoRA (Low-Rank Adaptation). Alguns experiments inicials reportaven una precisió direccional propera al 80% en horitzons de diversos mesos. Un assoliment extraordinari? No exactament. Un simple model 'sempre alcista' —que prediu pujada tots els dies— assoleix una precisió comparable en un mercat en tendència alcista sostinguda. Això no és habilitat predictiva, sinó un artefacte estadístic: la taxa base del mercat condiciona el resultat. D'aquí el títol de la nostra anàlisi: quan la precisió direccional mentrestant, es necessita un benchmark honest.

El treball de referència —que prenem només com a inspiració conceptual— estableix un protocol rigorós que qualsevol equip de ciència de dades hauria d'adoptar abans de declarar un èxit en predicció financera. Es basa en una validació walk-forward amb folds expansius, una separació estratificada d'actius no vistos durant l'entrenament, i un conjunt de línies base honestes: TimesFM en mode zero-shot, la regla sempre-alcista, un passeig aleatori, persistència (últim valor conegut) i un model autorregressiu AR(1). Sobre aquests resultats s'apliquen proves de significació aparellades (McNemar i Diebold-Mariano) amb control de falsos descobriments mitjançant el procediment Benjamini-Hochberg. L'objectiu no és només mesurar precisió, sinó separar el veritable acompliment del soroll de la taxa base.

Les troballes replicades són contundents. Primer, quan es recrea la condició històrica del 80%, la taxa base real és d'aproximadament 0.70, i el model ajustat amb LoRA queda per sota. Segon, l'adaptador LoRA no mostra cap habilitat direccional significativa sobre la taxa base en cap horitzó temporal analitzat, arribant fins i tot a ser negatiu en horitzons de sis mesos. Tercer, l'especialització per sectors —entrenar adaptadors independents per a tecnologia, salut, finances, etc.— resulta significativament pitjor que un únic adaptador global, amb un valor p menor a 0.001 en les proves de Diebold-Mariano sobre actius no vistos a un horitzó de 128 dies. L' únic benefici mesurable de l' ajust fi és una reducció estadísticament significativa en l' error de predicció puntual respecte al model base, però que no supera les línies base ingènues i, crucialment, no confereix cap avantatge direccional explotable en trading.

Què implica això per a una empresa que desitja implementar models de machine learning en els seus processos d'inversió o planificació financera? La lliçó principal és que la mètrica d' avaluació s' ha d' ajustar al context. Si l'actiu subjacent té una tendència dominant, qualsevol model que encerti la direcció simplement està replicant la tendència. La veritable prova de destresa és l' excés de precisió sobre la taxa base. En termes pràctics, un model que només iguala la freqüència de pujades del mercat no aporta valor. Perquè una estratègia sigui rendible, necessita generar senyals que millorin significativament aquesta línia base, especialment després de costos de transacció i risc.

Aquí és on la metodologia presentada esdevé una eina indispensable. Les empreses que desenvolupen aplicacions a mida per a anàlisi financera o per a qualsevol domini amb sèries temporals han d' incorporar aquest tipus de validació rigorosa. No es tracta només d'usar models potents com TimesFM, sinó de dissenyar experiments que responguin a la pregunta correcta: el model aporta informació addicional o només memoritza la tendència? Per això, en Q2BSTUDIO recomanem sempre construir un marc d' avaluació personalitzat, integrant des de la fase de disseny les proves de significació i controls de taxa base. El nostre equip d'experts en programari a mida pot implementar pipelins de validació walk-forward, ajust d'hiperparàmetres amb folds expansius i comparació contra múltiples línies base, garantint que els models desplegats en producció tinguin un recolzament estadístic sòlid.

A més, la intel·ligència artificial per a empreses no es limita a la predicció financera. En Q2BSTUDIO oferim serveis d'intel·ligència artificial que cobreixen des de la creació d'agents IA automatitzats fins a la integració de models generatius en fluxos de treball empresarials. Entenem que la fiabilitat de les prediccions és crítica, especialment quan es tracta de dades sensibles com els financers, i treballem amb metodologies que eviten biaixos com el de la taxa base. Els nostres desenvolupaments abasten també ciberseguretat per protegir les dades i models, serveis cloud AWS i Azure per escalar infraestructures de forma segura, i serveis d'intel·ligència de negoci amb Power BI per visualitzar mètriques d'acompliment com les que aquí es discuteixen.

Un aspecte rellevant de l' estudi és que l' especialització per sectors va empitjorar els resultats, la qual cosa desafia la intuïció que un model específic per a cada sector capturaria millor la dinàmica local. Això suggereix que el senyal de mercat és compartit entre sectors, i que dividir l'entrenament introdueix soroll. Per a una empresa que maneja múltiples actius, aquesta lliçó és clau: de vegades un únic model global amb característiques ben dissenyades supera un exèrcit de models locals. En Q2BSTUDIO ajudem les organitzacions a dissenyar arquitectures d'agents IA que decideixen quan usar un model global versus un especialitzat, basant-se en mètriques de validació rigoroses.

Un altre punt crític és la reproducibilitat. El protocol de l'estudi exigeix dades congelades, splits d'actius estratificats i llavors fixes. En entorns empresarials, la falta de reproducibilitat és una de les principals causes de fracàs dels projectes d'intel·ligència artificial. Per això, les nostres solucions d'aplicacions a mida inclouen sistemes de gestió d'experiments MLOps que registren cada configuració, dades i mètriques, permetent auditories i comparacions honestes. Si la seva empresa està avaluant la incorporació de TimesFM o qualsevol model de sèries temporals, li recomanem que exigeixi un benchmark com el descrit: línies base ingènues, proves estadístiques i control de taxa base. No es deixi seduir per números alts sense context.

En un mercat cada vegada més competitiu, on les decisions es prenen en mil·lisegons, la temptació de confiar en mètriques superficials és enorme. Però la història de la predicció financera és plena de models que semblaven funcionar fins que es van aplicar en condicions reals. El fracàs no sol estar en l'algoritme, sinó en la metodologia d'avaluació. Per això, des de Q2BSTUDIO apostem per un enfocament integral: combinem serveis cloud AWS i Azure per escalar el còmput, intel·ligència artificial per generar models, ciberseguretat per protegir les dades, i power bi per monitoritzar resultats. Tot això sota un paraigua de validació estadística que evita falsos positius.

En conclusió, la investigació sobre TimesFM i LoRA ens deixa una advertència metodològica que transcendeix les finances: qualsevol model de sèries temporals ha de ser avaluat contra la taxa base del seu domini. La precisió direccional mentre no s' ajusta per la tendència subjacent. Implementar un benchmark honest com el descrit no és opcional; és l'única manera de separar la ciència de la superstició. En Q2BSTUDIO, estem preparats per ajudar la seva empresa a dissenyar i implementar aquests processos, ja sigui en l'àmbit financer o en qualsevol altre on la predicció sigui clau. Contacte amb nosaltres per descobrir com les nostres solucions de programari a mida i ja per a empreses poden transformar les seves dades en decisions informades i verificables.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.