En l'àmbit dels models de supervivència, l'índex de concordança o C-index ha estat durant anys la mètrica estrella per avaluar la capacitat discriminativa: ordenar correctament qui experimenta un esdeveniment abans que un altre. No obstant això, un estudi recent amb dades sintètiques publicat a ICML 2026 va demostrar que confiar exclusivament en el C-index genera comparacions sistemàticament enganyoses. La raó és que aquesta mètrica ignora completament la calibració —com de properes estan les probabilitats predites a les freqüències reals— i la precisió dependent del temps. En altres paraules, un model pot tenir un C-index excel·lent però oferir estimacions de risc esbiaixades, amb conseqüències greus en sectors com la indústria, les finances o les plataformes digitals. En aquest article explorem per què la calibració importa, com aquesta il·lusió del C-index afecta aplicacions reals i què poden fer les empreses per evitar-ho, recolzant-se en solucions tecnològiques com les que ofereix Q2BSTUDIO.
L'estudi que inspira aquesta reflexió va replicar tres models publicats en dominis estructuralment diferents: fallades de discs durs, impagaments en préstecs peer-to-peer i abandonament d'usuaris en plataformes digitals. Els resultats van ser reveladors. Un model que reproduïa gairebé exactament el C-index reportat (0,9595 enfront de 0,958) va fallar estrepitosament en una prova formal de calibració amb un p-valor de 2,6e-136. És a dir, tot i que discriminava bé, les probabilitats de fallada que estimava no es corresponien amb la realitat. Aquesta fallada no es devia a una variable trivial: una anàlisi d'ablació de característiques no va trobar cap atribut únic responsable. La il·lusió del C-index és, per tant, un perill real que pot portar les empreses a confiar en models que en realitat no són fiables.
Com es tradueix això en el dia a dia d'una empresa? Imaginem un prestador que utilitza un model de risc d'impagament. Si tracta el prepagament del préstec com una censura no informativa en lloc d'un risc competitiu, les estimacions de probabilitat d'impagament es sesquen a l'alça en aproximadament dos punts percentuals, arribant a gairebé quatre punts en el segment més arriscat. Això significa que es rebutjaran préstecs a clients que probablement pagarien, o s'assignaran tipus d'interès injustos. De manera similar, un model d'abandonament d'usuaris (churn) pot mostrar una discriminació global estable dins d'una banda acceptable de C-index, però les estimacions de probabilitat es degraden a mesura que creix l'horitzó de predicció. L'empresa creurà que el seu model funciona bé quan en realitat està prenent decisions errònies sobre quan i com retenir clients.
La moral és clara: centrar-se només en la discriminació genera una falsa confiança. L'estudi esmentat va provar cinc hipòtesis preregistrades sota un control d'error familiar (Holm), i tres d'elles van ser rebutjades. Tot i que no es va poder demostrar que l'elecció de mètrica inverteixi quin model és preferit —a causa del limitat poder estadístic amb només dos o tres models per domini— el patró de fallada és més aviat de confiança mal col·locada: les empreses creuen que el seu model és bo quan no ho és. Per evitar-ho, és fonamental adoptar un marc d'avaluació complet que inclogui proves de calibració, anàlisi de riscos competitius i validació temporal.
A Q2BSTUDIO entenem que la tecnologia no és només una qüestió de mètriques superficials. Per això oferim aplicacions a mida que integren tant la discriminació com la calibració al cor del desenvolupament de models de supervivència. El nostre equip d'experts en intel·ligència artificial construeix sistemes que no només prediuen, sinó que també monitoritzen contínuament la calibració mitjançant agents d'IA específics. Aquests agents detecten desviacions en temps real, alertant els equips abans que les decisions basades en el model causin pèrdues. A més, despleguem aquestes solucions al núvol amb els proveïdors més sòlids: cloud AWS i Azure, garantint escalabilitat, seguretat i compliment normatiu.
La ciberseguretat és un altre pilar crític. Les dades utilitzades en models de supervivència —com registres de fallades hardware, historials crediticis o patrons de comportament— són sensibles i s'han de protegir. A Q2BSTUDIO apliquem les millors pràctiques en ciberseguretat i pentesting per assegurar que les dades i els models estiguin protegits d'accessos no autoritzats. De la mateixa manera, integrem solucions de Business Intelligence amb Power BI per visualitzar l'evolució de la calibració i la discriminació al llarg del temps, permetent als directius prendre decisions informades basades en mètriques reals, no en il·lusions estadístiques.
La il·lusió del C-index és un recordatori que l'avaluació de models no es pot reduir a un sol número. Les empreses que confien cegament en models mal calibrats s'exposen a riscos financers, operatius i reputacionals. La solució passa per adoptar un enfocament holístic que combini mètriques adequades, infraestructura cloud robusta, intel·ligència artificial fiable i una cultura de validació contínua. A Q2BSTUDIO ajudem les organitzacions a fer aquest pas, desenvolupant programari a mida que va més enllà del C-index i es centra en el que realment importa: prediccions precises, calibrades i accionables. Perquè en un món on cada decisió compta, no ens podem permetre il·lusions.



