En l'àmbit del diagnòstic assistit per intel·ligència artificial, un dels reptes més crítics és aconseguir que els models no només siguin precisos, sinó també fiables quan s'enfronten a dades que es desvien de les condicions d'entrenament. Un estudi recent sobre classificació de nòduls tiroïdals mitjançant imatges d'ultrasò posa de manifest la importància del calibratge de probabilitats, l'estimació d'incertesa i la predicció selectiva. Aquests conceptes, tot i néixer en la recerca clínica, tenen aplicacions directes en el desenvolupament d'aplicacions a mida per a entorns sanitaris i empresarials, on la presa de decisions informada és clau.
El treball analitzat proposa un conjunt profund calibrat de cinc membres basat en ConvNeXt-Tiny amb atenció squeeze-and-excitation, que genera una probabilitat mitjana de malignitat i una puntuació de desacord basada en la informació mútua. Aquest enfocament permet implementar una política de tres nivells: suggerir no fer FNA, recomanar FNA o derivar al radióleg. En la validació interna, el sistema va assolir un AUC-ROC de 0,9395, un error de calibratge esperat (ECE) de només 0,0088 i un Brier score de 0,0813. Tanmateix, en aplicar el model a un conjunt extern (TN3K), el rendiment va baixar significativament, demostrant la fragilitat dels llindars quan es produeix un desplaçament del dataset.
Aquest fenomen subratlla la necessitat d'incorporar mecanismes de predicció selectiva: no totes les imatges són adequades per a la classificació automàtica. En retenir només aquelles amb baixa incertesa (p. ex., el 50% amb menor informació mútua), el 7,2% dels casos van rebre un suggeriment de no FNA amb un valor predictiu negatiu del 98,3%, capturant el 99,83% de les malignitats. En el conjunt extern, el 83,7% de les imatges van requerir revisió radiològica, cosa que indica que la confiança del model ha de ser recalibrada localment.
Des d'una perspectiva empresarial, aquests resultats tenen implicacions directes en la construcció de sistemes de suport a la decisió basats en IA. Perquè una solució d'aquest tipus es pugui implementar en producció, és imprescindible comptar amb una infraestructura robusta que permeti el recalibratge continu dels models, la gestió de versions i el monitoratge del rendiment. Aquí és on serveis com cloud AWS/Azure ofereixen l'escalabilitat i flexibilitat necessàries per desplegar models en entorns reals, assegurant que els llindars s'ajustin dinàmicament segons les dades locals.
A més, l'estimació d'incertesa no només és rellevant en l'àmbit mèdic. En sectors com la ciberseguretat, els models de detecció d'anomalies també necessiten mesurar la seva confiança per evitar falsos positius que saturin els analistes. Un sistema de predicció selectiva, combinat amb un panell de control en BI/Power BI, permet visualitzar en temps real quines decisions han de ser revisades per humans i quines es poden automatitzar amb garanties.
La integració d'agents d'IA que decideixen quan delegar en un expert és una tendència creixent. A Q2BSTUDIO desenvolupem aplicacions a mida que incorporen aquests principis, utilitzant conjunts de models, calibratge per escalat de vectors i polítiques de confiança. El nostre equip pot ajudar-vos a dissenyar i implementar solucions que no només siguin precises, sinó que també sàpiguen quan callar i demanar ajuda.
En definitiva, la recerca sobre nòduls tiroïdals ens recorda que l'excel·lència tècnica no és suficient: la fiabilitat operativa exigeix una arquitectura de programari flexible, serveis cloud gestionats i una estratègia de recalibratge continu. Si voleu explorar com aquestes idees poden aplicar-se al vostre sector, us convidem a contactar amb nosaltres.





