En els darrers anys, la intel·ligència artificial aplicada a l'àmbit clínic ha avançat de manera notable, però la majoria de les avaluacions es limiten a entorns controlats on cada pacient requereix una única calculadora i l'eina apareix esmentada de forma explícita. La realitat hospitalària és molt diferent: un mateix cas pot exigir múltiples escales de valoració, càlculs niats i consultes ambigües que no especifiquen directament quin instrument utilitzar. Amb aquest desafiament al cap neix MedCalc-Pro, un nou referent que planteja tres nivells de complexitat creixent —mono-eina, multi-eina i càlcul niat— a partir de 2.268 casos clínics reals distribuïts en 77 calculadores de 14 especialitats. L'objectiu és mesurar fins a quin punt els grans models de llenguatge (LLM) poden operar en escenaris que imiten la pràctica diària, on la incertesa i la necessitat de combinar recursos són la norma.
Per afrontar aquestes situacions, els investigadors han dissenyat un marc d'agents IA capaç de seleccionar i encadenar diverses eines, gestionar crides niades i, sobretot, mitigar la propagació d'errors paramètrics mitjançant validació estructurada i revisió d'evidències. Aquest enfocament no només supera els models generalistes i els especialitzats en medicina en els tres nivells del benchmark, sinó que obre la porta a una nova generació d'assistents clínics veritablement adaptables. L'arquitectura recorda els principis que apliquem des de Q2BSTUDIO quan desenvolupem aplicacions a mida per a entorns sanitaris: modularitat, traçabilitat i capacitat d'integració amb sistemes legacy.
Darrere d'aquest avenç hi ha un canvi de paradigma. Fins ara, la majoria dels benchmarks mèdics se centraven en respostes textuals o diagnòstics, deixant de banda els càlculs quantitatius que són essencials en àrees com nefrologia, cardiologia o cures intensives. MedCalc-Pro exposa les limitacions dels LLMs quan han de manejar fórmules niades o consultes sense instruccions explícites. Per exemple, un clínic podria preguntar “Quin és el risc quirúrgic d'aquest pacient amb insuficiència renal?” sense esmentar que necessita combinar el score de Charlson, el aclariment de creatinina i l'escala ASA. L'agent ha d'inferir els passos, seleccionar les calculadores correctes i encadenar-les en l'ordre adequat. Aquesta complexitat és precisament la que aborda el nou framework, i la que converteix la ia per a empreses en una eina estratègica per a la transformació digital d'hospitals i asseguradores.
Des d'una perspectiva empresarial, implementar aquest tipus de solucions requereix una base tecnològica sòlida. La gestió de les dades clíniques, l'escalabilitat dels models i la protecció de la informació sensible són factors crítics. Per això, a Q2BSTUDIO complementem el desenvolupament d'agents intel·ligents amb serveis cloud AWS i Azure que garanteixen desplegaments elàstics i segurs, així com amb mesures de ciberseguretat que blinden la confidencialitat del pacient. A més, la integració amb plataformes de intel·ligència de negoci i Power BI permet als equips mèdics visualitzar en temps real els patrons d'ús, la precisió dels càlculs i les àrees de millora. No es tracta només de tecnologia, sinó d'orquestrar un ecosistema on el programari a mida s'adapta al flux de treball clínic, i no al revés.
El treball publicat a arXiv representa un pas ferm cap a assistents que no només entenen llenguatge natural, sinó que també executen raonaments quantitatius complexos. No obstant, com passa amb qualsevol innovació, la transferència a l'entorn real exigeix validació en múltiples centres, maneig de biaixos poblacionals i actualització contínua de les calculadores. A Q2BSTUDIO creiem que la col·laboració entre equips d'investigació, clínics i desenvolupadors d'aplicacions a mida és la clau perquè aquests agents passin de ser prototips prometedors a eines quotidianes. La medicina del futur no només serà predictiva, sinó també precisa en cada càlcul, i els agents LLM amb capacitat de selecció i niatge d'eines seran part essencial d'aquesta transformació.



