La intel·ligència artificial ha irromput amb força en l’àmbit sanitari, i els grans models de llenguatge (LLM) s’utilitzen cada cop més per generar resums d’assajos clínics dirigits a metges, pacients i pagadors. Tanmateix, la tendència d’aquests models a 'al·lucinar' (inventar informació versemblant però falsa) suposa un risc crític en un context on la precisió pot tenir conseqüències directes sobre la salut de les persones. Un estudi acadèmic recent ha proposat un marc d’avaluació de la fidelitat d’aquests resums, analitzant el rendiment de models com GPT-4o, Claude Sonnet 4.6 i Gemini 2.5 Flash. Els resultats revelen que el fracàs dominant són les afirmacions no sustentades, cosa que subratlla la necessitat de solucions que garanteixin la veracitat de la informació generada per IA.
Des d’una perspectiva tècnica i empresarial, aquest problema no és només un repte de recerca, sinó una oportunitat per a empreses de desenvolupament de programari com Q2BSTUDIO d’aportar solucions robustes. La creació de sistemes que combinin LLM amb fonts de coneixement verificades, com bases de dades d’assajos clínics, pot reduir dràsticament les al·lucinacions. Un enfocament prometedor és la integració de grafs de coneixement que actuïn com una capa de verificació, similar al que proposen els autors de l’estudi en desenvolupar un sistema de recuperació augmentada per graf. Aquest tipus d’arquitectura no només millora la fidelitat, sinó que també permet auditar l’origen de cada afirmació, un requisit indispensable en sectors regulats com el farmacèutic.
Per a una companyia de tecnologia, implementar aquestes solucions requereix experiència en diverses àrees. Primer, el desenvolupament d’aplicacions a mida que integrin LLM amb pipelines de dades clíniques. Segon, la necessitat de desplegar aquests sistemes en entorns cloud escalables, ja sigui AWS o Azure, per gestionar grans volums de sol·licituds i garantir la disponibilitat. A més, la ciberseguretat és fonamental: les dades d’assajos clínics són altament sensibles i han de complir normatives com HIPAA o GDPR. Una empresa que ofereixi serveis de ciberseguretat, com els que proporciona Q2BSTUDIO, pot ajudar a protegir aquests fluxos d’informació. Finalment, la intel·ligència de negoci (BI) amb eines com Power BI permet visualitzar les mètriques de fidelitat i rendiment dels models, facilitant la presa de decisions informades.
L’estudi de referència mesura la fidelitat mitjançant un esquema de sis dimensions, trobant que la mitjana d’afirmacions no sustentades és d’1.55 sobre 3 en tots els models. Això indica que, fins i tot els LLM més avançats, generen contingut que no es correspon amb les dades originals. Les millores observades en incorporar el sistema de recuperació augmentada (NLI amb cross-encoder) són estadísticament significatives, però modestes en termes absoluts (increment d’entailment de 0.0125). Això suggereix que encara hi ha camí per recórrer i que les solucions han de ser multimodals: combinar tècniques de prompting específiques per a cada audiència, verificació externa i refinament continu del model.
Des de l’òptica d’una empresa com Q2BSTUDIO, el repte no és només tècnic, sinó també de disseny d’experiència d’usuari. Un resum dirigit a un metge especialista ha d’incloure detalls estadístics i nivells d’evidència, mentre que per a un pacient ha de ser comprensible i empoderador. Els agents d’IA poden personalitzar aquests resums dinàmicament, però sempre sota un marc de verificació. La implementació de serveis cloud (AWS/Azure) permet orquestrar aquests agents de manera eficient, escalant segons la demanda i assegurant la baixa latència. A més, l’automatització de processos mitjançant programari a mida pot integrar aquests resums directament en els sistemes de registre clínic o plataformes de decisió mèdica.
Un altre aspecte clau és la transparència. Els models actuals són essencialment caixes negres, cosa que dificulta la confiança. Les solucions empresarials han d’incloure mecanismes de traçabilitat, on cada afirmació generada estigui vinculada a la font original de l’assaig clínic. Aquí és on la combinació de bases de coneixement estructurades (com la base de dades Aggregate Analysis of ClinicalTrials.gov utilitzada a l’estudi) i LLM pot marcar la diferència. Q2BSTUDIO, amb la seva experiència en intel·ligència artificial i desenvolupament de programari, pot ajudar a construir aquestes plataformes, integrant mòduls de verificació per NLI i grafs de coneixement.
El futur dels resums d’assajos clínics generats per IA dependrà de la capacitat de les empreses per anar més enllà dels models generals i desenvolupar solucions específiques, auditables i segures. Els resultats de l’estudi són una crida a l’acció: no podem delegar cegament en els LLM sense una infraestructura de validació robusta. La col·laboració entre investigadors, desenvolupadors i proveïdors de tecnologia com Q2BSTUDIO serà essencial per aconseguir que la IA sigui un aliat fiable en la salut, i no una font de desinformació amb conseqüències greus.




