L'avaluació de sistemes de generació augmentada per recuperació (RAG) se centra tradicionalment a verificar que les afirmacions del model estiguin recolzades per documents recuperats, sense comprovar si aquests documents corresponen realment a l'entitat consultada. Aquest buit dóna lloc a un fenomen que anomenem 'grounding enganyós' (deceptive grounding, DG): un error d'atribució d'entitat que passa desapercebut per a les mètriques habituals de fidelitat, al·lucinació i cites, perquè cada afirmació prové d'un document real, però referit a una entitat incorrecta. En l'àmbit clínic, un sistema RAG pot respondre amb total aparent precisió sobre el fàrmac X, citant estudis del fàrmac Y, sense que cap control automatitzat ho detecti. Aquest problema no només compromet la fiabilitat de les aplicacions sanitàries, sinó que obre una bretxa crítica en la seguretat del pacient.
Investigacions recents, com l'estudi controlat factorial sobre 13 models, revelen taxes de DG que oscil·len entre el 8% i el 87% en condicions adversarials màximes. Els models especialitzats en biomedicina van assolir fins a un 86,7%, cosa que demostra que l'especialització de domini no mitiga l'error, sinó que l'amplifica. L'ablació controlada identifica el mecanisme subjacent: quan s'elimina l'evidència clínica específica de l'entitat dels documents recuperats, l'error d'atribució d'entitat desapareix completament, i tot l'error es trasllada a confabulació. Ambdós modes d'error responen al mateix desencadenant, però prenen camins diferents. En un mesurament en producció sobre 740 parells fàrmac-malaltia, es va trobar un 7,8% de DG global en un sistema RAG desplegat, que va augmentar al 13,6% per a fàrmacs recentment aprovats. La verificació d'atribució d'entitat —comprovar que l'evidència citada s'aplica a l'entitat consultada— detecta el DG amb una precisió del 97,0% i un recall del 98,7% (estàndard d'or humà ajustat per IPW), però cap marc existent ho implementa.
Des d'una perspectiva tècnica i empresarial, aquesta troballa subratlla la necessitat d'incorporar capes de verificació addicionals en els sistemes RAG, especialment en sectors crítics com la salut. A Q2BSTUDIO, entenem que la intel·ligència artificial aplicada a la medicina no només ha de ser precisa, sinó també atribuïble. Per això, en desenvolupar solucions d'IA per al sector clínic, integrem mecanismes de verificació d'entitat que van més enllà de la mera fidelitat textual. El nostre enfocament combina la creació d'aplicacions a mida amb arquitectures robustes al núvol (AWS/Azure) per gestionar grans volums de documentació clínica, i emprem tècniques de ciberseguretat per protegir dades sensibles de pacients. A més, la monitorització contínua mitjançant BI/Power BI permet detectar patrons de DG en temps real, mentre que l'ús d'agents IA especialitzats pot realitzar comprovacions d'atribució abans de lliurar una resposta final.
La lliçó és clara: la confiança en els sistemes RAG clínics no pot basar-se únicament en mètriques superficials. El grounding enganyós és un error invisible que només es combat amb una verificació sistemàtica de la correspondència entre entitat consultada i evidència recuperada. Les empreses que lideren la transformació digital en salut, com Q2BSTUDIO, estan cridades a incorporar aquestes salvaguardes a les seves arquitectures de programari, garantint que cada resposta assistencial no només sigui factual, sinó que realment pertanyi al pacient i al tractament correcte. El futur de la IA en medicina depèn d'això.





