CARV: Benchmark de raonament analògic compositiu en MLLMs

Descobreix CARV, un benchmark de 5500 mostres que avalua el raonament analògic compositiu en models multimodals. Només 40% d'encert en IA enfront del 100% humà.

sábado, 25 de julio de 2026 • 5 min de lectura • Equip Q2BSTUDIO

Evalúa la composición de reglas en IA multimodal

El raonament analògic ha estat durant molt de temps un pilar de la intel·ligència humana, permetent transferir coneixement d'un domini a un altre mitjançant la identificació de relacions subjacents. En el camp de la intel·ligència artificial, els models multimodals de llenguatge (MLLMs) han demostrat avenços impressionants en tasques que combinen text i imatges, però la seva capacitat per compondre regles a partir de múltiples fonts continuava sent un repte no resolt. El recent benchmark CARV (Compositional Analogical Reasoning in Vision) tanca aquesta bretxa en introduir un conjunt de dades de 5.500 mostres dissenyat específicament per avaluar el raonament analògic compositiu. En aquest article explorem què significa CARV per al desenvolupament d'IA, per què els MLLMs actuals es queden curts davant del rendiment humà (100% enfront d'un 40,4% del millor model), i com empreses com Q2BSTUDIO estan aplicant aquests aprenentatges per construir solucions de programari més intel·ligents i robustes.

La tasca central de CARV estén l'analogia clàssica d'un parell a múltiples parells. En lloc de simplement mapejar relacions entre dos objectes, els models han d'extreure regles simbòliques de cada parell i després compondre noves transformacions. Això reflecteix un nivell d'abstracció més proper a la cognició humana, on no només es reconeix una similitud superficial, sinó que s'entenen les regles que governen les transformacions visuals. Per exemple, un MLLM ha d'observar com canvia una forma geomètrica en un parell d'imatges, identificar la regla (com rotació, canvi de color o escala), i aplicar-la a un nou parell de manera combinada. Els resultats del benchmark són reveladors: fins i tot el model més avançat, Gemini-2.5 Pro, amb prou feines arriba a un 40,4% de precisió, molt lluny del 100% humà. A més, l'anàlisi diagnòstica assenyala dos errors sistemàtics: la dificultat per descompondre canvis visuals en regles simbòliques i la pèrdua de robustesa sota configuracions diverses o complexes.

Des d'una perspectiva tècnica i empresarial, aquesta bretxa té implicacions profundes. Les empreses que busquen integrar IA en els seus processos necessiten models que no només classifiquin imatges o generin text, sinó que raonin de manera flexible davant situacions desconegudes. En sectors com l'automatització industrial, la ciberseguretat o l'anàlisi de negoci, un model que no pot compondre regles a partir de dades visuals múltiples corre el risc de fallar en escenaris crítics. Aquí és on entra el valor del desenvolupament d'aplicacions a mida. A Q2BSTUDIO entenem que la IA no és una solució única; cada repte empresarial requereix un enfocament personalitzat que combini models de llenguatge, visió per computador i lògica simbòlica per aconseguir un raonament compositiu fiable.

El benchmark CARV també posa el focus en la necessitat d'agents d'IA més sofisticats. Els agents autònoms que operen en entorns complexos —com la gestió d'infraestructura cloud a AWS o Azure, la monitorització d'amenaces de ciberseguretat o la generació d'informes de Business Intelligence amb Power BI— depenen de la capacitat d'interpretar regles visuals i compositives. Per exemple, un sistema de seguretat que analitza imatges de vigilància ha de poder inferir patrons de comportament a partir de múltiples fonts visuals, cosa que CARV demostra que els MLLMs actuals no fan bé. La indústria de la IA està avançant cap a models híbrids que combinen xarxes neuronals amb raonament simbòlic, una tendència que Q2BSTUDIO recolza mitjançant el desenvolupament d'agents IA que integren lògica i aprenentatge profund per superar els límits detectats en benchmarks com CARV.

D'altra banda, el component de ciberseguretat no es pot passar per alt. Un MLLM que no aconsegueix entendre regles compositives pot ser vulnerable a atacs adversariales on la manipulació d'imatges enganya el model. Les empreses que adopten solucions d'IA al núvol necessiten garantir que els seus sistemes siguin robustos davant tals fallades. Per això, a Q2BSTUDIO oferim serveis de ciberseguretat especialitzats per a entorns cloud, assegurant que els models d'IA no només siguin precisos en benchmarks, sinó segurs en producció. La integració de cloud AWS/Azure permet escalar aquests sistemes, mentre que l'analítica de negoci amb Power BI es beneficia de models que poden interpretar visualitzacions complexes i correlacionar dades de múltiples orígens.

Un altre aspecte clau és l'automatització de processos mitjançant programari a mida. Els resultats de CARV suggereixen que els MLLMs actuals no són adequats per a tasques que requereixen raonament compositiu en temps real, com la inspecció visual en línies de producció o l'assistència a cirurgians mitjançant anàlisi d'imatges mèdiques. No obstant, les empreses poden superar aquesta limitació combinant models pre-entrenats amb capes de lògica personalitzades desenvolupades per equips experts. A Q2BSTUDIO dissenyem arquitectures que integren visió per computador, IA generativa i regles de negoci per crear aplicacions que sí entenen les composicions visuals complexes. El nostre enfocament passa per utilitzar benchmarks com CARV com a eines de diagnòstic per identificar les debilitats dels models genèrics i enfortir-los amb solucions a mida.

La referència a Power BI i Business Intelligence és especialment rellevant. En moltes organitzacions, els informes visuals són la base de la presa de decisions. Un model que no pot raonar analògicament sobre gràfics, diagrames o dashboards podria malinterpretar tendències o relacions. Q2BSTUDIO ajuda a les empreses a implementar solucions de BI que aprofiten la IA per a l'anàlisi predictiva, però sempre amb un enfocament crític: sabem que els MLLMs tenen limitacions, per la qual cosa combinem el poder d'eines com Power BI amb lògica compositiva personalitzada per garantir la fiabilitat dels insights.

En resum, CARV no és només un benchmark acadèmic; és un senyal d'advertència i una oportunitat. Adverteix sobre les limitacions actuals dels models multimodals, però també obre la porta a innovacions en el disseny d'arquitectures d'IA més properes al raonament humà. Per a les empreses, la conclusió és clara: la IA genèrica no n'hi ha prou; calen solucions de programari a mida que integrin raonament simbòlic, visió per computador i agents intel·ligents, tot sobre infraestructures cloud segures i amb analítica de negoci avançada. A Q2BSTUDIO oferim precisament això: un enfocament integral que converteix els reptes del raonament compositiu en avantatges competitius per als nostres clients. Ja sigui desenvolupant aplicacions multiplataforma, desplegant agents d'IA al núvol o enfortint la ciberseguretat dels seus sistemes, estem preparats per portar la intel·ligència artificial al següent nivell, més enllà dels benchmarks.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.