La resolució de trencaclosques lògics com el Sudoku ha estat tradicionalment un camp de prova per a sistemes d'intel·ligència artificial, ja que combina percepció visual, comprensió del llenguatge i raonament simbòlic. Recentment, els models de llenguatge i visió (VLMs) han demostrat una capacitat sorprenent per interpretar graelles i generar solucions, però pateixen una debilitat fonamental: la manca de garanties de consistència lògica. Un model pot identificar correctament els dígits en una imatge i proposar una assignació que, tanmateix, violi les regles del joc. Aquí és on entra l'enfocament neuro-simbòlic proposat a la literatura, que utilitza un oracle de satisfactibilitat màxima (MaxSAT) per validar i refinar les sortides del VLM. Aquest article analitza en profunditat com el feedback basat en MaxSAT pot guiar els VLMs cap a solucions correctes, i com aquesta filosofia d'integració entre aprenentatge profund i lògica formal s'alinea amb les solucions empresarials que oferim a Q2BSTUDIO, especialistes en programari a mida, intel·ligència artificial, ciberseguretat, cloud AWS/Azure, BI amb Power BI i automatització de processos.
El problema central és que els VLMs, per molt avançats que siguin, manquen d'un mecanisme explícit per imposar restriccions. Quan se'ls demana resoldre un Sudoku, poden identificar patrons visuals i generar una seqüència de números, però res no els impedeix, per exemple, repetir un dígit en una fila. Alguns enfocaments intenten solucionar-ho afegint més dades d'entrenament o ajustant l'arquitectura, però el resultat continua sent probabilístic. L'alternativa que explorem aquí és la hibridació: deixar que el VLM proposi candidats —basats en la seva comprensió perceptual i contextual— i després sotmetre aquestes propostes a un verificador lògic. El verificador, implementat mitjançant MaxSAT, modela les restriccions del Sudoku com a clàusules dures (hard clauses), mentre que les assignacions del VLM es converteixen en clàusules toves (soft clauses). Si el conjunt complet és inconsistent, el solucionador MaxSAT troba el subconjunt més gran d'assignacions que es pot satisfer simultàniament, i retorna un feedback estructurat que indica al VLM quines posicions necessita revisar.
Aquesta idea no és nova en l'àmbit de la IA simbòlica, però la seva aplicació en combinació amb VLMs moderns obre possibilitats fascinants. En un escenari típic, el VLM genera una primera solució completa. L'oracle MaxSAT l'avalua i, si troba errors, produeix una descripció textual i visual (per exemple, ressaltant les cel·les conflictives) que es retroalimenta al model. El VLM, llavors, refina la seva predicció en aquelles àrees concretes. Els experiments amb conjunts de dades de Sudoku mostren que aquest cicle iteratiu incrementa significativament el nombre de trencaclosques resolts, especialment quan es refina tota la graella en lloc de corregir parcialment. Això demostra que l'optimització simbòlica pot millorar la fiabilitat del raonament visual-lingüístic.
Des d'una perspectiva empresarial, la lliçó és clara: els models purament connexionistes, tot i que potents, necessiten ser complementats amb mecanismes de verificació formal per a aplicacions crítiques. A Q2BSTUDIO, hem desenvolupat una pràctica sòlida en la integració de sistemes d'IA amb lògica de negoci utilitzant programari a mida. Els nostres clients, des de startups fins a grans corporacions, requereixen solucions que no només 'endevinin' la resposta correcta, sinó que la garanteixin dins d'un marc de restriccions predefinit. Per exemple, en sistemes de recomanació, planificació de rutes o validació de dades financeres, un enfocament neuro-simbòlic com el del feedback MaxSAT permet auditar i corregir automàticament les sortides de models de llenguatge o visió.
Però l'aplicació va més enllà del Sudoku. Qualsevol problema estructurat que combini percepció visual i raonament lògic es beneficia d'aquesta arquitectura. Penseu en la inspecció visual de peces industrials: un VLM identifica possibles defectes, però el sistema ha de respectar les regles de qualitat —per exemple, no acceptar una peça amb dues esquerdes a la mateixa zona—. El feedback MaxSAT assenyala exactament quines decisions del model violen les normes, permetent una correcció precisa sense necessitat de reentrenar tot el model. Això redueix costos i accelera la implantació en entorns de producció. A més, la mateixa tècnica es pot utilitzar per millorar la consistència d'agents d'IA conversacionals que gestionen bases de coneixement amb restriccions lògiques.
Un altre aspecte rellevant és la sinergia amb tecnologies cloud i de Business Intelligence. A Q2BSTUDIO, oferim serveis cloud a Azure i AWS que permeten desplegar aquests sistemes híbrids a escala. L'oracle MaxSAT pot executar-se com un microservei serverless, mentre que els VLMs s'allotgen en GPUs escalables. La retroalimentació s'envia a través d'APIs REST, i tot el pipeline es monitoritza amb eines de BI com Power BI per detectar patrons d'error i optimitzar el rendiment. Així mateix, la ciberseguretat juga un paper fonamental: en tractar-se d'un sistema que rep dades visuals i produeix decisions, qualsevol manipulació de l'entrada (per exemple, imatges adversarials) podria corrompre el procés. El nostre equip de ciberseguretat i pentesting assegura que el flux de dades estigui protegit i que el model no sigui vulnerable a atacs.
L'automatització de processos és un altre vector on aquesta tècnica aporta valor. Considereu un sistema de gestió documental que extreu informació de factures escanejades (visió) i la valida contra regles comptables (lògica). Un VLM podria extreure l'import i la data, però si hi ha discrepàncies amb el període fiscal, el feedback MaxSAT indica quins camps corregir. A Q2BSTUDIO, implementem solucions d'automatització de processos amb programari que integren aquestes capacitats, reduint l'error humà i accelerant fluxos de treball.
Tornant al cas del Sudoku, els resultats de les investigacions mostren que el refinament iteratiu basat en MaxSAT no només millora la taxa d'encert, sinó que també redueix l'ambigüitat del model. El VLM aprèn a confiar més en la seva percepció quan el feedback li confirma que certes assignacions són correctes, i a dubtar quan el verificador les rebutja. Aquest cercle virtuós es pot traslladar a entorns de formació de models, on es genera un conjunt de dades sintètiques amb retroalimentació simbòlica per entrenar VLMs més robustos.
En conclusió, la combinació de models de llenguatge i visió amb oracles de satisfactibilitat màxima representa un avenç significatiu cap a sistemes d'IA fiables i verificables. No es tracta de substituir l'aprenentatge profund, sinó de complementar-lo amb la lògica clàssica per obtenir el millor de tots dos mons. A Q2BSTUDIO, estem convençuts que aquesta aproximació és clau per desenvolupar aplicacions empresarials que requereixin precisió, traçabilitat i escalabilitat. Si la vostra organització necessita integrar intel·ligència artificial amb garanties formals, us convidem a explorar les nostres solucions d'intel·ligència artificial i programari a mida, on apliquem principis similars per resoldre desafiaments complexos en logística, finances, sanitat i més. La propera vegada que un model de visió falli en un Sudoku, recordeu que el fracàs no està en la percepció, sinó en la manca de lògica. Amb el feedback adequat, qualsevol error es converteix en una oportunitat de millora.





