En l'àmbit de la simulació científica, la intel·ligència artificial comença a transformar la manera com es modelen fenòmens complexos com el transport de radiació. No obstant això, perquè els models generatius siguin realment útils en entorns de producció, calen benchmarks rigorosos que avaluïn no només la capacitat de generar codi sintàcticament correcte, sinó també la precisió física dels resultats. En aquest context neix PHITSBench, un benchmark dissenyat específicament per mesurar el rendiment de models d'IA en la generació i modificació de simulacions amb el codi PHITS (Particle and Heavy Ion Transport code System). Al llarg d'aquest article explorem què és PHITSBench, què revelen els seus primers resultats i com empreses de desenvolupament de programari com Q2BSTUDIO poden ajudar a integrar aquestes capacitats en solucions reals, combinant aplicacions a mida, cloud computing, ciberseguretat, Business Intelligence i agents d'IA.
PHITSBench es compon de 282 tasques que cobreixen tres categories principals de flux de treball: edició de paràmetres (Edit), reparació de sintaxi (Repair) i generació completa de simulacions a partir de descripcions en llenguatge natural (Reproduce). Cada tasca s'avalua mitjançant una mètrica composta que combina l'èxit d'execució amb la concordança entre els observables de transport generats i els de referència. Aquesta aproximació permet mesurar tant la correcció sintàctica com la validesa física de les simulacions produïdes pel model. Les proves es van realitzar amb configuracions basades en GPT-5.4, des de prompting zero-shot fins a fluxos augmentats amb coneixement i agents autònoms.
Els resultats inicials són reveladors: en absència de coneixement específic del domini, el model aconsegueix un 95% d'èxit en tasques d'edició i un 70% en reparació, però fracassa completament en la generació des de zero (0% en Reproduce). Això mostra que, tot i que els grans models de llenguatge poden manipular codi existent amb certa fluïdesa, manquen del coneixement profund necessari per construir simulacions completes i físicament coherents. No obstant això, quan es proporciona un catàleg estructurat de coneixement de PHITS en format llegible per màquina —juntament amb el manual d'usuari— l'èxit en Reproduce salta al 57%. L'execució mitjançant agents l'eleva fins al 73%, tot i que a costa d'un major cost computacional.
L'anàlisi de fallades revela que els errors restants no són principalment de sintaxi, sinó de selecció i configuració incorrecta dels observables físics. És a dir, el model sap com escriure el codi, però no quins paràmetres físics triar perquè la simulació tingui sentit. Aquesta observació és clau: la propera frontera en la simulació assistida per IA no passa només per millorar els models fundacionals, sinó per construir bases de coneixement llegibles per màquina, conjunts de dades d'entrenament curats i entorns d'avaluació basats en execució real.
Per a les empreses que treballen amb simulacions científiques o industrials, aquestes troballes tenen implicacions directes. La integració d'IA en processos de simulació requereix alguna cosa més que un model de llenguatge: necessita una infraestructura de programari sòlida, capaç de gestionar dades, executar simulacions al núvol, garantir la seguretat dels sistemes i extreure conclusions dels resultats. Aquí és on entren en joc les capacitats d'IA i cloud AWS/Azure que ofereix Q2BSTUDIO.
Q2BSTUDIO és una empresa de desenvolupament de programari i tecnologia especialitzada en crear aplicacions a mida que s'adapten a les necessitats específiques de cada organització. En el context de la simulació de transport de radiació, per exemple, podríem desenvolupar una plataforma que combini un frontend intuïtiu per descriure escenaris en llenguatge natural, un backend que invoqui models d'IA com els avaluats a PHITSBench, i un motor d'execució al núvol que llanci les simulacions a AWS o Azure. Tot integrat amb sistemes de ciberseguretat per protegir les dades sensibles i amb dashboards de BI/Power BI per visualitzar els resultats de forma interactiva.
La creació d'agents IA és una altra àrea on Q2BSTUDIO pot marcar la diferència. Els agents autònoms, com els que es van provar a PHITSBench, poden iterar sobre les simulacions, corregir errors i optimitzar paràmetres, però requereixen una orquestració acurada i un coneixement del domini que ha de ser codificat en regles o bases de coneixement. El nostre equip pot dissenyar i implementar aquests agents, integrant-los amb catàlegs de coneixement estructurat i APIs de simulació.
A més, l'experiència de Q2BSTUDIO en aplicacions a mida / custom software permet construir solucions completes que no només executin simulacions, sinó que també gestionin el cicle de vida complet: des de la ingesta de dades d'entrada fins a la publicació de resultats, passant pel control de versions dels scripts, la monitorització de costos al núvol i l'auditoria de seguretat. Tot seguint les millors pràctiques de desenvolupament de programari i metodologies àgils.
Tornant a PHITSBench, el fet que els errors es concentrin en l'elecció d'observables físics subratlla la importància de comptar amb bases de coneixement especialitzades. A Q2BSTUDIO, podem ajudar les organitzacions a construir aquestes bases, extraient coneixement de manuals tècnics, articles científics i dades històriques, i estructurant-los en formats que els models d'IA puguin consumir (com grafs de coneixement o embeddings). Això, combinat amb la potència dels models fundacionals i l'escalabilitat del núvol, pot portar la simulació assistida per IA a un nivell professional.
Finalment, no podem oblidar la ciberseguretat. Les simulacions de transport de radiació poden involucrar dades crítiques o regulades, especialment en entorns nuclears o mèdics. Q2BSTUDIO implementa mesures de seguretat en totes les capes: des del xifrat de dades en repòs i en trànsit fins a l'autenticació multifactor i la segmentació de xarxes al núvol. El nostre servei de ciberseguretat inclou auditories i proves de penetració per garantir que la infraestructura sigui robusta davant d'amenaces.
En conclusió, PHITSBench representa un avenç significatiu en l'avaluació de models d'IA per a simulació científica. Els seus resultats demostren que, si bé els models de llenguatge són poderosos, necessiten un ecosistema de suport que inclogui bases de coneixement, execució al núvol i agents intel·ligents. Q2BSTUDIO està preparada per proporcionar aquest ecosistema, combinant la seva experiència en aplicacions a mida, cloud AWS/Azure, ciberseguretat, BI/Power BI i agents IA per ajudar les empreses a aprofitar tot el potencial de la simulació assistida per IA, ja sigui en transport de radiació o en qualsevol altre camp tècnic. El futur de la simulació no és només més intel·ligència artificial, sinó una integració intel·ligent d'eines, dades i coneixement.





