La seguretat en intel·ligència artificial s'ha convertit en una prioritat estratègica per a les empreses que integren models de llenguatge en els seus fluxos de treball. Un dels vectors d'atac més preocupants és el prompt injection, una tècnica que permet manipular la sortida d'un model inserint instruccions malicioses dins de dades aparentment inofensives. OpenAI ha fet un pas endavant amb GPT-Red, un model intern de red-teaming automatitzat que no només iguala, sinó que supera els equips humans en la detecció d'aquestes vulnerabilitats. En aquest article analitzem el seu funcionament, les seves descobertes i el que significa per a la ciberseguretat empresarial.
Per entendre la magnitud de l'avanç, cal recordar que els sistemes basats en agents —com assistents que llegeixen correus, naveguen per la web o interactuen amb eines— amplien la superfície d'atac. Un atacant pot incrustar una ordre en un fitxer, un banner web o el cos d'un correu electrònic, i el model l'executarà si no està degudament protegit. Els mètodes tradicionals de red-teaming humà són lents, costosos i no escalen. Els benchmarks de robustesa, per la seva banda, ja estan saturats en els models més recents. OpenAI necessitava un enfocament diferent.
GPT-Red no és un benchmark estàtic ni una biblioteca de prompts. És un model entrenat mitjançant aprenentatge per reforç amb auto-joc (self-play RL). En cada ronda, un atacant (GPT-Red) envia un prompt, observa la resposta del defensor i ajusta la seva estratègia per aconseguir un objectiu: provocar una injecció exitosa. Els defensors són una col·lecció diversa de models LLM que, al seu torn, reben recompensa per resistir l'atac sense deixar de completar la seva tasca original. Aquest equilibri és clau: un defensor no pot simplement rebutjar-ho tot, perquè ha de seguir sent funcional.
L'entrenament es realitza en múltiples entorns que simulen amenaces reals: GPT-Red pot controlar part d'un fitxer local, un banner de pàgina web, el cos d'un correu electrònic o la sortida d'una eina. A mesura que els defensors s'endureixen, l'atacant descobreix atacs més forts i diversos. Al final de l'entrenament, GPT-Red aconsegueix vulnerar gairebé tots els models contra els que s'enfronta, incloent versions internes i de producció fins a GPT-5.5.
Una de les descobertes més rellevants de GPT-Red és el Fake Chain-of-Thought (cadena de pensament falsa). Aquesta nova classe d'atac directe consisteix a inserir una entrada falsa dins de la traça de raonament del model objectiu. El model actua llavors sobre informació que creu haver verificat, quan en realitat ha estat manipulada. OpenAI considera que és una classe de vulnerabilitat mai vista abans pels seus investigadors. A partir d'aquesta descoberta, el Fake Chain-of-Thought es va incorporar com a objectiu d'entrenament per als defensors.
Els resultats quantitatius són contundents. En un escenari d'injecció indirecta replicat del treball de Dziemian et al. (2025), GPT-Red va aconseguir vulnerar GPT-5.1 en el 84% dels casos, davant del 13% dels red-teamers humans. En atacs directes de Fake Chain-of-Thought, la taxa d'èxit va superar el 95% contra GPT-5.1, tot i que va descendir per sota del 10% en GPT-5.6 Sol. En benchmarks d'injecció directa, el model GPT-5.6 Sol va mostrar sis vegades menys errors que el millor model de producció d'OpenAI quatre mesos abans. A més, en benchmarks indirectes (eines de desenvolupament, navegació), GPT-5.6 Sol va saturar la precisió per sobre del 97%.
OpenAI també va realitzar estudis de cas reals. En el primer, van atacar un sistema de venda automàtica (Vendy) basat en IA a les seves oficines. GPT-Red va canviar el preu d'un producte a 0,50 $, va demanar un article nou per 0,50 $ i va cancel·lar una comanda d'un altre client. En el segon cas, van atacar un agent Codex CLI basat en GPT-5.4 mini, aconseguint una taxa d'exfiltració de dades més alta i eficient que la línia base humana. Ambdós casos demostren que els atacs funcionen en sistemes reals, no només en laboratoris.
Per a les empreses que desenvolupen programari amb components d'IA, aquestes descobertes subratllen la importància d'integrar proves de seguretat automatitzades des de les fases primerenques del desenvolupament. No es tracta només de protegir el model, sinó de dissenyar tota la infraestructura amb defenses en capes. Aquí és on empreses com Q2BSTUDIO aporten valor. Amb experiència en aplicacions a mida, poden construir sistemes que incorporin mecanismes de detecció d'injeccions, validació d'entrades i segmentació de dades sensibles.
La ciberseguretat en entorns d'IA requereix un enfocament proactiu. GPT-Red demostra que els atacants automatitzats poden trobar vulnerabilitats que els humans passen per alt. Les empreses han de considerar serveis especialitzats en pentesting i anàlisi de seguretat per avaluar els seus sistemes. A més, la infraestructura al núvol juga un paper crític. En utilitzar cloud AWS o Azure, és possible desplegar entorns aïllats per a proves de red-teaming sense comprometre les dades de producció.
Un altre aspecte rellevant és la intel·ligència artificial aplicada a la intel·ligència de negoci. Els atacs de prompt injection no només afecten chatbots, sinó també sistemes de BI que utilitzen models de llenguatge per generar informes o consultes. Un atac podria manipular mètriques o filtrar dades estratègiques. Integrar solucions de Power BI amb agents d'IA segurs és una tendència creixent, i Q2BSTUDIO ofereix consultoria per implementar aquestes arquitectures amb les màximes garanties.
Finalment, l'automatització de processos mitjançant agents IA és una de les àrees més prometedores, però també la més exposada. Un agent que llegeix correus i fitxers pot ser vulnerable si no s'audita constantment. GPT-Red ens recorda que l'automatització ha d'anar acompanyada de proves contínues. Q2BSTUDIO ajuda les empreses a dissenyar fluxos automatitzats que incloguin controls de seguretat, utilitzant la seva experiència en automatització de processos.
En conclusió, GPT-Red marca una fita en la lluita contra les injeccions de prompt. La seva capacitat per descobrir atacs nous com el Fake Chain-of-Thought i el seu rendiment superior al humà indiquen que el futur de la seguretat en IA passa per models que aprenen a atacar-se a si mateixos. Les empreses que vulguin mantenir-se al capdavant han d'adoptar estratègies de red-teaming automatitzat, avaluar la seva infraestructura al núvol i comptar amb socis tecnològics com Q2BSTUDIO, que ofereixen solucions integrals en desenvolupament de programari, ciberseguretat, intel·ligència artificial i business intelligence.



