La web oberta ha estat durant dècades un espai de lliure accés per a qualsevol tipus de trànsit, inclosos els bots que indexen contingut per a motors de recerca o que recopilen informació en temps real per a assistents virtuals. No obstant això, aquest escenari està canviant de forma radical. A partir de setembre de 2024, una part significativa dels llocs web començarà a bloquejar per defecte els rastrejadors d'agents d'intel·ligència artificial, és a dir, aquells bots que actuen en nom d'un usuari que espera una resposta immediata. Aquesta decisió, impulsada per un dels principals proveïdors d'infraestructura web, suposa un punt d'inflexió per a empreses que han construït els seus fluxos d'automatització basant-se en la suposició que la web continuaria sent accessible sense restriccions.
El canvi es materialitza en una nova taxonomia que classifica els bots en tres categories: recerca, agent i entrenament. Els rastrejadors de recerca són els que indexen pàgines per respondre consultes de forma diferida, com els de Google o Bing. Els agents són sistemes automatitzats que actuen en temps real per a un usuari, com els bots de ChatGPT que obtenen informació al vol o els agents que naveguen per pàgines per completar tasques. Els d' entrenament són aquells que extreuen contingut per alimentar models de llenguatge. Fins ara, els llocs podien bloquejar-los tots mitjançant un simple interruptor, però a partir del 15 de setembre els valors per defecte canviaran: a les pàgines amb publicitat, els entrenadors i els agents quedaran bloquejats, mentre que els de recerca seguiran permesos. Això afecta tant nous dominis com els clients existents del pla gratuït, llevat que aquests optin per no aplicar la nova configuració.
La lògica darrere d'aquesta mesura és clara: un anunci publicitari és el senyal que una pàgina va ser dissenyada perquè un humà la visiti i consumeixi el seu contingut. Un bot de recerca que envia trànsit de tornada al lloc és considerat una referència vàlida. Però un agent que llegeix la pàgina i entrega la resposta a un tercer sense generar visita directa no aporta valor a l'editor. Per això, els llocs que depenen d'ingressos publicitaris tenen tot el dret a restringir aquest accés. Per a les empreses que despleguen agents d'IA, el problema és immediat: les pàgines amb anuncis són precisament les que contenen notícies, ressenyes, preus de la competència i documentació de productes. Bloquejar aquest accés significa que els agents es trobaran amb silencis o amb respostes construïdes a partir del poc que encara puguin assolir.
Un dels aspectes més complexos d'aquesta transició és la dificultat de separar els bots segons el seu comportament. Googlebot, per exemple, utilitza un mateix rastrejador tant per a recerca com per a entrenament. Si un lloc bloqueja l'entrenament, també bloqueja Googlebot, cosa que perjudica la seva visibilitat en els resultats de recerca. El mateix CEO de Cloudflare ha reconegut que l'objectiu és pressionar els grans actors perquè separin els seus rastrejadors, de manera que els editors puguin prendre decisions més fines. Mentre això no passi, les empreses que gestionen agents propis hauran d'analitzar acuradament quins comptes de Cloudflare es veuran afectats, perquè la classificació és conductual: no n'hi ha prou amb autodeclarar-se com a agent; els sistemes de bloqueig detecten el comportament en temps real.
La solució no passa per canviar el nom de l' user-agent, sinó per negociar l' accés. Estem davant el naixement d'un model de pagament per ús per a contingut web, on els agents d'IA hauran d'obtenir llicències o acords comercials per accedir a pàgines amb publicitat. Ja existeixen startups que estan implementant esquemes de pagament per consulta, on els editors reben una compensació cada vegada que el seu contingut apareix en respostes generades per IA. De fet, més de la meitat del trànsit de rastrejadors d'IA es dedica a tornar a descarregar pàgines que no han canviat, cosa que evidencia ineficiència tant per als agents com per als servidors. Eliminar aquest rebuig mitjançant acords econòmics beneficia ambdues parts.
Per a les organitzacions que vulguin adaptar-se a aquest nou escenari, comptar amb aplicacions a mesura que gestionin l' accés a fonts externes es torna essencial. No es tracta només de configurar un firewall, sinó de dissenyar sistemes d'intel·ligència artificial que sàpiguen quan i com obtenir dades sense violar les noves regles. En Q2BSTUDIO entenem que els agents IA necessiten una arquitectura flexible que pugui integrar permisos dinàmics, caixets intel·ligents i acords de llicència. Per això oferim programari a mesura que permeti a les empreses monitoritzar l'estat de les seves fonts i reaccionar davant bloquejos de forma automatitzada. A més, la nostra experiència en serveis cloud aws i azure garanteix que els agents s'executin en entorns escalables i segurs, adaptant-se a canvis de trànsit i normatives.
La ciberseguretat també juga un paper crucial. En negociar accessos privilegiats a contingut protegit, les empreses s' han d' assegurar que els seus agents no es converteixin en vectors d' atac. Implementar ciberseguretat robusta en la comunicació entre l'agent i l'editor és indispensable per evitar fuites de dades o accessos no autoritzats. En Q2BSTUDIO integrem pràctiques de seguretat en cada capa de desenvolupament, des de l'autenticació fins al xifrat de les sol·licituds.
D'altra banda, l'anàlisi de les dades que recopilen els agents requereix eines de serveis intel·ligència de negoci com power bi, que permetin visualitzar patrons de consum, costos per accés i rendiment de les fonts. Les empreses que despleguen desenes d'agents necessiten panells de control que mostrin en temps real quin contingut s'està utilitzant i quant costa. Això esdevé un input fonamental per optimitzar les estratègies d' obtenció d' informació.
La debilitat d'aquest nou ecosistema rau en la pròpia taxonomia. Les empreses d'intel·ligència artificial són les que declaren quin tipus de bot estan executant, i hi ha un incentiu evident per no classificar un rastrejador com a entrenament si això implica ser bloquejat. La infraestructura de Cloudflare opera a nivell de xarxa, detectant patrons de comportament, però encara no s'ha explicat com evitarà que un agent es disfressi de cercador. Mentre això no es resolgui, els editors hauran de confiar en la bona fe dels desenvolupadors o implementar sistemes de verificació addicionals.
Per a les empreses que estan construint agents avui, el termini fins al setembre és una oportunitat per ordenar els seus fluxos. És recomanable auditar quins comptes de Cloudflare utilitzen, identificar quines pàgines amb anuncis són crítiques per als seus processos i començar a negociar amb els editors. Qui esperi a rebre un error 403 es trobarà reconstruint les seves automatitzacions sobre la marxa. L'accés al web obert ha estat gratuït i il·limitat durant trenta anys, però ara la factura s'ha desglossat. Adaptar-se a aquest nou paradigma no és opcional: és una qüestió de viabilitat per a qualsevol sistema que depengui d' informació externa en temps real.
En aquest context, Q2BSTUDIO es posiciona com un aliat estratègic per a les empreses que necessiten incorporar ia per a empreses de forma segura i eficient. Els nostres serveis abasten des de la consultoria inicial fins al desenvolupament de plataformes completes d'agents, assegurant que cada interacció amb la web estigui alineada amb les noves regles del joc. Si la teva organització està avaluant com obtenir permís perquè els seus rastrejadors continuïn operant, et convidem a explorar les nostres solucions d'intel·ligència artificial i automatització.




