La col·laboració entre humans i intel·ligència artificial en la creació de contingut textual ha crescut de forma exponencial. Empreses de tots els sectors recorren a assistents basats en models de llenguatge (LLM) per redactar informes, correus, articles i fins a documentació tècnica. No obstant això, aquesta pràctica planteja un repte fonamental: com distingir quines parts d’un document han estat generades per una màquina i quines per una persona? La resposta no té només implicacions acadèmiques o d’autoria, sinó que afecta directament la integritat dels processos empresarials, la ciberseguretat i la confiança en els sistemes automatitzats.
Fins ara, la majoria dels detectors de text generat per IA se centraven a classificar documents complets com a “generats” o “humans”. Aquest enfocament binari resulta insuficient quan un mateix text conté aportacions mixtes: un paràgraf escrit per un expert humà, un altre polxit per un LLM, i una conclusió generada íntegrament per una màquina. Per abordar aquesta necessitat, sorgeix una nova generació de mètodes que operen a nivell de token, la unitat bàsica dels models de llenguatge moderns. La idea és assenyalar amb precisió cada fragment sospitós, de manera similar a com ho faria un corrector ortogràfic però orientat a identificar patrons de generació automàtica.
Un dels enfocaments més prometedors consisteix a suavitzar les puntuacions de detecció de tokens veïns per reduir la variabilitat, aplicant regles adaptatives com el mètode de Lepski per triar l’amplada de banda òptima segons l’estructura local d’autoria. Aquesta tècnica no requereix dades etiquetades a nivell de token durant l’entrenament, cosa que la fa especialment pràctica en escenaris reals on les dades són escasses o cares d’obtenir. A més, aconsegueix un equilibri entre sensibilitat i especificitat, minimitzant l’error quadrat mitjà en l’estimació del senyal subjacent.
Des d’una perspectiva empresarial, la capacitat de detectar tokens generats per LLM en textos coautorats té aplicacions directes en la verificació de continguts, l’auditoria d’informes generats per assistents virtuals i la protecció contra suplantació d’identitat literària. Per exemple, en l’àmbit de la ciberseguretat, identificar fragments generats per IA pot ajudar a detectar atacs de phishing automatitzats o campanyes de desinformació. De la mateixa manera, en entorns corporatius on s’utilitzen agents IA per redactar respostes a clients, és crucial saber quines parts del diàleg són automàtiques per mantenir la transparència i el compliment normatiu.
A Q2BSTUDIO, com a empresa de desenvolupament de programari i tecnologia, entenem que la integració d’aquestes capacitats en els sistemes existents requereix un enfocament sòlid i personalitzat. Per això oferim serveis de aplicacions a mida que permeten incorporar mòduls de detecció de tokens generats per IA en plataformes de gestió documental, sistemes CRM o eines de Business Intelligence. La combinació de BI/Power BI amb algoritmes de detecció d’autenticitat textual obre la porta a quadres de comandament que monitoritzen en temps real la proporció de contingut generat per màquines en els fluxos de treball.
La infraestructura necessària per executar aquests models de manera eficient sol desplegar-se al núvol. Aquí és on entren en joc les plataformes cloud com AWS o Azure, que proporcionen l’escalabilitat i els recursos computacionals per processar grans volums de text. Des de Q2BSTUDIO oferim serveis de cloud AWS/Azure per desplegar pipelines de detecció en temps real, garantint baixa latència i alta disponibilitat. A més, la integració amb sistemes d’automatització permet que les alertes generades per aquests detectors disparin accions correctives, com la revisió manual d’un document sospitós.
La investigació actual en detecció a nivell de token avanca cap a mètodes més robustos que puguin gestionar diferents idiomes, estils i longituds de context. La tècnica de suavitzat amb regla adaptativa de Lepski, esmentada anteriorment, és només un exemple de com l’estadística clàssica pot combinar-se amb el processament del llenguatge natural per obtenir resultats pràctics. La validació empírica mostra que aquest enfocament supera línies base tradicionals tant en conjunts de dades sintètics com en corpus reals de coautoria humà-IA.
Per a les empreses, implementar aquest tipus de solucions no és només una qüestió de transparència, sinó també de vantatge competitiu. Poder garantir l’autenticitat dels documents que es generen internament o que es reben de tercers enforteix la confiança dels clients i socis. A més, en sectors regulats com la banca o la salut, la capacitat d’auditar l’origen de cada token pot ser un requisit legal.
A Q2BSTUDIO apostem per un enfocament integral que combina desenvolupament de programari a mida, intel·ligència artificial, ciberseguretat, cloud computing i Business Intelligence. El nostre equip treballa colze a colze amb les organitzacions per dissenyar i implementar sistemes de detecció de contingut generat per IA que s’adaptin a les seves necessitats específiques. Ja sigui integrant un mòdul d’anàlisi de tokens en una aplicació existent o construint des de zero un pipeline de detecció al núvol, oferim solucions escalables, segures i eficients.
En conclusió, la detecció de tokens generats per LLM en textos coautorats humà-IA representa un camp en plena expansió amb un enorme potencial pràctic. Els mètodes a nivell de token, com els basats en suavitzat adaptatiu, permeten una granularitat que els classificadors documentals no poden aconseguir. Per a les empreses, adoptar aquestes tecnologies no és opcional si volen mantenir la integritat i la transparència en un món on la IA col·labora cada cop més en l’escriptura. A Q2BSTUDIO estem preparats per ajudar-vos a fer aquest pas, combinant experiència tècnica amb un profund coneixement del negoci.





