En el desenvolupament d'aplicacions basades en intel·ligència artificial, la qualitat dels prompts és un factor determinant per a l'èxit de qualsevol sistema conversacional o generatiu. Malgrat això, la majoria d'equips optimitzen les seves indicacions de manera intuïtiva: ajusten frases, proven amb tres exemples i despleguen. Setmanes després descobreixen degradacions en casos límit i han de revertir els canvis. Aquest procés no només és ineficient, sinó que manca de rigor científic. Les proves A/B de prompts ofereixen una alternativa mesurable, sistemàtica i reproduïble que elimina les conjectures i converteix l'optimització de prompts en una disciplina basada en dades.
L'avaluació manual de prompts pateix tres errors sistemàtics. El primer és l'error de mostra petita: verificar només cinc o deu exemples no detecta problemes subjacents. Un prompt pot funcionar bé en consultes senzilles i fallar en les complexes, però amb una mostra reduïda la probabilitat de passar per alt una degradació del 20% és superior al 33%. El segon és el biaix de confirmació: qui escriu el prompt selecciona inconscientment exemples on la nova versió es veu millor. No és mala intenció, és un biaix cognitiu que només s'elimina amb avaluació cega sobre una mostra aleatòria. El tercer és l'absència de línia base: sense un registre previ és impossible saber si la nova versió va millorar realment alguna cosa. Afirmar que 'les respostes semblen més precises' no és una mètrica; en canvi, passar de 0,82 a 0,87 en fidelitat sobre 200 exemples sí que ho és. Les proves A/B resolen aquests tres problemes mitjançant un dataset fix, una avaluació automatitzada i una verificació estadística de la diferència.
L'arquitectura d'una prova A/B de prompts difereix de la d'un producte digital. Mentre que en un producte es mesura el comportament de l'usuari (CTR, conversió), en un prompt es mesura la qualitat de les sortides del model. Els usuaris poden no estar involucrats directament. El pipeline consta de tres components: dataset, execució i avaluació. Cadascun requereix atenció específica. El dataset és la base de l'experiment: conté entrades, opcionalment sortides esperades, i metadades com categoria o complexitat. La mida mínima depèn de l'efecte esperat: per a canvis grans (efecte >0,15) n'hi ha prou amb 50–100 exemples; per a canvis mitjans (0,05–0,15) calen 200–500; i per a ajustos fins (
Les estratègies de construcció del dataset inclouen el mostreig aleatori de producció (el més rellevant), el mostreig estratificat que preserva les proporcions per categoria, i l'augmentació adversarial que afegeix casos difícils i límit que rarament apareixen en producció però són crítics per a la qualitat. En la fase d'execució, cada element del dataset es passa per ambdues variants del prompt. És imprescindible controlar les variables: mateix model (amb identificador exacte, no només 'gpt-4o'), mateixa temperatura (preferiblement 0 o entre 0,1 i 0,3), mateix seed si el proveïdor ho permet (per exemple, OpenAI), i mateix límit de tokens. D'aquesta manera, cap variant guanya simplement per ser més llarga o per utilitzar una aleatorietat diferent.
Les mètriques de qualitat es divideixen en dues categories: deterministes i basades en models de llenguatge (LLM-as-Judge). Les mètriques deterministes són ràpides, gratuïtes i completament reproduïbles, però cobreixen un conjunt limitat d'aspectes. Inclouen ROUGE-L per a coincidència de subseqüència comuna més llarga (útil en resums), BLEU per a superposició de n-grames (traduccions), coincidència exacta (classificació), validesa JSON (sortides estructurades), latència i recompte de tokens. Les mètriques LLM-as-Judge avaluen qualitat semàntica mitjançant una crida addicional a un model jutge. Exemples clau són la rellevància de la resposta (com aborda la pregunta), la fidelitat (com de fonamentada està en el context proporcionat, essencial en sistemes RAG) i mètriques personalitzades mitjançant G-Eval. G-Eval permet descriure un criteri en llenguatge natural i generar passos de raonament per puntuar aspectes específics com el compliment de marca, el to professional o la inclusió de descàrrecs legals. A Q2BSTUDIO, com a empresa especialitzada en desenvolupament d'aplicacions a mida i solucions d'intel·ligència artificial, apliquem aquest tipus de mètriques personalitzades per garantir que els assistents virtuals s'alineïn amb la identitat corporativa dels nostres clients.
Escollir les mètriques adequades és crucial. No s'ha de provar tot alhora; cada prova A/B verifica una hipòtesi concreta. Per exemple, si la hipòtesi és 'el nou prompt respon preguntes amb més exactitud', les mètriques apropiades són rellevància i fidelitat. Si es busca que les respostes siguin més concises sense perdre qualitat, es comparan el recompte de tokens i la rellevància. Per avaluar el to professional, s'utilitza G-Eval amb criteris personalitzats. Un cop obtingudes les puntuacions, cal determinar si la diferència és real o fruit de l'atzar. Per a mètriques contínues entre 0 i 1, s'empra la prova t aparellada o la prova de Wilcoxon de rangs amb signe (no paramètrica). La prova aparellada és adequada perquè ambdues variants s'avaluen sobre les mateixes entrades. La mida de l'efecte es calcula amb la d de Cohen. Un valor p inferior a 0,05 juntament amb una d de Cohen superior a 0,5 indica una millora significativa i substancial. Si p < 0,05 però d < 0,2, la diferència és estadísticament significativa però pràcticament irrellevant, i potser no mereix el risc del desplegament. A més, si s'avaluen diverses mètriques simultàniament, s'ha d'aplicar la correcció de Bonferroni per evitar falsos positius.
La integració d'aquestes proves en un flux de CI/CD permet que cada canvi en els prompts es validi automàticament abans d'arribar a producció. Un pipeline típic detecta quins prompts es van modificar, executa la prova A/B amb el dataset d'avaluació, calcula les mètriques i pren una decisió: aprovar si la nova versió no empitjora respecte a la línia base més enllà d'un llindar (per exemple, 2% de degradació), o rebutjar i notificar a l'equip. Aquesta automatització redueix el temps de cicle d'optimització de setmanes a hores i evita regressions no detectades. A Q2BSTUDIO combinem aquestes pràctiques amb agents d'IA i solucions cloud a AWS/Azure, així com amb plataformes de BI com Power BI, per oferir sistemes d'intel·ligència artificial robustos, escalables i mesurables. La ciberseguretat també és un pilar fonamental: garantim que les dades utilitzades en les proves compleixin amb els estàndards de protecció i privacitat.
Hi ha patrons que funcionen i d'altres que s'han d'evitar. Entre els primers, destaca canviar una sola variable per prova: si es modifiquen simultàniament el prompt del sistema i els exemples de few-shot, no es pot atribuir el resultat a cap canvi concret. També és recomanable analitzar els resultats per segments (categories, complexitat, idioma), ja que una variant pot ser superior en consultes tècniques però inferior en facturació. Així mateix, convé avaluar el cost econòmic: una millora del 3% en qualitat no justifica un augment del 40% en tokens d'entrada. Entre les males pràctiques hi ha provar sobre exemples que ja estan al prompt (contaminació del dataset), ignorar la variància (una mitjana de 0,85 amb desviació 0,25 és pitjor que 0,82 amb desviació 0,05), aturar-se prematurament en veure millora als primers 50 exemples (poden pertànyer a una mateixa categoria fàcil) i escollir resultats favorables sense corregir comparacions múltiples. La clau és definir la mètrica principal per endavant i documentar cada experiment.
En resum, les proves A/B de prompts proporcionen un mètode científic per millorar la interacció amb models de llenguatge. Amb un dataset representatiu, variables controlades, mètriques adequades i anàlisi estadística, qualsevol equip pot optimitzar els seus prompts amb confiança. No cal una infraestructura complexa: un conjunt de 100 exemples de producció, una mètrica i una prova estadística són suficients per superar l'assaig i error intuïtiu. A Q2BSTUDIO, com a empresa de desenvolupament de programari i tecnologia, apliquem aquests principis en cada projecte d'intel·ligència artificial, ja sigui per a chatbots, assistents virtuals, automatització de processos o sistemes de recomanació. Combinem el rigor de les proves A/B amb la nostra experiència en aplicacions a mida, cloud AWS/Azure, ciberseguretat i Business Intelligence (Power BI), oferint solucions que no només funcionen, sinó que milloren de forma contínua i mesurable. El futur de la IA conversacional passa per l'experimentació disciplinada; les proves A/B són el primer pas cap a una optimització basada en evidències.




