Disseny de prompts a escala: format, instruccions i context en LLMs

Descobreix com el format, el nombre d'instruccions i la longitud del context afecten l'adherència i les al·lucinacions en models de llenguatge. Estudi amb

jueves, 23 de julio de 2026 • 4 min de lectura • Equip Q2BSTUDIO

Cómo el formato y número de instrucciones afectan a los LLMs

El disseny d'indicacions (prompts) en models de llenguatge de gran escala (LLMs) combina art i ciència, però fins ara moltes decisions clau es prenien sense evidència controlada. Un estudi recent, basat en un corpus sintètic lliure de contaminació (el 'Llibre de Veyra'), examina tres factors crítics: el format de les instruccions (markdown, text pla, prosa o tabular), la quantitat d'instruccions simultànies que pot gestionar un prompt del sistema abans que el compliment es degrade, i la quantitat de context que un model pot retenir abans que la precisió i l'honestedat disminueixin. Els resultats, avaluats en cinc models, revelen troballes sorprenents amb implicacions directes per a empreses que busquen integrar IA de forma eficient.

En el primer experiment, amb 960 crides per model, es va observar que la taxa de respostes perfectes col·lapsava a zero quan el nombre de regles arribava a 80, independentment del format, la col·locació (prompt del sistema vs. torn d'usuari) o el model utilitzat. El format no va mostrar un avantatge clar: ni el markdown ni el text pla van destacar de manera consistent; de fet, un model de 35B va preferir el text pla. La col·locació de les instruccions va generar efectes tan grans com el format al límit de 160 regles, però la direcció va variar segons el model. Això suggereix que no existeix una recepta universal i que les empreses han de provar i adaptar les seves estratègies de prompting segons el model específic que utilitzin.

El segon experiment, amb 5.520 crides per model, va avaluar la precisió de record, la sicofània de premisses falses i la fabricació de fets absents al llarg d'una escala de context de 2k a 512k tokens. La precisió de record es va mantenir prop del sostre fins als 64-128k tokens, per després degradar-se de forma abrupta i depenent del format: en un model, la diferència de precisió va arribar a 48 punts en 128k tokens. Sorprenentment, no es va detectar fabricació en cap de les 5.760 proves, i la sicofània es va mantenir per sota del 8,3%. El que sí que va augmentar dràsticament prop del sostre de context de cada model va ser la negativa a respondre, passant del 0% al 79-90%. Aquest comportament és qualitativament diferent de la fabricació o la sicofània, i representa un risc operatiu per a aplicacions que requereixen alta disponibilitat de resposta.

Per a una empresa que desenvolupa solucions basades en IA, aquestes troballes són una crida a l'acció. No n'hi ha prou amb llançar un prompt ben redactat; cal considerar l'arquitectura del sistema, la gestió del context i l'elecció del model. A Q2BSTUDIO, com a empresa de desenvolupament de programari i tecnologia, entenem que la integració de intel·ligència artificial en processos de negoci ha de basar-se en dades empíriques i no en suposicions. Per això oferim serveis de consultoria i desenvolupament d'aplicacions a mida que permeten als nostres clients dissenyar sistemes de prompting robustos, capaços de gestionar centenars d'instruccions i contextos extensos sense perdre fiabilitat.

La investigació també subratlla la importància de la infraestructura. L'ús de serveis cloud com AWS o Azure facilita l'escalabilitat dels experiments de prompting i la monitorització del comportament del model en entorns productius. A més, la integració amb eines de Business Intelligence (BI) i Power BI permet visualitzar mètriques de rendiment com la taxa de rebuig o la precisió de record, ajudant a prendre decisions informades sobre quan retallar el context o ajustar el nombre d'instruccions.

Un altre aspecte rellevant és la ciberseguretat. Quan un model es nega sistemàticament a respondre prop del seu límit de context, pot ser senyal d'un comportament inesperat que podria explotar-se si no es gestiona adequadament. Per això, a Q2BSTUDIO incorporem pràctiques de ciberseguretat i pentesting en els nostres desenvolupaments d'IA, assegurant que els agents IA siguin robustos davant manipulacions i mantinguin la integritat de les dades.

En resum, el disseny de prompts a escala no és una tasca trivial. Els resultats d'aquest estudi ofereixen una guia basada en evidència que tota organització hauria de considerar. A Q2BSTUDIO, combinem la nostra experiència en aplicacions a mida, cloud computing, BI i ciberseguretat per ajudar les empreses a navegar aquest complex panorama. Ja sigui implementant agents IA que gestionin centenars d'instruccions simultànies o desplegant sistemes que gestionin contextos de fins a 128k tokens sense pèrdua de precisió, el nostre enfocament se centra en resultats mesurables i fiables. Per a aquelles companyies que busquen aprofitar el potencial dels LLMs sense caure en les trampes del disseny amateur, la col·laboració amb un soci tecnològic especialitzat és la clau de l'èxit.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.