Vaig provar GPT-5 i no va ser com esperava

Proves reals de GPT-5 davant de GPT-4.1 amb OpenAI Responses API: latència, flux end-to-end i recomanacions per optimitzar desenvolupament de programari

domingo, 17 de agosto de 2025 • 5 min de lectura • Equip Q2BSTUDIO

Intel·ligència-Artificial-

OpenAI acaba de llançar el seu nou model de raonament GPT-5 i l'expectació és alta per la seva capacitat per a tasques complexes i el seu potencial en desenvolupament de programari. En aquest article tradueixo i resumeixo una prova real d'ús per desenvolupadors que vaig fer fent servir la Responses API d'OpenAI en un projecte personal anomenat mycaminoguide i en una aplicació independent que analitza dades de clients extretes amb Airbyte Embedded MCP.

Avís important: aquestes proves no són científiques ni exhaustives. Buscava mesurar un ús real i mitjà per part d'un desenvolupador en casos d'ús concrets.

Prova 1 end to end: l'aplicació està escrita en Python amb front end a Streamlit i fa servir Airbyte Embedded MCP per obtenir factures de Stripe en nom d'un client. El flux consisteix a obtenir un token Bearer, cridar el MCP per portar les dades i després passar aquestes dades a la Responses API perquè el model les analitzi. El codi principal té al voltant de 114 línies. En executar tres vegades amb GPT 4.1 els temps van ser 29.85 segons, 15.38 segons i 13.56 segons. En canviar només el model a GPT 5 els temps van ser 77.72 segons, 57.72 segons i 83.40 segons. Aquests resultats van ser sorprenents perquè GPT 5 va ser molt més lent en aquest escenari d'encadenar MCP i anàlisi amb el model.

Prova 2 eliminant la variància: per assegurar que el retard no venia per crides a MCP o a Stripe, vaig separar la crida a MCP i després vaig injectar les dades directament al prompt. Vaig mantenir temporitzadors per a la crida proxy i per a la crida a OpenAI. Amb GPT 4.1 les crides proxy van trigar 6.71, 6.74 i 6.93 segons i la crida a OpenAI va trigar 9.87, 10.31 i 9.62 segons. Amb GPT 5 les crides proxy van ser 7.85, 7.01 i 7.11 segons mentre que la crida a OpenAI va trigar 80.01, 46.05 i 48.06 segons. En altres paraules, la latència atribuïble al model fent servir la Responses API amb GPT 5 va ser dramàticament més gran i la crida proxy va mostrar poca variació, cosa que suggereix que el problema era durant la interacció amb l'API i el model.

Prova 3 la Responses API introdueix la variància: per descartar que fos un problema del flux de l'API vaig fer servir la mateixa cadena de dades i vaig provar el mateix prompt directament des de ChatGPT amb GPT 4o i GPT 5. El prompt sol·licitava una anàlisi de factures i que el model informés exactament quant de temps va trigar en segons amb dos decimals. Amb ChatGPT els temps reportats per GPT 4o van ser 4.92, 5.32 i 3.47 segons. Amb GPT 5 els temps van ser 38.82, 36.78 i 34.62 segons. Observació: ChatGPT semblaria mesurar el temps incloent la generació de la resposta a pantalla, per la qual cosa els temps que imprimeix el propi model poden incloure la fase de tecleig visual, però la diferència de magnitud entre 4o i 5 continua sent notable.

Conclusió provisional: en les meves proves de desenvolupador i en escenaris reals d'integració amb dades de clients, GPT 5 es va comportar significativament més lent que GPT 4.1 i GPT 4o a través de la Responses API. No he comparat la qualitat de sortida en detall; és possible que GPT 5 ofereixi raonaments més profunds que requereixin més temps. Una altra hipòtesi és que GPT 5 estigui patint una major càrrega d'ús en el moment de les proves. Queden proves obertes com comparar GPT 5 amb versions open source o GPT 5 mini per filtrar càrregues de servidor i veure si el comportament es manté.

A Q2BSTUDIO com a empresa de desenvolupament de programari i aplicacions a mida seguim molt pendents d'aquests avenços. Som especialistes en programari a mida, aplicacions a mida i intel·ligència artificial aplicada a empreses. Oferim serveis integrals que inclouen ciberseguretat, serveis cloud aws i azure, serveis d'intel·ligència de negoci i solucions amb power bi. Treballem a integrar agents IA i solucions d'ia per a empreses que aportin valor real en processos de presa de decisions i automatització.

Si ets empresa i t'interessa millorar els teus processos amb intel·ligència artificial podem ajudar-te a avaluar models segons criteris de rendiment, cost i qualitat. En projectes on la latència és crítica podem proposar alternatives com optimització de prompts, batching, ús de models lleugers o desplegaments privats per reduir temps de resposta. El nostre equip domina la integració d'agents IA, power bi per a visualització i pipelines de dades segurs al núvol amb focus en ciberseguretat.

Recomanacions pràctiques després d'aquestes proves: 1) mesurar sempre la latència en escenaris reals de producció abans de triar un model per a l'aplicació, 2) considerar cost-benefici si la millora en raonament compensa la major latència, 3) provar models alternatius i arquitectures que desacoblin la recollida de dades i l'avaluació del model per controlar la variació, i 4) monitoritzar ús i latència per detectar pics de càrrega que afectin el servei.

A Q2BSTUDIO estem disponibles per assessorar en projectes de desenvolupament a mida, integració d'intel·ligència artificial, desplegaments segurs en serveis cloud aws i azure, projectes d'intel·ligència de negoci i solucions de ciberseguretat. Si vols construir agents IA, millorar processos amb ia per a empreses o crear informes interactius amb power bi, podem col·laborar per dissenyar una solució escalable i adaptada al teu negoci.

Per ara continuaré provant i afinant. A curt termini continuaré desenvolupant amb GPT 4 per mantenir temps de resposta acceptables i reservant proves amb GPT 5 per a casos on una major profunditat de raonament pugui justificar la latència. Si t'interessa que fem proves similars a la teva infraestructura o que avaluem models per al teu cas d'ús, contacta amb Q2BSTUDIO i parlem sobre aplicacions a mida, programari a mida i intel·ligència artificial aplicada.

UNA PAUSA?

Juga una estona abans de marxar

ELS NOSTRES SERVEIS

Com et podem ajudar

Tens un projecte en ment?

Explica'ns la teva visió i la convertim en una solució de programari. Sigui quin sigui l'abast, fem realitat la teva idea.