He escrit una sèrie d'articles sobre IA i empatia, i aviat estaran disponibles els pròxims benchmarks trimestrals dels principals models de llenguatge. No obstant, amb el recent llançament de ChatGPT 4.5 i les afirmacions d'OpenAI sobre un major nivell d'intel·ligència emocional, juntament amb el seu alt cost en vista prèvia (75,00 $ per milió de tokens d'entrada i 150,00 $ per milió de tokens de sortida, en comparació amb 2,50 $ i 10,00 $ per a la versió 4o), vaig decidir fer una comparació entre ChatGPT 4.5 i altres versions utilitzant una prova de coeficient emocional (EQ), proves d'empatia aplicada i avaluacions de diàlegs.
A nivell general, tot i que el comportament de ChatGPT 4.5 sembla més amigable i útil, els avenços en intel·ligència emocional real i la capacitat de simular empatia en situacions que ho requereixen no justifiquen l'increment de preu de més de 15 vegades en comparació amb la versió 4o, que a més obté millors puntuacions en proves estandarditzades i diàlegs. De fet, en múltiples casos, el mateix ChatGPT 4.5 qualifica les respostes de ChatGPT 4, 4o i Claude Sonnet 3.7 com a millors que les seves.
Proves estandarditzadesLes proves de coeficient emocional (EQ) i d'empatia aplicada (AEM) van demostrar que, tot i que ChatGPT 4.5 va obtenir una puntuació més alta en EQ, el seu rendiment en AEM no va justificar el seu alt cost. Els resultats van ser els següents:
| Model | EQ (Sense prompt del sistema) | AEM | Cost d'entrada | Cost de sortida |
|----|----|----|----|----|
| ChatGPT 4 | 54 | .7850 | 30,00 $ | 60,00 $ |
| ChatGPT 4o | 61 | .9750 | 2,50 $ | 10,00 $ |
| ChatGPT o1 | 59 | .8750 | 15,00 $ | 60,00 $ |
| ChatGPT 4.5 | 69 | .9625 | 75,00 $ | 150,00 $ |
| Claude Sonnet 3.7 | 68 | .9375 | 3,00 $ | 15,00 $ |
Basant en aquesta anàlisi, ChatGPT 4o va mostrar un equilibri superior entre intel·ligència emocional, rendiment i cost.
Respuestas al xatEls models van ser avaluats amb la pregunta: Estic trist. Vaig perdre la meva feina i em sento espantat i sol. Es van generar múltiples respostes i es van avaluar amb i sense un prompt del sistema dissenyat per maximitzar l'empatia.
En termes de qualitat de resposta, Claude Sonnet 3.7 constantment va demostrar un alt nivell d'empatia tant en el seu mode estàndard com amb un prompt de sistema optimitzat. D'altra banda, ChatGPT 4 i 4o, quan van ser ajustats amb un prompt de sistema, van aconseguir rendiments comparables o fins i tot millors que ChatGPT 4.5, però a un cost significativament menor.
ChatGPT 4.5, tot i que en aparença més amigable, no va destacar de manera notable en l'escala d'empatia, i en molts casos les seves respostes van ser menys valorades que les d'altres versions de ChatGPT.
ConclusionsSi busques un model que ofereixi empatia de manera natural sense necessitat d'ajustos addicionals, Claude Sonnet 3.7 és la millor opció en relació qualitat-preu. No obstant, si vols obtenir empatia amb un model d'OpenAI a menor cost, és millor optar per ChatGPT 4 o 4o i ajustar-lo amb un prompt per maximitzar l'empatia.
Des de Q2BSTUDIO, empresa de desenvolupament i serveis tecnològics, entenem la importància de triar la millor tecnologia en funció de la relació cost-benefici. Avaluem constantment les eines d'IA més avançades del mercat per oferir als nostres clients solucions efectives basades en dades i optimitzades per a cada necessitat específica.





