En el panorama actual del comerç digital, oferir recomanacions personalitzades i rellevants en temps real s'ha convertit en un factor diferencial per a la retenció i satisfacció dels usuaris. No obstant això, construir un sistema de recomanació capaç de processar milions de sol·licituds per segon, mantenir la frescor de les dades i controlar els costos d'infraestructura suposa un repte tant d'orquestració com de machine learning. A Q2BSTUDIO, com a empresa especialitzada en desenvolupament de programari a mida i solucions cloud, hem dissenyat i implementat arquitectures que combinen processament per lots amb capacitats en temps real, aprofitant l'ecosistema d'AWS per oferir experiències personalitzades a gran escala.
Aquest article explora com construir un sistema de recomanació escalable seguint un enfocament 'batch-first' (primer per lots) i estenent-lo progressivament amb components en temps real. L'arquitectura es recolza en serveis com AWS Lake Formation, Amazon Managed Workflows for Apache Airflow (MWAA), Amazon Athena, AWS Glue, Amazon SageMaker, Amazon DynamoDB i Amazon MemoryDB, tots orquestrats per aconseguir un equilibri entre eficiència operativa i latència mínima. A més, s'aborda com integrar senyals d'intel·ligència artificial i agents IA per enriquir el perfil de l'usuari sense disparar els costos.
Fonaments d'una arquitectura batch-firstLa majoria dels sistemes de recomanació comencen amb un pipeline per lots que processa dades històriques —catàlegs, transaccions, embeddings— i genera llistes de candidats que s'emmagatzemen en una base de dades de baixa latència. Aquest enfocament és fiable, econòmic i fàcil de depurar. En la nostra experiència, el primer pas és construir un data lake centralitzat que serveixi com a única font de veritat. Amb AWS Lake Formation i Amazon S3, creem conjunts de dades 'golden' (depurats i validats) accessibles de forma segura des de múltiples comptes d'AWS. Això elimina la duplicació de dades i garanteix que tots els pipelines (formació de models, inferència batch, dashboards de BI) treballin sobre la mateixa informació.
L'orquestració recau en Amazon MWAA, que gestiona fluxos de treball complexos definits en codi Python. Cada pipeline segueix un patró consistent: extracció de dades mitjançant Amazon Athena, transformacions intensives amb AWS Glue (PySpark), formació de models i vector search amb Amazon SageMaker, i publicació de resultats a DynamoDB. Per accelerar el desenvolupament, creem operadors personalitzats reutilitzables que encapsulen lògica comuna (gestió de rols IAM, escriptura en rutes S3 per convenció, reintents automàtics). A Q2BSTUDIO apliquem aquesta mateixa filosofia en desenvolupar aplicacions a mida: inverteix en components reutilitzables perquè els equips puguin llançar noves funcionalitats en dies, no setmanes.
Un aspecte clau és l'aïllament per mercat. Cada marketplace s'executa en el seu propi grup de tasques dins del DAG, de manera que una fallada en un no afecta els altres. Els pipelines s'executen seqüencialment per evitar contenció de recursos en treballs pesats de SageMaker i Glue. Tot l'intercanvi de dades entre passos es realitza mitjançant rutes S3 implícites, sense necessitat d'adreces codificades.
De batch a temps real: quan la frescor importaEl model batch cobreix la majoria dels casos d'ús (recomanacions basades en historial de compres, relacions de catàleg), però hi ha situacions on la informació canvia en segons: cerques recents, afegits al carretó, activitat en sessió. Per a aquests escenaris, vam estendre el sistema amb Amazon MemoryDB (compatible amb Valkey) per a cerca vectorial en temps real i endpoints de SageMaker per a generació d'embeddings sota demanda. El mateix pipeline batch que publica a DynamoDB també actualitza setmanalment l'índex de productes a MemoryDB. En temps de servei, quan un usuari realitza una acció recent, el sistema genera un embedding al moment, consulta els veïns més propers a MemoryDB (amb latència sub-mil·lisegon) i combina aquests resultats amb els candidats batch mitjançant un re-ranking a la capa de presentació.
Aquesta arquitectura híbrida permet mantenir l'eficiència del processament per lots per a senyals lentes —com preferències històriques— i l'agilitat del temps real per a senyals ràpides —com la sessió actual—. Tot compartint els mateixos models, el mateix data lake i el mateix servei de presentació. A Q2BSTUDIO ajudem els nostres clients a dissenyar aquest tipus de transicions graduals, evitant la temptació de construir un sistema completament en temps real des de l'inici. Com hem après, 'batch first, real-time later' és una estratègia que redueix riscos i costos.
A més, la integració d'agents IA permet personalitzar encara més els resultats. Per exemple, un agent pot analitzar el context de la sessió i aplicar regles dinàmiques de negoci abans de retornar la recomanació final. Aquests agents es despleguen com a funcions serverless o endpoints de SageMaker, i s'orquestren dins del mateix flux d'Airflow o des del servei de presentació.
Seguretat, fiabilitat i lliçons apresesLa seguretat és transversal. Amb Lake Formation controlem l'accés a nivell de taula entre comptes, cada motor de còmput (MWAA, Glue, SageMaker) utilitza rols IAM amb mínims privilegis, i els entorns es despleguen en VPCs aïllades per regió. La fiabilitat es recolza en l'aïllament regional: cada regió executa la seva pròpia còpia independent del sistema, de manera que una fallada en una no afecta les altres. Si un pipeline batch falla a mig camí, les dades de DynamoDB de l'execució anterior continuen servint fins a la següent actualització. Els reintents automàtics d'Airflow i l'expiració TTL de DynamoDB garanteixen que les dades obsoletes no persisteixin indefinidament.
Entre les lliçons apreses destaquem:
Separar còmput i emmagatzematge: Usar S3 com a capa intermèdia i treballs efímers de Glue/SageMaker permet pagar només pel còmput actiu, sense clústers ociosos entre execucions setmanals.
Invertir en un data lake governat: Els conjunts golden acceleren la incorporació de nous pipelines i fan que les comparacions entre models siguin fiables. La inversió inicial en Lake Formation s'amortitza ràpidament.
No totes les senyals necessiten temps real: Classificar les senyals per velocitat de canvi i rutar-les adequadament (batch per a les lentes, temps real per a les ràpides, re-ranking per a les intermèdies) optimitza costos i rendiment.
A Q2BSTUDIO apliquem aquests principis en cada projecte de transformació digital. Ja sigui desenvolupant programari a mida amb components cloud, integrant intel·ligència artificial o implementant solucions de ciberseguretat, el nostre objectiu és oferir sistemes escalables, segurs i adaptats a les necessitats reals del negoci. Si vols explorar com implementar un sistema de recomanació personalitzat a la teva organització, t'invitem a conèixer els nostres serveis a desenvolupament d'aplicacions a mida i a cloud AWS/Azure.
En resum, construir un sistema de recomanació escalable a AWS no és només qüestió d'escollir els serveis adequats, sinó d'orquestrar-los seguint un enfocament iteratiu que prioritzi l'eficiència batch abans d'afegir complexitat en temps real. La combinació d'Amazon MWAA, Lake Formation, SageMaker, DynamoDB i MemoryDB, juntament amb agents IA i un data lake governat, proporciona una base sòlida per oferir experiències personalitzades a milions d'usuaris sense disparar els costos. Com sempre, el millor sistema és aquell que evoluciona amb el negoci.





