STEEL: Energy-Efficient Fused Attention for Long Sequences on AMD NPU

Discover STEEL, the first open-source FlashAttention implementation for AMD XDNA NPUs, reducing energy consumption by up to 9.17x vs CPU and 1.75x vs GPU.

miércoles, 29 de julio de 2026 • 5 min read • Q2BSTUDIO Team

Ahorro energético en inferencia de IA gracias a STEEL

En la era de los agentes de inteligencia artificial integrados en los flujos de trabajo de sistemas operativos, la eficiencia energética en la inferencia de modelos ha pasado a ser un factor crítico, especialmente en dispositivos portátiles como los laptops de gama alta. Los System-on-Chip (SoC) modernos incluyen unidades de procesamiento neuronal (NPU) diseñadas para ofrecer un alto rendimiento con un consumo reducido. Sin embargo, la implementación eficiente de mecanismos de atención —el núcleo de los transformers— en estas NPU sigue siendo un desafío debido a la diversidad arquitectónica y a los modelos de programación explícitos de movimiento de datos. En este contexto surge STEEL, la primera implementación open source de FlashAttention dirigida a NPU tipo XDNA, presentada en el artículo arXiv:2607.09385v1.

STEEL, por sus siglas en inglés (Spatially Tiled Energy-Efficient Attention), introduce una formulación de flujo de datos para la atención de prefill que permite explotar eficientemente el paralelismo espacial y la memoria en chip de las NPU. Uno de los principales problemas que aborda es el desequilibrio de carga inducido por la máscara causal típica en los modelos autorregresivos. Para ello, STEEL utiliza un pipeline de colocación consciente de la dispersión (sparsity-aware) en el array de la NPU, reduciendo la sobrecarga de sincronización y mejorando la utilización de los recursos. Este enfoque resulta especialmente relevante para secuencias largas, donde el coste de la atención cuadrática se vuelve prohibitivo tanto en latencia como en energía.

Las evaluaciones realizadas sobre el SoC AMD Ryzen AI 9 HX 370 muestran resultados contundentes: STEEL reduce el consumo energético en promedio 9,17 veces respecto a la CPU y 1,75 veces respecto a la GPU. En términos de latencia, en XDNA 1 logra una reducción media de 9,6 veces frente al estado del arte anterior, y en XDNA 2 alcanza una aceleración media de 22,8 veces en comparación con una implementación capa por capa. Estas cifras no solo demuestran la viabilidad de ejecutar atención eficiente en NPU, sino que abren la puerta a nuevas aplicaciones de agentes IA en entornos locales sin depender de la nube.

Para las empresas que desarrollan soluciones de software, la aparición de bibliotecas como STEEL representa una oportunidad de optimizar sus productos para hardware especializado. Q2BSTUDIO, compañía especializada en desarrollo de aplicaciones a medida e inteligencia artificial, sigue de cerca estas innovaciones para integrarlas en sus proyectos de IA y agentes inteligentes. Al combinar un profundo conocimiento de los aceleradores hardware con prácticas de ingeniería de software modernas, Q2BSTUDIO puede ofrecer a sus clientes sistemas más rápidos, eficientes y seguros, ya sea en entornos cloud (AWS, Azure) o en dispositivos edge.

La optimización energética no solo beneficia la duración de la batería en laptops, sino que también reduce la huella de carbono de las operaciones de inferencia. En un momento donde la sostenibilidad es clave, soluciones como STEEL permiten que los agentes IA operen de forma más ecológica. Además, al ejecutarse localmente en la NPU, se eliminan los riesgos de latencia de red y se mejora la privacidad de los datos, aspectos fundamentales para aplicaciones de ciberseguridad y tratamiento de información sensible. Q2BSTUDIO ofrece servicios de desarrollo multiplataforma que pueden integrar estas capacidades de inferencia local en soluciones de ciberseguridad y análisis de negocio, como paneles de Power BI que se actualizan en tiempo real gracias a modelos de lenguaje ejecutados en el propio dispositivo.

Desde la perspectiva empresarial, la adopción de NPU para inferencia de secuencias largas permite a las compañías desplegar agentes IA en portátiles sin sacrificar rendimiento ni autonomía. Esto es particularmente útil en sectores como la atención médica, legal o financiera, donde la confidencialidad de los datos exige procesamiento local. Las empresas que ya han migrado sus cargas de trabajo a la nube con AWS o Azure pueden complementar su estrategia con inferencia híbrida: partes del modelo en la nube y otras en el dispositivo, optimizando costes y latencia. Q2BSTUDIO, como partner tecnológico, asesora en la elección de la arquitectura más adecuada, combinando servicios cloud con desarrollo de aplicaciones a medida que aprovechan al máximo el hardware cliente.

El impacto de STEEL va más allá de la eficiencia bruta. Al ser open source, fomenta la colaboración entre la comunidad investigadora y los fabricantes de hardware, acelerando la madurez del ecosistema de NPU. Los desarrolladores de software pueden integrar FlashAttention fácilmente en sus pipelines de transformers, reduciendo el time-to-market de nuevas funcionalidades. En combinación con herramientas de Business Intelligence como Power BI, es posible crear dashboards que se actualicen con resúmenes generados por IA en tiempo real, todo ello ejecutándose localmente en el portátil del usuario final, sin necesidad de conexión constante a internet.

La ciberseguridad también se beneficia: al mantener la inferencia en el dispositivo, se evita enviar datos sensibles a servidores externos, reduciendo la superficie de ataque. Q2BSTUDIO integra estas capacidades en soluciones de seguridad perimetral y detección de amenazas, donde los modelos de IA pueden analizar tráfico de red o logs directamente en el endpoint. Además, la eficiencia energética permite que estos análisis se ejecuten de forma continua sin agotar la batería, algo crítico en entornos de trabajo remoto o móvil.

En resumen, STEEL representa un avance significativo en la ejecución eficiente de atención en NPU AMD XDNA, con mejoras de latencia y energía que habilitan nuevos casos de uso para agentes IA en laptops. Empresas como Q2BSTUDIO, con su experiencia en desarrollo de software a medida, cloud, ciberseguridad e inteligencia artificial, están preparadas para aprovechar estas innovaciones y ofrecer soluciones competitivas a sus clientes. La combinación de hardware especializado y software optimizado es la clave para la próxima generación de aplicaciones inteligentes y sostenibles.

A BREAK?

Play for a moment before you go

OUR SERVICES

How we can help you

Do you have a project in mind?

Tell us your vision and we'll turn it into a software solution. Whatever the scope, we make your idea real.