Inkling: MoE multimodal de 975B parámetros con 41B activos y esfuerzo controlable

Inkling de Thinking Machines Lab es un modelo multimodal MoE de 975B parámetros con 41B activos. Ofrece esfuerzo de razonamiento controlable y ajuste fino.

lunes, 27 de julio de 2026 • 5 min de lectura • Equipo Q2BSTUDIO

Arquitectura Mixture-of-Experts de Inkling para personalización eficiente

El ecosistema de la inteligencia artificial ha recibido un nuevo integrante que promete cambiar las reglas del juego en el desarrollo de modelos multimodales. Thinking Machines Lab ha presentado Inkling, un modelo de lenguaje de última generación con 975 mil millones de parámetros totales y 41 mil millones activos, basado en una arquitectura Mixture-of-Experts (MoE). Pero más allá de las cifras, lo que realmente lo diferencia es su capacidad de controlar el 'esfuerzo de razonamiento' durante la inferencia, una característica que permite ajustar el coste computacional y la latencia por petición. En este artículo, analizamos en profundidad la arquitectura, las aplicaciones empresariales y cómo Q2BSTUDIO, como empresa de desarrollo de software y tecnología, puede ayudar a las organizaciones a sacar el máximo partido de este modelo y otros similares.

Inkling no es solo otro modelo grande. Su diseño MoE con 256 expertos enrutados y 2 expertos compartidos por capa, junto con un mecanismo de atención que intercala ventanas deslizantes y globales en proporción 5:1, le permite manejar contextos de hasta 1 millón de tokens. La capacidad de procesar simultáneamente texto, imágenes y audio (aunque solo genere texto UTF-8) lo convierte en una herramienta ideal para aplicaciones multimodales complejas. Pero quizás el aspecto más innovador es el control del esfuerzo de razonamiento: un parámetro que va de 0.2 a 0.99 y que permite decidir cuántos tokens dedicar a cada respuesta. Esto se traduce en una optimización directa de costes, algo crítico para empresas que necesitan escalar soluciones de IA sin disparar la factura.

Desde una perspectiva técnica, Inkling se entrenó con 45 billones de tokens de datos multimodales y empleó técnicas como Muon para matrices grandes y Adam para el resto de parámetros. El resultado es un modelo que, con esfuerzo máximo (0.99), alcanza puntuaciones competitivas en benchmarks como AIME 2026 (97.1%), GPQA Diamond (87.2%) o FORTRESS Adversarial (78.0%), superando a otros modelos open-weights en resistencia a ataques adversarios. Sin embargo, no es perfecto: en tareas como SimpleQA Verified (43.9%) o Terminal Bench 2.1 (63.8%) queda por detrás de competidores como DeepSeek V4 Pro o GLM 5.2. Aun así, su eficiencia es notable: gasta un tercio de los tokens que Nemotron 3 Ultra para igual rendimiento en Terminal Bench.

Para las empresas, este nivel de control y eficiencia abre la puerta a casos de uso muy concretos. Por ejemplo, en el desarrollo de aplicaciones a medida que integren voz y visión —como asistentes de soporte que procesan llamadas y capturas de pantalla para generar tickets estructurados—, la capacidad de ajustar el esfuerzo permite usar un modo económico para tareas rutinarias y el modo máximo solo cuando se necesita un análisis profundo. Esto encaja perfectamente con la filosofía de Q2BSTUDIO, que ofrece soluciones de IA personalizadas para clientes de sectores como finanzas, logística o salud. La posibilidad de afinar el modelo con datos propios (fine-tuning) mediante plataformas como Tinker (contexto de 64K o 256K) o a través de APIs en TogetherAI, Fireworks o Databricks, facilita la creación de sistemas de agentes IA adaptados a necesidades específicas.

Además, la integración con la nube es un factor clave. Inkling se puede desplegar en entornos cloud como AWS o Azure, y Q2BSTUDIO cuenta con experiencia en servicios cloud AWS/Azure para ayudar a las empresas a orquestar infraestructuras escalables. La inferencia con Inkling requiere al menos 2 TB de VRAM agregada en BF16 (por ejemplo, 8x NVIDIA B300 o 16x H200), pero con la cuantización NVFP4 (W4A4) se reduce a 600 GB, permitiendo ejecutarlo en 4x B300. Esto hace que el modelo sea viable para compañías que ya tienen inversiones en hardware de última generación, pero también abre la puerta a soluciones más ligeras como Inkling-Small (276B parámetros, 12B activos) que, aunque aún no está disponible, promete igualar o superar al modelo grande en muchos benchmarks.

Otro ámbito donde Inkling puede marcar la diferencia es en la ciberseguridad. Su puntuación de 78.0% en FORTRESS Adversarial indica una robustez superior contra entradas maliciosas. Esto lo convierte en un candidato ideal para sistemas de detección de anomalías o chatbots que deban resistir ataques de inyección de prompt. Q2BSTUDIO, con su división de ciberseguridad, puede integrar modelos como Inkling en plataformas de seguridad ofensiva y defensiva, ayudando a las empresas a proteger sus activos digitales mediante agentes inteligentes capaces de identificar patrones de ataque y sugerir contramedidas en tiempo real.

No podemos olvidar el valor de la inteligencia de negocio. Inkling puede procesar datos multimodales —como informes financieros, gráficos y grabaciones de reuniones— y generar resúmenes o extraer métricas clave. Esto se alinea con las soluciones de BI / Power BI que ofrece Q2BSTUDIO, donde la IA generativa puede automatizar la generación de dashboards o interpretar consultas en lenguaje natural. La capacidad del modelo para manejar contextos largos (1M tokens) permite analizar documentos extensos sin perder coherencia, ideal para auditorías o compliance.

Por último, la combinación de Inkling con estrategias de automatización empresarial es prometedora. Por ejemplo, en pipelines de atención al cliente, un agente con esfuerzo bajo puede clasificar incidencias, mientras que uno con esfuerzo alto resuelve las más complejas. Todo ello gestionado desde una misma infraestructura. La disponibilidad de un drafter de predicción multi-token (MTP) para decodificación especulativa acelera aún más la inferencia, reduciendo la latencia en aplicaciones en tiempo real.

En resumen, Inkling representa un avance significativo en la democratización de la IA multimodal: es abierto (licencia Apache 2.0), permite personalización y ofrece un control granular del coste computacional. Sin embargo, su adopción efectiva requiere un conocimiento profundo de la arquitectura y de las mejores prácticas de despliegue. Aquí es donde empresas como Q2BSTUDIO, especializadas en aplicaciones a medida, IA y cloud, pueden aportar su experiencia para que las organizaciones no solo integren el modelo, sino que lo optimicen para sus flujos de trabajo reales. Desde el fine-tuning con datos propietarios hasta la integración con sistemas de BI y ciberseguridad, el potencial es enorme. Lo que está claro es que el control del esfuerzo de razonamiento marca un antes y un después: la IA ya no es un recurso fijo, sino un servicio que se adapta al presupuesto y la urgencia de cada tarea.

¿UNA PAUSA?

Juega un momento antes de irte

NUESTROS SERVICIOS

Cómo podemos ayudarte

¿Tienes un proyecto en mente?

Cuéntanos tu visión y la convertimos en una solución de software. Sea cual sea el alcance, hacemos realidad tu idea.