¡Revisa el diccionario secreto de tu LLM! Cinco líneas de código revelan lo que tu LLM aprendió (incluyendo lo que no debería haber aprendido)

Descubre cómo revisar el diccionario secreto de tu LLM con solo 5 líneas de código. Una forma rápida de acceder a su vocabulario interno.

viernes, 22 de mayo de 2026 • 2 min de lectura • Equipo Q2BSTUDIO

Revisa el diccionario secreto de tu LLM con 5 líneas de código

Imagina que pudieras abrir un modelo de lenguaje grande (LLM) como si fuera una caja negra y, con solo cinco líneas de código, descubrir qué palabras y conceptos guarda en su interior, incluso aquellos que jamás debieron estar ahí. Eso es precisamente lo que permite una técnica reciente basada en la descomposición en valores singulares (SVD) de la matriz de clasificación final del modelo, conocida como lm_head. Este enfoque, que no requiere ejecutar inferencias ni consumir recursos masivos, revela subespacios semánticos directamente desde los pesos numéricos del modelo. Cada vector singular izquierdo identifica el conjunto de tokens que el modelo tiende a seleccionar cuando el estado oculto se alinea con esa dirección concreta, formando clusters de vocabulario que exponen la filosofía de curaduría de los datos de entrenamiento. Al analizar modelos como GPT-OSS-120B, Gemma-2-2B y Qwen2.5-1.5B, se observan diferencias sistemáticas: mientras GPT presenta una jerarquía gradual de subespacios funcionales, Gemma está dominada por ortografía inglesa anterior al siglo XIX, lo que podría explicar su alta controlabilidad en la salida. Qwen, por su parte, muestra una cobertura multilingüe amplia junto con subespacios cuyo contenido ha sido considerado éticamente inapropiado para publicación directa. Lo más revelador es que estos subespacios problemáticos se originan en el preentrenamiento y persisten incluso después de la alineación posterior al entrenamiento. Para cuantificar la coherencia de estos clusters se ha propuesto el Vocabulary Cluster Score (VCS), y el Weighted Projection Score (WPS) actúa como detector estático de glitch tokens sin necesidad de inferencia, recuperando ejemplos conocidos como el famoso token shokubutsu-hyakka-tsu reportado en la comunidad CJK. Este hallazgo tiene implicaciones profundas para la ciberseguridad y la auditoría de modelos de inteligencia artificial, ya que sugiere que el análisis SVD de lm_head debería convertirse en un paso estándar antes del lanzamiento público de cualquier LLM. En Q2BSTUDIO, entendemos que la transparencia y la seguridad son fundamentales en el desarrollo de ia para empresas. Nuestros servicios de aplicaciones a medida integran técnicas avanzadas de auditoría de modelos, utilizando agentes IA para detectar sesgos o contenido problemático en tiempo real. Además, ofrecemos soluciones de servicios cloud aws y azure para desplegar modelos auditados, y servicios inteligencia de negocio con power bi para visualizar los clusters semánticos extraídos. La combinación de software a medida con metodologías como el SVD permite a las organizaciones no solo entender qué sabe su LLM, sino también controlar lo que no debería saber. Esta técnica abre la puerta a una optimización más consciente del tokenizador y a un diseño de modelos más controlable, alineado con los principios de ciberseguridad y ética que promovemos en cada proyecto. En un mundo donde la inteligencia artificial se integra en procesos críticos, contar con herramientas de análisis interno como esta marca la diferencia entre una caja cerrada y un sistema verdaderamente transparente.

¿UNA PAUSA?

Juega un momento antes de irte

NUESTROS SERVICIOS

Cómo podemos ayudarte

¿Tienes un proyecto en mente?

Cuéntanos tu visión y la convertimos en una solución de software. Sea cual sea el alcance, hacemos realidad tu idea.