KAT-Coder-V2.5: modelo de codificación agente entrenado en 100.000 entornos

Descubre KAT-Coder-V2.5 de KwaiKAT: un modelo agente entrenado en más de 100.000 entornos de repositorio verificables. Lidera en PinchBench con 94.9.

lunes, 27 de julio de 2026 • 5 min de lectura • Equipo Q2BSTUDIO

KwaiKAT lanza un modelo que opera en repositorios reales

El desarrollo de inteligencia artificial aplicada a la programación ha dado un salto significativo con la llegada de KAT-Coder-V2.5, un modelo de codificación agente presentado por el equipo KwaiKAT de Kuaishou. A diferencia de los asistentes de código tradicionales que generan fragmentos independientes, este sistema está entrenado para operar dentro de repositorios ejecutables reales, comprendiendo el contexto completo de un proyecto y siendo capaz de realizar parches que pasen pruebas de validación. Este avance no solo representa un hito técnico, sino que además redefine cómo las empresas de desarrollo de software, como Q2BSTUDIO, pueden integrar inteligencia artificial en sus flujos de trabajo para crear aplicaciones a medida más robustas y eficientes.

La arquitectura de KAT-Coder-V2.5 se sustenta en tres pilares fundamentales: entornos verificables a escala, un filtrado de datos basado en procesos y un sistema de recompensas de tres niveles. El primer componente, denominado AutoBuilder, es responsable de construir entornos ejecutables a partir de repositorios reales. En lugar de confiar en descripciones textuales de issues, el equipo extrae tareas de pull requests y commits reales, siguiendo la línea de SWE-bench. Luego regenera descripciones divididas en enunciado del problema, requisitos derivados de las pruebas y restricciones de interfaz. Un agente de construcción analiza el repositorio y escribe un script de configuración que instala dependencias y ejecuta tests desde una copia limpia. La verificación acepta un entorno solo cuando más del 90% de las pruebas esperadas se recogen y los resultados son reproducibles. Este proceso, combinado con plantillas de sistemas de compilación y una biblioteca de recetas, elevó la tasa de éxito de construcción del 16,5% al 57,2%, generando más de 100.000 entornos verificables en 12 lenguajes de programación.

El segundo pilar es un ciclo de escalado de datos que filtra trayectorias de entrenamiento según el proceso, no solo el resultado final. Muchas trayectorias que pasan las pruebas pueden basarse en hard-coding o atajos que evitan la verdadera resolución del problema. Por el contrario, algunas trayectorias fallidas contienen comportamientos valiosos de búsqueda, localización y reparación. KwaiKAT aborda ambos casos: para los casi-aciertos, inserta pistas a nivel de proceso que orientan al agente sin revelar la solución, y luego regenera trayectorias sin pistas a partir del contexto original. Para las trayectorias exitosas, aplica puertas de validación basadas en reglas y una etapa de puntuación que evalúa exploración, localización, razonamiento previo a la edición, fidelidad a la especificación, convenciones del repositorio, minimalidad del parche, calidad de verificación, capacidad de recuperación y honestidad. Además, se aleatorizan nombres de herramientas, formatos de argumentos y plantillas para evitar el sobreajuste al arnés de pruebas, y se inyectan perturbaciones realistas como dependencias faltantes, fallos transitorios de comandos, salidas truncadas y logs ruidosos. Esto garantiza que el modelo aprenda a generalizar en entornos reales de desarrollo.

El tercer pilar es el sistema de entrenamiento con PPO asimétrico y recompensas de tres niveles. Durante el entrenamiento de KAT-Coder-V2, se descubrió que aproximadamente el 16% de las trayectorias fallaban debido a problemas de infraestructura del sandbox, no a la política del modelo. La corrección de estos problemas —como la política de eliminación de imágenes, variables de entorno incorrectas y la tokenización en endpoints de chat— redujo la tasa de error de feedback del sandbox del 16% a menos del 2%, y disminuyó los colapsos de entrenamiento en un orden de magnitud. El modelo utiliza una arquitectura actor-crítico asimétrica donde el crítico recibe un contexto privilegiado (recompensas, pruebas, cobertura, parches, metadatos) que el actor no ve en inferencia. Las recompensas incluyen puntuaciones de tareas principales (pruebas fail_to_pass y pass_to_pass), penalizaciones por duplicación o mal uso de herramientas, e incentivos por recuperación de archivos y crédito parcial en pruebas fallidas. Cinco expertos se fusionan mediante destilación multi-maestro con KL inversa, arranque off-policy y truncamiento adaptativo.

Los resultados cuantitativos sitúan a KAT-Coder-V2.5 como líder en PinchBench con 94,9 puntos, superando a Opus 4.8 (93,5). En SWE-Bench Pro obtiene 65,2 (frente a 69,2 del líder) y en el interno KAT Code Bench alcanza 53,1. Sin embargo, en Terminal-Bench 2.1 queda último con 60,7, lo que indica áreas de mejora en entornos puramente terminal. En SciCode iguala a GLM-5.2 con 50,3. Notablemente, existe una variante de pesos abiertos, KAT-Coder-V2.5-Dev, con arquitectura MoE de 35B total / 3B activos, entrenada sobre Qwen3.6-35B-A3B con 127K ejemplos SFT y luego RL, disponible bajo licencia Apache-2.0 en Hugging Face.

Para las empresas que desarrollan IA y soluciones de software, este tipo de modelo representa una oportunidad para automatizar tareas complejas de mantenimiento de código, generación de parches y verificación de pruebas. En Q2BSTUDIO, especialistas en aplicaciones a medida, sabemos que la integración de agentes inteligentes en el ciclo de desarrollo puede reducir drásticamente los tiempos de depuración y aumentar la calidad del código. Además, la capacidad de operar sobre repositorios completos y no solo fragmentos aislados permite abordar proyectos complejos que requieren entender el impacto global de cada cambio. La ciberseguridad también se beneficia: un agente que puede localizar y corregir vulnerabilidades en un entorno controlado, con pruebas de validación, es una herramienta poderosa para auditorías de seguridad. Asimismo, la integración con servicios cloud AWS/Azure y plataformas de BI como Power BI puede potenciar la automatización de pipelines de datos y la generación de informes inteligentes.

El aprendizaje más importante de KwaiKAT es que el desarrollo de agentes de codificación no es solo un problema de escalado de modelos, sino también de infraestructura. La capacidad de construir entornos verificables de forma fiable —pasando del 16,5% al 57,2%— demuestra que los cuellos de botella suelen estar en la ingeniería del sistema, no en la inteligencia artificial. Para una empresa como Q2BSTUDIO, que ofrece servicios de desarrollo de software a medida, consultoría en cloud y ciberseguridad, entender estas dinámicas es clave para adoptar herramientas de IA que realmente aporten valor en entornos de producción. La combinación de modelos como KAT-Coder-V2.5 con prácticas ágiles y metodologías DevOps puede transformar la manera en que se construye y mantiene el software.

En conclusión, KAT-Coder-V2.5 marca un antes y un después en la codificación asistida por agentes. Su enfoque en entornos verificables, filtrado por proceso y recompensas multicriterio ofrece un camino hacia sistemas de IA que no solo escriben código, sino que entienden el contexto completo de un repositorio y pueden garantizar que sus cambios pasan todas las pruebas. Para las empresas que buscan innovar en el desarrollo de software, la adopción temprana de estas tecnologías, con el soporte de socios tecnológicos como Q2BSTUDIO, puede suponer una ventaja competitiva decisiva en un mercado cada vez más exigente.

¿UNA PAUSA?

Juega un momento antes de irte

NUESTROS SERVICIOS

Cómo podemos ayudarte

¿Tienes un proyecto en mente?

Cuéntanos tu visión y la convertimos en una solución de software. Sea cual sea el alcance, hacemos realidad tu idea.