Microsoft ha lanzado su primer modelo de inteligencia artificial especializado en ciberseguridad, junto con una nueva plataforma basada en agentes automatizados. La jugada busca plantar cara a gigantes como Anthropic, Google y OpenAI, en un momento donde los ataques con IA se multiplican.
Un modelo pensado para defender, no para atacar
El modelo se llama MAI-Cyber-1-Flash y no funciona como una herramienta independiente. Opera dentro de MDASH, el sistema de escaneo multi-modelo de Microsoft para identificación y remediación de vulnerabilidades. Se trata de un transformador con atención propia y capas de mezcla dispersa de expertos (MoE), con 137 mil millones de parámetros totales y 5 mil millones activos, además de una ventana de contexto de 256k. Solo acepta y genera texto.
MAI-Cyber-1-Flash es un ajuste fino especializado en ciberseguridad del modelo MAI-Code-1-Flash, el mismo que ya impulsa GitHub Copilot y VS Code. Y a diferencia de lo que muchos podrían esperar, este modelo no puede generar exploits. En las pruebas de ExploitGym, sus puntuaciones son cero sobre cero sobre cero, y desde Microsoft aclaran que es algo deliberado: el modelo fue entrenado para realizar tareas defensivas, como parchear errores, no para escribir código ofensivo.
Resultados de vértigo en los benchmarks
El sistema completo —MDASH ejecutando MAI-Cyber-1-Flash junto con GPT-5.4— ha logrado una puntuación del 95,95% en CyberGym, el conjunto de referencia público que consta de 1.507 tareas de reproducción de vulnerabilidades reales extraídas de 188 proyectos de OSS-Fuzz. Según Microsoft, esa cifra supera en aproximadamente 12 puntos a Mythos de Anthropic, mientras que la tabla de resultados sitúa a los cuatro sistemas competidores entre el 83,2% y el 85,6%.
Cuando Microsoft presentó MDASH por primera vez en mayo de 2026, el sistema alcanzó un 88,45% usando solo modelos disponibles de forma general. Ya entonces era la mejor puntuación pública, unos cinco puntos por encima del siguiente competidor. La mejora hasta el 95,95% se logró, según el equipo de investigación, reemplazando el 80% de los modelos anteriores dentro del arnés.
Cómo funciona MDASH y el papel de los agentes
MDASH gestiona más de 100 agentes especializados repartidos en cinco etapas: Prepare, Scan, Validate, Dedupe y Prove. Hay agentes auditores que señalan hallazgos, agentes debatientes que discuten la explotabilidad de las vulnerabilidades, y una etapa final que ejecuta entradas desencadenantes con herramientas de análisis para objetivos en C/C++.
Para controlar los costes, MAI-Cyber-1-Flash maneja hasta el 90% de las tareas, dejando el 10% más difícil para GPT-5.4. Microsoft afirma que este enrutamiento supone un ahorro del 50% en costes respecto a la configuración anterior. El equipo de desarrollo, el Autonomous Code Security (ACS) de Microsoft, incluye miembros del equipo ganador del DARPA AI Cyber Challenge, Team Atlanta.
La eficacia ya se ha visto en casos reales. En mayo, el trabajo asistido por MDASH generó 16 CVE (incluyendo cuatro fallos críticos de ejecución remota de código) en la pila de redes y autenticación de Windows. En pruebas retrospectivas, recuperó el 96% de 28 casos de MSRC en el controlador clfs.sys y el 100% de 7 casos en tcpip.sys en un periodo de cinco años.
Perception: la plataforma de equipos automatizados
La otra gran novedad es Perception, una plataforma que despliega equipos de agentes para automatizar flujos de trabajo de seguridad. Hayete Gallot, vicepresidenta de seguridad de Microsoft, explicó que Perception permite a los defensores empresariales «defenderse contra la IA con IA a la escala y velocidad que tienen los atacantes».
Perception utiliza equipos rojos, azules y verdes. Los equipos rojos simulan ataques potenciales con contexto sobre actores de amenazas y vulnerabilidades. Los equipos azules se dedican a detectar y clasificar errores existentes, mientras que los verdes toman «acciones correctivas».
Dave Weston, ingeniero principal de Perception, describió la plataforma como una mejora masiva de eficiencia: «Hemos pasado de horas y horas de trabajo manual de múltiples especialistas a tener una solución en minutos».
Disponibilidad
Tanto MAI-Cyber-1-Flash como Perception estarán disponibles en preview a partir del 3 de noviembre.









