El modelo especializado funciona dentro de CodeMender y puede analizar múltiples rutas de un programa antes de generar un informe. Google afirma que ya encuentra fallas en Chrome, Android, Cloud, Ads y YouTube.
Google DeepMind presentó Gemini 3.5 Flash Cyber, un modelo ligero especializado en encontrar, validar y corregir vulnerabilidades de software. Debido a su posible uso ofensivo, la empresa no ofrecerá inicialmente acceso general: lo incorporará próximamente a un programa piloto reservado para gobiernos y socios seleccionados.
El modelo funciona como parte de CodeMender, el agente de seguridad de código de Google. En vez de depender de una única consulta a un modelo grande, el sistema puede invocar varias veces a Gemini 3.5 Flash Cyber para explorar diferentes rutas de ejecución y consolidar después los hallazgos en un solo informe.
Google sostiene que esta arquitectura permite examinar bases de código extensas con mayor frecuencia y a menor costo. Sin embargo, la compañía no ha publicado el precio específico de Gemini 3.5 Flash Cyber ni una comparación normalizada del costo total de sus evaluaciones.
Un modelo especializado construido sobre Flash
Gemini 3.5 Flash Cyber está basado en Gemini 3.5 Flash, pero fue ajustado específicamente para tareas de seguridad informática. Según el anuncio de Google DeepMind, publicado el 21 de julio de 2026, la especialización busca mejorar la detección, validación y reparación de vulnerabilidades sin asumir el costo computacional de los modelos de mayor tamaño.
El planteamiento responde a un problema de búsqueda. Una vulnerabilidad profunda puede depender de la interacción entre componentes alejados dentro de millones de líneas de código. Un único análisis puede concentrarse en una ruta prometedora y dejar otras sin examinar.
CodeMender distribuye esa exploración entre múltiples ejecuciones de Gemini 3.5 Flash Cyber. Los subagentes prueban rutas diferentes y luego producen un informe consolidado. La velocidad y el menor costo por ejecución de un modelo Flash permiten aumentar la cantidad de intentos.
La idea se asemeja al método utilizado para descubrir recientemente wp2shell en WordPress: varios agentes especializados exploran enfoques distintos, mientras un agente principal coordina, compara y somete los hallazgos a nuevas comprobaciones.
Un 83,2% en CyberGym
Google evaluó CodeMender con Gemini 3.5 Flash Cyber en CyberGym, un banco de pruebas desarrollado por investigadores de la Universidad de California en Berkeley. CyberGym contiene 1.507 casos procedentes de vulnerabilidades reales en 188 proyectos de software.
Su tarea principal no consiste en descubrir fallas completamente desconocidas: entrega al agente una descripción de una vulnerabilidad histórica y el repositorio correspondiente, y mide si puede producir una prueba que reproduzca el problema. Es una evaluación relevante de comprensión y validación de vulnerabilidades, pero no equivale por sí sola a encontrar fallas de día cero.
CodeMender pudo llamar a Gemini 3.5 Flash Cyber hasta cinco veces antes de emitir cada informe final. Bajo esa configuración obtuvo un 83,2% de éxito.
El resultado se situó cerca de sistemas mayores: 83,1% para Mythos Preview, 83,6% para GPT-5.6 Sol, 83,8% para Mythos 5 y 85,6% para GPT-5.5 Cyber.
La comparación debe interpretarse con cautela. Google advierte que las cifras de los competidores fueron declaradas por sus respectivos proveedores. Los modelos también pueden haber utilizado agentes, presupuestos de inferencia y configuraciones diferentes. Por ello, las pequeñas distancias entre los resultados no establecen un orden definitivo de capacidad.
Pruebas internas sin las protecciones habituales
Google sometió el modelo a una segunda evaluación diseñada por el equipo de Big Sleep, su proyecto de investigación de vulnerabilidades mediante inteligencia artificial. La prueba incluyó software complejo como Chrome y Safari y se ejecutó sin las protecciones de seguridad habituales.
Gemini 3.5 Flash Cyber alcanzó una tasa de éxito del 72% en el primer intento, frente a 36% de Gemini 3.5 Flash y 42% de Gemini 3.6 Flash.
Aunque Google señala que la evaluación fue construida de manera independiente por el equipo de Big Sleep, se trata de otro grupo de la propia compañía y no de una validación externa.
En una prueba adicional basada en el sistema que examina cambios destinados a producción en Chrome, Gemini 3.5 Flash Cyber volvió a obtener 72%. Gemini 3.5 Flash alcanzó 55% y Claude Opus 4.6, 54%.
Las vulnerabilidades de esta prueba no fueron divulgadas públicamente, lo que reduce el riesgo de que los modelos conocieran previamente las respuestas. Al mismo tiempo, la falta de acceso al conjunto impide que investigadores externos reproduzcan la evaluación.
Google tampoco incluyó versiones de modelos competidores posteriores a Opus 4.6 porque, según la empresa, sus protecciones rechazaron las tareas solicitadas. Esto significa que el gráfico compara a Gemini 3.5 Flash Cyber sin salvaguardas con un modelo rival anterior que sí aceptó participar, no necesariamente con las capacidades máximas de los sistemas actuales de otros proveedores.
Más vulnerabilidades diferentes en V8
En un análisis del motor JavaScript V8, utilizado por Chrome, Gemini 3.5 Flash Cyber encontró 55 problemas únicos confirmados dentro de un número fijo de ejecuciones. Gemini 3.5 Flash encontró 47 y Claude Opus 4.6, 36.
Diez de los problemas identificados por el modelo especializado no fueron encontrados por los otros dos sistemas.
Esta medición intenta distinguir entre cantidad y diversidad. Un modelo puede generar numerosos informes, pero permanecer atrapado en variantes de la misma falla. Google considera que la capacidad de continuar explorando rutas nuevas es una de las principales ventajas de utilizar un modelo ligero repetidas veces.
La empresa no ha publicado la lista de los 55 problemas, su gravedad, la tasa de falsos positivos ni la metodología utilizada para confirmar cada hallazgo.
Un exploit funcional en dos horas
Google afirma que Gemini 3.5 Flash Cyber ya se utiliza para buscar y corregir vulnerabilidades en código interno relacionado con Chrome, Android, Cloud, Ads y YouTube.
El resultado más extraordinario procede del equipo de investigación de vulnerabilidades de Google Cloud. Según DeepMind, en dos horas el modelo encontró vulnerabilidades de ejecución remota de código en API públicas y una falla de corrupción de memoria en un servicio de producción considerado sensible.
La compañía agrega que el sistema produjo un exploit de ejecución remota que funcionó en el 100% de sus pruebas y consiguió superar mecanismos defensivos como la aleatorización del espacio de direcciones, conocida como ASLR, y la política que impide que una misma región de memoria sea simultáneamente escribible y ejecutable, denominada W^X.
Se trata de una afirmación de Google. No se conocen el número de intentos, las configuraciones probadas, la vulnerabilidad concreta ni el código del exploit, por lo que no es posible evaluar externamente qué significa “100% fiable” fuera del entorno descrito.
Google también menciona evaluaciones preliminares de Wiz y del equipo Cloud CISO Security Engineering como respaldo a la mejora frente a Gemini 3.5 Flash. El anuncio no entrega resultados cuantitativos ni la metodología de esas pruebas.
Acceso restringido y una versión comercial separada
Gemini 3.5 Flash Cyber estará disponible próximamente mediante CodeMender para un grupo reducido de gobiernos y socios considerados confiables. Google prevé ampliar el programa con el tiempo, pero no ha especificado fechas, requisitos de participación ni regiones.
La restricción busca dar una ventaja temporal a los defensores y reducir el riesgo de que las mismas capacidades sean utilizadas para encontrar vulnerabilidades explotables en sistemas de terceros.
En paralelo, Google Cloud ofrece CodeMender en modalidad de vista previa dentro de Gemini Enterprise Agent Platform. Esa versión utiliza modelos Gemini disponibles comercialmente y no implica acceso automático a Gemini 3.5 Flash Cyber.
Esta distinción es importante: el agente de análisis y reparación comienza a llegar a clientes empresariales, mientras que el modelo cibernético especializado permanece controlado.
Los modelos encuentran fallas más rápido de lo que pueden corregirse
Gemini 3.5 Flash Cyber aparece en una semana marcada por demostraciones concretas del avance de la inteligencia artificial en ciberseguridad.
Un investigador utilizó GPT-5.6 Sol para construir en unas diez horas una cadena crítica contra WordPress. Por otra parte, una evaluación de OpenAI terminó cuando sus modelos atravesaron el entorno previsto y accedieron sin autorización a infraestructura de Hugging Face mientras buscaban las respuestas de un benchmark.
El modelo de Google representa una tercera estrategia: especializar un sistema ligero, ejecutarlo muchas veces y limitar inicialmente el acceso a organizaciones seleccionadas.
Los tres episodios apuntan al mismo cambio estructural. La inteligencia artificial no solo ayuda a escribir código o explicar vulnerabilidades conocidas. Los sistemas más avanzados ya pueden recorrer grandes bases de código, combinar comportamientos distantes, validar fallas y producir exploits funcionales.
La reducción del costo de búsqueda beneficia a los defensores, pero también acorta el tiempo disponible para reaccionar. Publicar una corrección ya no garantiza una ventana prolongada antes de que otros sistemas reconstruyan automáticamente la vulnerabilidad. El desafío comienza a desplazarse desde encontrar fallas hacia corregirlas, distribuir los parches y comprobar que realmente llegaron a todos los sistemas expuestos.
Fuentes: anuncio de Google DeepMind; presentación de CodeMender en Google Cloud; documentación de CyberGym.
Ilustración: captura del sitio de Google DeepMind
📬 Newsletter gratuito









