Google lanzó Gemini 3.8 Flash y Gemini 3.8 Flash Cyber para instituciones de defensa cibernética confiables el 2 de septiembre de 2026. La versión estándar ofrece un contexto de 1 millón de tokens, enfocándose en programación, agents y tareas de conocimiento especializado; en las pruebas publicadas por Google, logró un 73,7% en ingeniería de software de larga duración, cerca del 74,0% de Claude Opus 5, y superó a los modelos evaluados en agentes financieros, agentes legales y algunas tareas de razonamiento integral. La versión Cyber puede encontrar automáticamente vulnerabilidades y generar parches: en pruebas internas de Google que abarcan 20 lenguajes de programación, la tasa de éxito superó el 70%, y el equipo de Chrome recibió 2,6 veces más parches correctos que los modelos comerciales grandes. El precio actual de la API es de $0,75 por millón de tokens de entrada y $3,75 por millón de tokens de salida, pero el modelo intercambia mayor cantidad de pasos de razonamiento y llamadas a herramientas por rendimiento; evaluaciones independientes muestran que su costo por tarea individual es aproximadamente un 40% más alto que el de 3.7 Flash. La señal clave de este lanzamiento es que las capacidades de agentes, anteriormente exclusivas de modelos insignia costosos, ahora están llegando a modelos económicos y escalables para trabajo, aunque los datos de rendimiento aún se basan principalmente en pruebas de Google y sus socios, y la versión Cyber no está disponible para usuarios generales.Autor del artículo, fuente: DeepMind
Actualizado tres veces en seis semanas, Google convirtió a Flash en el modelo principal
Gemini 3.8 Flash se lanza solo tres semanas después de la versión 3.7 Flash y es el tercer modelo Flash lanzado por Google en seis semanas.
Antes, "Flash" solía significar velocidad y bajo costo, pero con capacidades claramente inferiores a los modelos insignia. La posición de Gemini 3.8 está cambiando: Google aún lo denomina un "modelo de trabajo" adecuado para implementaciones a gran escala, pero ahora destaca como capacidades principales la programación de larga duración, la llamada continua a herramientas y el análisis profesional, en lugar de limitarlo solo a tareas ligeras como chats o resúmenes.
El nuevo modelo admite entradas de texto, imagen, audio, video y PDF, con un contexto de 1 millón de tokens y una salida máxima de 64 000 tokens, y puede invocar herramientas de búsqueda, funciones y operaciones de computadora. Ya está disponible oficialmente, no en versión de prueba, y se puede utilizar a través de Gemini API, Google AI Studio, Gemini Enterprise, Google Antigravity, la aplicación Gemini, el modo AI de búsqueda y Google Sheets.
El agente alojado por Google, Antigravity, también ha adoptado por defecto la versión 3.8 Flash. Esto indica que el modelo está realmente orientado hacia agentes que requieren planificación repetida, llamadas a herramientas, verificación de resultados y corrección continua, y no hacia respuestas únicas.
The coding performance is approaching that of expensive flagship models.
En la prueba de ingeniería de software de largo plazo DeepSWE v1.1 publicada por Google, Gemini 3.8 Flash obtuvo un 73.7%, superando al 65.3% de 3.7 Flash y al 72.7% de GPT-5.6 Sol, y estando a solo 0.3 puntos porcentuales del 74.0% de Claude Opus 5.
Este tipo de prueba requiere que el modelo acceda a un repositorio de código real, comprenda las relaciones entre múltiples archivos, identifique problemas y realice modificaciones que pasen las pruebas. Es más cercana al trabajo real de un agente de programación que la generación independiente de una función.
En Vals Finance Agent v2, 3.8 Flash obtuvo el 61.4%, mientras que los 3.7 Flash, Claude Opus 5 y GPT‑5.6 Sol evaluados obtuvieron respectivamente el 59.0%, el 58.6% y el 53.8%.
En la prueba de Harvey Legal Agent, Flash 3.8 obtuvo un 10.0%, superior al 8.8% de Flash 3.7, al 6.7% de Claude Opus 5 y al 2.5% de GPT-5.6 Sol. Sin embargo, todos los modelos obtuvieron puntuaciones absolutas muy bajas en esta evaluación; ocupar el primer lugar no significa que puedan manejar con confiabilidad tareas legales complejas.
En la prueba de razonamiento multidisciplinario HLE-Verified, 3.8 Flash obtuvo un 54.9%, GPT‑5.6 Sol y Claude Opus 5 obtuvieron respectivamente un 54.5% y un 54.4%; la diferencia entre los tres es mínima y no suficiente para demostrar que alguno de los modelos tenga una ventaja general y estable.
Estos resultados fueron publicados principalmente por Google según su propia configuración. El modelo, el marco de agente, la intensidad de razonamiento, los permisos de herramientas y el presupuesto de prueba afectan los resultados finales; por lo tanto, una conclusión más razonable es que los modelos de nivel Flash ya están cerca de algunos modelos de gama alta costosos, y no que Gemini ya lidera en todas las tareas.
“Trabajar más” significa trabajar de manera más inteligente, y también puede significar más caro
Google atribuye la mejora de la capacidad de Flash 3.8 a una elección de diseño directa: hacer que el modelo "trabaje más".
Cuando enfrenta tareas complejas, utiliza más pasos intermedios de razonamiento, llama repetidamente a herramientas y verifica activamente el trabajo ya completado. Los desarrolladores pueden elegir entre tres niveles de pensamiento: bajo, medio y alto; el nivel medio es el predeterminado; el nivel alto es adecuado para programación difícil y razonamiento multietapa, mientras que el nivel bajo es ideal para chats en tiempo real, generación de borradores y tareas sensibles a la latencia.
Esto reduce la probabilidad de que el agente se detenga prematuramente, omita pasos o se desvíe completamente del objetivo tras un fallo en una llamada a herramienta, pero también consume más tokens.
En pruebas independientes de Artificial Analysis, 3.8 Flash obtuvo un índice de inteligencia de 59 puntos en niveles altos de pensamiento, un aumento de 3 puntos respecto a 3.7 Flash, y se encuentra en un nivel similar a la configuración de razonamiento no máxima de GPT‑5.6 Sol. Su velocidad promedio de salida es de aproximadamente 300 tokens por segundo, y tarda en promedio 2.5 minutos en completar cada prueba individual.
Pero el promedio de tokens generados por 3.8 Flash aumentó aproximadamente un 30%, y también se realizaron más rondas de ejecución en las evaluaciones de Agentes. Aunque el precio por token no aumentó, el costo promedio por tarea es de aproximadamente 0.58 dólares, un 40% más que los 0.40 dólares de 3.7 Flash.
Por lo tanto, "precio unitario bajo" no equivale a "cada tarea necesariamente más barata". Si la tarea en sí no requiere razonamiento complejo, hacer funcionar a 3.8 Flash a alta intensidad solo podría aumentar el tiempo y los costos. Google también recomienda flujos de trabajo que prioricen la eficiencia, reduciendo el nivel de pensamiento, o continuar utilizando la versión 3.7 Flash que aún recibe soporte.
El precio actual es una oferta por tiempo limitado
Hasta el 31 de diciembre de 2026, el precio promocional de Gemini 3.8 Flash es de $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida, igual que el precio actual de 3.7 Flash.
A partir del 1 de enero de 2027, el precio estándar se convertirá en $1.50 por millón de tokens de entrada y $7.50 por millón de tokens de salida, exactamente el doble. Los desarrolladores no deben considerar los precios del período de lanzamiento como precios permanentes al evaluar los costos a largo plazo.
Incluso calculando según los precios futuros estándar, sigue siendo más económico que algunos modelos insignia; sin embargo, para un agente que necesita generar decenas de miles de tokens y realizar decenas de llamadas a herramientas, se debe comparar el costo total de la tarea, no solo el número por millón de tokens en la tabla de precios.
El objetivo de la versión Cyber no es explicar la vulnerabilidad, sino entregar directamente el parche.
Google también lanzó Gemini 3.8 Flash Cyber. Comparte las capacidades básicas con la versión estándar, pero ha sido entrenado con un enfoque más centrado en ciberseguridad y utiliza restricciones de ciberseguridad más relajadas, lo que le permite realizar análisis de vulnerabilidades que los modelos estándar podrían rechazar.
En el benchmark de descubrimiento de vulnerabilidades CyberGym, Google afirmó haber alcanzado el estado del arte. Dado que CyberGym se centra principalmente en proyectos de C y C++, la empresa diseñó una prueba interna que cubre 20 lenguajes de programación y contiene bibliotecas de código real y complejas, logrando una tasa de éxito superior al 70% en la detección de vulnerabilidades por Flash Cyber.
Encontrar la vulnerabilidad es solo el primer paso. Google enfatiza especialmente que el enfoque del entrenamiento de Cyber es corregir los problemas, no generar exploits de ataque.
En la prueba de parches CWE-Bench ejecutada por Collinear, la primera entrega de Flash Cyber logró una tasa de aprobación del 47,2%, frente al 47,8% del modelo insignia líder comparado. Ambos resultados son cercanos, pero Google indica que el costo de ejecución de Flash Cyber es menor.
Esto representa un cambio en el objetivo del agente de ciberseguridad, de “informar a los ingenieros que podría haber un problema” hacia la comprensión de vulnerabilidades, la escritura de parches, la ejecución de pruebas y la verificación de las modificaciones. Si los resultados son lo suficientemente confiables, podría reducir el tiempo que el equipo de seguridad tarda en pasar de detectar una vulnerabilidad a implementar una corrección.
Chrome obtiene 2.6 veces el parche correcto, pero aún está en pruebas por parte del fabricante y los socios.
Google ha utilizado Flash Cyber para trabajos de seguridad de código interno.
El equipo de seguridad de Chrome afirma que la cantidad de parches de vulnerabilidad correctos que genera es 2.6 veces mayor que la de modelos comerciales más grandes. La empresa de ciberseguridad Wiz indica que, en sus pruebas de penetración, Flash Cyber supera a otros modelos de vanguardia en una tasa de recuperación de vulnerabilidades entre 7.5 y 9.7 puntos porcentuales, con un costo entre 2.3 y 5.2 veces menor.
El equipo de investigación de vulnerabilidades de Google Cloud también indicó que el modelo descubrió una vulnerabilidad crítica en menos de dos horas, mientras que estudios similares suelen durar meses.
Estos resultados tienen valor de referencia real, pero no deben considerarse como evaluaciones públicas independientes y reproducibles. Google no ha hecho públicos los detalles específicos de esa vulnerabilidad crítica, la lista de modelos comparados ni el recorrido completo de ejecución; los datos de Chrome provienen de Google internamente, y Wiz también es un socio de Fairwind. Por lo tanto, demuestran que los modelos ya pueden participar en tareas de seguridad reales, pero no prueban que logren un rendimiento equivalente de forma estable en todos los repositorios de código y tipos de vulnerabilidades.
La capacidad de seguridad cibernética más fuerte solo está disponible para instituciones confiables
Flash Cyber se ofrece a través del nuevo programa Fairwind de Google, con más de 650 participantes actuales, principalmente instituciones gubernamentales de ciberseguridad, operadores de infraestructuras críticas, mantenedores de software y grandes empresas de seguridad.
Las instituciones deben limitar el acceso interno a un grupo específico de personas y adoptar medidas de seguridad como la autenticación multifactor. Después de integrarse con el CodeMender Agent, el modelo puede buscar, verificar y reparar vulnerabilidades en el entorno en la nube de la institución.
Los clientes normales de Google Cloud aún pueden usar CodeMender con el modelo público de Gemini, pero no pueden acceder directamente a todas las capacidades completas de Flash Cyber.
Este enfoque de lanzamiento, “un modelo base con dos niveles de permisos”, es muy similar a la estrategia anterior de Anthropic al dividir a Claude en Fable y Mythos: las capacidades generales de programación y análisis se ponen a disposición del mercado, mientras que las funciones de ciberseguridad más propensas a ser utilizadas para ataques se proporcionan mediante verificación de identidad, control de acceso y monitoreo continuo.
La seguridad no ha tenido una mejora evidente, pero algunas expresiones en idiomas distintos al inglés han empeorado.
La versión estándar 3.8 Flash incluye restricciones de seguridad relacionadas con química, biología, radiación, nuclear y ataques cibernéticos; la versión Cyber, al necesitar cumplir misiones de defensa profesional, tiene restricciones de seguridad cibernética más flexibles, por lo que solo está disponible para instituciones aprobadas.
La ficha del modelo de Google indica que, en comparación con 3.7 Flash, 3.8 Flash no presenta nuevas capacidades sustanciales en los ámbitos de alto riesgo enfocados por el marco de seguridad de vanguardia de la empresa, por lo que no se activa un nivel de riesgo superior. Además, su protección en las pruebas de inyección de indicaciones indirectas Gray Swan también ha mejorado.
Sin embargo, la ficha del modelo también revela que 3.8 Flash descendió un 5.4% en las pruebas automáticas de seguridad multilingüe en comparación con 3.7 Flash. Tras una revisión manual por parte de Google, se indicó que la mayoría de las diferencias corresponden a falsos positivos o contenidos no graves, pero no se han publicado los datos completos de la muestra ni los datos por idioma.
El modelo también conserva los problemas comunes de los modelos de lenguaje grande, incluidas alucinaciones, respuestas ocasionales lentas o tiempo de espera excedido, y el uso excesivo de tokens para mejorar el rendimiento. La fecha de corte de conocimiento se indica como marzo de 2026, pero Google señala que en algunos ámbitos, el conocimiento confiable puede seguir actualizándose solo hasta alrededor de enero de 2025; cuando se trate de información más reciente, aún es necesario verificarla en línea.
La verdadera competencia está pasando de "quién es más inteligente" a "quién puede ser utilizado a gran escala".
Lo más destacable de Gemini 3.8 Flash no es que haya superado en un punto porcentual alguna métrica, sino que Google está incorporando capacidades de programación de largo plazo, análisis profesional y llamada autónoma de herramientas en el rango de precios de Flash.
Los modelos de gama alta son adecuados para tareas difíciles de alto valor y baja frecuencia; sin embargo, los Agentes que realmente se ejecutan en servicios al cliente empresarial, pipelines de programación, análisis financiero y escaneo de seguridad pueden manejar millones de llamadas diarias. En estos escenarios, la velocidad, el costo por unidad y la tasa de éxito por tarea suelen ser más importantes que ocupar el primer lugar en los rankings.
3.8 Flash también muestra la contradicción en esta ruta: cuanto mejor sea el modelo en revisar repetidamente y trabajar de forma continua, más probable será que genere más tokens, aumentando el costo por tarea del modelo "barato". Por lo tanto, el núcleo de la competencia futura entre Agentes no solo será quién responda mejor, sino también quién pueda determinar cuándo continuar pensando, cuándo utilizar herramientas y cuándo detenerse.
