Google lanzó Gemini 3.8 Flash y 3.8 Flash Cyber para defensa cibernética el 2 de septiembre. A solo tres semanas del lanzamiento de 3.7 Flash, esta es la tercera actualización de la serie Flash en seis semanas. Google posiciona a 3.8 como el modelo Flash más potente hasta la fecha en razonamiento y codificación; la versión estándar ya está disponible en Gemini API, Google AI Studio, Android Studio, Gemini Enterprise y algunos productos de consumo; la versión Cyber, en cambio, solo se ofrece de forma prioritaria a instituciones gubernamentales confiables, operadores de infraestructuras críticas y mantenedores de software a través del nuevo Programa Fairwind. Ambas comparten la inteligencia base, pero difieren en permisos de implementación y protección de seguridad.
El precio de lanzamiento de普通3.8 Flash sigue siendo de 0.75 dólares por millón de tokens de entrada y 3.75 dólares por millón de tokens de salida, igual que en la versión 3.7. Sin embargo, este precio solo estará vigente hasta el 31 de diciembre de 2026; a partir del 1 de enero de 2027, los precios oficiales aumentarán a 1.50 dólares por millón de tokens de entrada y 7.50 dólares por millón de tokens de salida. Lo que es más fácil pasar por alto es que, en tareas complejas, el modelo realizará más pasos de razonamiento y llamará repetidamente a herramientas; Google advierte explícitamente que los niveles de esfuerzo elevados pueden consumir más tokens. Que el precio unitario no haya aumentado no significa que la factura total de una tarea se mantenga invariable.
Flash comienza a competir por tareas largas, donde además de la velocidad, se valora la tasa de finalización
La evidencia presentada por Google abarca codificación de largos ciclos, análisis profesional y razonamiento multietapa. Flash supera a la mayoría de los modelos前沿 más grandes en la evaluación de ingeniería de software de largos ciclos DeepSWE v1.1; obtiene un 54.9% en HLE-Verified. La empresa también cita benchmarks de agentes financieros y legales para demostrar que busca transformar a Flash de un modelo de respuesta de baja latencia en un modelo de trabajo capaz de planificar continuamente, invocar herramientas y entregar resultados completos. Demostraciones como la visualización de desmontaje de hardware, la generación de un mapa de DOS con una sola indicación y un juego 3D enfatizan que el modelo no solo genera fragmentos de código, sino que puede revisar y modificar continuamente el producto final en un bucle.
Sin embargo, la puntuación de referencia no se puede intercambiar directamente por productividad empresarial. La tasa de éxito en tareas largas suele verse afectada por el tamaño del repositorio de código, el entorno de dependencias, la calidad de las pruebas, los permisos de las herramientas y el presupuesto de reintentos. Cuando la estrategia “más diligente” de 3.8 mejora la tasa de finalización, también aumenta el tiempo de ejecución y el uso de tokens. Los equipos de desarrollo deben registrar simultáneamente el precio por llamada, el total de tokens por tarea, el número de llamadas a herramientas, el número de reintentos antes del éxito y el tiempo de re trabajo humano para determinar si la actualización realmente resulta más económica. Para cargas de trabajo donde la latencia o el presupuesto son prioritarias, Google sigue recomendando reducir el nivel de esfuerzo o continuar utilizando 3.7 Flash; las versiones anteriores no se retiraron inmediatamente tras el lanzamiento del nuevo producto.
La versión estándar ya está disponible para desarrolladores y empresas, y los usuarios de Google AI Pro y Ultra también pueden utilizarla en la aplicación Gemini, en el modo AI de búsqueda y en Gemini en Sheets. Las funciones, cuotas y alcance geográfico pueden variar según la entrada, por lo que no se debe afirmar que “el modelo se ha lanzado” como si todos los usuarios y todos los productos tuvieran exactamente las mismas capacidades. En particular, los flujos de trabajo con herramientas autónomas dependen de que la aplicación proporcione al modelo las herramientas, permisos y entornos de ejecución recuperables correspondientes.
La versión Cyber es más fuerte y más estrecha; el 47.2% no es un compromiso de reparación automática
Gemini 3.8 Flash Cyber se centra en la detección de vulnerabilidades y la generación de parches. Google afirma que logró una tasa de éxito superior al 70% en evaluaciones internas de detección de vulnerabilidades que cubren 20 lenguajes de programación; en evaluaciones externas de parches CWE-Bench, alcanzó un pass@1 del 47,2%, cerca del 47,8% de un modelo líder de vanguardia, pero con costos más bajos. Los resultados del uso interno del equipo de seguridad de Chrome muestran que 3.8 Flash Cyber generó 2,6 veces más parches correctos de vulnerabilidades que el mejor modelo comercial grande. Wiz también informó un aumento en la tasa de recuperación de 7,5 a 9,7 puntos porcentuales en sus benchmarks internos de pruebas de penetración, con costos entre 2,3 y 5,2 veces más bajos.
Estos números tienen valor de referencia, pero también límites. Los métodos de muestreo, sugerencias y evaluación humana para los umbrales internos no se detallan completamente en el anuncio; un pass@1 del 47,2% implica que una sola generación no garantiza que se corrijan más de la mitad de los problemas. Google prioriza la "corrección" sobre la "explotación" y añade protección contra abusos químicos, biológicos, radiológicos, nucleares y cibernéticos a la versión estándar 3.8. La versión Cyber, diseñada para satisfacer necesidades de defensa profesionales, adopta restricciones de ciberseguridad más flexibles y, por lo tanto, no se ha publicado completamente, sino que solo está disponible para defensores confiables dentro del programa Fairwind.
Lo que realmente cambia en este lanzamiento es el equilibrio de la serie Flash: ya no se basa únicamente en precios bajos y velocidad para atraer solicitudes masivas, sino que persigue una mayor tasa de finalización de tareas complejas mediante ciclos de inferencia más largos. El error más común que cometen las empresas al reemplazar directamente la 3.7 por la 3.8 es comparar únicamente los precios por millón de tokens. El enfoque más seguro es realizar pruebas por capas con tareas reales: limitar el nivel de esfuerzo en solicitudes simples, permitir más ciclos en tareas largas y mantener aprobación humana y entornos aislados para tareas seguras. La Flash 3.8 ya está disponible, y Cyber ya ha ingresado al programa restringido; sin embargo, si puede completar más tareas de producción con un costo total más bajo dependerá de los datos end-to-end de cada equipo.
