Just now, Google is back!
Esta noche, Google lanzó oficialmente Gemini 3.8 Flash y Gemini 3.8 Flash Cyber, especializado en ciberseguridad.
Esta es la tercera versión de Flash lanzada por Google en solo seis semanas.
Las dos actualizaciones anteriores parecían solo un calentamiento, porque esta vez, Google lleva directamente la relación calidad-precio al frente:
¡Costo por tarea única de $0.58! ¡Solo $0.75 por millón de tokens!
Just a tiny model at a "penny price" has, through rigorous performance on key benchmarks, genuinely reached the threshold of the world's top flagship models: Opus 5, GPT-5.6 Sol, and Grok 4.6.
El experto de Google DeepMind, Yao Shunyu, comentó: Para el modelo, esto es solo un pequeño paso; pero para RSI, es un gran avance.

En X, los desarrolladores ya han estallado.
Tras una prueba real, alguien se hizo la pregunta fundamental: “¡Dios mío, ¿Google envió el producto equivocado? ¿No es esto simplemente el Gemini 3.5 Pro que nunca se lanzó? ¡Paga el precio de Flash y hace el trabajo de Pro!”


En el equipo de DeepMind, probablemente alguien no ha dormido desde julio.
Mientras todos aún están procesando Fable 5.1, Google volvió a cambiar las reglas del juego.
El rey de la eficiencia de Google ha regresado: el rey de la relación calidad-precio
Google, tras un largo silencio, anuncia al mundo de manera extremadamente competitiva: el gran demonio ha regresado.

Para comprender el impacto de Gemini 3.8 Flash, primero debemos examinar el panorama actual del mercado de IA.
Originalmente, en la prueba de Artificial Analysis, ya se había establecido una barrera extremadamente estricta. Para poseer una inteligencia de primer nivel (Índice de Inteligencia de alrededor de 60 puntos), debes pagar un costo elevado en Tokens.
Como resultado, Gemini 3.8 Flash actúa como un asesino, simplemente sin reglas.
En el modo de razonamiento avanzado de Artificial Analysis, el índice de inteligencia de Gemini 3.8 Flash alcanzó 59 puntos.

¿Qué concepto es este? Está a un paso de los mejores GPT-5.6 Sol y Grok 4.6, e incluso supera a Claude Opus 5 en algunos aspectos.
¿Y el costo de lograr todo esto? Su costo por tarea individual es de solo $0.58.
Específicamente, el costo de entrada se mantiene en 0.75 dólares por millón de tokens, y la salida en 3.75 dólares por millón de tokens.
Google creó una gráfica: en la frontera de Pareto entre inteligencia y costo, el punto azul que representa a Gemini 3.8 Flash se encuentra en la esquina superior derecha del benchmark de ingeniería de software DeepSWE, dejando atrás al segundo lugar por un amplio margen.

Gemini 3.8 Flash no solo es inteligente, sino que también es increíblemente rápido. Su velocidad de generación alcanza una asombrosa cantidad de 305 tokens/s, mientras que el siguiente modelo apenas llega a 154 tokens/s.
Rápido, inteligente y barato como si no costara nada, este es el modelo que realmente puede usar la gente todos los días.

En particular, en el benchmark de ingeniería de software de ciclo largo (DeepSWE v1.1), 3.8 Flash logró un impresionante 73.7%.
En esta prueba que requiere que la IA resuelva problemas de ingeniería complejos de forma autónoma y escriba código de extremo a extremo, no solo superó a la mayoría de los modelos avanzados y costosos, sino que también costó solo una fracción de su precio.
Sabe que esta es solo la versión «Flash», no la «Pro», ni mucho menos la «Ultra».
En esta ocasión, Google nuevamente permite que los modelos pequeños le arrebaten el puesto a los modelos insignia.
Alguien probó directamente Gemini 3.8 Flash y Opus 5 en la misma tarea.

Este salto significativo en habilidades de programación no es casual.

Este salto significativo en habilidades de programación no es casual.
Según se informa, durante las pruebas de la herramienta de código interna de Google, Jetski, los ingenieros de Google incluso prefieren utilizar 3.8 Flash en lugar del modelo Opus de Anthropic.

Detrás de esto, Google ha estado invirtiendo intensamente en aprendizaje por refuerzo desde principios del año: es decir, la fase de «ajuste final» en el entrenamiento del modelo, que permite que el modelo aprenda realmente a realizar tareas mediante la prueba y el error.
Google DeepMind ha formado un equipo de intervención de código enfocado en mejorar las capacidades de los modelos de programación, liderado por el CTO de DeepMind y supervisado directamente por el cofundador Sergey Brin.
Su objetivo es forzar la autoevolución recursiva, transformar abruptamente el modelo de programación en un investigador de IA completamente automático y cerrar por completo el ciclo de investigación y desarrollo.

En el memorándum interno, Google dijo directamente:
To win the final sprint, we must urgently close the gap in agent execution and turn our models into lead developers.

Además, Google contrató a Barret Zoph, cofundador de Thinking Machines Lab y exresponsable de postentrenamiento en OpenAI, quien ahora ocupa el cargo de vicepresidente de investigación, a cargo del aprendizaje por refuerzo y el postentrenamiento. Este movimiento deja claro que están decididos a luchar hasta el final.
El mes pasado, el cofundador y premio Nobel Demis Hassabis dejó el cargo de CEO, y su sucesor, Koray Kavukcuoglu, comenzó diciendo: acelerar, acelerar y aún más acelerar.
¿Inflación de referencia o superioridad real?
Sin embargo, entre los aplausos, Google fue ampliamente criticada por abrir el champán demasiado pronto.

Lo menos agradable es Meta—
Meta's Muse Spark 1.3 y Gemini 3.8 Flash se enfrentan, con el primero obteniendo 62 puntos en el índice de inteligencia de Artificial Analysis, empatando con Claude Fable 5 y ubicándose entre los mejores.
Muse tiene un costo de entrada 8 veces menor y un costo de salida casi 12 veces menor que Fable 5, ofreciendo una relación calidad-precio óptima.
El jefe de IA de Meta, Alexandr Wang, lo dijo directamente: en el índice inteligente Artificial Analysis, Gemini no es nada y solo puede respirar los gases de escape de los modelos de otros.


Muse Spark 1.3 obtiene una puntuación superior a GPT-5.6 Sol, Grok 4.6 y Gemini 3.8 Flash, pero actualmente solo está disponible en previsualización restringida.
Alguien señaló que, aunque el gráfico de prueba de 3.8 Flash se ve bien, en la práctica puede no serlo.
De hecho, Gemini 3.8 Flash superó a GPT-5.6 Sol y Opus 5 en pruebas como Terminal-Bench 2.1 y HLE, pero la gran diferencia de puntuación entre TBench 2.1 y TBench 4 revela que podría haber cierto componente de «manipulación de clasificaciones».
Es decir, frente a desafíos del mundo real de Zero-shot desconocidos y no incluidos en el conjunto de entrenamiento, 3.8 Flash probablemente aún no sea tan bueno como Opus 5, ese gigante de parámetros.
Pero la solución de Google es extremadamente inteligente: la diligencia compensa la falta de talento.
Como menciona Google en su blog oficial: «Estas mejoras de rendimiento se deben a decisiones de diseño fundamentales: 3.8 Flash trabaja más duro.»
Cuando se enfrenta a tareas complejas, 3.8 Flash está diseñado para realizar pasos adicionales de razonamiento e invocar herramientas iterativamente. Cuando se encuentra con preguntas que no entiende, no se rinde directamente, sino que consume más tokens para realizar una verificación y reflexión internas rápidas.
Aunque consume más tokens al realizar múltiples ciclos de pensamiento, debido a su precio unitario base extremadamente bajo (0.75 dólares por millón de tokens), en total sigue siendo mucho más barato que llamar directamente a GPT-5.6.
Esta estrategia rompe directamente la competencia unidimensional anterior de «parámetros grandes = mayor capacidad».
Demuestra que, en un ciclo de agente perfecto, la velocidad y el costo de inferencia extremadamente bajo son, por sí mismos, una forma poderosa de inteligencia.
¿Por qué publicar un Flash? La versión Pro «cancelada»
¿Esta vez, realmente no enviaron el producto equivocado?
Gemini 3.5 Pro aún no ha aparecido. Gemini 4, el siguiente cartucho principal, tiene datos de preentrenamiento bastante atractivos, pero aún no ha completado la fase de postentrenamiento.

De hecho, el retraso de Google en lanzar la versión Pro tiene detrás una historia triste.
Pai Chai prometió en mayo de este año que lanzaría la serie Pro más potente "el próximo mes", pero ha estado posponiéndolo constantemente.
En realidad, Google tenía originalmente varios modelos candidatos para 3.5 Pro, pero todos fueron descartados sin piedad, ya que no superaban significativamente al actual sistema Flash.
Al mismo tiempo, el próximo modelo insignia, Gemini 4, tan esperado por todos, aunque ha mostrado un buen desempeño en las evaluaciones de preentrenamiento, actualmente se encuentra estancado en la fase más crítica de postentrenamiento.
En resumen, todo se combinó de manera inesperada para impulsar la frenética iteración de la serie Flash.
Hace 2 horas se descubrió una vulnerabilidad que tardaría meses en encontrarse: ¡domina el ranking de ciberseguridad!
¿Está Google, en esta ocasión, simplemente presionando precios en tareas generales con 3.8 Flash?
Mucho más que eso.
El verdadero arma de esta presentación es su hermano gemelo: Gemini 3.8 Flash Cyber.
Incluso los desarrolladores están asombrados: «¿Qué tipo de tarea de seguridad merece que Google cree una variante exclusiva de Cyber específicamente para Flash?»
La respuesta de Google es: para combatir a los futuros hackers de IA.
En la prueba de referencia CyberGym donde se descubrió la vulnerabilidad, 3.8 Flash Cyber obtuvo una puntuación del 86.2%, dominando directamente la tabla de clasificaciones y dejando muy atrás a los modelos anteriores.
No solo eso, el código del mundo real no se limita a C/C++.
En pruebas integradas dentro de Google que abarcan 20 lenguajes de programación, este modelo logró una tasa de éxito superior al 70% para detectar vulnerabilidades generalizadas.
Lo más impresionante es su desempeño real en el mundo real.
El equipo de seguridad de Chrome lo probó y descubrió que generó 2.6 veces más parches de corrección correctos que el mejor modelo comercial disponible anteriormente, que era mucho más grande.
La empresa de seguridad Wiz descubrió que su tasa de recuperación aumentó entre un 7,5 % y un 9,7 % durante las pruebas de penetración, mientras que los costos se redujeron entre 2,3 y 5,2 veces.
Lo más sorprendente es que el equipo de investigación de vulnerabilidades de Google Cloud lo utilizó y, en solo 2 horas, descubrió una vulnerabilidad crítica y fundamental, mientras que anteriormente a los expertos humanos más destacados les llevaba meses encontrar este tipo de vulnerabilidades.
En CWE-Bench (prueba de capacidad de parcheo), la tasa de primer intento de Flash Cyber alcanzó el 47,2%, casi empatando con los modelos de vanguardia más avanzados (47,8%), pero a un costo solo una mínima fracción.

Precisamente debido a la asombrosa capacidad de ataque y defensa de la red de 3.8 Flash Cyber, Google no optó por abrirlo completamente, sino que lo hizo disponible únicamente para instituciones de confianza a través del nuevo programa Fairwind.
OpenAI, Anthropic y Google: La batalla de los grandes modelos entra en un punto de inflexión
A través del lanzamiento de Gemini 3.8 Flash, se puede ver que los tres gigantes actuales de la IA han seguido tres rutas de evolución completamente diferentes.
Anthropic (serie Claude) se enfoca en la confiabilidad y estabilidad del conocimiento.
En pruebas orientadas a cobertura de conocimiento y precisión factual (como AA-Omniscience), Claude sigue siendo una dominación abrumadora.
Los siete primeros son todos de la serie Claude; actualmente están reforzando claramente su capacidad de evitar errores en tareas empresariales, buscando una salida estable.
OpenAI (serie GPT) apuesta por el «razonamiento profundo y la epifanía».
En la prueba CritPt orientada a la física y la derivación matemática, GPT-5.6 Sol lidera con una ventaja abrumadora.
OpenAI parece estar persiguiendo un surgimiento puro de inteligencia, exigiendo que el modelo pueda "pensar" por sí mismo como un científico, sin que nadie le diga la respuesta.
Google (sistema Gemini) crea al "trabajador hiperacelerado en un bucle infinito".
Google这次给出了第三种答案:也许我一次想不通最难的物理题,但我反应极快、成本极低。
En la era de los agentes, puedo pensar 100 veces en un segundo, escribir código, ejecutarlo, encontrar errores, modificarlo, y forzar la obtención del resultado correcto mediante iteraciones brutales a un costo extremadamente bajo.
Agen enfrenta problemas en la vida real que requieren prueba y error repetidos, llamadas a herramientas y ajustes dinámicos.
Y Gemini 3.8 Flash está perfectamente diseñado para este tipo de "flujos de trabajo de larga duración".
En Google Antigravity, puedes hacer que 3.8 Flash genere automáticamente un juego completo con rompecabezas, texturas de entorno y niveles 3D utilizando solo una palabra clave y una instrucción de bucle.
Puedes usarlo para generar automáticamente un mapa de Google en versión DOS con vistas de calle y navegación.
Claramente, la facilidad de uso y el costo de Gemini 3.8 Flash han superado un punto crítico.
La llegada de Gemini 3.8 Flash parece que Google anuncia a toda la industria: los modelos grandes están dejando atrás la idea de que "solo los gigantes pueden permitírselos" y avanzan hacia la democratización del poder de cómputo.
Las tareas de agentes que antes requerían decenas de miles de dólares y días enteros de ejecución ahora se pueden completar en minutos por el costo de unas pocas tazas de café.
La era del individuo sobresaliente para las personas comunes ha llegado realmente.
Este es el momento de conciencia de los modelos pequeños.
Referencias:
https://x.com/alexandr_wang/status/2095266112212754659?s=20
https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
Editado por: Aeneas David
Este artículo proviene del canal de WeChat "Nuevas Inteligencias", autor: Apocalipsis ASI
