Google lanzará Gemini 3.8 Flash mañana, con enfoque en programación y comprensión de video

icon MarsBit
Compartir
AI summary iconResumen
Google lanzará Gemini 3.8 Flash mañana, un importante evento de lanzamiento de token en el ámbito de la IA. El modelo, con nombre en código 'Skimaki', mejora la programación y la comprensión de video, reduciendo el uso de tokens hasta en un 88%. Gemini 3.5 Pro ha sido cancelado, con el desarrollo desplazado a Gemini 4.0. Las noticias en cadena muestran que Google también está introduciendo la comprensión de video agente para el análisis de contenido dinámico.

Claude 5.1 acaba de lanzarse, y al otro lado OpenAI Astra llega inmediatamente.

Ahora, incluso Google ha tenido nuevos movimientos. Según los últimos rumores, Gemini 3.8 Flash debutará mañana.

Google

Google

Parece que el mundo de la IA va a tener otra "fiesta de Año Nuevo".

Gemini 3.5 Pro retirado, próxima gran versión 4.0

En lugar de la publicación de Gemini 3.8 Flash, muchos aún están más curiosos: ¿¡Cuándo saldrá Gemini 3.5 Pro?!

Lo siento, no esperen más, Google ha abandonado...

Google

Desde el anuncio de la conferencia I/O de mayo de este año, han pasado casi 4 meses, y la evolución de Gemini 3.5 Pro ni siquiera llega a la de Flash.

Google también se vio obligado a descartarlo directamente.

Afortunadamente, Gemini 4.0 obtuvo una excelente evaluación durante la preentrenamiento, y el postentrenamiento continúa avanzando sin problemas.

Google

Google

Esta exclusiva de WSJ también anuncia con gran impacto las potentes habilidades de programación de Gemini 3.8 Flash (código «Skimaki»).

Se afirma que, en pruebas comparativas de las herramientas de codificación internas de Google, Jetski, 3.8 Flash superó directamente al modelo Opus.

Además, este modelo ha estado en desarrollo durante varios meses, incluso antes del «terremoto» en la dirección de Google.

Hassabis se retira, el científico principal Jeff Dean deja la empresa, lo que hace que muchos se preocupen por el futuro de Gemini.

Google

However, it appears that everything is proceeding smoothly internally.

Actualmente, Google planea lanzar primero Gemini 3.8 Flash porque este modelo tiene menos parámetros, requiere menos cálculo y es más fácil de lograr resultados.

Según fuentes internas, desde principios de este año, Google ha asignado más recursos humanos y computacionales específicamente para mejorar la capacidad de Gemini para escribir código.

En particular, se ha aumentado la inversión en "aprendizaje por refuerzo" para que la IA pueda aprender verdaderamente nuevas habilidades mediante la prueba y el error.

Además, Google DeepMind y otros laboratorios avanzan simultáneamente en múltiples proyectos, de modo que si uno no funciona, otro puede tomar su lugar.

Gemini 3.5 Pro no cumplió con las expectativas, pero Gemini 4.0 aún no está disponible.

Actualmente, las dos grandes de Silicon Valley, OpenAI y Anthropic, ya destacan mucho en modelos avanzados y agentes de programación.

Information indica que la próxima generación de OpenAI, Astra, también utiliza un nuevo método de inferencia llamado «profundidad recurrente», que reduce la cantidad de tokens de pensamiento mientras mejora significativamente el rendimiento.

This王牌 will be revealed this week.

Google

Y en este preciso momento, Google debe entregar algo.

Después de la promesa de劈柴, durante los siguientes meses, además de lanzar un modelo 3.7 Flash, no ha lanzado ningún otro modelo que emocione a la comunidad de IA.

Quizás esta noche llegue Gemini 3.8 Flash.

Google

Gemini por primera vez, ya puede ver videos.

Antes de publicar esto, Google lanzó hoy una previa para integrar una nueva función en Gemini:

Comprensión de video por agentes (Agentic Video Understanding)

Esta función es simplemente genial.

Sube un video de la conferencia I/O: el mismo modelo, Gemini 3.7 Flash, reduce el consumo de tokens en un 88%.

Google

Google indicó en su blog oficial que los modelos Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite pueden utilizar la capacidad de comprensión de video agente, accesible a través de Google AI Studio y Gemini Enterprise Agent Platform.

Al activar este interruptor en los conjuntos de referencia estándar de análisis de video, el consumo de tokens puede reducirse hasta un 88%, el costo de análisis hasta un 66% y la precisión aumentar hasta un 7%.

Google

Y no se cobra un centavo adicional; se mantiene la tarifa estándar de token de la API. Ahorrar dinero y ser preciso suelen entrar en conflicto. Esta vez no ocurrió.

Google

Porque Gemini aprendió a "arrastrar la barra de progreso".

El enfoque anterior se llamaba procesamiento «estático»: el modelo recibía pasivamente un flujo de imágenes con una tasa de fotogramas fija, determinada por parámetros de la API, sin tener ninguna voz en el asunto.

Ahora el modelo decide por sí mismo qué segmento ver, a qué velocidad verlo, si observar las imágenes, escuchar el audio o leer directamente la transcripción.

Google

Esta no es la primera vez que Google hace esto.

La visión agente anterior combinaba la ejecución de código con la comprensión nativa de imágenes de Gemini, permitiendo que el modelo escribiera código por sí mismo para ampliar, recortar y comparar una imagen.

Ahora le toca al video, misma idea, solo que se reemplazó la herramienta por la herramienta nativa de video.

Cuatro tareas que antes eran muy difíciles

El blog oficial también enumera varios escenarios de aplicación de alta dificultad.

Búsqueda de fragmentos de menos de un segundo. Anteriormente, los modelos «veían» videos y tomaban una imagen por segundo. El problema es que muchas cosas pasan en menos de un segundo.

Ahora se puede localizar estos instantes con precisión de menos de un segundo.

Esto significa que por primera vez la "edición automática" es realmente viable: antes, los editores tenían que revisar manualmente la línea de tiempo, cuadro por cuadro, para determinar dónde hacer los cortes; ahora, el modelo puede escanear primero y marcar los puntos de corte candidatos, y luego el humano elige.

Google

Buscar una aguja en un pajar. Hacer una pregunta compleja en horas de material sin tener que gastar millones de tokens.

Detección de anomalías. Una vez que el modelo identifica una ventana de tiempo específica, puede aumentar la tasa de fotogramas y volver a muestrear solo ese segmento para observar movimientos rápidos y pequeños defectos visuales. Esto es especialmente útil en la inspección de calidad en líneas de producción y en la vigilancia de seguridad, ya que las anomalías suelen ocurrir solo durante unos pocos segundos.

Cuenta. Preguntas como cuántas veces se repite un movimiento o cuántos objetos diferentes hay en la escena eran errores estables para el modelo, y la razón es sencilla: en los fotogramas omitidos justo había algo.

Google

El agente finalmente prestó atención al video.

El video siempre ha sido el más caro de todos los modalidades.

El texto es barato, las imágenes están bien, pero los videos son grandes y largos; un minuto puede consumir tantos tokens como un libro entero.

Entonces, en los últimos dos años, todos han hablado de los Agentes, pero más bien se enfocan en que pueden leer, escribir y utilizar herramientas.

El problema es que un agente que depende principalmente de la comprensión textual ve, en realidad, solo un mundo que ha sido «transmitido» por otra persona.

No sabe nada de lo capturado por cámaras, lo grabado en reuniones o lo que pasa por la línea de producción: cosas que nadie quiere dedicar tiempo a transcribir.

Ahora, esta curva de costos se ha reducido significativamente.

Un agente que pueda revisar varias horas de monitoreo, decenas de horas de cursos y cientos de materiales sin agotar el presupuesto cambia la forma en que interactúa con el mundo.

Ya no necesita esperar a que alguien describa la imagen en texto para alimentarla, ni tiene que elegir entre "verlo bien" y "verlo con precisión".

Google fue el primero en romper esta barrera.

La batalla de la IA, la siguiente ronda

En estos días, los lanzamientos de las cuatro empresas casi coincidieron.

Claude 5.1 acaba de llegar, OpenAI Astra ya está en la puerta, y Google, que lleva meses acuartelado, finalmente lanza Gemini 3.8 Flash para enfrentarla.

Tras esta actualización, Claude ahora se enfoca en dos áreas principales: programación e investigación.

La próxima generación de Astra se convertirá en un "agente continuo"; en palabras de Ultraman, su capacidad de uso de la computadora ha alcanzado el nivel humano.

Google

Gemini 3.8 Flash también experimentará un mayor avance en programación.

Ahora, OpenAI, Anthropic, Google y SpaceXAI ya están funcionando a plena capacidad.

Google

Musk anuncia que Grok 4.7 se lanzará en diez días

Esta batalla recién está entrando en su fase más feroz.

Referencias:

https://x.com/Google/status/2094840983913402704

https://deepmind.google/blog/introducing-agentic-video-in-gemini/

Este artículo proviene del canal de WeChat "Nuevas Inteligencias", autor: Apocalipsis ASI

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.