Google presenta Gemini 3.5 y Gemini Omni: la nueva generación de IA multimodal
En el marco del Google I/O 2026, Google anunció dos grandes novedades en su ecosistema de inteligencia artificial: Gemini 3.5 Flash, el modelo más avanzado para tareas agénticas, y Gemini Omni, un nuevo modelo capaz de generar y editar video a partir de cualquier tipo de entrada. Ambos lanzamientos marcan un salto significativo en las capacidades de IA de Google y están disponibles hoy para millones de usuarios.
Gemini 3.5 Flash: inteligencia de frontera para agentes autónomos
Gemini 3.5 Flash llega como el primer modelo de la nueva familia Gemini 3.5, diseñada específicamente para ejecutar flujos de trabajo complejos con agentes autónomos. Google lo describe como el modelo con mejor rendimiento en agentes y programación que ha desarrollado hasta la fecha.
Rendimiento sin precedentes
En pruebas de referencia, Gemini 3.5 Flash supera a Gemini 3.1 Pro en múltiples métricas clave: Terminal-Bench 2.1 (76.2%), GDPval-AA (1656 Elo), MCP Atlas (83.6%) y comprensión multimodal con un 84.2% en CharXiv Reasoning. Además, genera cuatro veces más tokens por segundo que otros modelos de frontera, lo que lo convierte en una opción ideal para aplicaciones que requieren velocidad sin sacrificar calidad.
Diseñado para trabajar con subagentes
Una de las características más destacadas de Gemini 3.5 Flash es su integración con el sistema Antigravity de Google, la plataforma de desarrollo de agentes de la compañía. Con esta combinación, el modelo puede orquestar múltiples subagentes que trabajan en paralelo para resolver problemas complejos: desde desarrollar nuevas aplicaciones hasta administrar bases de código o preparar documentos financieros complejos.
Como ejemplo, Google demostró cómo dos agentes usando Gemini 3.5 Flash lograron sintetizar el documento AlphaZero y programar un juego completamente funcional en apenas seis horas, una tarea que antes requería días de trabajo humano.
Impacto real en empresas líderes
Antes de su lanzamiento público, Gemini 3.5 Flash ya está siendo utilizado por algunas de las empresas tecnológicas más importantes del mundo. Shopify lo usa para analizar datos complejos y prever crecimiento en ventas. Macquarie Bank lo prueba para procesar documentos de más de 100 páginas con baja latencia. Salesforce lo integró en Agentforce para automatizar tareas empresariales. Xero lo utiliza para administrar procesos de varias semanas de forma autónoma, y Databricks lo usa para monitorear y analizar grandes conjuntos de datos en tiempo real.
Disponibilidad y acceso
Gemini 3.5 Flash está disponible hoy para miles de millones de usuarios a través de la app de Gemini y el Modo IA en el Buscador de Google. Los desarrolladores pueden acceder a él en Google Antigravity, la API de Gemini en Google AI Studio y Android Studio. Las empresas pueden integrarlo a través de Gemini Enterprise Agent Platform y Gemini Enterprise.
Google también anunció que está trabajando en Gemini 3.5 Pro, que ya se usa internamente y se espera que esté disponible al público el próximo mes.
Gemini Omni: el modelo que crea desde cualquier entrada
El segundo gran anuncio del Google I/O 2026 es Gemini Omni, un modelo que representa un salto cualitativo en la generación de contenido multimodal. Si Gemini 3.5 se especializa en agentes y programación, Omni lleva las capacidades creativas de la IA a un nivel completamente nuevo, comenzando con la generación y edición de video.
Edición de video por conversación
Gemini Omni permite editar videos mediante lenguaje natural, de forma conversacional. El usuario puede encadenar instrucciones una tras otra, y el modelo mantiene coherencia entre ellas: los personajes conservan su apariencia, las leyes físicas se respetan y la escena recuerda lo que ocurrió antes.
Las posibilidades son amplias: se puede transformar el entorno de un video, cambiar elementos específicos, reimaginar la acción, agregar nuevos objetos o personajes, o convertir un momento cotidiano en algo completamente distinto. Todo mediante texto, sin necesidad de herramientas de edición especializadas.
Razonamiento aplicado a la creatividad
A diferencia de otros modelos generativos, Gemini Omni no solo imita patrones visuales: razona sobre lo que debería ocurrir en la escena. Combina una comprensión intuitiva de la física (gravedad, dinámica de fluidos, energía cinética) con el conocimiento histórico, científico y cultural propio de Gemini. El resultado son videos que no solo parecen reales, sino que tienen coherencia narrativa y significado.
Esto abre la puerta a casos de uso muy variados: desde explicaciones visuales de conceptos científicos complejos (como el plegamiento de proteínas en estilo claymation) hasta animaciones interactivas para investigaciones académicas.
Multimodalidad total como entrada
Una de las características más potentes de Gemini Omni es su capacidad para aceptar cualquier tipo de referencia como entrada: imágenes, videos, audio o combinaciones de todos ellos. El usuario puede, por ejemplo, tomar un personaje de una imagen, aplicarle el movimiento de un video de referencia y agregar el audio de un archivo de sonido, obteniendo un video final coherente y de alta calidad.
Avatares digitales y transparencia
Gemini Omni también permite crear videos con avatares digitales, versiones virtuales del propio usuario que permiten generar videos con su apariencia y voz. Google asegura que todos los videos creados con Omni incluyen la marca de agua imperceptible SynthID, verificable desde la app de Gemini, Google en Chrome y el Buscador de Google.
Disponibilidad
Gemini Omni Flash, el primer modelo de la familia Omni, está disponible hoy para todos los suscriptores de Google AI Pro y Ultra a nivel mundial a través de la app de Gemini y Google Flow. También estará disponible sin costo para usuarios de YouTube Shorts y la app de YouTube Create a partir de esta semana. En las próximas semanas, los desarrolladores y clientes empresariales podrán acceder al modelo a través de APIs.
Una nueva era de IA creativa y agéntica
Los lanzamientos de Gemini 3.5 y Gemini Omni en el Google I/O 2026 confirman la apuesta de Google por dos frentes simultáneos: la IA agéntica capaz de ejecutar tareas complejas de forma autónoma, y la IA generativa multimodal que democratiza la creación de contenido visual. En ambos casos, Google busca que sus modelos sean accesibles para el usuario general, los desarrolladores y las grandes empresas por igual.
