Publicado 07/10/2026 10:25

Google lanza EmbeddingGemma 2, un modelo multimodal ligero para buscar fotos, vídeos y audio sin conexión en el móvil

Imagen de portada del anuncio de EmbeddingGemma 2.
Imagen de portada del anuncio de EmbeddingGemma 2. - GOOGLE DEEPMIND

   MADRID, 7 Oct. (Portaltic/EP) -

   Google DeepMind ha lanzado su nuevo modelo de pesos abiertos EmbeddingGemma 2 para desarrolladores, que sobresale no solo por su poco tamaño para poder instalarse en un móvil, sino también por su incrustación multimodal, que permite convertir distintos tipos de información (texto, imágenes, vídeo y audio) en números (vectores) dentro de un mismo sistema.

   La tecnológica ha compartido los detalles de EmbeddingGemma 2 que, además de ser un modelo dedicado a desarrolladores como el mejor de su clase por lo ligero que es y los pocos recursos de cómputo que requiere, puede probarse en un móvil Android o iPhone a través de la aplicación Google AI Edge Gallery con dos demos: búsqueda instantánea de contenido sin conexión y 'Video Moments Finder'.

   La búsqueda instantánea de contenido permite organizar y buscar entre las fotos y vídeos de forma local en tiempo real según se escriben las palabras, al relacionar frases o imágenes de ejemplo con los vectores de las fotos locales, guardados en una base de datos SQLite.

   'Video Moments Finder' es la otra demo disponible sin conexión para el móvil, capaz de encontrar fotogramas concretos dentro de vídeos locales con frases como "niños riéndose" o "perro atrapando una pelota de tenis", al analizar la imagen y fragmentos de audio sin necesidad de generar transcripciones de texto intermedias.

   Por otro lado, hay otra demostración para Mac en forma de una aplicación experimental, Google AI Edge Foresight, que actúa como asistente de reuniones local y privado al conectarse al audio del sistema y al micrófono para funcionar sin conexión con cualquier plataforma de videollamadas.

   Son varios ejemplos de la utilidad que supone para los desarrolladores EmbeddingGemma 2, que se define por su función principal al representar texto, imágenes, fotogramas de vídeo y audio en un único espacio vectorial numérico, lo que permite relacionar y buscar cualquier tipo de archivo sin necesidad de traducir a texto.

   Además, el modelo se caracteriza por su tamaño compacto de 740 millones de parámetros y se ha diseñado para ejecutarse en el dispositivo de forma local y sin conexión con el fin de garantizar la privacidad de los datos, lo que abre la puerta a que los desarrolladores integren estas funciones de búsqueda en nuevas aplicaciones o en futuras actualizaciones.

Asimismo, Google ha puesto a disposición varias herramientas para desarrolladores como ML Kit (que llegará en las próximas semanas), MediaPipe Tasks y LiteRT para facilitar la integración de EmbeddingGemma 2.

Contador

Contenido patrocinado