Google DeepMind presenta EmbeddingGemma 2, un modelo abierto que integra texto, imagen, video y audio

Google DeepMind presenta EmbeddingGemma 2, un modelo abierto que integra texto, imagen, video y audio

Imagen para ayudar a comprender el artículo

Un modelo multimodal abierto para convertir información en vectores

Google DeepMind anunció el lanzamiento de EmbeddingGemma 2, un modelo abierto diseñado para transformar texto, imágenes, videos y audio en representaciones vectoriales dentro de un mismo sistema. La compañía presentó la herramienta como uno de los modelos abiertos de su categoría con soporte multimodal desde su diseño inicial.

El modelo completo cuenta con 740 millones de parámetros y sus pesos están disponibles gratuitamente en Hugging Face y Kaggle bajo la licencia Apache 2.0, que permite también el uso comercial. El identificador del modelo publicado es google/embeddinggemma-2.

Google indicó que EmbeddingGemma 2 también estará disponible próximamente en Model Garden de Gemini Enterprise Agent Platform y que puede ejecutarse mediante herramientas como vLLM, llama.cpp y Ollama.

Arquitectura y funcionamiento en dispositivos

La versión multimodal de EmbeddingGemma 2 está compuesta por distintos módulos: un bloque de texto de 270 millones de parámetros, un codificador visual de 170 millones y un codificador de audio de 300 millones. También existe una versión enfocada únicamente en procesamiento de texto.

El modelo utiliza una ventana de contexto de 8.000 tokens y genera vectores de 768 dimensiones. Gracias al entrenamiento Matryoshka, estos vectores pueden reducirse a tamaños de 512, 256 o 128 dimensiones según las necesidades de uso.

Google publicó datos de consumo de memoria tras aplicar cuantización en un Google Pixel 11 Pro: el procesamiento exclusivo de texto requiere aproximadamente 191 MB, mientras que el uso completo de las funciones multimodales necesita unos 567 MB.

Además, se presentó una aplicación de notas de reuniones para Mac con enfoque local, que utiliza EmbeddingGemma 2 para organizar registros de distintas aplicaciones y reuniones presenciales sin necesidad de conexión a internet.

Resultados publicados y límites del modelo

Google compartió comparaciones de rendimiento principalmente frente a la generación anterior, EmbeddingGemma 1. Según la tarjeta del modelo de Google AI, en la evaluación MTEB Code (NDCG@10), EmbeddingGemma 2 obtuvo 78,68 puntos frente a 68,76 de la versión anterior.

En la prueba multilingüe MTEB (Mean Task), el nuevo modelo alcanzó 61,36 puntos, una diferencia reducida respecto a los 61,15 puntos de EmbeddingGemma 1. Google también informó resultados para tareas de imagen, video y búsqueda de audio, aunque estas mediciones no incluyen comparaciones directas con modelos de otras compañías.

La empresa señaló que el modelo logró resultados destacados entre los modelos multimodales de menos de 1.000 millones de parámetros, aunque las tablas comparativas publicadas se centraron en la comparación con la versión anterior de EmbeddingGemma.

Google también detalló algunas limitaciones. La reducción del vector a 128 dimensiones puede disminuir la calidad, especialmente en búsquedas de imagen, video y audio, donde el rendimiento puede caer aproximadamente al 75% del nivel original. Para usos multimodales, la compañía recomienda validar el funcionamiento con datos reales antes del despliegue. La versión de 256 dimensiones mantiene una pérdida de calidad reducida.

Entre otras condiciones, el modelo puede procesar audio de hasta unos 5,5 minutos por vez. Google advierte además que el rendimiento puede variar entre los más de 100 idiomas compatibles y que, como otros modelos entrenados con grandes volúmenes de datos, puede reflejar sesgos sociales y culturales presentes en esos datos.

Source: Original Korean article - Trendy News Korea

Comentarios