Google DeepMind представила EmbeddingGemma 2 — відкриту модель для пошуку та зіставлення інформації різних форматів. Вона працює з текстом, програмним кодом, зображеннями, аудіо та відео й може виконувати завдання безпосередньо на пристрої без передавання даних у хмару.
EmbeddingGemma 2 має 740 млн параметрів і базується на архітектурі Gemma 4. Модель створює числові представлення даних — ембеддинги, які допомагають системі визначати схожість інформації за змістом. Завдяки цьому людина може, до прикладу, знайти потрібний фрагмент відео за голосовим запитом або відшукати інформацію в аудіозаписах за текстовим описом.
Google розробила модель так, щоб окремі її компоненти можна було використовувати залежно від завдання. Для роботи лише з текстом потрібно близько 270 млн параметрів. Окремо можна підключити компоненти для обробки зображень і аудіо.
Модель також дає змогу зменшувати розмір ембеддингів із 768 до 512, 256 або 128 вимірів. За даними Google, це може скоротити обсяг памʼяті для локальних векторних баз даних до шести разів.
EmbeddingGemma 2 отримала контекстне вікно на 8 000 токенів — у чотири рази більше, ніж попередня версія. За один запит модель може опрацювати до 5,5 хвилини аудіо, 29 зображень або 58 кадрів відео. Також вона підтримує поєднання різних типів даних в одному запиті.
Google повідомляє, що EmbeddingGemma 2 зберегла можливості попередньої версії для роботи з текстами різними мовами та покращила результати для програмного коду. У тесті MTEB Code показник моделі зріс із 68,76 до 78,68 бала.
Розробники можуть використовувати EmbeddingGemma 2 для локального пошуку у файлах, медіатеках і програмному коді, а також для систем RAG, які знаходять потрібну інформацію перед формуванням відповіді ШІ. Локальна обробка може бути корисною для сервісів, де важливо не передавати дані на зовнішні сервери або забезпечити роботу без підключення до інтернету.
EmbeddingGemma 2 поширюється за ліцензією Apache 2.0. Google вже опублікувала модель на Hugging Face і Kaggle. Вона підтримує низку інструментів для запуску моделей, серед яких transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama та LM Studio.
Джерело: Google