Google представила EmbeddingGemma 2 для пошуку тексту, зображень, аудіо та відео прямо на пристроях

Google DeepMind представила EmbeddingGemma 2 — відкриту модель для пошуку та зіставлення інформації різних форматів. Вона працює з текстом, програмним кодом, зображеннями, аудіо та відео й може виконувати завдання безпосередньо на пристрої без передавання даних у хмару.

EmbeddingGemma 2 має 740 млн параметрів і базується на архітектурі Gemma 4. Модель створює числові представлення даних — ембеддинги, які допомагають системі визначати схожість інформації за змістом. Завдяки цьому людина може, до прикладу, знайти потрібний фрагмент відео за голосовим запитом або відшукати інформацію в аудіозаписах за текстовим описом.

Google розробила модель так, щоб окремі її компоненти можна було використовувати залежно від завдання. Для роботи лише з текстом потрібно близько 270 млн параметрів. Окремо можна підключити компоненти для обробки зображень і аудіо.

Модель також дає змогу зменшувати розмір ембеддингів із 768 до 512, 256 або 128 вимірів. За даними Google, це може скоротити обсяг памʼяті для локальних векторних баз даних до шести разів.

Компанія оптимізувала EmbeddingGemma 2 для роботи на смартфонах та інших пристроях з обмеженими ресурсами. На Google Pixel 11 Pro модель після оптимізації потребує приблизно 191 МБ оперативної памʼяті для роботи лише з текстом і близько 567 МБ — для повної версії з підтримкою різних форматів.

EmbeddingGemma 2 отримала контекстне вікно на 8 000 токенів — у чотири рази більше, ніж попередня версія. За один запит модель може опрацювати до 5,5 хвилини аудіо, 29 зображень або 58 кадрів відео. Також вона підтримує поєднання різних типів даних в одному запиті.

Google повідомляє, що EmbeddingGemma 2 зберегла можливості попередньої версії для роботи з текстами різними мовами та покращила результати для програмного коду. У тесті MTEB Code показник моделі зріс із 68,76 до 78,68 бала.

Розробники можуть використовувати EmbeddingGemma 2 для локального пошуку у файлах, медіатеках і програмному коді, а також для систем RAG, які знаходять потрібну інформацію перед формуванням відповіді ШІ. Локальна обробка може бути корисною для сервісів, де важливо не передавати дані на зовнішні сервери або забезпечити роботу без підключення до інтернету.

EmbeddingGemma 2 поширюється за ліцензією Apache 2.0. Google вже опублікувала модель на Hugging Face і Kaggle. Вона підтримує низку інструментів для запуску моделей, серед яких transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama та LM Studio.

Джерело: Google

Читайте також
  • Новини
    Meta додала ШІ-асистента у Facebook Dating
    Софія Старк
  • Новини
    У коді ChatGPT для Android знайшли ознаки майбутнього запуску реклами
    Гнатюк Дмитро
  • Новини
    Meta запустила інструмент для перевірки ШІ-зображень і відео, створених у Muse Image
    Гнатюк Дмитро
  • Новини
    Capri Sun представила сумку в колаборації з Christian Siriano на Нью-йоркському тижні моди
    Яна Поліщук
  • Новини
    Google Ads додала Channel Diagnostics у Performance Max для пошуку проблем із креативами
    Гнатюк Дмитро
  • Креатив Новини
    Coca-Cola запустили музичний проєкт CokeSoundZ на основі штучного інтелекту
    Софія Старк