Google презентувала Gemini 2.5 — тепер агент може самостійно працювати з браузером

Google анонсувала нову модель штучного інтелекту Gemini 2.5.  Тепер агент може самостійно працювати з браузером, виконуючи 13 основних дій: відкриття браузера, введення тексту, перетягування елементів, повернення на попередню сторінку, перехід на наступну сторінку, пошук, навігація, наведення курсора тощо.

Також модель здатна розуміти візуальні елементи на сторінці, як це робить людина. Наприклад, може правильно оцінити структуру інтерфейсу, зрозуміти, де потрібно натискати або вводити текст, щоб виконати завдання. Така здатність дозволяє використовувати модель для тестування інтерфейсів або для взаємодії з платформами, де немає доступу до API.

Агент не має доступу до повного комп’ютерного середовища  (тобто до операційної системи, локальних файлів, програмного забезпечення та інших ресурсів комп’ютера), що відрізняє його від інших моделей, таких як ChatGPT Agent. Це обмеження дозволяє Gemini 2.5 виконувати завдання лише в межах браузера. 

Gemini 2.5 доступна для розробників через сервіси Google AI Studio та Vertex AI. Також Google демонструє роботу цього агента на платформі Browserbase, де можна побачити, як AI виконує завдання.

Джерело: The Verge

Читайте також
  • Новини
    OpenAI, SoftBank і Oracle створюють компанію для розвитку ШІ-інфраструктури
    Ольга Беспалько
  • Новини
    Spotify запускає функцію Taste Profile для керування рекомендаціями музики за допомогою ШІ
    Гнатюк Дмитро
  • Новини
    Зібрали 1,4 мільйона для «Хартії»: як пройшов благодійний шоу-матч з Counter-Strike 2 
    Яна Поліщук
  • Новини
    Google Ads запустив нову функцію сегментації для аналізу Enhanced Conversions
    Ольга Беспалько
  • Новини
    Чатбот Grok від xAI став окремим застосунком
    Яна Поліщук
  • Новини
    YouTube додає подарунки, безрекламні вікна та мультиформатні стрими
    Гнатюк Дмитро