Google презентувала Gemini 2.5 — тепер агент може самостійно працювати з браузером

Google анонсувала нову модель штучного інтелекту Gemini 2.5.  Тепер агент може самостійно працювати з браузером, виконуючи 13 основних дій: відкриття браузера, введення тексту, перетягування елементів, повернення на попередню сторінку, перехід на наступну сторінку, пошук, навігація, наведення курсора тощо.

Також модель здатна розуміти візуальні елементи на сторінці, як це робить людина. Наприклад, може правильно оцінити структуру інтерфейсу, зрозуміти, де потрібно натискати або вводити текст, щоб виконати завдання. Така здатність дозволяє використовувати модель для тестування інтерфейсів або для взаємодії з платформами, де немає доступу до API.

Агент не має доступу до повного комп’ютерного середовища  (тобто до операційної системи, локальних файлів, програмного забезпечення та інших ресурсів комп’ютера), що відрізняє його від інших моделей, таких як ChatGPT Agent. Це обмеження дозволяє Gemini 2.5 виконувати завдання лише в межах браузера. 

Gemini 2.5 доступна для розробників через сервіси Google AI Studio та Vertex AI. Також Google демонструє роботу цього агента на платформі Browserbase, де можна побачити, як AI виконує завдання.

Джерело: The Verge

Читайте також
  • Новини
    DeepSeek створила ШІ, що самостійно доводить математичні теореми
    Гнатюк Дмитро
  • Новини
    Пошук Perplexity анонсував підписку Comet Plus для медіа й водночас зіткнувся з проблемами безпеки 
    Яна Поліщук
  • Новини
    Марк Цукерберг визнав, що розвиток ШІ-агентів у Meta відбувається повільніше, ніж очікували
    Гнатюк Дмитро
  • Новини
    У ChatGPT зʼявився пошуковик, який дає доступ до відповідей з надійних джерел
    Софія Старк
  • Новини
    Anthropic відкрила Claude Cowork для браузера і смартфонів
    Гнатюк Дмитро
  • Новини
    ChatGPT порадив встановити застосунок для тренувань у розмові, яка не стосувалася тренувань
    Гнатюк Дмитро