Відкриті ШІ-моделі майже наздогнали OpenAI та Anthropic, але відстають у безпеці — дослідження

Китайська компанія Z.ai випустила відкриту модель штучного інтелекту GLM-5.2, яка за своїми можливостями майже наздогнала найсучасніші моделі OpenAI й Anthropic. Водночас дослідження некомерційної організації SaferAI показало, що модель суттєво поступається їм за рівнем безпеки.

За оцінкою SaferAI, GLM-5.2 лише на кілька місяців відстає від OpenAI GPT-5.5 і Claude Opus 4.7 у завданнях, пов’язаних із кібербезпекою та біологічними дослідженнями. Проте під час тестування через публічний API модель не відмовилася виконати жоден запит, пов’язаний із наступальними кібератаками або біологічними сценаріями подвійного призначення.

Для порівняння, Claude Opus 4.7 настільки послідовно блокувала подібні запити, що дослідники не змогли завершити тест CyberGym — бенчмарк для оцінки можливостей моделей у сфері кібербезпеки.

Експерти SaferAI вважають, що ситуація демонструє головну проблему відкритих моделей. Після публікації ваг моделі будь-хто може запускати її на власному обладнанні, змінювати або повністю прибирати вбудовані обмеження, перенавчати систему чи змінювати системні інструкції.

Закриті моделі OpenAI та Anthropic також не забезпечують абсолютного захисту. Дослідники регулярно знаходять способи обходу їхніх обмежень через так звані jailbreak-атаки. Проте в цих сервісах компанії можуть застосовувати додаткові механізми безпеки: навчання моделі відмовляти у небезпечних запитах, спеціальні класифікатори та контроль через API. Для відкритих моделей такі інструменти після завантаження ваг фактично перестають діяти.

Виконавчий директор SaferAI Генрі Пападатос зазначив, що галузь має зробити безпечні можливості моделей доступними для всіх, водночас обмежуючи небезпечні функції. Одним із можливих рішень він назвав фільтрацію навчальних даних ще до тренування моделі. Деякі дослідження показують, що це допомагає зменшити небезпечні біологічні знання без суттєвої втрати загальної якості моделі.

Водночас застосувати такий підхід до кібербезпеки набагато складніше. За словами Пападатоса, важко створити модель, яка добре програмує, але водночас не здатна допомагати зі зламом систем. Це особливо актуально, оскільки саме програмування стало одним із найважливіших напрямів використання генеративного ШІ.

SaferAI також звернула увагу, що під час випуску GLM-5.2 компанія Z.ai не опублікувала рамку безпеки, результати передрелізного тестування або оцінку ризиків моделі. Компанія не відповіла на запит журналістів щодо проведення внутрішніх або незалежних перевірок перед релізом.

Окремо дослідники звернули увагу на різницю в підходах США та Китаю до регулювання штучного інтелекту. Експерт Стенфордського центру кіберполітики Грем Вебстер зазначив, що китайські правила переважно зосереджені на політично чутливому контенті, дезінформації та суспільній стабільності, а не на ризиках використання ШІ для кібератак чи створення біологічних загроз.

Водночас прихильники відкритих моделей наголошують, що їхня доступність допомагає захисникам краще готуватися до атак. Зокрема, генеральний директор Hugging Face Клем Деланг назвав відкриті моделі важливим інструментом для пошуку вразливостей і зміцнення кіберзахисту.

У SaferAI погоджуються, що відкриті моделі можуть приносити користь, але вважають, що це не повинно означати вільне поширення небезпечних можливостей. На думку організації, галузі варто зосередитися на тому, щоб зробити доступними насамперед безпечні функції штучного інтелекту.

Джерело: TechCrunch

Читайте також
  • Новини
    Сем Альтман звинуватив The New York Times у надмірних вимогах до конфіденційності під час інтерв’ю
    Софія Старк
  • Новини
    Lidl представив аналог різдвяної вантажівки Coca-Cola та анонсував святковий тур Великобританією
    Ольга Беспалько
  • Новини
    Alzheimer’s Society перетворила фінал Чемпіонату світу 1966 року на символ втрати пам’яті у кампанії Lost Memorybilia
    Гнатюк Дмитро
  • Новини
    Instagram дозволить блогерам створювати свої ШІ-версії
    Софія Старк
  • Новини
    Хореографиня Анастасія Харченко знялася в дебютному кампейні українського barefoot-бренду NUGAIA
    Яна Поліщук
  • Новини
    TikTok розширює функцію збереження музики — тепер і на SoundCloud
    Яна Поліщук