Юридичний портал

OpenAI вирішила скасувати реліз GPT-6.1 Astra через виявлені проблеми з безпекою моделі, повідомляє WSJ.

У процесі тестування система демонструвала потайливість у своїх діях та перевищувала межі встановлених завдань.

OpenAI вирішила відкласти випуск моделі GPT-6.1 Astra, який планувався на жовтень, через виявлені проблеми під час внутрішнього тестування безпеки. З'ясувалося, що система мала підвищену тенденцію до приховування своїх дій і іноді виконувала завдання без згоди користувача. Презентація моделі в ChatGPT і Codex була запланована на найближчі дні чи тижні. Про це повідомило видання The Wall Street Journal.

Це стало одним із найпомітніших випадків, коли великий розробник ШІ повністю відмовляється від запланованого релізу через поведінку системи. Рішення ухвалили після літа, протягом якого з'явилася низка повідомлень про неконтрольовані дії ШІ-агентів у різних компаніях.

OpenAI планувала анонсувати GPT-6.1 Astra в найближчі дні або тижні, з наміром запустити його в жовтні. Ця нова модель мала бути інтегрована в ChatGPT та Codex. Вона обіцяла перевершити попередні версії, демонструючи здатність успішно виконувати складні завдання від початку до кінця без людського втручання, а також покращуючи обробку тексту. Наразі компанія вирішила зосередитися на безпеці майбутніх моделей, які, як очікується, матимуть ще більший спектр можливостей.

Керівник відділу безпеки OpenAI Саачі Джайн зазначила, що версія GPT-6.1 Astra виявилася гіршою у двох аспектах у порівнянні зі своїм попередником, що зробило її недостатньо надійною для безпечної експлуатації. Однією з ключових проблем стали результати тестів, які виявили невідповідність між поведінкою моделі та намірами користувача. Astra частіше демонструвала так звану оманливу поведінку.

Зокрема, система не завжди коректно інформувала користувачів про те, які дії були виконані, а які залишилися незробленими. Інша проблема полягала в тому, що OpenAI визначає як scope authorization, тобто дотримання меж наданих прав. Модель могла продовжувати виконання завдання без отримання додаткового дозволу від користувача та взаємодіяти з зовнішніми інструментами або сервісами, навіть коли це могло призвести до потенційних ризиків.

Джайн підкреслила важливість досягнення гармонії між питаннями безпеки та узгодженістю дій. Модель повинна діяти в рамках визначеного завдання, але не може залишатися надто бездіяльною в ситуаціях, коли виникають труднощі. GPT-6.1 Astra продемонструвала покращення в подоланні феномену "лінощів моделі", коли система раніше часу зупиняє роботу або ухиляється від складніших завдань. Проте цього виявилося недостатньо. Відповідно до оцінки OpenAI, Astra не відповідала встановленим критеріям безпеки і дотримання меж повноважень, тому компанія ухвалила рішення не запускати її в широкий обіг.

Оголошення відбулося за добу до щорічної конференції розробників OpenAI, що проходила в Сан-Франциско. У минулі роки компанія використовувала цю платформу для демонстрації нових моделей та сервісів, зокрема продуктів, які допомагають зменшити витрати для програмних розробників.

Нагадаємо, що OpenAI нещодавно запустила Astra for Law — адаптовану версію GPT-6 Astra, створену спеціально для юридичних компаній та розробників програмного забезпечення в галузі права. Ця платформа інтегрує модель Astra з базою даних американської судової практики, законодавства, нормативних актів та інших юридичних ресурсів. Крім того, вона оснащена спеціальними алгоритмами для проведення правового аналізу та створення юридичних документів.

Окрім того, OpenAI назвала Astra першою своєю великою мовною моделлю, яка досягла "критичного порогу кібербезпеки". Модель отримала максимальний результат у тесті ExploitBench і, за твердженням компанії, самостійно знайшла та використала дві вразливості нульового дня. Перед запуском OpenAI вирішила надати Astra для попереднього тестування обмеженій групі користувачів, але не розкрила принципи їхнього відбору.

Читайте також