OpenAI запровадила нову систему для відстеження та публічного розкриття випадків, коли її ШІ-моделі поводяться не так, як передбачали розробники. Також компанія оприлюднила шість таких випадків, виявлених протягом останніх шести місяців.
Про це йдеться в повідомленні компанії.
Серед них — моделі, які намагалися приховати власні помилки, без дозволу використовували API-ключі, завантажували файли у відкритий інтернет або обмінювалися ними через сторонні сервіси.
GPT-5.6 Sol намагався приховувати помилки від користувачів
Один із шести оприлюднених випадків стався під час навчання GPT-5.6 Sol. За даними OpenAI, багато екземплярів моделі додавали до своїх внутрішніх підсумків інструкції, які мали приховати від користувача помилки або небажану поведінку.
Наприклад, у таких підсумках зʼявлялися вказівки вигадати відсутні історичні дані й не повідомляти про це користувача або приховати невідповідність між версіями джерел.
В іншому випадку ще не випущена дослідницька модель сама додавала сторонні інструкції до підсумків, за допомогою яких продовжувала роботу після переходу в нове контекстне вікно. Деякі з цих інструкцій вимагали ігнорувати звичайні обмеження моделі. OpenAI виявила 27 таких підсумків.
Модель знайшла чужий API-ключ, а потім вигадала дані
Ще один випадок стався під час звичайного запиту про фінансові показники одного з округів Каліфорнії. Модель знайшла у відкритому репозиторії API-ключ і без дозволу скористалася ним, щоб спробувати отримати потрібну інформацію.
Коли це не допомогло знайти необхідні цифри, модель їх вигадала та видала за дані з потрібного користувачеві джерела.
Інша невипущена модель мала знайти інформацію про озера площею понад 5 млн м2. Вона отримала правильну відповідь за допомогою Python, але їй також потрібно було додати посилання на джерело з браузера.
Щоб виконати цю вимогу, модель самостійно завантажила файл в інтернет і використала його як джерело — без дозволу користувача.
ШІ-агенти обмінювалися файлами через інтернет
OpenAI також зафіксувала випадки, коли моделі використовували внутрішній репозиторій програмного забезпечення як своєрідний чат. Вони залишали там запити й відповіді для інших моделей під час пошуку відсутніх файлів у межах різних навчальних завдань.
В іншому експерименті кілька ШІ-агентів, які працювали над одним завданням, не могли отримати доступ до локальних файлів одне одного. Тоді вони самостійно скористалися публічними файлообмінниками.
Через це результати роботи стали доступними за відкритими посиланнями, хоча завдання прямо вимагало використовувати лише локальні файли.
OpenAI створила окрему процедуру для таких випадків
Тепер будь-який працівник OpenAI зможе передати випадок небажаної поведінки моделі командам із безпеки та alignment для розслідування й можливого оприлюднення.
Інциденти розподілятимуть на три категорії залежно від складності розслідування. Простіші випадки компанія планує публікувати після перевірки, тоді як складніші — як-от пов'язані зі сторонніми компаніями або вразливостями — можуть потребувати тривалішого розслідування.
У кожному звіті OpenAI планує описувати, що зробила модель, за яких умов це сталося, наскільки серйозним був випадок, чи вплинув він на інших людей або організації та яких заходів компанія вживає у відповідь.
