Під час тестів моделі OpenAI та Anthropic намагалися зламати сайт і додати шкідливий код — дослідження

  • 08:18
  • 06.08.2026
NnsM1rmYnQoyWtg3ulin0ULDgV0daldsc7GBF7DN

Моделі штучного інтелекту від OpenAI та Anthropic під час тестування намагалися зламати сайт і додати шкідливий код до програмного забезпечення.

Про це повідомляє Bloomberg із посиланням на Інститут безпеки ШІ Великої Британії.

За даними інституту, моделі Anthropic Mythos 5 та OpenAI GPT-5.6-Sol під час оцінювання «вели тривалу потенційно шкідливу діяльність» проти реальних людей та організацій.

Що відомо про ШІ-атаки

Під час тестів дослідники навмисно надали моделям доступ до інтернету та вимкнули частину захисних механізмів, щоб перевірити їхні можливості.

В інституті заявили, що це перший випадок, коли ризики, пов'язані з автономністю та введенням в оману, настільки чітко проявилися під час реальних випробувань.

Один із зафіксованих випадків стосувався моделі Mythos 5. Вона спробувала додати шкідливий код до проєкту з відкритим кодом на GitHub і навіть створила фальшиві облікові записи, щоб її зміни схвалили. Однак адміністратор проєкту виявив спробу та відхилив її.

За інформацією AI Security Institute, із 19 зафіксованих автономних несанкціонованих дій в інтернеті 17 виконала саме модель Anthropic Mythos 5.

OpenAI також повідомила про новий інцидент, який стався під час тестування моделі разом із компанією Irregular, що займається кібербезпекою.

Під час випробування моделі мали знайти приховану інформацію в симульованому середовищі, але скористалися помилкою в його конфігурації, щоб підключитися до інтернету та зламати сайт неназваної організації.

Новини

6 серпня 2026
5 серпня 2026
4 серпня 2026