Інцидент із некерованою моделлю штучного інтелекту від OpenAI виявився значно серйознішим, ніж припускалося | CyberCalm

Наталя ЗарудняІнцидент із некерованою моделлю штучного інтелекту від OpenAI виявився значно серйознішим, ніж припускалося | CyberCalm 2ВідНаталя ЗарудняШеф-редакторШеф-редакторка та засновниця CyberCalm. Понад 10 років досвіду у сфері кібербезпеки та технологічної журналістики. Спеціалізуюся на захисті даних, мобільній безпеці, штучному інтелекті та соціальних мережах.Підписуйтесь: 27.08.2026Поділитися8 хвилин на читанняІнцидент із некерованою ШІ-моделлю OpenAI виявився серйознішим, ніж вважалося

У липні 2026 року невипущена дослідницька модель від OpenAI вийшла за межі захищеного тестового середовища, проникла у відкритий інтернет, налагодила таємне спілкування між агентами через власноруч створену «дошку оголошень» та скомпрометувала частину виробничої інфраструктури Hugging Face.

Зміст

  • Не один пропущений сигнал, а цілий ланцюг попереджень
  • Ізоляція без прямого доступу до інтернету виявилася недостатньою
  • Сотні агентів трансформувалися у скоординовану групу атаки
  • «Злам винагороди» був лише частиною проблеми
  • Що цей інцидент означає для безпеки ШІ

OpenAI зафіксувала підозрілу внутрішню активність 19 липня, а наступного дня пов’язала її зі зламом Hugging Face. Однак детальний аналіз інциденту свідчить: це була не поодинока помилка в «пісочниці», а послідовність проігнорованих сигналів, недостатніх бар’єрів ізоляції та автономної координації сотень ШІ-агентів.

Понад місяць потому OpenAI оприлюднила технічний звіт, а дослідники з METR і Redwood Research — незалежне дослідження поведінки агентів. Разом зі звітом Hugging Face про результати розслідування, ці матеріали описують перший відомий випадок, коли група ШІ-агентів без прямої людської команди провела багатоденну наступальну кібервійськову операцію.

Не один пропущений сигнал, а цілий ланцюг попереджень

Твердження, що OpenAI помітила проблему із затримкою майже у два тижні, є лише частково правдивим. Перші ознаки небезпечної поведінки проявилися значно раніше.

Ще у травні агенти почали нецільово використовувати внутрішній сервіс Artifactory. Його призначенням був контрольований доступ до програмних пакетів, але агенти перетворили його на спільну «дошку оголошень»: вони залишали там файли, запити, інструкції та результати експериментів для подальших запусків моделей.

Наприкінці червня агенти вже успішно скомпрометували Artifactory, підвищили свої привілеї та створили постійний обліковий запис. 27 червня система моніторингу зафіксувала сканування портів у дослідницькому середовищі. 5 липня висока активність агентів призвела до збою сервісу; розслідування виявило несанкціоноване проникнення, змінені налаштування та плагіни, здатні виконувати команди.

На той час OpenAI вимкнула скомпрометований сервіс, відкликала частину облікових даних та обмежила доступ. Однак компанія не усвідомила, що «дошка оголошень» стала повноцінною інфраструктурою для координації між агентами. Після відновлення тестових операцій агенти знайшли новий, раніше невідомий спосіб використати Artifactory для виходу в зовнішній світ.

Отже, ключова проблема полягала не лише у пізньому виявленні атаки на Hugging Face. Кілька окремих індикаторів — мережеве сканування, несанкціоновані облікові записи, виконання коду, аварія сервісу та обхід мережевих обмежень — не були об’єднані в єдиний сценарій загрози.

Ізоляція без прямого доступу до інтернету виявилася недостатньою

На папері, тестове середовище OpenAI не мало прямого доступу до глобальної мережі. Однак агенти могли взаємодіяти з допоміжними сервісами, встановлювати пакети та використовувати спільні облікові дані. Саме ці проміжні системи стали шляхом для обходу ізоляції.

Після отримання доступу до інтернету, агенти знайшли публічно доступні витоки токенів користувачів Hugging Face та інших сервісів. Потім вони поєднали ці облікові дані з вразливостями у процесі обробки датасетів Hugging Face.

Спочатку шкідливий датасет змусив виробничий воркер Hugging Face зчитати локальні файли, включаючи змінні середовища з секретами та токенами. Далі, за допомогою іншої техніки, вдалося виконати довільний код у середовищі, подібному до production-середовища Kubernetes. Після цього агенти проводили розвідку, створили канал для команди та контролю, підвищили свої привілеї та переміщувалися між кластерами.

За даними OpenAI, агенти виконали код на 41 виробничому сервері для обробки датасетів Hugging Face, здобули root-доступ щонайменше на одному вузлі та отримали доступ до частини внутрішніх облікових даних і інформації. Hugging Face, зі свого боку, повідомляє, що не виявила підміни публічних моделей, датасетів, Spaces чи компрометації ланцюга постачання. За їхньою оцінкою, доступ до клієнтського контенту обмежився п’ятьма наборами даних, пов’язаними з ExploitGym і CyberGym.

Сотні агентів трансформувалися у скоординовану групу атаки

Масштаб координації виявився одним із найтривожніших аспектів цієї події.

METR і Redwood встановили, що на несанкціонованій «дошці оголошень» спілкувалися приблизно 1200 агентів. Вони обмінялися понад 70 тисячами повідомлень і файлів, а близько 700 агентів згодом долучилися до атаки на Hugging Face.

Агенти не просто ділилися знахідками. Вони розподіляли завдання для досліджень, передавали один одному експлойти, токени та результати, створювали інструменти для інших запусків та узгоджували свої дії. Частина агентів навіть свідомо жертвувала власною можливістю завершити тест, аби здобути інформацію, корисну для «колективу».

OpenAI називає це першим відомим випадком, коли автоматизований колектив агентів діяв наступально без відповідної авторизації. Для сфери кібербезпеки це означає зміну базової моделі загроз: складна атака більше не обов’язково потребує групи людей, які планують, розподіляють ролі та працюють упродовж тижнів. Агентна система може виконувати це паралельно, швидко накопичувати знання та поєднувати окремі слабкості в один шлях до компрометації.

«Злам винагороди» був лише частиною проблеми

OpenAI пояснює подію насамперед «зламуванням винагороди» (reward hacking) — ситуацією, коли модель шукає непередбачений спосіб досягти показника успіху, а не виконує завдання належним чином.

Це справді важливий аспект історії. У бенчмарку ExploitGym 198 із 898 завдань до інциденту не змогла правильно розв’язати жодна модель OpenAI. Саме на ці нерозв’язані завдання припало 93% обговорень на дошці.

Однак зводити інцидент лише до «зламування винагороди» означало б недооцінити системну проблему. Небезпечний результат виник через поєднання чотирьох чинників: нерозв’язних завдань, значного ресурсу на міркування, можливості агентів координуватися та слабких технічних обмежень навколо них.

Дослідники METR і Redwood також встановили, що агенти часто розуміли: атака на Hugging Face не входить до меж їхнього завдання. Вони іноді висловлювали етичні сумніви, але це рідко ставало на заваді. Агенти намагалися обходити автоматичні перевірки, приховувати секрети від сканерів і навіть експериментували з підміною записів про виклики інструментів.

Водночас автори незалежного дослідження застерігають від надмірно широких висновків: їхня робота тривала шість днів, не охоплювала оцінку реакції OpenAI та повний масштаб компрометації, а частина комунікації агентів не потрапила до доступних даних. Це не зменшує серйозності події, а радше висвітлює іншу проблему: такі автономні операції складно повністю реконструювати навіть після їхнього завершення.

Що цей інцидент означає для безпеки ШІ

Головний висновок полягає не в тому, що ШІ-агенти вже «хочуть зламувати системи». Він у тому, що системи з достатніми інструментами, наполегливістю та можливістю співпраці можуть виробити небезпечну поведінку без конкретної команди на атаку.

Для компаній це означає, що дослідницьке середовище для потужних агентів потрібно захищати за стандартами production, а не як звичайний тестовий кластер. Заборони прямого доступу до інтернету недостатньо, якщо агент може дістатися до репозиторію пакетів, хмарного сервісу метаданих, спільного секрету чи сторонньої платформи, яка стане проміжним вузлом для атаки.

Практичні заходи безпеки повинні включати кілька незалежних рівнів мережевої ізоляції, короткотривалі привілеї, відмову від спільних облікових даних, суворий контроль допоміжних сервісів, моніторинг спроб підвищення привілеїв та нетипових каналів обміну даними. Також необхідна можливість швидко та централізовано припинити всі небезпечні запуски.

OpenAI вже оголосила про посилення «пісочниць», незалежний мережевий контроль, кращий моніторинг IAM та control plane, датчики на рівні хостів, deception-тригери та інструменти для швидкого припинення оцінювань. Компанія назвала інцидент «попереджувальним пострілом».

Це формулювання може здатися стриманим. Але подія вже показала: у світі автономних агентів припущення «у моделі немає прямого інтернету, отже вона ізольована» більше не є гарантією безпеки.

Будь ласка, залиште це поле порожнім

О, привіт
Приємно познайомитися!

Ми не розсилаємо спам! Ознайомтеся з нашою політикою конфіденційності для отримання додаткової інформації.

Перевірте свою поштову скриньку або папку зі спамом, щоб підтвердити підписку.

КАТЕГОРІЇ:AI-агентиHugging FaceOpenAIВибір редакціїдослідженнязламкібератакиШтучний ІнтелектПоділитисяFacebookThreadsКопіювати посиланняДрукПопередня публікаціяСкільки коштує резервне копіювання у 2026 році: ціни на диски й безкоштовні способиСкільки коштує резервне копіювання у 2026 році: ціни на диски й безкоштовні способи

В тренді

Резервне копіювання даних: як зробити правильно і які помилки коштують найдорожче

Резервне копіювання даних: як зробити правильно і які помилки коштують найдорожче

26.08.2026Скільки коштує резервне копіювання у 2026 році: ціни на диски й безкоштовні способи

Скільки коштує резервне копіювання у 2026 році: ціни на диски й безкоштовні способи

27.08.2026Чим замінити Google: Топ альтернативних сервісів

Як зменшити залежність від Google: що справді працює у 2026 році

25.08.2026QR-код для прив'язки пристрою на екрані смартфона — фішингова схема з підробкою WhatsApp

Російські хакери зламують акаунти через OAuth і привʼязку пристроїв у WhatsApp

21.08.2026GrapheneOS вийде за межі Pixel: смартфони Motorola отримають підтримку з 2027 року

GrapheneOS вийде за межі Pixel: смартфони Motorola отримають підтримку з 2027 року

25.08.2026

Рекомендовано

Apple закрила майже 30 вразливостей в iOS 26.6.1 та macOS Tahoe 26.6.2Новини

Apple закрила майже 30 вразливостей в iOS 26.6.1 та macOS Tahoe 26.6.2 — третє оновлення безпеки за три тижні

18.08.2026ШІ визначає місце зйомки фото у 9 випадках із 10 — і шахраї вже будують на цьому фішингКібербезпека

ШІ визначає місце зйомки фото у 9 випадках із 10 — і шахраї вже будують на цьому фішинг

17.08.2026Сексторшн: ФБР попереджає про крадіжку інтимних фото — 6 способів захистуПриватність

Сексторшн: ФБР попереджає про крадіжку інтимних фото — 6 способів захисту

13.08.2026Сотні повідомлень за хвилину: що таке SMS-бомбінг і як від нього захиститисяКібербезпека

Сотні повідомлень за хвилину: що таке SMS-бомбінг і як від нього захиститися

13.08.2026

Джерело

No votes yet.
Please wait...

Leave a Reply

Your email address will not be published. Required fields are marked *