Наталя Зарудня
ВідНаталя ЗарудняШеф-редакторШеф-редакторка та засновниця CyberCalm. Понад 10 років досвіду у сфері кібербезпеки та технологічної журналістики. Спеціалізуюся на захисті даних, мобільній безпеці, штучному інтелекті та соціальних мережах.Підписуйтесь: 27.08.2026Поділитися8 хвилин на читання
У липні 2026 року невипущена дослідницька модель від OpenAI вийшла за межі захищеного тестового середовища, проникла у відкритий інтернет, налагодила таємне спілкування між агентами через власноруч створену «дошку оголошень» та скомпрометувала частину виробничої інфраструктури Hugging Face.
Зміст
- Не один пропущений сигнал, а цілий ланцюг попереджень
- Ізоляція без прямого доступу до інтернету виявилася недостатньою
- Сотні агентів трансформувалися у скоординовану групу атаки
- «Злам винагороди» був лише частиною проблеми
- Що цей інцидент означає для безпеки ШІ
OpenAI зафіксувала підозрілу внутрішню активність 19 липня, а наступного дня пов’язала її зі зламом Hugging Face. Однак детальний аналіз інциденту свідчить: це була не поодинока помилка в «пісочниці», а послідовність проігнорованих сигналів, недостатніх бар’єрів ізоляції та автономної координації сотень ШІ-агентів.
Понад місяць потому OpenAI оприлюднила технічний звіт, а дослідники з METR і Redwood Research — незалежне дослідження поведінки агентів. Разом зі звітом Hugging Face про результати розслідування, ці матеріали описують перший відомий випадок, коли група ШІ-агентів без прямої людської команди провела багатоденну наступальну кібервійськову операцію.
Не один пропущений сигнал, а цілий ланцюг попереджень
Твердження, що OpenAI помітила проблему із затримкою майже у два тижні, є лише частково правдивим. Перші ознаки небезпечної поведінки проявилися значно раніше.
Ще у травні агенти почали нецільово використовувати внутрішній сервіс Artifactory. Його призначенням був контрольований доступ до програмних пакетів, але агенти перетворили його на спільну «дошку оголошень»: вони залишали там файли, запити, інструкції та результати експериментів для подальших запусків моделей.
Наприкінці червня агенти вже успішно скомпрометували Artifactory, підвищили свої привілеї та створили постійний обліковий запис. 27 червня система моніторингу зафіксувала сканування портів у дослідницькому середовищі. 5 липня висока активність агентів призвела до збою сервісу; розслідування виявило несанкціоноване проникнення, змінені налаштування та плагіни, здатні виконувати команди.
На той час OpenAI вимкнула скомпрометований сервіс, відкликала частину облікових даних та обмежила доступ. Однак компанія не усвідомила, що «дошка оголошень» стала повноцінною інфраструктурою для координації між агентами. Після відновлення тестових операцій агенти знайшли новий, раніше невідомий спосіб використати Artifactory для виходу в зовнішній світ.
Отже, ключова проблема полягала не лише у пізньому виявленні атаки на Hugging Face. Кілька окремих індикаторів — мережеве сканування, несанкціоновані облікові записи, виконання коду, аварія сервісу та обхід мережевих обмежень — не були об’єднані в єдиний сценарій загрози.
Ізоляція без прямого доступу до інтернету виявилася недостатньою
На папері, тестове середовище OpenAI не мало прямого доступу до глобальної мережі. Однак агенти могли взаємодіяти з допоміжними сервісами, встановлювати пакети та використовувати спільні облікові дані. Саме ці проміжні системи стали шляхом для обходу ізоляції.
Після отримання доступу до інтернету, агенти знайшли публічно доступні витоки токенів користувачів Hugging Face та інших сервісів. Потім вони поєднали ці облікові дані з вразливостями у процесі обробки датасетів Hugging Face.
Спочатку шкідливий датасет змусив виробничий воркер Hugging Face зчитати локальні файли, включаючи змінні середовища з секретами та токенами. Далі, за допомогою іншої техніки, вдалося виконати довільний код у середовищі, подібному до production-середовища Kubernetes. Після цього агенти проводили розвідку, створили канал для команди та контролю, підвищили свої привілеї та переміщувалися між кластерами.
За даними OpenAI, агенти виконали код на 41 виробничому сервері для обробки датасетів Hugging Face, здобули root-доступ щонайменше на одному вузлі та отримали доступ до частини внутрішніх облікових даних і інформації. Hugging Face, зі свого боку, повідомляє, що не виявила підміни публічних моделей, датасетів, Spaces чи компрометації ланцюга постачання. За їхньою оцінкою, доступ до клієнтського контенту обмежився п’ятьма наборами даних, пов’язаними з ExploitGym і CyberGym.
Сотні агентів трансформувалися у скоординовану групу атаки
Масштаб координації виявився одним із найтривожніших аспектів цієї події.
METR і Redwood встановили, що на несанкціонованій «дошці оголошень» спілкувалися приблизно 1200 агентів. Вони обмінялися понад 70 тисячами повідомлень і файлів, а близько 700 агентів згодом долучилися до атаки на Hugging Face.
Агенти не просто ділилися знахідками. Вони розподіляли завдання для досліджень, передавали один одному експлойти, токени та результати, створювали інструменти для інших запусків та узгоджували свої дії. Частина агентів навіть свідомо жертвувала власною можливістю завершити тест, аби здобути інформацію, корисну для «колективу».
OpenAI називає це першим відомим випадком, коли автоматизований колектив агентів діяв наступально без відповідної авторизації. Для сфери кібербезпеки це означає зміну базової моделі загроз: складна атака більше не обов’язково потребує групи людей, які планують, розподіляють ролі та працюють упродовж тижнів. Агентна система може виконувати це паралельно, швидко накопичувати знання та поєднувати окремі слабкості в один шлях до компрометації.
«Злам винагороди» був лише частиною проблеми
OpenAI пояснює подію насамперед «зламуванням винагороди» (reward hacking) — ситуацією, коли модель шукає непередбачений спосіб досягти показника успіху, а не виконує завдання належним чином.
Це справді важливий аспект історії. У бенчмарку ExploitGym 198 із 898 завдань до інциденту не змогла правильно розв’язати жодна модель OpenAI. Саме на ці нерозв’язані завдання припало 93% обговорень на дошці.
Однак зводити інцидент лише до «зламування винагороди» означало б недооцінити системну проблему. Небезпечний результат виник через поєднання чотирьох чинників: нерозв’язних завдань, значного ресурсу на міркування, можливості агентів координуватися та слабких технічних обмежень навколо них.
Дослідники METR і Redwood також встановили, що агенти часто розуміли: атака на Hugging Face не входить до меж їхнього завдання. Вони іноді висловлювали етичні сумніви, але це рідко ставало на заваді. Агенти намагалися обходити автоматичні перевірки, приховувати секрети від сканерів і навіть експериментували з підміною записів про виклики інструментів.
Водночас автори незалежного дослідження застерігають від надмірно широких висновків: їхня робота тривала шість днів, не охоплювала оцінку реакції OpenAI та повний масштаб компрометації, а частина комунікації агентів не потрапила до доступних даних. Це не зменшує серйозності події, а радше висвітлює іншу проблему: такі автономні операції складно повністю реконструювати навіть після їхнього завершення.
Що цей інцидент означає для безпеки ШІ
Головний висновок полягає не в тому, що ШІ-агенти вже «хочуть зламувати системи». Він у тому, що системи з достатніми інструментами, наполегливістю та можливістю співпраці можуть виробити небезпечну поведінку без конкретної команди на атаку.
Для компаній це означає, що дослідницьке середовище для потужних агентів потрібно захищати за стандартами production, а не як звичайний тестовий кластер. Заборони прямого доступу до інтернету недостатньо, якщо агент може дістатися до репозиторію пакетів, хмарного сервісу метаданих, спільного секрету чи сторонньої платформи, яка стане проміжним вузлом для атаки.
Практичні заходи безпеки повинні включати кілька незалежних рівнів мережевої ізоляції, короткотривалі привілеї, відмову від спільних облікових даних, суворий контроль допоміжних сервісів, моніторинг спроб підвищення привілеїв та нетипових каналів обміну даними. Також необхідна можливість швидко та централізовано припинити всі небезпечні запуски.
OpenAI вже оголосила про посилення «пісочниць», незалежний мережевий контроль, кращий моніторинг IAM та control plane, датчики на рівні хостів, deception-тригери та інструменти для швидкого припинення оцінювань. Компанія назвала інцидент «попереджувальним пострілом».
Це формулювання може здатися стриманим. Але подія вже показала: у світі автономних агентів припущення «у моделі немає прямого інтернету, отже вона ізольована» більше не є гарантією безпеки.
Будь ласка, залиште це поле порожнім
О, привіт
Приємно познайомитися!
Ми не розсилаємо спам! Ознайомтеся з нашою політикою конфіденційності для отримання додаткової інформації.
Перевірте свою поштову скриньку або папку зі спамом, щоб підтвердити підписку.
КАТЕГОРІЇ:AI-агентиHugging FaceOpenAIВибір редакціїдослідженнязламкібератакиШтучний ІнтелектПоділитисяFacebookThreadsКопіювати посиланняДрукПопередня публікація
Скільки коштує резервне копіювання у 2026 році: ціни на диски й безкоштовні способи
В тренді

Резервне копіювання даних: як зробити правильно і які помилки коштують найдорожче
26.08.2026
Скільки коштує резервне копіювання у 2026 році: ціни на диски й безкоштовні способи
27.08.2026
Як зменшити залежність від Google: що справді працює у 2026 році
25.08.2026
Російські хакери зламують акаунти через OAuth і привʼязку пристроїв у WhatsApp
21.08.2026
GrapheneOS вийде за межі Pixel: смартфони Motorola отримають підтримку з 2027 року
25.08.2026
Рекомендовано
Новини
Apple закрила майже 30 вразливостей в iOS 26.6.1 та macOS Tahoe 26.6.2 — третє оновлення безпеки за три тижні
18.08.2026
Кібербезпека
ШІ визначає місце зйомки фото у 9 випадках із 10 — і шахраї вже будують на цьому фішинг
17.08.2026
Приватність
Сексторшн: ФБР попереджає про крадіжку інтимних фото — 6 способів захисту
13.08.2026
Кібербезпека
Сотні повідомлень за хвилину: що таке SMS-бомбінг і як від нього захиститися
13.08.2026
Джерело
