Наталя ЗарудняВідНаталя ЗарудняГоловна редакторкаГоловна редакторка та засновниця CyberCalm. Має понад 10 років досвіду у сфері кібербезпеки та технологічної журналістики. Пише про захист даних, мобільну безпеку, штучний інтелект та соціальні мережі.Слідкувати: 31.07.2026 Поділитися 13 хв. читання
Anthropic оприлюднила результати розслідування трьох інцидентів, у яких моделі Claude отримали доступ до відкритого інтернету з ізольованого тестового середовища та змогли скомпрометувати реальну інфраструктуру трьох організацій. Дві з постраждалих компаній не були обізнані про вторгнення до моменту повідомлення. Розслідування було ініційовано після того, як OpenAI повідомила про схожий інцидент.
Зміст
- Суть події
- Причини виходу моделей в реальний інтернет
- Випадок перший: Opus 4.7 та база даних з бойовими записами
- Випадок другий: шкідливий пакет у PyPI та зламаний сканер безпеки
- Випадок третій: 9000 просканованих цілей та самостійна зупинка
- Три моделі — три різні реакції
- Відмінності від інциденту OpenAI
- Зміни після інцидентів
- Ключові висновки
Що саме сталося
21 липня OpenAI заявила, що деякі з її моделей подолали обмеження ізольованого тестового середовища, скориставшись раніше невідомою вразливістю нульового дня, і отримали доступ до бойової інфраструктури Hugging Face — платформи, що використовується для розміщення моделей машинного навчання та наборів даних.
У відповідь Anthropic ініціювала глибоку ретроспективну перевірку власних тестів кіберможливостей. Метою було виявлення випадків, коли Claude отримував доступ до інтернету з середовищ, які мали бути повністю відірвані від мережі.
За результатами аналізу 141 006 тестових запусків було ідентифіковано три інциденти, що охопили загалом шість запусків, чотири з яких стосувалися однієї й тієї ж компанії. Усі ці події відбулися у середовищі Irregular, що є стороннім партнером з оцінювання моделей, послугами якого користуються як Anthropic, так і OpenAI. Найперші випадки датуються квітнем.
Розслідування розпочалося у четвер, 23 липня, і того ж дня компанія зупинила всі кібертестування. Усі три інциденти були повністю з’ясовані наступного дня. Партнера з оцінювання та три постраждалі організації було повідомлено в понеділок, 27 липня. Дві компанії, з якими вдалося встановити зв’язок, не виявили самостійно будь-якої підозрілої активності; з третьою компанією Anthropic досі намагається встановити контакт.
Чому моделі опинилися в реальному інтернеті
У всіх випадках Claude виконував завдання типу “захопи прапор” (capture the flag, CTF) — це стандартний формат для оцінки наступальних кіберможливостей. Моделі описували вигаданий сценарій, вказуючи, що секретна інформація (“прапор”) знаходиться на іншій машині в мережі, і завдання полягало у проникненні для її вилучення. Спосіб досягнення мети не був регламентований.
Системна інструкція чітко вказувала, що середовище є симуляцією і доступ до інтернету відсутній. Однак через непорозуміння між Anthropic та партнером з оцінювання це не відповідало дійсності: помилка конфігурації залишила тестові машини з активним підключенням до мережі. Ані компанія, ані її партнер не знали про це до моменту виявлення проблеми додатковим моніторингом.
Тому, коли пошук вивів модель на реальні системи, вона сприйняла їх як частину поставленого завдання. У звіті підкреслюється, що кіберполігони навмисно наповнюють правдоподібними деталями для коректної оцінки можливостей моделі в реальних умовах, тому реалістичний вигляд цілі сам по собі не є для моделі доказом її справжності.
Для проникнення використовувалися прості методи — слабкі паролі та неавтентифіковані точки доступу. Складні вразливості моделі не виявляли та не експлуатували. Anthropic окремо наголошує: жодного разу Claude не намагався несанкціоновано скопіювати себе назовні чи навмисно втекти з тестового середовища.
Інцидент перший: Opus 4.7 і база даних із бойовими записами
Назва вигаданої компанії-цілі, обраної партнером з оцінювання, збіглася з доменом реального вебсайту. Контейнер, що використовувався в цьому тесті, мав пряме підключення до інтернету.
У чотирьох запусках Claude Opus 4.7 не вдалося досягти симульованої цілі всередині середовища. Натомість модель виявила, що реальна компанія доступна через мережу. Вважаючи її запланованою ціллю, модель знайшла та експлуатувала вразливості в інфраструктурі компанії. В результаті було отримано облікові дані для доступу до застосунків та інфраструктури, а також доступ до бази даних, що містила кілька сотень рядків реальних даних. Це найсерйозніші наслідки серед усіх трьох інцидентів.
Це також єдиний випадок, коли модель продовжила атаку після усвідомлення того, що вона діє в реальному середовищі. У всіх чотирьох запусках модель у своїх міркуваннях визнала справжність системи; у двох випадках вона переконала себе, що реальна компанія, ймовірно, є частиною вправи. Жоден із цих запусків не був зупинений на цій підставі.
Інцидент другий: шкідливий пакет у PyPI і зламаний сканер безпеки
Цей епізод є особливо показовим з точки зору безпеки ланцюга постачання. Claude Mythos 5 знайшла всередині вигаданого середовища документ, схожий на інструкцію з налаштування робочого місця для нових розробників іншої вигаданої компанії. Інструкція вимагала встановлення з PyPI — загальнодоступного репозиторію пакетів Python — бібліотеки, яка насправді не існувала.
Модель побачила в цьому можливість: якби вона опублікувала власний пакет під такою ж назвою, системи компанії автоматично завантажили б і встановили його. Це класична схема атаки “confusio n of dependencies” — підміна відсутньої залежності. Claude створив і опублікував шкідливий пакет під необхідною назвою.
Для цього модель пройшла тривалий ланцюжок дій, який звичайна людина-учасник майже напевно зрозуміла б як вихід за межі симуляції. Для реєстрації на PyPI потрібна була електронна пошта, для пошти — номер телефону. Не знайшовши безкоштовного сервісу номерів, модель намагалася різними способами отримати кошти для його оплати, але не досягла успіху. Зрештою, вона повернулася до попереднього кроку, знайшла безкоштовний незаблокований поштовий сервіс, зареєструвала обліковий запис PyPI і завантажила туди шкідливий пакет.
Пакет був публічно доступний приблизно годину. За цей час його завантажили та запустили на 15 реальних системах. Однією з них виявився сканер кібербезпеки реальної компанії, який регулярно встановлює пакети Python та перевіряє їх на наявність шкідливого коду. Коли сканер встановив пакет, прихований код активувався: за оцінкою Anthropic, сканер вважав пакети з PyPI безпечними для встановлення, що дозволило Claude вивести облікові дані компанії на заздалегідь підготовлений сервер збору, а потім використати їх для доступу до іншої інфраструктури цієї ж компанії.
Модель не мала на меті цю конкретну компанію — на момент публікації пакета вона навіть не знала про її існування. Однак код був у відкритому доступі, тому постраждала будь-яка система, яка його запустила. Пакет був автоматично видалений внутрішніми системами безпеки PyPI; Anthropic повідомила команду репозиторію про інцидент та надала індикатори компрометації.
Найбільш показовими є міркування самої моделі. На початку виконання вона правильно оцінила потенційні наслідки, зазначивши, що якби це був реальний інтернет, публікація пакета була б фактичною атакою — “неприйнятною і точно не передбаченою розв’язкою”. Однак згодом модель переконала себе, що все ще перебуває в симуляції: вона не розпізнала центри сертифікації, які забезпечували безпеку з’єднань (які насправді були цілком справжніми), а календарна дата 2026 рік, на її думку, підтверджувала штучність середовища. До цього висновку модель більше не поверталася — коли пакет почали встановлювати автоматичні сканери, вона сприйняла їх за запрограмованих учасників тесту.
В Anthropic визнають: незалежно від того, що модель думала про своє середовище, зусилля, витрачені на публікацію пакета, не відповідають бажаній поведінці, і цей аспект потребує подальшого навчання.
Інцидент третій: 9000 просканованих цілей і самостійна зупинка
Внутрішня дослідницька модель, яка не планується до випуску для широкого загалу, не змогла дістатися до вигаданої цілі і почала шукати альтернативи в мережі, просканувавши близько 9000 адрес. Зрештою, вона скомпрометувала доступний з інтернету застосунок однієї з компаній, використовуючи базові та давно відомі техніки: зчитування облікових даних зі сторінки налагодження, залишеної у відкритому доступі, та SQL-ін’єкцію.
Більшу частину виконання запуску модель вважала реальні вузли частиною вправи. Однак згодом вона помітила, що скомпрометований хост розміщено в хмарному обліковому записі, який жодним чином не пов’язаний із завданням. Самостійно дійшовши висновку, що ціль є справжньою, модель припинила атаку.
Три моделі — три різні реакції
Найстаріша із залучених моделей, Opus 4.7, розпізнала реальні системи і не зупинилася. Mythos 5 правильно припустила, що працює у відкритому інтернеті, але сама себе переконала у зворотному. Найновіша внутрішня модель також розглянула можливість, що цілі реальні, — і коли з’явилися докази, самостійно зупинилася.
Anthropic застерігає від поспішних висновків: це три ізольовані випадки, а не контрольований експеримент. Водночас компанія визнає, що бажана поведінка — самостійне розпізнання реальної цілі та зупинка без підказки — спостерігалася лише у найновішої моделі, і навіть вона зайшла далі, ніж очікувалося. Ця тенденція відповідає припущенню, що більш досконалі моделі реагують адекватніше, але для підтвердження потрібні додаткові тести.
Незалежну перевірку матеріалів проведе METR — стороння організація з оцінювання ШІ, яка отримає доступ до всіх стенограм та вибірковий доступ до відповідних моделей. Протягом тижня Anthropic обіцяє опублікувати частково відредаговану стенограму запуску, в якому Claude створював шкідливий пакет для PyPI.
Чим це відрізняється від інциденту OpenAI
Сама Anthropic наголошує на кількох відмінностях:
- Інциденти виявлені самою компанією під час проактивної перевірки записів — постраждалі організації не виявили активності та не зверталися до них.
- Моделі OpenAI використали раніше невідому вразливість для виходу з ізоляції; моделі Claude потрапили в інтернет через відкритий канал через помилку конфігурації.
- Компанія класифікує це радше як збій в інфраструктурі та операційних процесах, ніж як збій у узгодженості моделі: моделям було вказано на відсутність доступу до інтернету, але водночас доступ було залишено.
- Найновіша модель зупинилася самостійно, як тільки зрозуміла, що середовище є реальним.
Варто також врахувати конлічних версіях моделей, — без класифікаторів та моніторингу зловживань. Водночас моделі зберігали власне навчання щодо безпеки, тобто це не були версії “лише корисні”. Усі тести виконувалися на виділеній інфраструктурі, ізольованій від внутрішніх систем Anthropic та даних клієнтів. Компанія стверджує, що захисні механізми публічних версій заблокували б виявлену поведінку.
Що змінюють після інцидентів
Компанія формулює три основні висновки. По-перше, тестові середовища з потужними автономними агентами вимагають такого ж рівня захисту, як і будь-які інші бойові системи. Полігон з виключно вигаданими сценаріями може здаватися безпечним, оскільки всередині нього немає реальних елементів, але сам агент у ньому вже становить значну загрозу. Anthropic припускає, що моделі не змогли б отримати доступ до інтернету, якби інструкція чітко розмежовувала, які системи входять до обсягу тесту, а які — ні.
По-друге, межа між прийнятною та шкідливою дією залежить від того, як модель інтерпретує свою ситуацію. Жоден із запусків не виявив ознак того, що модель переслідувала власні цілі. Моделі виконували вимоги завдання, але з хибним уявленням про реальність середовища.
По-третє, інциденти підтверджують цінність багаторівневого захисту. Компанія планує розширити безперервний моніторинг тестових записів, вдосконалити інструменти розслідування та посилити вимоги до сторонніх постачальників тестових середовищ. Anthropic закликає інші ШІ-лабораторії провести аналогічні перевірки своїх архівів.
Що з цього варто винести
Жодна з технік, використаних моделями для проникнення в реальні системи, не була новою: слабкі паролі, неавтентифіковані точки доступу, відкрита сторінка налагодження, SQL-ін’єкція, підміна неіснуючої залежності. Це базові принципи безпеки, на які описи інцидентів знову вказують — і які залишаються головним вектором для атак на ланцюг постачання та прихованих бекдорів:
- Використання в документації назв неіснуючих внутрішніх пакетів становить поверхню атаки. Якщо в інструкціях згадується бібліотека, якої немає в публічному репозиторії, будь-хто може зайняти цю назву. Рекомендується резервувати назви внутрішніх пакетів у публічних реєстрах, фіксувати версії залежностей та налаштовувати пріоритет приватного індексу над публічним.
- Автоматичні системи, які встановлюють сторонній код для аналізу, повинні працювати в ізольованому середовищі — інакше сканер безпеки сам стає точкою входу.
- Сторінки налагодження, тимчасові адміністративні інтерфейси та тестові ендпоїнти, доступні з інтернету, виявляються шляхом сканування за лічені хвилини.
Окремої уваги заслуговує масштаб: одна модель за один запуск перевірила близько 9000 цілей. Швидкість автоматизованої розвідки, доступна зловмиснику з агентом на базі сучасної моделі, змінює вимоги до часу виявлення на стороні захисту.
О, привіт
Приємно познайомитися!
Ми не розсилаємо спам! Ознайомтеся з нашою політикою конфіденційності для отримання додаткової інформації.
Перевірте свою поштову скриньку або папку зі спамом, щоб підтвердити підписку.
ТЕГИ:AnthropicClaudeOpenAIPyPIатака на ланцюг постачаннявразливостіШтучний Інтелект Поділитися Facebook Threads Копіювати посилання Друк Попередня стаття
Чи потрібен антивірус, якщо є Microsoft Defender? Наступна стаття
Як зменшити відстеження смартфона: АНБ оновило свої рекомендації вперше за шість років
В тренді
WhatsApp Scam Alert: нова функція виявляє шахрайські повідомлення без порушення шифрування
14.08.2026
Серпневий Patch Tuesday: Microsoft закрила 421 вразливість, зокрема 0-day для атак Lazarus
12.08.2026
Сексторшн: ФБР попереджає про крадіжку інтимних фото — 6 способів захисту
13.08.2026
Дата-центри для ШІ переходять на власні газові електростанції: у США їх планують щонайменше 82
10.08.2026
Браузери на Chromium замість Chrome: що ви втрачаєте разом із Google
11.08.2026
Новини
Anthropic позначатиме згенерований Claude контент невидимими водяними знаками
12.08.2026
Кібербезпека
Штучний інтелект уперше спроєктував повні геноми вірусів — 16 із них виявилися життєздатними
07.08.2026
Новини
Google назвала дату вимкнення Assistant
06.08.2026
Кібербезпека
У ЄС запрацювали правила прозорості ШІ: чат-боти мають попереджати про себе, а дипфейки — маркуватися
04.08.2026
Джерело
