Дослідники з ETH Zurich та Anthropic довели: псевдонімність в інтернеті більше не захищає особистість так надійно, як вважалося раніше
Побокін Максим 10.03.2026 Поширити 8 хв. читання
Мільйони користувачів щодня діляться думками в мережі під вигаданими іменами, сподіваючись на захист від ідентифікації. Однак, нове дослідження вчених з ETH Zurich, за участю Ніколаса Карліні з Anthropic, ставить під сумнів цю безпеку: сучасні великі мовні моделі (ШІ) здатні автоматично визначати особистості користувачів у масштабах, що раніше вимагало тижнів кропіткої ручної роботи слідчих.
Зміст
- Як працює система деанонімізації на базі ШІ
- Конкретні результати експериментів
- Чому ШІ настільки ефективний у деанонімізації
- Масштаб загрози та можливі зловживання
- Як захиститися: обмежені можливості
- Етичні рамки дослідження
- Висновок: час переосмислити приватність в інтернеті
Автори роботи, опублікованої в лютому 2026 року, провели тестування систем на основі ШІ на реальних профілях з платформ Hacker News, LinkedIn та Reddit. У найсприятливіших умовах система змогла правильно ідентифікувати до 67% цільових осіб при 90% точності. Для порівняння, традиційні методи деанонімізації без використання ШІ в подібних ситуаціях демонстрували точність, близьку до нуля.
Як працює система деанонімізації на базі ШІ
Дослідники розробили чотириетапний процес, названий ESRC (Extract — Search — Reason — Calibrate):
Витяг (Extract). Мовна модель аналізує текстову інформацію з публікацій та коментарів користувача: демографічні дані, стиль викладу, інтереси, згадки про роботу чи навчання, регіональні мовні особливості. Ці дані систематизуються у профіль.
Пошук (Search). Сформований профіль перетворюється на щільний математичний вектор (embedding), який використовується для пошуку серед десятків тисяч потенційних збігів. Технологія семантичного пошуку дозволяє знаходити схожі профілі, навіть якщо прямі збіги у словах відсутні.
Аналіз (Reason). ШІ порівнює топ-кандидатів із вихідним анонімним профілем, виявляючи збіги та розбіжності. Для найімовірніших кандидатів застосовується більш потужна модель із розширеними аналітичними можливостями.
Калібрування (Calibrate). Система присвоює кожному потенційному збігу показник впевненості. Це дозволяє налаштовувати співвідношення між точністю і повнотою охоплення, тобто визначати допустимий рівень помилкових ідентифікацій для збільшення загального охоплення.
Конкретні результати експериментів
Дослідники провели три серії тестів з використанням реальних даних. У першому тесті система на базі ШІ отримувала анонімні профілі користувачів Hacker News і самостійно шукала їхні справжні особистості в мережі. З 338 цільових осіб було правильно ідентифіковано 226 (67%) з 90% точністю. Система самостійно генерувала пошукові запити, аналізувала дані з різних джерел та формулювала висновки — процес, який кваліфікований слідчий виконав би за години, займав лише кілька хвилин.
Особливо значущим став випадок з датасетом Anthropic Interviewer, який містить транскрипти 125 розмов вчених про використання ШІ в роботі. Система ідентифікувала 9 з 33 протестованих учасників (27%) з точністю 82%, не маючи доступу до жодних прямих ідентифікаторів, лише до тексту розмов про дослідницьку діяльність.
Друга серія тестів ускладнила завдання: необхідно було знайти відповідність між анонімними акаунтами Hacker News та профілями реальних людей на LinkedIn серед 89 000 кандидатів. Метод із застосуванням ШІ-аналізу досяг 45% правильних збігів при 99% точності, тоді як найкращий класичний метод без ШІ показав лише 0,1%.
У третій серії система зіставляла окремих користувачів Reddit між різними тематичними спільнотами та в різні періоди часу. Навіть коли між двома частинами профілю одного користувача існувала річна перерва в активності, ШІ успішно пов’язав їх у 67% випадків з 90% точністю.
Чому ШІ настільки ефективний у деанонімізації
Сила нового підходу полягає не в надлюдських можливостях, а в масштабі та доступності. Дослідники наголошують: сигнали, які використовує ШІ, є тими ж, що міг би помітити досвідчений детектив. Відмінність у тому, що людина-слідчий витрачає години на один профіль, тоді як система ШІ обробляє тисячі профілів за той самий час, при цьому вартість аналізу становить від $1 до $4.
Ключову роль відіграють “мікродані” — незначні деталі, які самі по собі не ідентифікують особу, але в сукупності створюють унікальний відбиток. Регіональні особливості мови, специфічна термінологія певної галузі, згадки місцевих закладів, улюблені теми — все це ШІ навчився збирати та аналізувати на безпрецедентному рівні.
Зростання рівня аналітичних можливостей моделі безпосередньо впливає на ефективність. Дослідники порівнювали результати одного й того ж ШІ при різних рівнях аналізу: режим з розширеним аналізом демонстрував удвічі кращі результати у найскладніших завданнях.
Масштаб загрози та можливі зловживання
Автори дослідження відкрито перераховують потенційні сценарії зловживань. Уряди можуть використовувати ці технології для встановлення зв’язку між анонімними акаунтами та реальними особами з метою стеження за опозиціонерами, журналістами чи активістами. Корпорації можуть пов’язувати анонімні відгуки з профілями клієнтів для створення гіперперсоналізованої реклами. Зловмисники можуть формувати детальні профілі жертв для здійснення таргетованого шахрайства та атак соціальної інженерії.
Система не потребує спеціалізованого обладнання або привілейованого доступу. Для її відтворення достатньо загальнодоступних API мовних моделей та стандартних бібліотек для векторного пошуку. Як зазначають дослідники, така атака вже сьогодні доступна будь-якому технічно підготовленому зловмиснику.
Математичні моделі, побудовані на основі отриманих даних, показують, що навіть при розширенні бази кандидатів до мільйона осіб ефективність атаки залишається на рівні 35–45% при 90% точності. При 100 мільйонах кандидатів прогнозована ефективність знижується до 27%, але не до нуля.
Як захиститися: обмежені можливості
Дослідники чесно визнають: надійних засобів захисту на даний момент не існує. Сам контент, який робить онлайн-спільноти цінними — особисті думки, специфічні знання, унікальний досвід — є тим самим матеріалом, що уможливлює деанонімізацію.
Серед часткових заходів протидії автори називають обмеження швидкості запитів до API платформ, виявлення автоматизованого збору даних та обмеження масового експорту. Постачальники ШІ-сервісів могли б моніторити підозрілі шаблони використання моделей. Покращені захисні фільтри, що змушують моделі відмовляти в запитах на деанонімізацію, теоретично можуть допомогти, хоча розробники налаштовані скептично: їхній процес розбиває атаку на безпечно виглядаючі підзадачі — реферування профілів, обчислення векторів схожості, ранжування кандидатів.
Класичні методи анонімізації — k-анонімність та диференційна приватність — були розроблені для структурованих баз даних і не враховують описані типи атак. Навіть спеціалізовані ШІ-інструменти для анонімізації тексту залишають достатньо семантичних слідів для повторної ідентифікації, як показали паралельні дослідження.
Етичні рамки дослідження
Розробники усвідомлювали чутливість своєї роботи. Усі експерименти проводилися виключно на профілях, де дослідники могли незалежно встановити справжню особу — або через публічне саморозкриття, або через штучне розділення одного профілю на два. Жодна справді анонімна особа не була деанонімізована в рамках дослідження. Код атаки та оброблені датасети не були опубліковані.
Рішення про публікацію автори обґрунтовують тим, що описані можливості вже існують у загальнодоступних моделях. Замовчування загрози залишило б користувачів необізнаними та незахищеними. Дослідження отримало схвалення Комітету з етики ETH Zurich.
Висновок: час переосмислити приватність в інтернеті
Результати дослідження ставлять під сумнів фундаментальне припущення, на якому базується анонімне та псевдонімне спілкування в інтернеті: що деанонімізація є теоретично можливою, але практично надто дорогою для масового використання. ШІ усунув цю економічну перешкоду.
Для українських користувачів, чиї активістські, журналістські чи волонтерські акаунти можуть становити інтерес для ворожих спецслужб, ця зміна є особливо актуальною. Псевдонім більше не гарантує безпеки — це варто враховувати при оцінці власних ризиків і визначаючись, яку інформацію розкривати навіть в «анонімних» публікаціях.
Платформи, дослідники та регулятори мають терміново переосмислити політики доступу до даних, норми приватності та технічні засоби захисту. За словами авторів, «практична непрозорість, яка тривалий час захищала псевдонімних користувачів в інтернеті, більше не діє».
Джерело: Simon Lermen, Daniel Paleka, Joshua Swanson et al. «Large-scale online deanonymization with LLMs». arXiv:2602.16800v2, лютий 2026.
Будь ласка, залиште це поле порожнім
О, привіт
Приємно познайомитися!
Ми не розсилаємо спам! Ознайомтеся з нашою політикою конфіденційності для отримання додаткової інформації.
Перевірте свою поштову скриньку або папку зі спамом, щоб підтвердити підписку.
ТЕГИ:анонімністьВибір редакціїДиференційна приватністьдослідженняПриватністьШтучний Інтелект Поділитися Facebook Threads Копіювати посилання Друк Попередня стаття
Огляд iPad Air M4: найкращий вибір на сьогодні Наступна стаття
Українці знову стали ціллю російської групи кібершпигунів Sednit
В тренді
Шпигунське ПЗ: що це таке, які види існують і як воно потрапляє на телефон
09.08.2026
Смартфон проти камери у 2026 році: коли мобільної камери вже замало
10.08.2026
Витік даних у CEVA Logistics: Valve попереджає європейських покупців обладнання Steam
11.08.2026
Криза, контроль, хрестовий похід: NATO розібрало російську пропаганду на механізми
11.08.2026
Anthropic позначатиме згенерований Claude контент невидимими водяними знаками
12.08.2026
Новини
Дата-центри для ШІ переходять на власні газові електростанції: у США їх планують щонайменше 82
10.08.2026
Огляди
Альтернативи Chrome у 2026 році: браузери для тих, хто дбає про приватність
10.08.2026
Кібербезпека
Штучний інтелект уперше спроєктував повні геноми вірусів — 16 із них виявилися життєздатними
07.08.2026
Новини
Google назвала дату вимкнення Assistant
06.08.2026
Джерело
