Штучний інтелект “з’їдає” корпоративні чати: де компаніям брати тексти для навчання?

Нова хвиля в світі ШІ: Корпоративні дані стають “золотом” для розробників

Розробники передових мовних моделей, таких як OpenAI та Anthropic, все активніше звертають увагу на внутрішні корпоративні дані. Це пов’язано з тим, що вони стикаються з певними обмеженнями при зборі загальнодоступної інформації з інтернету для тренування своїх нейронних мереж. За даними інсайдерів, за останні кілька місяців спостерігається значне зростання попиту на такі типи даних, як листування у месенджерах, електронна пошта, записи відеоконференцій та історія змін у програмному коді.

 Источник изображения: Gemini

Джерело зображення: Gemini

Боббі Семюелс, генеральний директор брокера даних Protege, зазначив, що на тлі зростаючого попиту обсяг угод його компанії зріс із 30 мільйонів доларів (приблизно 1 200 000 ₴ за поточним курсом) минулого року до щонайменше 100 мільйонів доларів (приблизно 4 000 000 ₴) цього року. Підвищений інтерес до таких даних зумовлений, зокрема, розвитком ШІ-агентів, які здатні виконувати реальні повсякденні завдання користувачів.

Зацікавленість у корпоративних даних пояснюється тим, що записи реальної взаємодії між людьми містять цінну інформацію про те, як розробники вирішують проблеми, обговорюють фінансові показники, демонструють роботу програмного забезпечення та виконують інші робочі процеси. Усе це є надзвичайно корисним для навчання та вдосконалення ШІ-моделей. Особливо високий інтерес покупці виявляють до даних стартапів, яким загрожує банкрутство або поглинання.

Як приклад, стартап Warmly, що спеціалізується на розробці ШІ-агентів і нещодавно був придбаний компанією HubSpot, отримав чотири пропозиції на суму до 300 тисяч доларів (приблизно 12 000 ₴) за дані про робочу взаємодію своїх співробітників. Це включало протоколи нарад та електронні листи. Усі пропозиції надійшли вже після підписання угоди про поглинання і були відхилені.

Зі зростанням торгівлі корпоративними даними все гостріше постає питання їх анонімізації. Компанії, які продають дані для тренування ШІ, змушені приділяти ще більше уваги видаленню інформації, яка може ідентифікувати конкретних осіб. “Ми дотримуємося суворого процесу анонімізації, щоб зберегти цінність даних та забезпечити дотримання правил конфіденційності”, – зазначає Шуб Сінха, генеральний директор компанії з обробки даних Integral.

Порада від Soft Portal:

Ця новина є надзвичайно важливою для розуміння еволюції штучного інтелекту. Вона підкреслює, як конфіденційні корпоративні дані стають ключовим ресурсом для навчання потужних ШІ-систем. Для користувачів це означає потенціал для появи нових, більш ефективних інструментів та застосунків, здатних вирішувати складні завдання. Водночас, це ставить питання про необхідність посилення захисту персональних та комерційних даних.

No votes yet.
Please wait...

Leave a Reply

Your email address will not be published. Required fields are marked *