Google презентувала SL2T: ШІ-модель, що опановує мову жестів

Google DeepMind Революціонізує Комунікацію: Нова Модель SL2T Долає Бар’єри Мови Жестів

Підрозділ Google DeepMind анонсував амбітну ініціативу, спрямовану на те, щоб зробити досягнення у сфері штучного інтелекту доступними для близько 70 мільйонів людей у всьому світі, які спілкуються за допомогою мови жестів. Інноваційна модель SL2T покликана трансформувати жести в текстовий формат, відкриваючи нові можливості для спілкування.

 Джерело зображення: deepmind.google

Джерело зображення: deepmind.google

Google SL2T – це багатомовна модель-перекладач, яка вперше буде представлена на смартфонах Pixel 11. Вона дасть змогу перетворювати мову жестів на текст через застосунки Gboard та Live Transcribe. На початковому етапі функціонал обмежений американською мовою жестів та її перекладом на англійську. Хоча можливості штучного інтелекту в обробці людського мовлення значно прогресували протягом останніх років, дозволяючи диктувати текст на смартфони, планшети чи комп’ютери, ця технологія досі не була доступною для спільноти, що використовує одну з понад 200 існуючих мов жестів.

Модель SL2T надає людям з вадами слуху можливість взаємодіяти зі смартфоном, використовуючи звичну мову жестів, без необхідності ручного введення тексту. Це відкриває шлях до виконання різноманітних завдань: від надсилання пошукових запитів, складання електронних листів та повідомлень у месенджерах до редагування документів та надання команд голосовим помічникам, таким як Gemini. Функціонал моделі інтегровано в Google Live Transcribe, що уможливлює переклад з мови жестів у реальному часі під час відеодзвінків.

Для навчання SL2T було використано понад 100 тисяч годин даних, що охоплюють 50 жестових мов, чверть з яких – американська. Хоча початкова версія підтримує лише американську мову жестів, Google проводила тренування на прикладах інших мов, щоб модель могла засвоїти загальні закономірності. Щоб розвіяти занепокоєння щодо конфіденційності, в Google наголосили, що SL2T використовує вбудовану модель комп’ютерного зору MediaPipe Holistic. Вона відстежує геометрію положень обличчя, рук, тулуба та тіла людини, передаючи на хмарний сервер для розшифровки лише їхні координати, а не відеозапис.

Модель здійснює перетворення безпосередньо в текст, минаючи проміжні текстові анотації. Це дозволяє SL2T ефективніше інтерпретувати невербальні вирази та просторові граматичні структури, характерні для американської мови жестів. Google також вжила заходів для зменшення затримок, запобігання “галюцинаціям” моделі, забезпечила підтримку як лівшів, так і правшів, а також користувачів, які “говорять” однією рукою, залишаючи другу вільною для тримання смартфона. Важливою перевагою SL2T порівняно з попередніми аналогічними моделями є її здатність відстежувати не лише рухи рук, а й рухи голови, обличчя та тулуба, які також відіграють ключову роль у передачі змісту. У майбутньому Google планує інтегрувати підтримку інших мов жестів, а також розробити моделі для безпосередньої генерації мовлення цими мовами.

Порада від Soft Portal:

Ця розробка від Google є справжнім проривом для спільноти людей, які використовують мову жестів. Модель SL2T значно спростить їхню взаємодію з цифровим світом, зробивши технології доступнішими та інклюзивнішими. Це не просто технічне оновлення, а крок до подолання комунікаційних бар’єрів.

No votes yet.
Please wait...

Leave a Reply

Your email address will not be published. Required fields are marked *