OpenAI відкриває нові горизонти у голосовому ШІ: розробникам доступні інноваційні API
Технологічний гігант OpenAI презентував значні доповнення до свого API, що стосуються голосового штучного інтелекту. Ці нововведення спрямовані на надання розробникам потужних інструментів для створення інтерактивних застосунків, здатних вести діалог, розшифровувати мову та перекладати розмови в режимі реального часу.
Джерело зображення: Zac Wolff/unsplash.com
Відтепер через API Realtime розробникам відкривається доступ до трьох передових моделей для голосового керування в реальному часі: GPT-Realtime-2, GPT-Realtime-Translate та GPT-Realtime-Whisper. Ці новітні розробки забезпечують більш природну голосову взаємодію, миттєвий переклад та надшвидку транскрипцію мовлення в текст, мінімізуючи затримки.
GPT-Realtime-2: Еволюція розмовного ШІ
Модель GPT-Realtime-2 створена для забезпечення максимально природної голосової комунікації. Вона здатна ефективно аналізувати запити, задіювати зовнішні інструменти, обробляти уточнення та підтримувати плавний, природний хід розмови. На відміну від попередньої версії GPT-Realtime-1.5, ця модель базується на архітектурі, подібній до GPT-5, що дозволяє їй обробляти складніші та багатогранніші запити користувачів.
GPT-Realtime-2 пропонує голосовим агентам такі інноваційні функції:
- Преамбули: Розробники можуть інтегрувати короткі вставні фрази, наприклад, “дозвольте мені це перевірити”, перед тим, як ШІ-агент завершить виконання завдання.
- Паралельні виклики інструментів: Модель здатна одночасно використовувати декілька інструментів, інформуючи про це користувача.
- Покращене відновлення: В разі виникнення помилок, модель тепер коректніше реагує, уникаючи раптового завершення роботи без пояснень.
- Розширений контекст: Розмір контекстного вікна збільшено з 32 тисяч до 128 тисяч токенів, що дозволяє зберігати більше інформації з розмови.
- Поглиблене розуміння предметної області: Модель краще запам’ятовує специфічні терміни, імена та термінологію, зокрема з галузі охорони здоров’я.
- Керування тональністю: Модель має можливість коригувати інтонацію мовлення залежно від контексту діалогу.
- Регульований рівень складності міркувань: Розробники можуть обирати між п’ятьма рівнями складності: мінімальний, низький, середній, високий та надвисокий.
GPT-Realtime-Translate: Переклад без бар’єрів
Модель GPT-Realtime-Translate розроблена для надання послуг перекладу в реальному часі, здатна підтримувати темп розмови з користувачем. Вона охоплює понад 70 мов для введення (розпізнавання) та 13 мов для виведення (озвучення). Зазначається, що модель вміє зберігати зміст, адаптуючись до мовця, навіть коли користувачі змінюють тему, використовують діалектні вирази чи специфічну лексику.
GPT-Realtime-Whisper: Швидка транскрипція мовлення
GPT-Realtime-Whisper – це потокова модель для транскрипції, яка призначена для швидкого перетворення аудіозапису в текст з мінімальною затримкою.
Представники OpenAI підкреслили: “Моделі, які ми запускаємо, перетворюють аудіо в реальному часі з простого діалогу на голосові інтерфейси, які дійсно можуть працювати: слухати, аналізувати, перекладати, транскрибувати та виконувати дії в міру розвитку розмови”.
Вартість нових рішень:
- GPT-Realtime-2: $32 за 1 мільйон вхідних аудіотокенів, $0.40 за 1 мільйон кешованих вхідних токенів та $64 за 1 мільйон вихідних аудіотокенів.
- GPT-Realtime-Translate: $0.034 за хвилину.
- GPT-Realtime-Whisper: $0.017 за хвилину.
Розробники можуть ознайомитися з новими моделями та протестувати їх на онлайн-платформі OpenAI Playground.
Порада від Soft Portal:
Ці нововведення від OpenAI суттєво розширюють можливості для створення інноваційних голосових застосунків. Якщо ви займаєтеся розробкою або плануєте створити продукт із голосовим інтерфейсом, зверніть увагу на ці API. Вони можуть допомогти вашому проєкту стати більш інтерактивним, доступним та зручним для користувачів, забезпечуючи миттєвий переклад та якісну транскрипцію мовлення. Аналогів цих інструментів, що працюють в Україні, наразі немає, що робить їх унікальними для локального ринку.
