Microsoft представляє нові ШІ-моделі: економія ресурсів та нові можливості для зображень і мови

Microsoft представляє революційні ШІ-моделі: MAI-Image-2.5-Pro та MAI-Voice-2-Flash

Корпорація Microsoft з гордістю анонсує публічний попередній доступ до двох потужних моделей штучного інтелекту власної розробки. MAI-Image-2.5-Pro позиціонується як передовий генератор зображень в портфоліо компанії, тоді як MAI-Voice-2-Flash призначений для ефективного розпізнавання мовлення в умовах значних корпоративних навантажень.

Джерело зображень: microsoft.ai

Джерело зображень: microsoft.ai

Технологічний гігант навів вражаючі показники продуктивності обох моделей, підтверджуючи свою стратегію використання власних розробок замість зовнішніх рішень, зокрема від OpenAI. Наразі моделі ШІ від Microsoft інтегровані в широкий спектр продуктів компанії, включаючи Bing, PowerPoint, OneDrive, Dynamics 365, Excel, GitHub Copilot та Azure. Це вже не експериментальні проєкти, а функціональна інфраструктура, що обслуговує мільйони користувачів. У Microsoft наголошують: “Кожне з цих вдосконалень – крок до єдиної мети: продукти Microsoft, що працюють на основі моделей Microsoft”.

Нові грані генерації зображень та розпізнавання мови

Дві представлені моделі свідомо займають протилежні позиції на кривій “якість-швидкість-вартість”.

  • MAI-Image-2.5-Pro – це преміальна розробка, яка створює зображення найвищої якості, забезпечує детальне редагування та точне відтворення тексту. При використанні через API вартість становить приблизно 235₴ ($5) за 1 млн текстових токенів на вході, 370₴ ($8) за 1 млн токенів зображень на вході та 4900₴ ($106) за 1 млн токенів зображень на виході. Нещодавно базова версія MAI-Image-2.5 посіла друге місце на платформі Arena серед моделей для редагування зображень.
  • MAI-Voice-2-Flash, навпаки, пропонує значно кращу продуктивність. Вона працює вдвічі швидше за базову версію MAI-Voice-2 та на 32% дешевша – приблизно 700₴ ($15) за 1 млн символів. Ця модель орієнтована на ринок високопродуктивного голосового зв’язку: кол-центрів, голосових асистентів та застосунків для обробки мови в реальному часі, де критично важлива низька затримка. Потреби студії, що прагне до максимальної точності, кардинально відрізняються від потреб служби підтримки, яка щоденно обробляє мільйони дзвінків.

Microsoft представляє нові ШІ-моделі: економія ресурсів та нові можливості для зображень і мови 2

Практична інтеграція та успіхи Microsoft

Microsoft також поділилася успіхами у впровадженні власних ШІ-рішень. Сервіс Bing Image Creator повністю переведено на MAI-Image-2.5. У PowerPoint ця модель дозволила скоротити витрати на ресурси графічного процесора на 84% порівняно з OpenAI GPT-Image-2, а також оптимізувала обробку завдань у хмарному сховищі OneDrive.

Нова MAI-Voice-2-Flash вже працює на платформі Dynamics 365 Contact Center, зменшивши витрати на ресурси GPU до 89%. Її також інтегровано в сервіс Azure Voice Live для розробників. Медичний застосунок Microsoft Dragon Copilot, яким користуються 170 000 медичних установ і який обробив 28 млн запитів пацієнтів за перший квартал, переведено на модель MAI-Transcribe-1.5, що підтримує 58 мов.

Спрощена модель MAI-Code-1-Flash для написання коду, запущена в червні на GitHub Copilot, демонструє значні переваги над конкурентами. Порівняно з OpenAI GPT-5.4 Mini та Anthropic Claude Haiku 4.5, вона забезпечує на 10% вищу частоту прийняття коду та на 10% менше середнє споживання токенів. Користувачі на 6% частіше обирають її, ніж GPT-5.4 Mini, і на 11% частіше, ніж Claude Haiku 4.5. Додатково модель була навчена для роботи в Excel, де в більшості типових завдань демонструє результати на рівні GPT-5.6. Важливо, що MAI-Code-1-Flash достатньо компактна для роботи на застарілих прискорювачах Nvidia H100 та навіть A100.

Порада від Soft Portal:

Ці нові ШІ-розробки від Microsoft демонструють значний прогрес у доступності та ефективності потужних інструментів для бізнесу та творчості. MAI-Image-2.5-Pro відкриває нові можливості для створення візуального контенту, а MAI-Voice-2-Flash обіцяє суттєво покращити якість та швидкість обробки мовних даних. Впровадження цих моделей у вже знайомі продукти Microsoft робить їх ще більш цінними для користувачів, забезпечуючи зростання продуктивності та зниження витрат.

No votes yet.
Please wait...

Leave a Reply

Your email address will not be published. Required fields are marked *