Microsoft представляє революційні ШІ-моделі: MAI-Image-2.5-Pro та MAI-Voice-2-Flash
Корпорація Microsoft з гордістю анонсує публічний попередній доступ до двох потужних моделей штучного інтелекту власної розробки. MAI-Image-2.5-Pro позиціонується як передовий генератор зображень в портфоліо компанії, тоді як MAI-Voice-2-Flash призначений для ефективного розпізнавання мовлення в умовах значних корпоративних навантажень.
Джерело зображень: microsoft.ai
Технологічний гігант навів вражаючі показники продуктивності обох моделей, підтверджуючи свою стратегію використання власних розробок замість зовнішніх рішень, зокрема від OpenAI. Наразі моделі ШІ від Microsoft інтегровані в широкий спектр продуктів компанії, включаючи Bing, PowerPoint, OneDrive, Dynamics 365, Excel, GitHub Copilot та Azure. Це вже не експериментальні проєкти, а функціональна інфраструктура, що обслуговує мільйони користувачів. У Microsoft наголошують: “Кожне з цих вдосконалень – крок до єдиної мети: продукти Microsoft, що працюють на основі моделей Microsoft”.
Нові грані генерації зображень та розпізнавання мови
Дві представлені моделі свідомо займають протилежні позиції на кривій “якість-швидкість-вартість”.
- MAI-Image-2.5-Pro – це преміальна розробка, яка створює зображення найвищої якості, забезпечує детальне редагування та точне відтворення тексту. При використанні через API вартість становить приблизно 235₴ ($5) за 1 млн текстових токенів на вході, 370₴ ($8) за 1 млн токенів зображень на вході та 4900₴ ($106) за 1 млн токенів зображень на виході. Нещодавно базова версія MAI-Image-2.5 посіла друге місце на платформі Arena серед моделей для редагування зображень.
- MAI-Voice-2-Flash, навпаки, пропонує значно кращу продуктивність. Вона працює вдвічі швидше за базову версію MAI-Voice-2 та на 32% дешевша – приблизно 700₴ ($15) за 1 млн символів. Ця модель орієнтована на ринок високопродуктивного голосового зв’язку: кол-центрів, голосових асистентів та застосунків для обробки мови в реальному часі, де критично важлива низька затримка. Потреби студії, що прагне до максимальної точності, кардинально відрізняються від потреб служби підтримки, яка щоденно обробляє мільйони дзвінків.
Практична інтеграція та успіхи Microsoft
Microsoft також поділилася успіхами у впровадженні власних ШІ-рішень. Сервіс Bing Image Creator повністю переведено на MAI-Image-2.5. У PowerPoint ця модель дозволила скоротити витрати на ресурси графічного процесора на 84% порівняно з OpenAI GPT-Image-2, а також оптимізувала обробку завдань у хмарному сховищі OneDrive.
Нова MAI-Voice-2-Flash вже працює на платформі Dynamics 365 Contact Center, зменшивши витрати на ресурси GPU до 89%. Її також інтегровано в сервіс Azure Voice Live для розробників. Медичний застосунок Microsoft Dragon Copilot, яким користуються 170 000 медичних установ і який обробив 28 млн запитів пацієнтів за перший квартал, переведено на модель MAI-Transcribe-1.5, що підтримує 58 мов.
Спрощена модель MAI-Code-1-Flash для написання коду, запущена в червні на GitHub Copilot, демонструє значні переваги над конкурентами. Порівняно з OpenAI GPT-5.4 Mini та Anthropic Claude Haiku 4.5, вона забезпечує на 10% вищу частоту прийняття коду та на 10% менше середнє споживання токенів. Користувачі на 6% частіше обирають її, ніж GPT-5.4 Mini, і на 11% частіше, ніж Claude Haiku 4.5. Додатково модель була навчена для роботи в Excel, де в більшості типових завдань демонструє результати на рівні GPT-5.6. Важливо, що MAI-Code-1-Flash достатньо компактна для роботи на застарілих прискорювачах Nvidia H100 та навіть A100.
Порада від Soft Portal:
Ці нові ШІ-розробки від Microsoft демонструють значний прогрес у доступності та ефективності потужних інструментів для бізнесу та творчості. MAI-Image-2.5-Pro відкриває нові можливості для створення візуального контенту, а MAI-Voice-2-Flash обіцяє суттєво покращити якість та швидкість обробки мовних даних. Впровадження цих моделей у вже знайомі продукти Microsoft робить їх ще більш цінними для користувачів, забезпечуючи зростання продуктивності та зниження витрат.
