Microsoft выпустила три собственные ИИ-модели для речи и изображений

Пост опубликован в блогах iXBT.com, его автор не имеет отношения к редакции iXBT.com
| Новость | ИИ, сервисы и приложения

Microsoft представила три собственные модели искусственного интеллекта для работы с речью и изображениями. Системы MAI-Transcribe-1, MAI-Voice-1 и MAI-Image-2 доступны через сервис Microsoft Foundry и площадку MAI Playground.

Модель преобразования речи в текст MAI-Transcribe-1 показала средний уровень ошибок 3,8% при тестировании на 25 языках по методике FLEURS. Алгоритм обрабатывает файлы форматов MP3, WAV и FLAC объемом до 200 МБ. Скорость пакетной транскрипции превышает показатели существующих предложений Azure в 2,5 раза. Технология применяется в режимах голосового управления Copilot и для расшифровки разговоров в Teams.

Автор: qwen. ai Источник: chat.qwen.ai

Генератор голоса MAI-Voice-1 создает 60 секунд аудио за одну секунду реального времени и поддерживает клонирование голоса по коротким образцам. Стоимость услуги составляет 22 доллара за миллион символов. Система создания изображений MAI-Image-2 размещена в тройке лидеров рейтинга Arena. ai и работает вдвое быстрее предыдущей версии. Тарифы установлены на уровне 5 долларов за миллион входных токенов и 33 доллара за миллион выходных токенов.

Разработка моделей велась командами численностью менее десяти человек. Требования к вычислительным ресурсам снизились вдвое по сравнению с показателями конкурентов. Запуск состоялся после пересмотра соглашения с OpenAI в сентябре 2024 года, который снял ограничения на самостоятельные исследования в области общего искусственного интеллекта. Партнерство с OpenAI сохраняется до 2032 года.

Руководитель направления суперинтеллекта Мустафа Сулейман сообщил о планах обеспечить независимость компании в создании моделей всех типов. Стратегия ценообразования направлена на снижение себестоимости внутренних продуктов.

Источник: venturebeat

Автор не входит в состав редакции iXBT.com (подробнее »)
Об авторе
Интересуюсь технологиями и рассказываю о них вам.

0 комментариев

Добавить комментарий

Сейчас на главной

Новости

Публикации

Kiwi Ears B_Media Chorus: обзор наушников с мягким и универсальным звучанием

Kiwi Ears Chorus — это слегка бас ориентированные, нейтральные динамические наушники из бюджетного сегмента, выпущенные в сотрудничестве с аудиорецензентом B_Media. СодержаниеПараметры...

Червоточина внутри атома: как обычный водород проверяет главную гипотезу квантовой гравитации

Объединение квантовой механики и теории относительности остается главной нерешенной задачей теоретической физики. Две эти теории описывают мир на разных масштабах: первая работает со сверхмалыми...

Грозит ли Земле перенаселение? Новая математическая модель предсказывает резкий обвал населения к 2064 году

В середине XX века ученые всерьез опасались, что человечество погибнет от перенаселения. Самый известный и пугающий прогноз сделал американский физик Хайнц фон Фёрстер в 1960 году. Он...

Стоит ли покупать Xiaomi 15 в 2026 году: обзор и опыт использования компактного флагмана

Если вы ищете смартфон за 40-50 тысяч рублей, то лучшим вариантом может стать прошлогодний флагман. Одним из таких является Xiaomi 15. Мощный аппарат с компактным корпусом, тройной камерой...

Озеро Утренней Славы: как туристы превратили чудо природы в разноцветную лужу

В Йеллоустоне находится одно из самых красивых озер мира — небольшая по диаметру воронка с водой такого насыщенного синего цвета, что кажется, будто на землю упал кусочек неба. Жена...