
Компания Alibaba представила новую линию моделей Qwen-Audio-3.0-TTS, предназначенных для синтеза речи. В этот ассортимент вошли Flash — для озвучивания с минимальной задержкой и Plus — ориентированная на высокое качество генерации.
Эти модели доступны через API Alibaba Cloud Model Studio в таких регионах, как Сингапур и Китай (Пекин). Стоимость Flash составляет $0,15, тогда как Plus обойдется в $0,20 за 10 тысяч символов на входе. Дополнительные сведения можно найти в материале Postium.
Также читайте: Нейросети для озвучивания текста голосом
Возможности нейросети Qwen-Audio-3.0-TTS
Модели поддерживают 16 языков, включая русский, английский, китайский, японский, корейский, немецкий, французский, итальянский, португальский, тайский, индонезийский, малайский и вьетнамский.
Стиль речи можно настроить с помощью обычного текста: например, можно попросить модель говорить медленнее, более эмоционально, шепотом или в стиле диктора. В текст также можно добавлять теги, указывающие на эмоции и звуковые действия, такие как смех, вздохи, кашель, шепот или пение.
Функция клонирования голоса доступна в версии Flash. Для этого необходимо загрузить аудиофайл, создать голос через API, а затем указать его идентификатор при генерации. По данным Qwen, новая версия лучше справляется с неидеальными записями.
Как подключить Qwen-Audio-3.0-TTS
Для использования потребуется API-ключ Alibaba Cloud Model Studio. В запросе необходимо указать модель qwen-audio-3.0-tts-flash или qwen-audio-3.0-tts-plus, выбрать голос и передать текст для озвучивания.
Модели поддерживают потоковую генерацию аудио через WebSocket. На данный момент API функционирует только в однонаправленном потоковом режиме.
Почему это важно? На день раньше Qwen представила Qwen 3.8 Max Preview — новую языковую модель. Теперь компания выпустила отдельные модели для синтеза речи. Это откроет возможности для применения Qwen в голосовых ассистентах, сервисах озвучивания контента и приложениях по клонированию голоса без необходимости подключения отдельного TTS-сервиса.
Итог: В Alibaba Cloud Model Studio появились две ИИ-модели для многоязычного озвучивания — Qwen-Audio-3.0-TTS.


