Skip to main content
Qwen выпустила Qwen-Audio-3.0-TTS — ИИ-модели для озвучки текста и клонирования голоса

Компания Alibaba представила новую линию моделей Qwen-Audio-3.0-TTS, предназначенных для синтеза речи. В этот ассортимент вошли Flash — для озвучивания с минимальной задержкой и Plus — ориентированная на высокое качество генерации.

Эти модели доступны через API Alibaba Cloud Model Studio в таких регионах, как Сингапур и Китай (Пекин). Стоимость Flash составляет $0,15, тогда как Plus обойдется в $0,20 за 10 тысяч символов на входе. Дополнительные сведения можно найти в материале Postium.

Также читайте: Нейросети для озвучивания текста голосом

Возможности нейросети Qwen-Audio-3.0-TTS

Модели поддерживают 16 языков, включая русский, английский, китайский, японский, корейский, немецкий, французский, итальянский, португальский, тайский, индонезийский, малайский и вьетнамский.

Стиль речи можно настроить с помощью обычного текста: например, можно попросить модель говорить медленнее, более эмоционально, шепотом или в стиле диктора. В текст также можно добавлять теги, указывающие на эмоции и звуковые действия, такие как смех, вздохи, кашель, шепот или пение.

Функция клонирования голоса доступна в версии Flash. Для этого необходимо загрузить аудиофайл, создать голос через API, а затем указать его идентификатор при генерации. По данным Qwen, новая версия лучше справляется с неидеальными записями.

Как подключить Qwen-Audio-3.0-TTS

Для использования потребуется API-ключ Alibaba Cloud Model Studio. В запросе необходимо указать модель qwen-audio-3.0-tts-flash или qwen-audio-3.0-tts-plus, выбрать голос и передать текст для озвучивания.

Модели поддерживают потоковую генерацию аудио через WebSocket. На данный момент API функционирует только в однонаправленном потоковом режиме.

Почему это важно? На день раньше Qwen представила Qwen 3.8 Max Preview — новую языковую модель. Теперь компания выпустила отдельные модели для синтеза речи. Это откроет возможности для применения Qwen в голосовых ассистентах, сервисах озвучивания контента и приложениях по клонированию голоса без необходимости подключения отдельного TTS-сервиса.

Итог: В Alibaba Cloud Model Studio появились две ИИ-модели для многоязычного озвучивания — Qwen-Audio-3.0-TTS.

Alibaba Qwen Нейросети

Close Menu
Новости интернет маркетинга, сайтов, новости нейросетей и технологий