
Alibaba представила линейку Qwen-Audio-3.1, состоящую из пяти моделей: для распознавания речи, синтеза голоса, голосового диалога, создания звуковых сцен и анализа аудиофайлов. Компания обновила технологии ASR, TTS и Realtime, добавив две новые модели — TTS-Next и ASR-Next.
TTS-Next создает речь с эффектами и фоновыми звуками согласно сценарию. ASR-Next распознает не только слова в записи, но и эмоции, а также звуки окружающей среды. На данный момент отдельная документация API для ASR-Next не была опубликована.
Читайте также: ТОП-7 нейросетей для создания видео
TTS-Next генерирует озвучку с эффектами звука
Qwen-Audio-3.1-TTS-Next принимает текст, временные метки и образцы голосов. В рамках одного задания модель может озвучить диалог нескольких персонажей и добавить окружающие звуки — например, шум улицы под реплики. Такой результат востребован для подкастов, видеороликов, игр и аудиокниг.

Согласно документации Alibaba Cloud, данная модель работает с китайским и английским языками, принимает до трёх образцов аудио и выдаёт WAV, MP3 или PCM. За один запрос можно получить до четырёх минут подкаста; для других сценариев максимальная длительность — две минуты. Модель также поддерживает вывод на частоте 48 кГц и предоставляет детальный контроль временных меток. Сервис возвращает готовый файл, а не поток звука в процессе генерации.
ASR-Next анализирует аудиозапись, ASR расшифровывает речь
ASR-Next ориентирована на анализ аудиофайлов: компания утверждает, что распознает эмоции говорящего, фоновые и механические звуки, а также может находить звуковые события по времени и отвечать на вопросы о записи. Отдельная документация API для ASR-Next пока не доступна.
Обновлённая Qwen-Audio-3.1-ASR преобразует речь в текст на 30 языках и 16 диалектах китайского языка. Она может определять говорящего и время каждой реплики, а также удалять слова-паразиты и повторы. По данным Qwen, на открытых наборах KeSpeech и WSYue средний процент ошибочно распознанных иероглифов составил 4,55% на 11 поднаборах. Это результат тестирования, а не гарантированная точность для любых записей.
TTS и Realtime обновили голосовые сценарии
Qwen-Audio-3.1-TTS синтезирует речь и позволяет управлять подачей: задавать эмоцию, темп и стиль произнесения. Компания также утверждает, что сохраняет характер голоса при смене языка.
Qwen-Audio-3.1-Realtime предназначена для диалогов голосом в реальном времени. Ассистента можно прервать во время ответа; модель поддерживает смену языка в процессе разговора и активацию инструментов. Эти функции необходимы, например, голосовому помощнику, который отвечает на вопросы и выполняет команды.
Как получить доступ
На платформе Qwen AI размещены страницы ASR, TTS, TTS-Next и Realtime. Alibaba Cloud отдельно описала подключение TTS-Next через Model Studio. Отдельная документация API для ASR-Next пока не опубликована.
Кроме того, Qwen сообщила о снижении цен на голосовые модели: ориентировочно на 70% для TTS, на 85% для Realtime и до 95% для ASR. Конкретная стоимость зависит от выбранной модели и платформы подключения.
Ранее Alibaba выпустила Qwen-Image 2.1 с функцией генерации прозрачных изображений.
Изображение: x.com/Alibaba_Qwen/status/2102687258990026993

