
В новой предварительной версии Wan 2.5 внедрена важная функция — нативная генерация видео на основе аудио. Теперь при создании видеороликов можно загружать не только текст или изображения, но и аудиофайлы: голос, музыку или звуковые эффекты.
Модель использует аудио как основу для сюжетной линии и синхронизации — возможно генерировать ролики до 10 секунд, а качество изображения значительно улучшено.
Читайте также: Кто такие AI-креаторы и чем они занимаются
Как генерировать видео по аудио в Wan 2.5
Ранее видео в Wan создавалось в основном на основе текстовых описаний или статичных референсных кадров. В интерфейсе теперь добавлен отдельный ввод для аудиофайлов или ссылок. Их можно комбинировать с текстовыми подсказками и референсными изображениями, управляя сразу несколькими параметрами видео.

Как это функционирует:
- можно загрузить текст диктора — модель адаптирует движения губ и выражения лица под речь;
- можно выбрать музыкальное сопровождение — сцены будут смонтированы в ритме;
- можно использовать звуковые эффекты (шаги, взрывы, аплодисменты) — и в кадре произойдут соответствующие действия.
На самом деле, это объединяет этапы производства: звук и изображение генерируются одновременно, без отдельной пост-обработки. Ограничение по длительности составляет до 10 секунд. Качество зависит от выбранной платформы.
Wan активно развивает функции синхронизации аудио и видео. В предыдущих обновлениях разработчики уже внедряли генерацию с озвучкой и лип-синком, а теперь звук стал полноценным входом для модели. Это выделяет Wan на фоне таких конкурентов, как Veo, которые в основном ориентируются на визуальную сторону.
Ранее Suno AI представила Suno Studio, позволяющую записывать и редактировать музыку с использованием ИИ.


