Skip to main content
Как генерировать видео по аудио в Wan 2.5

В новой предварительной версии Wan 2.5 внедрена важная функция — нативная генерация видео на основе аудио. Теперь при создании видеороликов можно загружать не только текст или изображения, но и аудиофайлы: голос, музыку или звуковые эффекты.

Модель использует аудио как основу для сюжетной линии и синхронизации — возможно генерировать ролики до 10 секунд, а качество изображения значительно улучшено.

Читайте также: Кто такие AI-креаторы и чем они занимаются

Как генерировать видео по аудио в Wan 2.5

Ранее видео в Wan создавалось в основном на основе текстовых описаний или статичных референсных кадров. В интерфейсе теперь добавлен отдельный ввод для аудиофайлов или ссылок. Их можно комбинировать с текстовыми подсказками и референсными изображениями, управляя сразу несколькими параметрами видео.

audio-to-video

Как это функционирует:

  • можно загрузить текст диктора — модель адаптирует движения губ и выражения лица под речь;
  • можно выбрать музыкальное сопровождение — сцены будут смонтированы в ритме;
  • можно использовать звуковые эффекты (шаги, взрывы, аплодисменты) — и в кадре произойдут соответствующие действия.

На самом деле, это объединяет этапы производства: звук и изображение генерируются одновременно, без отдельной пост-обработки. Ограничение по длительности составляет до 10 секунд. Качество зависит от выбранной платформы.

Wan активно развивает функции синхронизации аудио и видео. В предыдущих обновлениях разработчики уже внедряли генерацию с озвучкой и лип-синком, а теперь звук стал полноценным входом для модели. Это выделяет Wan на фоне таких конкурентов, как Veo, которые в основном ориентируются на визуальную сторону.

Ранее Suno AI представила Suno Studio, позволяющую записывать и редактировать музыку с использованием ИИ.

Нейросети

Close Menu
Новости интернет маркетинга, сайтов, новости нейросетей и технологий