Skip to main content

Команда Kandinsky представила Time Adapter – расширение для генеративных моделей, которое регулирует динамику событий и частоту кадров в видео. Это решение позволяет модели осознать, как должно протекать время в видеофайле. Исходный код доступен разработчикам бесплатно по открытой лицензии MIT. Об этом рассказали в «Сбере» на платформе IT Speaker.

Time Adapter – это компактный модуль (менее 1% от размера основной модели), который интегрируется с существующей нейросетью. Он состоит из двух независимых компонентов: один отвечает за частоту кадров (от 15 до 60 fps), другой – за динамику событий в каждый момент сцены. 

«Ранее скорость событий в кадре определялась исключительно словами в промпте, и влиять на реальную динамику в создаваемом видео было довольно сложно. С помощью Time Adapter модель осознает, как события развиваются во времени, и может естественно задавать необходимый ритм в любой сцене, а не просто заучивать готовые шаблоны. Это критически важное условие для обучения физического ИИ и будущих моделей мира: система должна точно понимать продолжительность и динамику каждого действия. Новый подход позволяет превращать модели в инструменты, которые лучше соответствуют замыслу человека – режиссера, инженера, разработчика робототехники или любого творческого пользователя», – прокомментировал Денис  Димитров, CTO Kandinsky и управляющий директор по исследованию данных «Сбера». 

Точный контроль времени улучшает качество видео в разных сценариях, позволяет быстрее достигать нужного результата и снижает затраты на создание контента. К основным сценариям относятся: 

  • создание физически реалистичных синтетических данных для обучения физического ИИ;

  • генерация пользовательских видео без артефактов движения с произвольной динамикой;

  • создание рекламных, кино- и музыкальных роликов с строгим контролем темпа;

  • упрощение обработки видео – получение эффектов замедления, ускорения и плавных переходов по темпу прямо в процессе генерации, без привлечения отдельного специалиста по монтажу.

У Time Adapter предусмотрено два режима использования. В первом режиме адаптер обучается и затем подключается к предварительно обученной модели генерации видео: в этом случае движения становятся более плавными, при этом общий характер генерации остается прежним. Во втором режиме модель дообучается совместно с адаптером – в этом случае изменяется не только плавность движения, но и физика сцены. В результате появляется возможность генерировать физические процессы, которые базовая модель создать не могла. 

Ранее редакция IT Speaker сообщала о том, что «Сбер» разрабатывает модель ИИ, которая одновременно может говорить и слушать. Технология нового типа получила название «фулл-дуплекс». 

Вас может заинтересовать: 

«Алиса AI» научилась распознавать рукописный текст с фото

Close Menu
Новости интернет маркетинга, сайтов, новости нейросетей и технологий