
ByteDance представила SeedRealtime — мультимодальную модель, предназначенную для ведения диалогов в формате видео и аудио в реальном времени. Она интегрирует обработку звука, изображения и текста в единую архитектуру и продолжает анализировать ситуацию, пока пользователь говорит или перемещает камеру.
Компания уже внедрила SeedRealtime в приложение Doubao (чат-бот) для всех пользователей. ByteDance не уточнила, будет ли модель доступна в других продуктах. Дополнительные детали можно найти в материале Postium.
Читайте также: 6 нейросетей для озвучки текста голосом
Нейросеть SeedRealtime: возможности и принципы работы
SeedRealtime принимает непрерывный поток данных с камеры и микрофона. Модель сопоставляет произносимую речь с объектами, находящимися в кадре, учитывает изменения в сцене и определяет, к кому или к чему относится вопрос пользователя.
Например, пользователь может показать камеру меню и задать вопрос о конкретном блюде. Модель распознает его по изображению, учитывает устный вопрос и отвечает в рамках того же диалога. SeedRealtime также различает собеседников, связывает голоса с людьми в кадре и сохраняет их пожелания в контексте беседы.

Модель поддерживает полный дуплекс: пользователь и ИИ могут говорить одновременно, перебивать друг друга и продолжать диалог без строгого чередования реплик. SeedRealtime самостоятельно определяет момент для ответа, не полагаясь только на внешний детектор окончания речи.
По информации ByteDance, во внутренних тестах проблемы с темпом разговора возникали у SeedRealtime вдвое реже, чем у каскадных систем, где распознавание речи, анализ изображения и синтез ответа происходят на отдельных этапах.
Более того, модель может продолжать наблюдение без постоянных команд. В одном из тестов её попросили заметить определённый объект, и SeedRealtime сообщила, когда он появился в кадре. В одной из демонстраций модель следила за страницами научной статьи и остановила пользователя на нужном разделе.
На данный момент ByteDance демонстрирует SeedRealtime исключительно как функцию Doubao. Компания не раскрыла параметры модели, стоимость инфраструктуры, условия лицензирования и планы по доступу для сторонних разработчиков.
Ранее ByteDance представила видеомодель Seedance 2.5 и модель для генерации изображений Seedream 5.0 Pro. Обе доступны в Dreamina AI.
Заключение: SeedRealtime может следить за непрерывным видеопотоком, учитывать фоновые реплики и отвечать в нужный момент, не ожидая отдельного снимка или завершения голосового сообщения.


