Skip to main content
ElevenLabs выпустили Eleven v4 и v4 Turbo

ElevenLabs анонсировала новые модели синтеза речи, Eleven v4 и Eleven v4 Turbo. Они разработаны на основе новой архитектуры и предназначены для создания более выразительной озвучки с управлением эмоциями, темпом и стилем подачи непосредственно в тексте.

Eleven v4 была создана специально для контента, аудиокниг, озвучки персонажей и других случаев, где критически важно качество. Версия v4 Turbo сохраняет выразительность основной модели, но оптимизирована для работы в реальном времени — особенно с голосовыми агентами. По заявлениям ElevenLabs, её медианная задержка инференса составляет примерно 100 мс, а время до первого звука — около 150 мс.

Читайте также: ТОП-6 нейросетей для озвучки текста голосом

Нейросеть Eleven v4: возможности и принцип работы

Одним из основных нововведений является более точное управление подачей. В текст можно добавлять аудиотеги, такие как [whispering], [shouting], [laughing], [sigh], что позволяет задавать, как именно должна звучать конкретная реплика. Модель также учитывает контекст сцены, что позволяет изменять эмоциональную подачу в рамках одного текста. ElevenLabs подчеркивает, что v4 более точно следует последовательностям тегов по сравнению с предыдущей версией.

Как работает Eleven v4

Для длинных материалов применяется контекстное сшивание, что позволяет сохранять темп и характер подачи между отдельными генерациями. Компания также утверждает, что голос остаётся стабильным при повторной генерации отдельных фрагментов, что облегчает работу с диалогами и длительной озвучкой.

1

Клонирование голоса и языков

Eleven v4 поддерживает Instant Voice Cloning — пользователь может клонировать голос по записи длиной от 10 секунд. Также модель снова поддерживает Professional Voice Clones, которые предназначены для более точного воспроизведения оригинального голоса. Для использования клона необходимо получить подтверждённое согласие владельца голоса.

Клонирование голоса и языки

Модель поддерживает более 90 языков, включая русский. ElevenLabs отдельно подчеркивает, что v4 может генерировать речь на поддерживаемых языках с одним и тем же голосом.

Eleven v4 и v4 Turbo доступны через ElevenCreative, ElevenAgents и ElevenAPI. Для API предусмотрены как потоковая, так и стандартная генерация речи.

Ранее ElevenLabs представила Studio 4.0, которая включает генерацию видео, изображений и звука.

Изображения: elevenlabs.io

ElevenLabs Нейросети

Close Menu
Новости интернет маркетинга, сайтов, новости нейросетей и технологий