
Pika анонсировала Pika Audio — набор из четырёх ИИ-моделей, предназначенных для работы со звуком: Soundtrack, Music, SFX и Speech.
Эти модели доступны через Pika API. Soundtrack создает синхронизированную аудиодорожку для видео, Music генерирует музыку, SFX — звуковые эффекты на основе текстового описания, а Speech — речь с клонированием голосов. Дополнительные сведения можно найти в материале Postium.
Также читайте: 10 нейросетей для создания веб-сайтов с нуля
Pika Audio — возможности новых моделей
Pika Music создает оригинальные музыкальные композиции, основываясь на текстовом описании, тексте песни, музыкальном референсе и образце голоса. Pika SFX генерирует звуковые эффекты по текстовому запросу.
Pika Speech предназначена для синтеза речи и клонирования голосов. Pika Soundtrack создает синхронизированную аудиодорожку для загруженного видео.

На странице Pika API указаны тарифы для моделей. Однако конкретные расценки и условия использования могут варьироваться в зависимости от способа доступа к API.
Как использовать
Модели функционируют через Pika API. Разработчику необходимо получить доступ к API; затем он выбирает нужную модель и передает ей текст, аудиореференс или видео — в зависимости от конкретного сценария.
Почему это имеет значение? Pika объединила четыре сценария работы со звуком в одной линейке и одном API: музыка по тексту или референсу, звуковые эффекты, синтез речи и дорожка, синхронизированная с видео.
Ранее мы сообщали, что Pika Labs тестирует социальную сеть с ИИ-видео из селфи — первую в мире социальную сеть, полностью основанную на контенте, созданном ИИ.
Итог. Pika Audio добавляет в Pika API инструменты для генерации музыки, речи, звуковых эффектов и звуковых дорожек для видео.


