Пользователи «ГигаЧата» теперь могут создавать видео со звуком

Kandinsky 6.0 Video доступна в «ГигаЧате». Модель делает видео в Full HD с физикой реального мира и синхронным звуком.

Пользователи «ГигаЧата» теперь могут создавать видео со звуком

Пользователи «ГигаЧата» теперь могут бесплатно создавать видео с речью, музыкой и звуками окружения в Full HD. О запуске новой мультимодальной модели Kandinsky 6.0 Video, которая генерирует ролики с синхронным звуком, Rozetked рассказали представители компании.

Чтобы получить готовый ролик с озвучкой, нужно описать сцену текстом или загрузить первый кадр и добавить описание звукового ряда. Сейчас максимальная длительность ролика со звуком составляет пять секунд, но со временем разработчики планируют её увеличить.

Кроме того, модель лучше передаёт физику реального мира: движения людей, животных и техники в роликах выглядят естественнее и правдоподобнее. Kandinsky стал первой российской нейросетью, способной создавать видео с синхронным звуком, отмечают в компании.

«Мы хотим, чтобы генеративный ИИ стал таким же естественным инструментом креатора, как сегодня текстовый редактор или камера телефона. Любой человек получает возможность снимать более выразительные личные видео. А для профессионального контента это означает более быстрое и выгодное производство. Модель Kandinsky 6.0 Video мы отдаём разработчикам бесплатно и без ограничений — строить на ней свои сервисы может каждый»
— Антон Фролов, старший вице-президент, руководитель блока «Развитие генеративного ИИ» «Сбербанка»

Разработчикам новая модель доступна в опенсорсе под лицензией MIT — её можно бесплатно интегрировать в собственные продукты. Модель также будет доступна в популярных инструментах для запуска и интеграции нейросетей, писать интеграцию с нуля не требуется.