Пользователи «ГигаЧата» теперь могут бесплатно создавать видео с речью, музыкой и звуками окружения в Full HD. О запуске новой мультимодальной модели Kandinsky 6.0 Video, которая генерирует ролики с синхронным звуком, Rozetked рассказали представители компании.
Чтобы получить готовый ролик с озвучкой, нужно описать сцену текстом или загрузить первый кадр и добавить описание звукового ряда. Сейчас максимальная длительность ролика со звуком составляет пять секунд, но со временем разработчики планируют её увеличить.
Кроме того, модель лучше передаёт физику реального мира: движения людей, животных и техники в роликах выглядят естественнее и правдоподобнее. Kandinsky стал первой российской нейросетью, способной создавать видео с синхронным звуком, отмечают в компании.
«Мы хотим, чтобы генеративный ИИ стал таким же естественным инструментом креатора, как сегодня текстовый редактор или камера телефона. Любой человек получает возможность снимать более выразительные личные видео. А для профессионального контента это означает более быстрое и выгодное производство. Модель Kandinsky 6.0 Video мы отдаём разработчикам бесплатно и без ограничений — строить на ней свои сервисы может каждый»— Антон Фролов, старший вице-президент, руководитель блока «Развитие генеративного ИИ» «Сбербанка»
Разработчикам новая модель доступна в опенсорсе под лицензией MIT — её можно бесплатно интегрировать в собственные продукты. Модель также будет доступна в популярных инструментах для запуска и интеграции нейросетей, писать интеграцию с нуля не требуется.