Новая нейросеть создаёт видео с озвучкой

Пользователи сервиса ГигаЧат теперь могут создавать видео с речью, музыкой и звуками окружения в высоком качестве Full HD абсолютно бесплатно. Это стало возможным благодаря внедрению новой модели Kandinsky 6.0 Video, которая генерирует ролики с синхронным звуком. Для того чтобы получить готовый видеоролик с озвучкой, пользователю достаточно описать сцену текстом или загрузить первый кадр и добавить описание звукового ряда. Максимальная продолжительность ролика с озвучкой составляет пять секунд, но разработчики планируют увеличить этот лимит в будущем. Также модель улучшила передачу физики реального мира, что позволяет движениям людей, животных и техники выглядеть более естественно и правдоподобно. Kandinsky стал первой российской нейросетью, способной создавать видео с синхронным звуком. Подробности можно найти на сайте Baikal24.Ru.

Как отметил Антон Фролов, старший вице-президент и руководитель блока «Развитие генеративного ИИ» в Сбербанке: «Мы стремимся к тому, чтобы генеративный ИИ стал таким же привычным инструментом для креаторов, как текстовый редактор или камера на телефоне. Каждый человек теперь может создавать более выразительные личные видео. Для профессионального контента это означает более быстрое и выгодное производство. Мы предоставляем модель Kandinsky 6.0 Video разработчикам бесплатно и без ограничений — любой желающий может строить на её основе свои сервисы».

Возможности новой модели впечатляют: Kandinsky 6.0 Video — это мультимодальная модель, которая одновременно «видит» и «слышит» генерируемое. Благодаря этому диалоги, звуковые эффекты и музыкальное сопровождение синхронизированы с изображением, а губы персонажей двигаются в такт речи. Если звук не нужен, пользователь может запросить создание видео без него. Когда модель сталкивается с объектом, которого она не знает, например, новым персонажем из поп-культуры, она ищет референсы и генерирует точный результат, что позволяет создавать даже те объекты, которые появились после её обучения.

Kandinsky может создавать натуральный звук в широком диапазоне — от разговоров и цифровых эффектов до шагов, шума ветра или звука проезжающей машины. В одном видео можно разыграть диалог, добавить музыку — от «испанской гитары» до «саундтрека к погоне», «лоу-фая для сонного вечера» или любой другой фон для создания атмосферы. Модель генерирует чистый и детализированный звук, избегая «шипения» и потери качества при частоте 44 кГц, что соответствует стандартам большинства стриминговых сервисов.

Эти функции окажутся полезными для множества задач: с их помощью можно оживить семейные фотографии, создать видеооткрытки с речью или музыкой для близких, записать ASMR-ролики с шелестом бумаги, потрескиванием дров или скрипом снега, а также возродить старые мемы или кадры из фильмов.

Кроме того, новая модель доступна разработчикам в опенсорсе под лицензией MIT, что позволяет интегрировать её в собственные продукты без каких-либо затрат. Она также будет доступна в популярных инструментах для запуска и интеграции нейросетей, таких как FAL, Diffusers, FastVideo, ComfyUI, SGLang и vLLM-omni. При этом разработчикам не придётся писать интеграцию с нуля — Kandinsky 6.0 Video можно подключить прямо в существующие продукты.

Качество видео также заслуживает внимания: Kandinsky 6.0 Video создаёт ролики в разрешении до Full HD. В ГигаЧате пользователи смогут выбирать необходимое качество прямо в окне ввода перед отправкой запроса: SD для быстрой генерации, HD или Full HD для более четкой и детализированной картинки. Модель точно передаёт физику реального мира, а движения людей, животных и предметов выглядят более естественно, что особенно заметно в динамичных роликах с быстрым движением или сменой ракурса.

Это обновление будет полезно всем, кто занимается созданием видео, как в профессиональных, так и в личных проектах:

  • Авторам контента для соцсетей: создать короткий ролик с озвученной репликой персонажа или фоновым звуком без необходимости использования микрофона, актёров и монтажа звука.
  • Малому бизнесу: сделать голосовой рекламный ролик о товаре или услуге без съёмочной команды.
  • Маркетологам и SMM-специалистам: собрать тестовый ролик с диалогом и фирменной атмосферой — звуком окружения и музыкальной подложкой — для соцсетей и мессенджеров.
  • Преподавателям: оживить архивное фото или портрет исторической личности с озвученной репликой — для урока истории или литературы.
  • Дизайнерам: собрать черновик ролика со звуком для питча или демонстрации идеи.

Как обучали модель также стоит упомянуть. Kandinsky 6.0 Video состоит из двух связанных модулей, отвечающих за генерацию видео и звука. Звуковой модуль обучен на более чем 20 миллионах разнообразных видео со звуком. Для обучения команда отбирала ролики только с чистым, качественным звуком, а также видео с говорящими людьми крупным планом для более точной синхронизации речи и мимики.

В новой версии Kandinsky 6.0 Video Pro качество генерации значительно возросло в общем визуальном качестве, следовании промпту и движении камеры. Новая модель лучше своей предшественницы Kandinsky 5.0 в среднем на 71% по всем критериям, также уверенно обходит открытую модель LTX 2.5. В задаче оживления изображения модель превосходит и ведущую закрытую модель Veo 3.1 Fast по визуальному качеству, соответствию исходному изображению и движениям камеры.

Пользователи сервиса ГигаЧат теперь могут создавать видео с речью, музыкой и звуками окружения в высоком качестве Full HD абсолютно бесплатно. Это стало возможным благодаря внедрению новой модели...
Источник:
Опубликовано:
Реклама