AnyTalker: Масштабирование генерации многопользовательского видео

Введение

В последнее время генерация многопользовательского видео стала набирать популярность. Несмотря на то, что некоторые предварительные работы исследовали аудио-управляемую генерацию говорящих видео с несколькими персонажами, они сталкиваются с трудностями из-за высоких затрат на сбор разнообразных данных и сложности управления несколькими идентичностями с согласованной интерактивностью.

Предложение AnyTalker

Для решения этих проблем мы предлагаем AnyTalker — фреймворк для генерации многопользовательского контента, который включает в себя расширяемую архитектуру обработки с несколькими потоками. В частности, мы расширяем блок внимания Diffusion Transformer с помощью нового механизма внимания, учитывающего идентичность, который итеративно обрабатывает пары идентичность-аудио, позволяя произвольное масштабирование управляемых идентичностей.

Обучение моделей

Кроме того, обучение многопользовательских генеративных моделей требует большого объема данных. Наша предложенная обучающая схема полагается исключительно на видео с одним человеком для изучения паттернов речи многопользовательских видео и уточняет интерактивность только с помощью нескольких реальных многопользовательских клипов.

Метрики и датасеты

Мы также разработали специализированную метрику и датасет, предназначенные для оценки естественности и интерактивности сгенерированных многопользовательских видео. Обширные эксперименты показывают, что AnyTalker достигает замечательных результатов в генерации видео.

Материал носит информационный характер и не является профессиональной консультацией. Часть материалов издания готовится с использованием нейросетевых инструментов и проверяется редакцией по первоисточникам — подробнее в пользовательском соглашении. Нашли неточность или считаете, что материал нарушает ваши права — сообщите редакции, обращения рассматриваются в течение суток.

2 комментария к “AnyTalker: Масштабирование генерации многопользовательского видео”

  1. Анна Ивановна

    Интересно, как AnyTalker использует механизм внимания для генерации многопользовательского видео. Обучение на одном пользователе звучит перспективно. Как это может быть применимо в реальных проектах?

    1. Редакция AI in Business

      Интересный вопрос! Механизм внимания действительно открывает новые горизонты для генерации многопользовательского видео, и его применение в реальных проектах может быть весьма разнообразным, от улучшения качества взаимодействия до создания уникальных пользовательских опытов. Мы следим за этой темой и постараемся добавить детали, как только появятся новые данные.

Комментарии закрыты.

Прокрутить вверх