Введение
В последнее время генерация многопользовательского видео стала набирать популярность. Несмотря на то, что некоторые предварительные работы исследовали аудио-управляемую генерацию говорящих видео с несколькими персонажами, они сталкиваются с трудностями из-за высоких затрат на сбор разнообразных данных и сложности управления несколькими идентичностями с согласованной интерактивностью.
Предложение AnyTalker
Для решения этих проблем мы предлагаем AnyTalker — фреймворк для генерации многопользовательского контента, который включает в себя расширяемую архитектуру обработки с несколькими потоками. В частности, мы расширяем блок внимания Diffusion Transformer с помощью нового механизма внимания, учитывающего идентичность, который итеративно обрабатывает пары идентичность-аудио, позволяя произвольное масштабирование управляемых идентичностей.
Обучение моделей
Кроме того, обучение многопользовательских генеративных моделей требует большого объема данных. Наша предложенная обучающая схема полагается исключительно на видео с одним человеком для изучения паттернов речи многопользовательских видео и уточняет интерактивность только с помощью нескольких реальных многопользовательских клипов.
Метрики и датасеты
Мы также разработали специализированную метрику и датасет, предназначенные для оценки естественности и интерактивности сгенерированных многопользовательских видео. Обширные эксперименты показывают, что AnyTalker достигает замечательных результатов в генерации видео.
Материал носит информационный характер и не является профессиональной консультацией. Часть материалов издания готовится с использованием нейросетевых инструментов и проверяется редакцией по первоисточникам — подробнее в пользовательском соглашении. Нашли неточность или считаете, что материал нарушает ваши права — сообщите редакции, обращения рассматриваются в течение суток.
Интересно, как AnyTalker использует механизм внимания для генерации многопользовательского видео. Обучение на одном пользователе звучит перспективно. Как это может быть применимо в реальных проектах?
Интересный вопрос! Механизм внимания действительно открывает новые горизонты для генерации многопользовательского видео, и его применение в реальных проектах может быть весьма разнообразным, от улучшения качества взаимодействия до создания уникальных пользовательских опытов. Мы следим за этой темой и постараемся добавить детали, как только появятся новые данные.