Введение
Предварительное обучение видео-текстовых моделей на большом объеме данных показывает отличные результаты, но зависит от шумных синтетических подписей с ограниченным семантическим покрытием. Такие модели часто игнорируют неявные знания о мире, такие как движение объектов, 3D-геометрия и физические подсказки.
Проблемы существующих подходов
Сравнительно, моделирование замаскированного видео (MVM) напрямую использует пространственно-временные структуры, но отстает от методов, основанных на текстовом надзоре, в общих задачах. Мы обнаружили, что эта разница возникает из-за игнорируемых архитектурных проблем:
- Пиксельная реконструкция: Страдает от трудностей с сходимостью, а её низкоуровневые требования часто конфликтуют с семантикой.
- Латентное предсказание: Часто ведет к обучению на укороченных путях.
Предлагаемое решение
Чтобы решить эти проблемы, мы разделяем традиционное проектирование энкодера-декодера на структуру Encoder-Predictor-Decoder (EPD), где Predictor функционирует как латентная модель мира. Мы предлагаем InternVideo-Next, двухступенчатую схему предварительного обучения, которая создает семантически согласованное, но сохраняющее детали латентное пространство для этой модели мира.
Этап 1: Условный диффузионный декодер
На первом этапе традиционный линейный декодер в пиксельном MVM заставляет выходные латенты предсказателя линейно проецироваться, что приводит к конфликту с семантической абстракцией. Мы предлагаем условный диффузионный декодер, который вводит…
Материал носит информационный характер и не является профессиональной консультацией. Часть материалов издания готовится с использованием нейросетевых инструментов и проверяется редакцией по первоисточникам — подробнее в пользовательском соглашении. Нашли неточность или считаете, что материал нарушает ваши права — сообщите редакции, обращения рассматриваются в течение суток.
Интересно, что модель InternVideo-Next обещает работать без текстового надзора, но вызывает сомнения, насколько это реально. Упоминание о «новой эре» звучит заманчиво, но такие технологии часто сталкиваются с проблемами в интерпретации контекста. Неясно, как она будет справляться с нюансами и сложными сценариями в видео.