InternVideo-Next: Новая эра моделей видео без текстового надзора

Введение

Предварительное обучение видео-текстовых моделей на большом объеме данных показывает отличные результаты, но зависит от шумных синтетических подписей с ограниченным семантическим покрытием. Такие модели часто игнорируют неявные знания о мире, такие как движение объектов, 3D-геометрия и физические подсказки.

Проблемы существующих подходов

Сравнительно, моделирование замаскированного видео (MVM) напрямую использует пространственно-временные структуры, но отстает от методов, основанных на текстовом надзоре, в общих задачах. Мы обнаружили, что эта разница возникает из-за игнорируемых архитектурных проблем:

  • Пиксельная реконструкция: Страдает от трудностей с сходимостью, а её низкоуровневые требования часто конфликтуют с семантикой.
  • Латентное предсказание: Часто ведет к обучению на укороченных путях.

Предлагаемое решение

Чтобы решить эти проблемы, мы разделяем традиционное проектирование энкодера-декодера на структуру Encoder-Predictor-Decoder (EPD), где Predictor функционирует как латентная модель мира. Мы предлагаем InternVideo-Next, двухступенчатую схему предварительного обучения, которая создает семантически согласованное, но сохраняющее детали латентное пространство для этой модели мира.

Этап 1: Условный диффузионный декодер

На первом этапе традиционный линейный декодер в пиксельном MVM заставляет выходные латенты предсказателя линейно проецироваться, что приводит к конфликту с семантической абстракцией. Мы предлагаем условный диффузионный декодер, который вводит…

Материал носит информационный характер и не является профессиональной консультацией. Часть материалов издания готовится с использованием нейросетевых инструментов и проверяется редакцией по первоисточникам — подробнее в пользовательском соглашении. Нашли неточность или считаете, что материал нарушает ваши права — сообщите редакции, обращения рассматриваются в течение суток.

1 комментарий к “InternVideo-Next: Новая эра моделей видео без текстового надзора”

  1. Анна Ивановна

    Интересно, что модель InternVideo-Next обещает работать без текстового надзора, но вызывает сомнения, насколько это реально. Упоминание о «новой эре» звучит заманчиво, но такие технологии часто сталкиваются с проблемами в интерпретации контекста. Неясно, как она будет справляться с нюансами и сложными сценариями в видео.

Комментарии закрыты.

Прокрутить вверх