Введение
Современные мультимодальные модели стремятся преодолеть ограничения однородных представлений, объединяя понимание и генерацию. Чаще всего для этого используются задачи текст-к-изображению (T2I), которые помогают наладить семантическую согласованность.
Проблемы существующих моделей
Тем не менее, их зависимость от статической генерации изображений в процессе обучения и оценки приводит к переобучению на статическом сопоставлении шаблонов и семантическом слиянии. Это существенно затрудняет моделирование динамических процессов, которые развиваются со временем.
Предложение Envision
Чтобы решить эти проблемы, мы предлагаем Envision — бенчмарк для оценки прогрессии причинных событий в цепочках генерации текст-к-многоизображению. Основанный на мировых знаниях и структурированный по пространственно-временному причинно-следственному анализу, он реорганизует существующие критерии оценки и включает 1000 четырехступенчатых заданий из шести научных и гуманитарных областей.
Переход к последовательным кадрам
Для перехода от оценки одиночных изображений к последовательным кадрам и для того, чтобы проверить, действительно ли модели усваивают мировые знания, следуя причинно-временным ограничениям, мы вводим Envision-Score — комплексный метрик, который интегрирует многомерную согласованность, физичность и эстетику.
Оценка моделей
Обширная оценка 15 моделей (10 специализированных T2I моделей и 5 унифицированных моделей) выявляет, что специализированные T2I модели…
Материал носит информационный характер и не является профессиональной консультацией. Часть материалов издания готовится с использованием нейросетевых инструментов и проверяется редакцией по первоисточникам — подробнее в пользовательском соглашении. Нашли неточность или считаете, что материал нарушает ваши права — сообщите редакции, обращения рассматриваются в течение суток.