Введение
В глобализированном мире культурные элементы из различных источников часто встречаются вместе в одной визуальной сцене. Такие ситуации мы называем сценариями культурного смешения, но как Большие Модели Визуального Языка (LVLM) воспринимают их, остается малоизученным.
Культурное смешение как вызов для LVLM
Мы исследуем культурное смешение как важную проблему для LVLM и анализируем поведение текущих моделей, когда культурные элементы из разных регионов объединяются.
Создание базы данных CultureMix
Чтобы систематически проанализировать данные поведения, мы создаем CultureMix — набор для визуального вопросно-ответного тестирования (VQA) с 23 тыс. изображений культурного смешения, сгенерированных диффузией и проверенных людьми. Набор включает четыре подзадачи:
- (1) только еда,
- (2) еда + еда,
- (3) еда + фон,
- (4) еда + еда + фон.
Анализ и результаты
При оценке 10 LVLM мы обнаружили последовательные ошибки в сохранении индивидуальных культурных идентичностей в смешанных условиях. Модели показывают сильную зависимость от фона, с падением точности на 14%, когда к базовым данным о еде добавляются культурные фоны. Также наблюдаются непоследовательные прогнозы для одинаковой еды в разных контекстах.
Стратегии повышения устойчивости
Чтобы преодолеть эти ограничения, мы исследуем три стратегии повышения устойчивости. Мы обнаружили, что контролируемая дообучение с использованием разнообразного набора данных о культурном смешении существенно улучшает качество модели.