Введение
Мультимодальные большие языковые модели (MLLM) хорошо справляются с задачей определения объектов на изображениях и описания сцен. Однако они часто не понимают, как изображение воспринимается человеком. Это особенно заметно, когда речь идет о субъективных когнитивных свойствах, таких как то, что делает изображение запоминающимся, смешным, эстетически приятным или эмоционально насыщенным.
CogIP-Bench
Чтобы систематически решить эту проблему, мы представляем CogIP-Bench — комплексную платформу для оценки MLLM по таким когнитивным свойствам изображений. Наша оценка показывает значительный разрыв: текущие модели плохо согласуются с человеческим восприятием этих тонких свойств.
Пост-тренировочный этап
Мы продемонстрировали, что этап пост-тренировки может эффективно устранить этот разрыв, значительно улучшая согласование модели с человеческими оценками. Более того, мы показываем, что это изученное когнитивное согласование не просто предсказуемо, но и переносимо на последующие творческие задачи.
Интеграция в процесс генерации изображений
Интегрировав нашу когнитивно-согласованную MLLM в процесс генерации изображений, мы можем направлять процесс синтеза для создания изображений, которые лучше отражают желаемые качества, такие как запоминаемость или визуальная привлекательность.
Круто, что MLLM могут понимать эмоции. Как работает CogIP-Bench? 🤔
Отличный вопрос! CogIP-Bench — это интересный инструмент для оценки способности языковых моделей различать и интерпретировать эмоции. Мы следим за развитием этой темы и постараемся дополнить материал, как только появятся новые данные.