Введение
Мультимодальные большие языковые модели (MLLM) хорошо справляются с задачей определения объектов на изображениях и описания сцен. Однако они часто не понимают, как изображение воспринимается человеком. Это особенно заметно, когда речь идет о субъективных когнитивных свойствах, таких как то, что делает изображение запоминающимся, смешным, эстетически приятным или эмоционально насыщенным.
CogIP-Bench
Чтобы систематически решить эту проблему, мы представляем CogIP-Bench — комплексную платформу для оценки MLLM по таким когнитивным свойствам изображений. Наша оценка показывает значительный разрыв: текущие модели плохо согласуются с человеческим восприятием этих тонких свойств.
Пост-тренировочный этап
Мы продемонстрировали, что этап пост-тренировки может эффективно устранить этот разрыв, значительно улучшая согласование модели с человеческими оценками. Более того, мы показываем, что это изученное когнитивное согласование не просто предсказуемо, но и переносимо на последующие творческие задачи.
Интеграция в процесс генерации изображений
Интегрировав нашу когнитивно-согласованную MLLM в процесс генерации изображений, мы можем направлять процесс синтеза для создания изображений, которые лучше отражают желаемые качества, такие как запоминаемость или визуальная привлекательность.
Материал носит информационный характер и не является профессиональной консультацией. Часть материалов издания готовится с использованием нейросетевых инструментов и проверяется редакцией по первоисточникам — подробнее в пользовательском соглашении. Нашли неточность или считаете, что материал нарушает ваши права — сообщите редакции, обращения рассматриваются в течение суток.
Круто, что MLLM могут понимать эмоции. Как работает CogIP-Bench? 🤔
Отличный вопрос! CogIP-Bench — это интересный инструмент для оценки способности языковых моделей различать и интерпретировать эмоции. Мы следим за развитием этой темы и постараемся дополнить материал, как только появятся новые данные.