От пикселей к чувствам: как MLLM понимают изображения

От пикселей к чувствам: как MLLM понимают изображения

Введение

Мультимодальные большие языковые модели (MLLM) хорошо справляются с задачей определения объектов на изображениях и описания сцен. Однако они часто не понимают, как изображение воспринимается человеком. Это особенно заметно, когда речь идет о субъективных когнитивных свойствах, таких как то, что делает изображение запоминающимся, смешным, эстетически приятным или эмоционально насыщенным.

CogIP-Bench

Чтобы систематически решить эту проблему, мы представляем CogIP-Bench — комплексную платформу для оценки MLLM по таким когнитивным свойствам изображений. Наша оценка показывает значительный разрыв: текущие модели плохо согласуются с человеческим восприятием этих тонких свойств.

Пост-тренировочный этап

Мы продемонстрировали, что этап пост-тренировки может эффективно устранить этот разрыв, значительно улучшая согласование модели с человеческими оценками. Более того, мы показываем, что это изученное когнитивное согласование не просто предсказуемо, но и переносимо на последующие творческие задачи.

Интеграция в процесс генерации изображений

Интегрировав нашу когнитивно-согласованную MLLM в процесс генерации изображений, мы можем направлять процесс синтеза для создания изображений, которые лучше отражают желаемые качества, такие как запоминаемость или визуальная привлекательность.

2 комментария для “От пикселей к чувствам: как MLLM понимают изображения

  1. Круто, что MLLM могут понимать эмоции. Как работает CogIP-Bench? 🤔

    1. Отличный вопрос! CogIP-Bench — это интересный инструмент для оценки способности языковых моделей различать и интерпретировать эмоции. Мы следим за развитием этой темы и постараемся дополнить материал, как только появятся новые данные.

Обсуждение закрыто.