SPHINX: Искусственная среда для визуального восприятия

SPHINX: Искусственная среда для визуального восприятия

Введение в Sphinx

Мы представляем Sphinx — искусственную среду для визуального восприятия и рассуждения, которая нацелена на основные когнитивные примитивы. Sphinx процедурно генерирует головоломки, используя мотивы, плитки, диаграммы, иконки и геометрические примитивы, каждая из которых сопровождается проверяемыми решениями. Это позволяет как точно оценивать, так и создавать масштабные наборы данных.

Типы задач

Бенчмарк охватывает 25 типов задач, включая:

  • Обнаружение симметрии
  • Геометрические преобразования
  • Пространственное мышление
  • Интерпретация диаграмм
  • Предсказание последовательностей

Оценка моделей

Оценка недавних крупных языковых моделей с визуальным восприятием (LVLMs) показывает, что даже самая современная модель GPT-5 достигает лишь 51,1% точности, что значительно ниже уровня человека.

Улучшение точности через RLVR

Наконец, мы демонстрируем, что обучение с подкреплением с проверяемыми наградами (RLVR) значительно улучшает точность моделей по этим задачам и дает приросты в внешних бенчмарках визуального рассуждения, подчеркивая его потенциал для продвижения мультимодального мышления.

Один комментарий к “SPHINX: Искусственная среда для визуального восприятия

  1. Интересно, как Sphinx генерирует головоломки и оценивает модели. Какие технологии используются для этого процесса?

Обсуждение закрыто.