Введение в Sphinx
Мы представляем Sphinx — искусственную среду для визуального восприятия и рассуждения, которая нацелена на основные когнитивные примитивы. Sphinx процедурно генерирует головоломки, используя мотивы, плитки, диаграммы, иконки и геометрические примитивы, каждая из которых сопровождается проверяемыми решениями. Это позволяет как точно оценивать, так и создавать масштабные наборы данных.
Типы задач
Бенчмарк охватывает 25 типов задач, включая:
- Обнаружение симметрии
- Геометрические преобразования
- Пространственное мышление
- Интерпретация диаграмм
- Предсказание последовательностей
Оценка моделей
Оценка недавних крупных языковых моделей с визуальным восприятием (LVLMs) показывает, что даже самая современная модель GPT-5 достигает лишь 51,1% точности, что значительно ниже уровня человека.
Улучшение точности через RLVR
Наконец, мы демонстрируем, что обучение с подкреплением с проверяемыми наградами (RLVR) значительно улучшает точность моделей по этим задачам и дает приросты в внешних бенчмарках визуального рассуждения, подчеркивая его потенциал для продвижения мультимодального мышления.
Интересно, как Sphinx генерирует головоломки и оценивает модели. Какие технологии используются для этого процесса?