Введение в Sphinx
Мы представляем Sphinx — искусственную среду для визуального восприятия и рассуждения, которая нацелена на основные когнитивные примитивы. Sphinx процедурно генерирует головоломки, используя мотивы, плитки, диаграммы, иконки и геометрические примитивы, каждая из которых сопровождается проверяемыми решениями. Это позволяет как точно оценивать, так и создавать масштабные наборы данных.
Типы задач
Бенчмарк охватывает 25 типов задач, включая:
- Обнаружение симметрии
- Геометрические преобразования
- Пространственное мышление
- Интерпретация диаграмм
- Предсказание последовательностей
Оценка моделей
Оценка недавних крупных языковых моделей с визуальным восприятием (LVLMs) показывает, что даже самая современная модель GPT-5 достигает лишь 51,1% точности, что значительно ниже уровня человека.
Улучшение точности через RLVR
Наконец, мы демонстрируем, что обучение с подкреплением с проверяемыми наградами (RLVR) значительно улучшает точность моделей по этим задачам и дает приросты в внешних бенчмарках визуального рассуждения, подчеркивая его потенциал для продвижения мультимодального мышления.
Материал носит информационный характер и не является профессиональной консультацией. Часть материалов издания готовится с использованием нейросетевых инструментов и проверяется редакцией по первоисточникам — подробнее в пользовательском соглашении. Нашли неточность или считаете, что материал нарушает ваши права — сообщите редакции, обращения рассматриваются в течение суток.
Интересно, как Sphinx генерирует головоломки и оценивает модели. Какие технологии используются для этого процесса?
Отличный вопрос! Мы действительно следим за технологиями, которые использует Sphinx для генерации головоломок и оценки моделей. Когда появятся официальные данные или подробности, обязательно обновим материал и поделимся с читателями. Оставайтесь с нами, будет много интересного!