Способны ли языковые модели улучшать свои ответы?
Этот вопрос становится все более актуальным, поскольку взаимодействие пользователей с системами часто включает запросы на уточнение. Однако предыдущие исследования в основном оценивали способности языковых моделей (ЯМ) к самосовершенствованию на проверяемых задачах, таких как математические соревнования или символическое мышление с упрощенными шаблонами. В то время как пользователи обычно задают открытые вопросы и предоставляют разные уровни обратной связи о своих ожиданиях.
Введение в RefineBench
С учетом недавнего появления моделей рассуждений, которые демонстрируют паттерны саморефлексии, мы представляем RefineBench — набор из 1,000 сложных задач из 11 областей, дополненный оценочной системой на основе чек-листов. Мы оцениваем два режима самосовершенствования:
- Управляемое самосовершенствование: ЯМ получает обратную связь на естественном языке.
- Самосовершенствование: ЯМ пытается улучшить свои ответы без посторонней помощи.
Результаты оценки моделей
В условиях самосовершенствования даже передовые модели, такие как Gemini 2.5 Pro и GPT-5, показывают скромные базовые результаты — 31.3% и 29.1% соответственно. Большинство моделей не могут последовательно улучшать свои ответы в процессе итераций. Например, Gemini 2.5 Pro увеличивает результат всего на 1.8%, в то время как DeepSeek-R1 демонстрирует снижение.