Введение
В данной статье предложена новая формулировка для обучения с подкреплением (RL) с использованием больших языковых моделей. Мы объясняем, почему и при каких условиях истинная последовательная награда может быть оптимизирована через суррогатную токеновую цель в методах градиента политики, таких как REINFORCE.
Суррогатная цель и условия ее применения
Конкретно, через первое приближение мы показываем, что этот суррогат становится все более актуальным, когда минимизируются как несоответствие между обучением и выводом, так и устаревание политики. Это понимание предоставляет обоснование для важной роли нескольких широко используемых техник в стабилизации обучения RL.
Ключевые техники стабилизации
- Коррекция важности выборки
- Клиппинг
- Routing Replay для моделей Mixture-of-Experts (MoE)
Эксперименты и результаты
В ходе обширных экспериментов с моделью MoE на 30 миллиардов параметров, для обучения, требующего сотни тысяч часов GPU, мы показали, что базовый алгоритм градиента политики с коррекцией важности выборки достигает наивысшей стабильности обучения при онлайновом обучении. Когда вводятся обновления оффлайн для ускорения сходимости, комбинация клиппинга и Routing Replay становится необходимой для снижения нестабильности, вызванной устареванием политики.
Заключение
Примечательно, что после стабилизации обучения можно продлить…
Материал носит информационный характер и не является профессиональной консультацией. Часть материалов издания готовится с использованием нейросетевых инструментов и проверяется редакцией по первоисточникам — подробнее в пользовательском соглашении. Нашли неточность или считаете, что материал нарушает ваши права — сообщите редакции, обращения рассматриваются в течение суток.