Стабилизация обучения с подкреплением с помощью LLM: подходы

Введение

В данной статье предложена новая формулировка для обучения с подкреплением (RL) с использованием больших языковых моделей. Мы объясняем, почему и при каких условиях истинная последовательная награда может быть оптимизирована через суррогатную токеновую цель в методах градиента политики, таких как REINFORCE.

Суррогатная цель и условия ее применения

Конкретно, через первое приближение мы показываем, что этот суррогат становится все более актуальным, когда минимизируются как несоответствие между обучением и выводом, так и устаревание политики. Это понимание предоставляет обоснование для важной роли нескольких широко используемых техник в стабилизации обучения RL.

Ключевые техники стабилизации

  • Коррекция важности выборки
  • Клиппинг
  • Routing Replay для моделей Mixture-of-Experts (MoE)

Эксперименты и результаты

В ходе обширных экспериментов с моделью MoE на 30 миллиардов параметров, для обучения, требующего сотни тысяч часов GPU, мы показали, что базовый алгоритм градиента политики с коррекцией важности выборки достигает наивысшей стабильности обучения при онлайновом обучении. Когда вводятся обновления оффлайн для ускорения сходимости, комбинация клиппинга и Routing Replay становится необходимой для снижения нестабильности, вызванной устареванием политики.

Заключение

Примечательно, что после стабилизации обучения можно продлить…

Материал носит информационный характер и не является профессиональной консультацией. Часть материалов издания готовится с использованием нейросетевых инструментов и проверяется редакцией по первоисточникам — подробнее в пользовательском соглашении. Нашли неточность или считаете, что материал нарушает ваши права — сообщите редакции, обращения рассматриваются в течение суток.

Прокрутить вверх