Полный текст

​RL для Alignment в больших языковых моделях: опыт команды YandexGPTСегодня через API стала доступна новая модель YandexGPT 3 Lite. Одним из ключевых этапов её обучения, как и в случае с другими недавними моделями, стал этап выравнивания, включающий в том числе стадию обучения с подкреплением (RL). Пожалуй, без этого этапа не получилось бы добиться такого роста в качестве, который был необходим для запуска новых возможностей и сервисов (например, Нейро). Поэтому эта статья полностью посвящена особенностям выравнивания моделей.