2026 г.

Глава 5. Дообучение: SFT, RLHF и DPO

Учебник «Большие языковые модели»

Предобученная модель из главы 4 — эрудированный «продолжатель текста». Попросите её: «Напиши функцию сортировки на Python» — и она с равным успехом может выполнить просьбу, продолжить её списком похожих заданий («…Напиши функцию поиска. Напиши парсер CSV.») или ответить в духе форума: «мне тоже это задали, помогите кто-нибудь». Все три продолжения правдоподобны — а учили её именно правдоподобию. Путь от продолжателя текста к ассистенту называют пост-обучением (post-training); эта глава — о его трёх китах: SFT, обучении на предпочтениях (RLHF/DPO) и обучении рассуждениям.

5.1. SFT: дообучение на инструкциях

Первый шаг прост по механике. Собирается набор диалогов образцового качества: запрос пользователя — идеальный ответ ассистента (десятки тысяч – миллионы примеров, изначально написанных людьми, сегодня в значительной мере порождаемых и фильтруемых сильными моделями). Диалоги оборачиваются в шаблон со специальными токенами (глава 1) и модель дообучается тем же самым предсказанием следующего токена, что и в главе 4. В распространённой схеме функция потерь считается только на токенах ответа ассистента, а токены запроса маскируются; некоторые рецепты обучают и на других частях последовательности. Маскирование должно соответствовать конкретному шаблону диалога.

Это supervised fine-tuning, SFT — дообучение с учителем. После него модель уже выглядит ассистентом: отвечает на вопросы, следует формату, останавливается в конце ответа (выучен токен конца сообщения). Но SFT хорошо учится по положительным примерам и не получает прямого сигнала о сравнении нескольких допустимых ответов. Пары предпочтений дополняют его: они явно показывают, какой из ответов люди считают лучше и по каким критериям надо различать близкие варианты.

5.2. Модель вознаграждения и RLHF

Ключевое эмпирическое наблюдение: людям трудно написать идеальный ответ, но легко сравнить два готовых. На этом строится обучение на человеческой обратной связи (RLHF, reinforcement learning from human feedback), широко популяризированное работами InstructGPT и последующими чат-ассистентами.

Шаг первый: сбор предпочтений. Модель порождает по несколько ответов на каждый запрос; разметчики указывают, какой лучше. Получается набор троек (запрос x, выбранный ответ yw, отвергнутый yl).

Шаг второй: модель вознаграждения (reward model). Отдельная сеть (обычно — копия той же LLM с числовым выходом вместо словаря) обучается ставить ответу оценку r(x, y) так, чтобы предпочтения объяснялись моделью Брэдли–Терри — вероятность того, что первый ответ лучше второго, определяется разностью их оценок:

P(yw ≻ yl) = σ(r(x, yw) − r(x, yl)),    σ(z) = 1/(1+e−z)

Функция потерь — минус логарифм этой вероятности по всем парам. После обучения reward-модель служит автоматическим приближением человеческих предпочтений в области данных, похожей на обучающую. За её пределами оценка может быть систематически неверной; это не универсальный судья истины.

Шаг третий: собственно обучение с подкреплением. Языковая модель (политика πθ) порождает ответы, reward-модель их оценивает, и параметры политики сдвигаются в сторону ответов с высокой оценкой (алгоритмически — PPO или варианты вроде GRPO, где групповая оценка заменяет отдельный критик). Целевой функционал содержит принципиально важную добавку — штраф за отклонение от исходной SFT-модели:

J(θ) = E [ r(x, y) ] − β · KL( πθ || πSFT )

Без KL-штрафа происходит взлом вознаграждения (reward hacking): оптимизация находит дыры в оценщике — модель начинает льстить, раздувать ответы, злоупотреблять уверенным тоном и оформлением, если reward-модель хоть немного это переоценивает. Reward-модель — лишь аппроксимация человеческих предпочтений, и давить на неё бесконечно нельзя; β регулирует, насколько далеко политике разрешено уйти от исходного поведения. След этой борьбы виден в продуктах: склонность ассистентов к угодливости (sycophancy) — классический шрам несовершенных reward-моделей.

5.3. DPO: предпочтения без обучения с подкреплением

Классический вариант RLHF с PPO тяжёл: политика, референсная модель, reward-модель и критик, нестабильность RL, дорогая генерация в цикле обучения. В 2023 году в работе о direct preference optimization (DPO) было показано, что при принятых модельных предположениях можно обойтись без явной reward-модели и онлайн-RL: задача «максимизируй вознаграждение при KL-ограничении» допускает решение в замкнутой форме, и его можно подставить обратно в функцию потерь Брэдли–Терри. Получается обычная градиентная оптимизация на парах предпочтений:

LDPO = −log σ( β [ log(πθ(yw|x)/πref(yw|x)) − log(πθ(yl|x)/πref(yl|x)) ] )

Интуиция: увеличивай вероятность выбранного ответа и уменьшай вероятность отвергнутого, относительно референсной модели и с силой β. Реализация — страница кода:

import torch
import torch.nn.functional as F

def dpo_loss(logp_w, logp_l, ref_logp_w, ref_logp_l, beta=0.1):
    """logp_* -- суммы лог-вероятностей токенов ответа
    (выбранного w / отвергнутого l) по политике и по референсу."""
    ratio_w = logp_w - ref_logp_w        # log(pi/ref) для y_w
    ratio_l = logp_l - ref_logp_l        # log(pi/ref) для y_l
    return -F.logsigmoid(beta * (ratio_w - ratio_l)).mean()

DPO и его многочисленные родственники (IPO, KTO, ORPO…) сделали обучение на предпочтениях доступным за пределами крупных лабораторий: пара референс+политика и набор пар предпочтений обучаются обычным градиентным циклом. Онлайн-RL остаётся полезен, когда нужно собирать новые траектории текущей политики и оценивать их исполняемым или интерактивным вознаграждением, хотя существуют и другие способы превратить такой сигнал в обучающие данные.

5.4. Обучение рассуждениям

Последний рубеж пост-обучения — рассуждающие модели. Идея: для задач с проверяемым ответом (математика — сверить число, программирование — прогнать тесты) вознаграждение можно вычислять автоматически, без людей и без выученной reward-модели. Это обучение с верифицируемым вознаграждением (RLVR): модель порождает решение и ответ, а автоматический проверяющий сигнал поощряет успешный результат. Такой сигнал может улучшить математику, программирование и другие проверяемые задачи, но не доказывает, что показанное объяснение достоверно отражает внутреннее вычисление. Модель способна воспользоваться ошибкой проверяющей программы или подобрать верный ответ неверным путём, поэтому нужны устойчивые верификаторы, тесты на взлом вознаграждения и, где возможно, проверка промежуточных результатов.

Верифицируемость — и сила, и граница метода: там, где ответ нельзя проверить автоматически (эссе, совет, перевод), RLVR напрямую не применим, и качество по-прежнему держится на человеческих предпочтениях со всеми их несовершенствами.

5.5. Итоги

Пост-обучение сочетает несколько сигналов. SFT на образцовых диалогах учит форме: отвечать, следовать шаблону, останавливаться. Обучение на предпочтениях (RLHF с reward-моделью и KL-штрафом или DPO) задаёт различия: какие ответы люди считают лучшими. RLVR даёт автоматический сигнал там, где результат можно проверить. Понимание этой кухни объясняет живые черты ассистентов: почему они услужливы до угодливости, почему уверенный тон не гарантирует истины, почему reasoning-модели могут тратить дополнительные токены перед ответом — и почему все эти свойства поддаются настройке, но не абсолютному контролю.

Модель обучена. Следующая глава — о том, как из её вероятностей рождается конкретный текст: сэмплирование, температура и природа галлюцинаций.

Упражнения

1. Пусть reward-модель оценила два ответа: r(y1) = 2,1 и r(y2) = 0,6. С какой вероятностью, по модели Брэдли–Терри, человек предпочтёт первый ответ второму?

2. В функции dpo_loss установите β = 0 и покажите, почему значение потерь становится константой, а градиент — нулём. Затем при β > 0 уберите члены референсной модели и обсудите, какую роль референс играет в исходной постановке DPO.

3. Придумайте по три задачи, для которых вознаграждение (а) верифицируемо автоматически, (б) принципиально требует человеческой оценки. К какому классу относится ваша основная рабочая задача?

404 Not Found

404 Not Found


nginx/1.24.0 (Ubuntu)

Связь с редакцией