Strategy/projects/files/mipt/maxim_ivanov_reply_draft.md
+

maxim_ivanov_reply_draft

Черновик ответа Максиму Иванову

Подготовлено Феанором, 2026-03-06 18:00 MSK
Студент МФТИ, написал 13:02 06.03 о теме проекта D1


Тема студента

Дообучение LLM ризонингу (GRPO/PPO/DPO/дистилляция на Qwen/модели ~3.5-4B)

Черновик ответа (для @bratishk в TG)


Максим, привет!

Хорошая тема — reasoning fine-tuning прямо в тренде и хорошо ложится на курс.

Для D1 нужно формализовать как задачу оптимизации. Вот вариант:

GRPO/PPO-подход:

min_θ  -E_{q~π_θ}[r(q)] + β · KL(π_θ || π_ref)

где r(q) — reward (правильность ответа), β — регуляризация (KL к SFT-модели)

DPO-подход (проще и без reward model):

min_θ  -E_{(x,y+,y-)}[log σ(β(log π_θ(y+|x)/π_ref(y+|x) - log π_θ(y-|x)/π_ref(y-|x)))]

Baseline воспроизводится за ~1-2 дня:
- Repo: huggingface/trl (GRPO/DPO уже реализованы)
- Данные: GSM8K или MATH для reasoning (открытые)
- Модель: Qwen2.5-1.5B вместо 3.5B если GPU не хватит

На D1 достаточно: постановка задачи + baseline (SFT без GRPO) за 1 эпоху.

До встречи в понедельник!


Заметки

  • Тема сложная (L), но воспроизводимая — реалистично для команды 2-4
  • Если будет проблема с GPU: дистилляция (KD) значительно дешевле PPO
  • GRPO (DeepSeek R1 метод) — самый актуальный, хорошо подходит для физтеховских
  • Связь с курсом: GRPO = policy gradient = первый порядок оптимизация со стохастическим оракулом
Choose icon