Strategy/content/rlhf_overview_post.md
+

rlhf_overview_post

review_statusnew
projectfminxyz
creation_date2026-02-25

@fminxyz — Пост: 4 способа выровнять LLM — итог серии

Серия 3 | Пост 5 из 5 | Дата: 15 марта 2026, 19:30 MSK


Текст поста (~1800 символов)

Серия про alignment. 4 метода за 4 дня. Итог 🧵

За неделю мы разобрали, как из языковой модели делают “правильное” AI:

RLHF (2022) — пионер. Три шага: SFT → Reward Model → PPO.
Люди размечают предпочтения → нейросеть учится предсказывать “хорошесть” → policy оптимизирует её через RL.
Мощно, но дорого: нужны тысячи человеко-часов разметки.
→ ChatGPT (GPT-3.5) = GPT-3 + RLHF.

DPO (2023, Stanford) — элегантное упрощение. Один вывод Rafailov et al.:
оптимальная policy уже кодирует reward неявно. Reward model не нужна.
Один лосс, одна модель, то же качество.
→ Все современные Llama/Mistral instruction-tuned = DPO.

GRPO (2024, DeepSeek) — убирает даже человеческие предпочтения.
Для задач с верификатором (математика, код): сэмплируй группу из G ответов, считай advantage внутри группы.
Critic не нужен — baseline = среднее по группе.
→ DeepSeek R1 обучился рассуждать, не видя готовых объяснений.

CAI (2022, Anthropic) — alignment через конституцию.
Та же модель генерирует черновик → сама его критикует → переписывает.
Разметчики не видят вредного контента. Human labels → нуль.
→ Claude 1/2/3 — все обучены с CAI.


Тренд виден:
2022: нужны тысячи людей и 3 нейросети
2024: нужны задача + верификатор

Следующий рубеж — автоматическое построение верификатора. LLM, которая сама учит себя быть лучше.


Серия завершена. Следующая: Score-based diffusion models (DDPM → DDIM → Flow Matching → CFG).

Если был полезен этот цикл — поделись с тем, кто спрашивает “как устроен ChatGPT” 🙏


Метаданные

  • Файлы: rlhf_overview_animation.py → rlhf_overview_animation.mp4 (25с, 2MB)
  • Хэштеги: #нейросети #RLHF #DPO #GRPO #CAI #alignment #deeplearning
  • CTA: “Какой метод кажется самым элегантным?”
  • Визуал: radar chart — 5 осей (автономность/стабильность/compute/универсальность/качество), 4 метода появляются по очереди → всё вместе в конце
  • Связь с серией: финальный пост, объединяет все 4 поста серии
Choose icon