rlhf_post
@fminxyz — Пост: RLHF — как ChatGPT научился слушаться
Серия 3 | Пост 1 из 5 | Дата: 11 марта 2026, 19:30 MSK
Текст поста (~1800 символов)
GPT-3 был умным, но не послушным. GPT-3.5 стал послушным. Разница — три буквы: RLHF 🤖
GPT-3 мог написать инструкцию по взрыву и детский стишок с одинаковым энтузиазмом — оба запроса были “правдоподобными продолжениями”. Язык смоделирован, но не выровнен с тем, что нужно людям.
Решение — Reinforcement Learning from Human Feedback.
3 шага пайплайна:
① SFT (Supervised Fine-Tuning)
Берём GPT-3, обучаем на демонстрациях: “вот вопрос, вот хороший ответ” (разметчики писали вручную). Получаем базовую послушную модель.
② Reward Model
Показываем разметчикам два ответа модели → они выбирают лучший. На этих парах (y_w ≻ y_l) обучаем отдельную нейросеть — reward model RM(y), которая предсказывает “насколько хорош ответ” числом.
③ PPO
Теперь оптимизируем policy (языковую модель) через RL:
max E[RM(y)] − β · KL(π || π_ref)
Первая часть: максимизировать reward (быть полезным).
Вторая часть: не уходить слишком далеко от SFT-модели (KL-penalty).
KL-штраф критичен: без него модель учится “взламывать” reward model — находить ответы с высоким скором, но бессмысленные. β контролирует баланс.
Проблема:
Разметка предпочтений — дорого. Одна итерация RLHF = тысячи человеко-часов. Поэтому ищут альтернативы: DPO (завтра), GRPO (послезавтра).
Результат:
ChatGPT (GPT-3.5-turbo) = GPT-3 + RLHF. Та же архитектура, другой характер. Alignment — не о размере модели, а о том, что мы оптимизируем.
🔜 Завтра: DPO — то же самое, но без reward model и PPO
Метаданные
- Файлы: rlhf_animation.py → rlhf_animation.mp4 (25с, 104KB)
- Хэштеги: #нейросети #RLHF #ChatGPT #alignment #deeplearning
- CTA: “Какой из 2 ответов Claude вам показался умнее?” (опрос с примером)
- Связь с каналом: PPO = policy gradient оптимизация → как SGD, но в пространстве политик