mipt_session_30mar_brief
МФТИ: Сессия 30 марта (понедельник, 13:55–16:55)
Подготовлено Феанором 2026-03-30 11:15 MSK
Контекст
- D2 дедлайн: ПРОШЁЛ (28 мар 23:59). 0 GitHub форков, НО 7 активных команд в GSheets (~32 студента).
- D2 reminder: готов к отправке →
/review/inbox/mipt_d2_reminder_draft.md(ВАРИАНТ E) - Ассистент сегодня: Denis Rubtsov (у него ожидает ответ в ЛС — MS FPMI)
- Следующая лекция: 6 апр — L23 (Двойственные методы / ADMM), Забара
D2 — что сказать студентам (часть 1, ~10 мин)
GSheets проверен: 7 команд с проектами уже работают:
1. Дорогова et al. (5) — Экстраградиентные методы для CycleGAN
2. Чирков et al. (5) — Квантизация LLM
3. Кравацкий et al. (4) — Neon: nuclear norm vs muon
4. Неверов et al. (4) — Interior point methods
5. Шурмин et al. (5) — LLM как оптимизатор чёрного ящика
6. Стрелков et al. (5) — Оптимизация на матричных многообразиях
7. Багрянов et al. (4) — Методы оптимизации для генерации атак
→ Отметить работу команд. Попросить всех кто не залил Paper/Demo/Poster ссылки — сделать это сегодня.
→ Уточнить: кто ещё не в GSheets? Проект обязателен для оценки.
Лекция 22: Advanced SGD + Neural Network Training + Memory
Источник: /root/mipt25_work/lectures/22.md (346 строк, beamer-формат)
Структура лекции:
Часть 1: Adaptive Gradient Methods (60 мин)
- Finite-sum problem → SGD recap
- Adagrad → RMSProp → Adadelta → Adam → AdamW
- AlgoPerf benchmark (сравнение методов на реальных задачах)
- Shampoo (Kronecker-factored preconditioner)
- Muon (Nesterov momentum + Newton-Schulz orthogonalization)
Часть 2: Neural Network Training Basics (30 мин)
- Loss functions: MSE vs Cross-Entropy
- Simple example: Fashion MNIST
Часть 3: Memory & Large Model Training (40 мин)
- GPT-2 training memory footprint (параметры + оптимизатор + активации + градиенты)
- Activation checkpointing: ~50% снижение памяти, ~33% overhead на пересчёт
- Практические выводы: trade-off память vs скорость
Что интересного для студентов:
- Muon: очень актуальная тема (студенты Кравацкий et al. делают проект на Neon/nuclear norm vs Muon!)
- AlgoPerf benchmark: показывает что “стандартные” методы часто проигрывают
- Activation checkpointing: релевантно для большинства проектов с обучением нейросетей
Возможные вопросы студентов
- “Наш проект использует Adam/AdamW — нужно сравнивать с Muon/Shampoo?” → по желанию, но интересно
- “Что сдавать в D2 если мы уже в GSheets?” → ссылки на Paper (PDF/overleaf) + Demo/Poster
- “Если команда меньше 4 человек…” → проверить Requirements
- Про D3 (следующий этап): пока не определён, сосредоточиться на D2 completion
Чеклист перед парой
- Отправить D2 reminder в TG канал МФТИ (если ещё не отправлен) — скопировать из review item
- Проверить что slides 22.pdf есть на сайте mipt25.fmin.xyz/lectures/22.pdf
- Denis Rubtsov — напомнить что он ассистент сегодня (и ответить ему про MS FPMI)
После пары
- Обновить D2 статус в GSheets по итогам сессии
- Посмотреть: сколько ещё команд добавилось в GSheets?