Strategy/projects/files/digital_teams_apr6_lecture_outlines.md
+

digital_teams_apr6_lecture_outlines

Digital Teams — 6 апреля 2026: Подготовка к двум лекциям

Место: СберУниверситет, кампус
Аудитория: руководители и технические специалисты бизнес-команд (уже знают базовые нейросети из модуля 1 / ВШЭ)
Формат: 2 лекции по 1.5ч каждая + практика между ними другим лектором
Статус: ⚠️ Подтверждение ещё не получено + 🔴 КОНФЛИКТ В КАЛЕНДАРЕ (Феанор 30 мар 09:05)
⚠️ КОНФЛИКТ: Физтех лекция 13:55–16:55 ПЕРЕСЕКАЕТСЯ со слотом 1 (14:00–15:30)!
Слот 2 (18:00–19:30) — свободен. Review: /data/review/inbox/ruslan_lecture_april6_digital_teams.md


Лекция 1: Архитектурные типы нейронных сетей

Слот: 14:00–15:30 (90 мин)

Контекст в расписании

После двух практических блоков по обработке изображений утром. Аудитория уже видела базовый python + CNN на практике, но без теоретической систематизации.

Цель лекции

Дать ментальную карту архитектур нейросетей: какие типы существуют, для чего каждый, как выбирать.

Структура (90 мин)

1. Вводный фрейм (10 мин)
- Зачем разные архитектуры? Разные данные — разные структуры
- Ключевой принцип: inductive bias (встроенное предположение об структуре данных)
- Обзорная карта: табличные данные → изображения → текст → граф → временные ряды

2. MLP и его пределы (10 мин)
- Полносвязная сеть как “заготовка под всё”
- Почему не работает на изображениях напрямую: количество параметров, отсутствие трансляционной инвариантности
- Переход к специализированным архитектурам

3. CNN — Свёрточные сети (20 мин)
- Свёртка: локальность + разделение весов
- Пулинг: пространственная инвариантность
- Классический стек: Conv → BN → ReLU → Pool
- Эволюция: LeNet → AlexNet → VGG → ResNet (skip connections — ключевая идея)
- Демо/картинка: what different conv layers “see” (edges → textures → parts → objects)

4. RNN / LSTM — Рекуррентные сети (15 мин)
- Идея: скрытое состояние = “память” о предыдущих шагах
- Vanishing gradient → LSTM/GRU: ворота
- Применения: временные ряды, речь, текст (до Трансформеров)
- Актуальность сегодня: вытеснены Трансформерами, но живут в edge-устройствах (LSTM в Apple Watch!)

5. Трансформер — архитектура десятилетия (20 мин)
- Self-attention: каждый токен “смотрит” на все остальные
- Positional encoding: добавляем информацию о порядке
- Encoder / Decoder / Encoder-only (BERT) / Decoder-only (GPT)
- Почему вытеснил RNN: параллельное обучение + длинные зависимости
- Ключевая интуиция: attention как мягкий “поиск по словарю” (query–key–value)
- Применения: GPT, BERT, ViT, Whisper, AlphaFold

6. Специальные архитектуры (5 мин)
- Graph Neural Networks (GNN) → молекулы, социальные сети, рекомендации
- Diffusion models → генерация изображений (Stable Diffusion)
- State Space Models (Mamba) → конкурент трансформеров для длинных контекстов

7. Как выбирать архитектуру (5 мин)
- Простая таблица: тип данных → рекомендуемая архитектура
- “Начинай с трансформера, если не знаешь с чего начать”
- Краткий Q&A (5 мин)

Ключевые визуализации (нужны в слайдах)

  • Карта архитектур (одним слайдом)
  • Swipe animation: как работает свёртка (gif или схема)
  • Attention pattern visualization (heatmap)
  • ResNet skip connection vs plain network
  • Таблица “тип задачи → архитектура”

Необходимые слайды: ~25-30


Лекция 2: Компьютерное зрение

Слот: 18:00–19:30 (90 мин)

Контекст в расписании

После второй практики по обработке изображений. Аудитория уже “потрогала” CNN руками. Эта лекция — систематизация + реальные применения + SOTA.

Цель лекции

Показать что умеет CV сегодня и как это применять в бизнесе. От детекции объектов до мультимодальных систем.

Структура (90 мин)

1. Что такое CV в 2026 году (5 мин)
- Не “распознавание картинок”, а экосистема задач
- Обзор задач: classification → detection → segmentation → generation → 3D → video
- Ключевой сдвиг: от узких задач к foundation models

2. Классические CV задачи (25 мин)

2a. Классификация (5 мин)
- ImageNet → ResNet → ViT
- Benchmark: top-1 accuracy over years (показывает прогресс наглядно)

2b. Детекция объектов (10 мин)
- Что нужно: bounding box + class + confidence
- YOLO: real-time detection (показать live demo или gif)
- Применения: камеры безопасности, беспилотники, контроль качества на производстве
- Одна цифра: YOLO v10 = 640x640 → <5ms на GPU

2c. Сегментация (10 мин)
- Semantic vs Instance vs Panoptic
- SAM (Segment Anything Model, Meta) — кликнул на объект → мгновенная маска
- Применения: медицинские снимки, спутниковые изображения, автопилот

3. Foundation Models в CV (20 мин)

3a. CLIP (OpenAI, 2021) — 10 мин
- Текст + изображение в одном embedding-пространстве
- Zero-shot classification: можно найти “красная машина рядом с деревом” без обучения
- Революционное: обучен на пар text-image из интернета

3b. ViT — Vision Transformer (5 мин)
- Как применить Transformer к изображениям: патчи = токены
- Почему лучше CNN при большом количестве данных

3c. SAM / DINO / DINOv2 (5 мин)
- Self-supervised visual features
- “Universal encoder” для CV задач

4. Генеративные модели в CV (15 мин)

4a. Diffusion models (10 мин)
- Как работает: шум → постепенное “проявление”
- Stable Diffusion, DALL-E, Midjourney
- Text-to-image как пример мультимодальности
- Бизнес-применение: маркетинговый контент, дизайн, синтетические данные для обучения

4b. Видео (5 мин)
- Sora (OpenAI), RunwayML
- Статус: впечатляет, но physics artifacts
- Применение: реклама, анимация, proof-of-concept

5. Мультимодальные системы (10 мин)
- GPT-4V, Gemini, Claude — “смотрит на картинку и отвечает”
- VLM (Vision-Language Models) как новый стандарт
- Применения в бизнесе: анализ документов, OCR++, контроль качества с описанием проблемы
- Кейс: как Perelman (наш проект AI4S) использует VLM для анализа PDF статей

6. Как внедрить CV в компании (10 мин)
- Build vs Buy: когда fine-tune готовую модель, когда обучать с нуля
- Данные — всё: без разметки нет детектора
- Практический путь: 1) Определи задачу, 2) Собери 100-1000 примеров, 3) Fine-tune YOLO/CLIP/SAM, 4) Deploy
- Антипаттерны: “нам нужна нейросеть” без задачи
- Q&A (5 мин)

Ключевые визуализации (нужны в слайдах)

  • CV tasks taxonomy (один слайд-карта)
  • YOLO demo gif (реальное видео с bounding boxes)
  • SAM demo: клик → маска (скриншот с huggingface spaces)
  • CLIP: поиск изображений по тексту
  • Diffusion: шум → изображение (step by step)
  • Build vs Buy decision matrix

Необходимые слайды: ~30-35


Практические заметки для подготовки

Demos (рекомендуются live/embedded)

  1. YOLO в браузере: ultralytics.com/hub — можно показать real-time
  2. SAM: huggingface.co/spaces/facebook/segment-anything
  3. CLIP search: openai.com/research/clip demos
  4. Stable Diffusion: можно показать с предгенерированными примерами

Связь между лекциями

  • Лекция 1 (архитектуры) → строит фундамент
  • Практика между → CNN руками
  • Лекция 2 (CV) → надстройка: “а вот что из этого вырастает”
  • Явно ссылаться на лекцию 1 в лекции 2 (например: “ViT — это трансформер из первой лекции, применённый к изображениям”)

Audience-specific adjustments (executive education)

  • Меньше формул, больше аналогий и примеров
  • Каждую архитектуру → конкретное бизнес-применение
  • “Что мне делать с этим знанием?” — завершать каждый раздел практическим выводом
  • Слайды ≤ 40 слов, много визуалов

Подготовлено: Феанор worker 19:05 MSK 29 мар вс
Статус: черновик — требует подтверждения участия Даниила (review item)

Choose icon