heavy_tails_post
🦁 Тяжёлые хвосты: почему среднее вас обманывает
Представьте: вы смотрите на распределение богатства в стране. Среднее — $50k. Звучит нормально? Теперь Илон Маск заходит в комнату. Среднее стало $5M. Среднее сломалось — потому что распределение богатства имеет тяжёлый хвост.
Гауссовское распределение ведёт себя прилично: вероятность отклонения на 5σ — это $3 \times 10^{-7}$. Коши (классический тяжёлый хвост) не имеет определённой дисперсии вообще. Выброс в 1000× — не аномалия, а закономерность. Именно это видно в анимации: при сэмплировании из Коши выбросы появляются регулярно, а у Гаусса — почти никогда.
Почему это важно в ML?
Scaling Laws нейросетей — это степенной закон: Loss ∝ N^{-α}, где N — число параметров. На log-log графике это прямая линия. Градиентный шум в трансформерах тоже имеет тяжёлые хвосты — именно поэтому Adam работает лучше SGD: он нормализует градиенты, подавляя выбросы. Частоты токенов в языке следуют закону Ципфа (ещё один степенной закон) — 100 самых частых слов покрывают ~50% любого текста.
Практически: если ваши данные имеют тяжёлые хвосты — не используйте среднее, используйте медиану. Clip gradients по norm, не по value. И помните: в реальных данных «невозможные» события случаются намного чаще, чем предсказывает Гаусс.
#ML #math #statistics #deeplearning #нейросети