Model Scaling

Масштабирование — рост качества модели с увеличением числа параметров (N), объёма данных (D) и вычислений (C). Scaling laws делают это улучшение предсказуемым (степенные законы), и это главная движущая идея всей гонки за размером.

Заметка содержит быстро устаревающие цифры (размеры frontier-моделей 2026) — status/volatile. Сверяй числа при ревизии.

Суть

Параметр — одно обучаемое число внутри модели. «Триллион параметров» = триллион чисел в матрицах эмбеддингов, attention (W_Q/K/V/O), feedforward (W_up/W_down) и output-матрице.

Зачем это нужно

Объясняет, почему индустрия гонится за размером: качество растёт предсказуемо по scaling laws, и при масштабе внезапно появляются новые способности (см. Emergent Abilities). Это контекст для выбора модели (см. Model Selection).

Как работает

  • Что увеличивают: d_model (4096→8192→16384, квадратичный рост параметров), число слоёв (32→80→126), intermediate_size (3–4×d_model), num_heads, vocab_size.
  • Распределение параметров (типичная LLM): ~70% в feedforward (хранилище знаний, см. Transformer), ~17% в attention, ~13% в эмбеддингах и output-матрице.
  • Chinchilla scaling laws (2022): оптимально ~20 токенов данных на параметр (модель 70B → ~1.4T токенов); современные часто учат на большем для качества.
  • Тренд (осторожно, быстро устаревает): в источнике утверждается, что на текущей стадии индустрия уходит от простого роста числа параметров к уплотнению информации («качество на миллион весов»), т.к. крупные модели часто недообучены относительно оптимального объёма данных (перекликается с Chinchilla). Отдача от чистого размера упирается не только в параметры, но и в данные/эффективность.
  • Mixture of Experts (MoE): триллионы параметров всего, но на токен активируется малая часть — «большой мозг по разумной цене» (GPT-4, Gemini, DeepSeek).
  • Что здесь на самом деле устаревает (ревизия 2026-08). Законы масштабирования, соотношение Chinchilla и механика MoE — устойчивая часть, её не надо пересверять. Устаревает только список размеров ниже, причём он и в момент записи был списком оценок закрытых моделей, а не опубликованных чисел: вендоры размеры не раскрывают. Пользоваться им стоит как иллюстрацией порядков величин, а не справочником — и не подставлять эти числа в расчёты.
  • Оценки размеров, по состоянию на май 2026 (не перепроверялись): GPT-4 ~1.7T (MoE), Claude Opus ~0.5–2T (оценки), Llama-3 405B (dense), DeepSeek V3 671B (37B активных).

Где выполаживается отдача и что выбирать: dense или MoE

Про убывающую отдачу соотношение Chinchilla выше даёт точный ответ: она наступает не «после стольких-то параметров», а как только рост размера перестаёт сопровождаться ростом данных. Модель, увеличенная без пропорционального увеличения обучающего корпуса, недообучена, и добавленные параметры не окупаются. Практически для прикладного инженера это означает: сравнивать модели по числу параметров бессмысленно, потому что за одним и тем же размером стоят разные бюджеты обучения, — сравнивать надо по результатам на своей задаче (Model Selection).

Dense или MoE — с точки зрения применения это вопрос не качества, а профиля стоимости. У MoE на каждый токен активируется малая часть параметров, поэтому вычислений на токен меньше, чем можно подумать по общему размеру, — но в память нужно поднять все веса. Отсюда разное поведение в двух сценариях: при работе через API разница видна только в цене за токен и вас не касается; при собственном хостинге MoE требует памяти по полному размеру, а вычислительно ведёт себя как модель заметно меньше — что выгодно при высокой нагрузке и невыгодно, если памяти мало (Local LLM Deployment).

Практическое следствие: выбор между ними принимается там, где вы платите за железо, и не имеет смысла там, где платите за токены.

Связано с

  • Model Selection — размер/архитектура как критерий выбора
  • Emergent Abilities — что даёт масштаб качественно
  • Transformer — где живут параметры (70% в FFN)