Emergent Abilities

Эмерджентные способности — те, что отсутствуют у малых моделей и внезапно появляются при достижении определённого масштаба. Главная интрига: мы не знаем заранее, какая способность возникнет на следующем порядке размера.

Суть

Качество многих задач растёт не плавно, а скачком при переходе через некоторый размер модели. Это эмпирическое наблюдение, тесно связанное со scaling laws (см. Model Scaling).

Зачем это нужно

Это и есть причина гонки за масштабом: эмерджентность означает, что новые возможности нельзя надёжно предсказать из поведения маленьких моделей — приходится строить большие и смотреть.

Как работает

Конкретные эмерджентные способности (по guide):

  • Арифметика с большими числами — у малых моделей не работает, у крупных «вдруг» появляется.
  • Chain-of-Thought reasoning — пошаговое рассуждение (см. Chain of Thought).
  • Следование инструкциям — понимание намерения.
  • In-context learning — обучение из примеров в промпте без обновления весов (см. Few Shot Prompting).
  • Перевод между языками без явного обучения, программирование.

Гипотезы происхождения: композиция простых способностей; обучение многих задач сразу; частично — артефакт измерения (дискретные метрики создают иллюзию скачка). Scaling laws: качество предсказуемо улучшается с N/D/C (степенные законы, линейны в log-масштабе).

Скачок или артефакт измерения

Это спор с известным результатом, и он важнее самого явления. Значительная часть наблюдаемых «скачков» объясняется выбором метрики, а не поведением модели. Метрики вида «ответ совпал полностью» разрывны по построению: модель, дающая почти верный ответ, получает ноль ровно так же, как модель, дающая бессмыслицу. Когда качество плавно растёт, такая метрика долго показывает ноль, а потом резко — единицу, и на графике возникает скачок, которого в самом поведении нет.

Если ту же задачу мерить непрерывно — расстоянием до эталона, вероятностью верного токена, частичным совпадением, — кривая обычно оказывается гладкой.

Отсюда следует не «эмерджентности не существует», а более полезное: прежде чем объяснять скачок природой модели, проверьте, не создан ли он метрикой. Практический признак — резкий переход у разрывной метрики при плавном улучшении непрерывной на тех же данных. Это ровно тот же класс ошибки, что и средний скор, прячущий поломку в срезе (RAG Metrics): измерение формирует картину, которую потом объясняют содержательно.

Можно ли получить способность дообучением

Сверка 2026-08: да, и это уже рабочая практика, а не гипотеза. Способности вроде пошагового рассуждения переносятся в существенно меньшие модели дистилляцией — обучением ученика на выходах более сильного учителя, включая его цепочки рассуждений. В отдельных работах для заметного сдвига хватало порядка тысячи примеров, сгенерированных сильной моделью.

Важная оговорка, без которой вывод звучит сильнее, чем есть: это перенос, а не возникновение. Способность должна существовать у учителя — дистилляция передаёт её, а не создаёт из масштаба ученика. Поэтому фраза «маленькая модель тоже умеет рассуждать» корректна ровно в той мере, в какой рядом была большая, которая научила.

Есть и наблюдение, смягчающее исходное противопоставление «масштаб или обучение»: способности возникают в ходе обучения стохастически, и у крупных моделей это происходит в среднем раньше, а появление конкретного умения соответствует резкому формированию нужных паттернов внимания. То есть масштаб влияет не столько на возможность, сколько на момент — что согласуется с разбором выше о том, что резкость «скачка» во многом создаётся способом измерения.

Практическое следствие: если нужная способность есть у доступной большой модели, дешевле дистиллировать её в малую под свою задачу, чем ждать, пока малая дорастёт сама (Prompt Tuning — про соседний, ещё более дешёвый уровень).

Связано с

  • Model Scaling — масштаб как условие появления способностей
  • Chain of Thought — CoT как эмерджентная способность
  • Few Shot Prompting — in-context learning тоже эмерджентен