Суть
Качество многих задач растёт не плавно, а скачком при переходе через некоторый размер модели. Это эмпирическое наблюдение, тесно связанное со scaling laws (см. Model Scaling).
Зачем это нужно
Это и есть причина гонки за масштабом: эмерджентность означает, что новые возможности нельзя надёжно предсказать из поведения маленьких моделей — приходится строить большие и смотреть.
Как работает
Конкретные эмерджентные способности (по guide):
- Арифметика с большими числами — у малых моделей не работает, у крупных «вдруг» появляется.
- Chain-of-Thought reasoning — пошаговое рассуждение (см. Chain of Thought).
- Следование инструкциям — понимание намерения.
- In-context learning — обучение из примеров в промпте без обновления весов (см. Few Shot Prompting).
- Перевод между языками без явного обучения, программирование.
Гипотезы происхождения: композиция простых способностей; обучение многих задач сразу; частично — артефакт измерения (дискретные метрики создают иллюзию скачка). Scaling laws: качество предсказуемо улучшается с N/D/C (степенные законы, линейны в log-масштабе).
Скачок или артефакт измерения
Это спор с известным результатом, и он важнее самого явления. Значительная часть наблюдаемых «скачков» объясняется выбором метрики, а не поведением модели. Метрики вида «ответ совпал полностью» разрывны по построению: модель, дающая почти верный ответ, получает ноль ровно так же, как модель, дающая бессмыслицу. Когда качество плавно растёт, такая метрика долго показывает ноль, а потом резко — единицу, и на графике возникает скачок, которого в самом поведении нет.
Если ту же задачу мерить непрерывно — расстоянием до эталона, вероятностью верного токена, частичным совпадением, — кривая обычно оказывается гладкой.
Отсюда следует не «эмерджентности не существует», а более полезное: прежде чем объяснять скачок природой модели, проверьте, не создан ли он метрикой. Практический признак — резкий переход у разрывной метрики при плавном улучшении непрерывной на тех же данных. Это ровно тот же класс ошибки, что и средний скор, прячущий поломку в срезе (RAG Metrics): измерение формирует картину, которую потом объясняют содержательно.
Можно ли получить способность дообучением
Сверка 2026-08: да, и это уже рабочая практика, а не гипотеза. Способности вроде пошагового рассуждения переносятся в существенно меньшие модели дистилляцией — обучением ученика на выходах более сильного учителя, включая его цепочки рассуждений. В отдельных работах для заметного сдвига хватало порядка тысячи примеров, сгенерированных сильной моделью.
Важная оговорка, без которой вывод звучит сильнее, чем есть: это перенос, а не возникновение. Способность должна существовать у учителя — дистилляция передаёт её, а не создаёт из масштаба ученика. Поэтому фраза «маленькая модель тоже умеет рассуждать» корректна ровно в той мере, в какой рядом была большая, которая научила.
Есть и наблюдение, смягчающее исходное противопоставление «масштаб или обучение»: способности возникают в ходе обучения стохастически, и у крупных моделей это происходит в среднем раньше, а появление конкретного умения соответствует резкому формированию нужных паттернов внимания. То есть масштаб влияет не столько на возможность, сколько на момент — что согласуется с разбором выше о том, что резкость «скачка» во многом создаётся способом измерения.
Практическое следствие: если нужная способность есть у доступной большой модели, дешевле дистиллировать её в малую под свою задачу, чем ждать, пока малая дорастёт сама (Prompt Tuning — про соседний, ещё более дешёвый уровень).
Связано с
- Model Scaling — масштаб как условие появления способностей
- Chain of Thought — CoT как эмерджентная способность
- Few Shot Prompting — in-context learning тоже эмерджентен