Looped Flows

Looped flows — способ обучать рекуррентное рассуждение локальными denoising-задачами: кандидат решения движется по probability flow от шума к ответу, а отдельное скрытое состояние переносит вычисление между шагами. Это форма test-time compute без порождения промежуточных reasoning-токенов, пока показанная только на структурированных задачах.

Два состояния, которые нельзя смешивать

На каждом шаге stateful denoiser получает условие задачи c и обновляет два разных объекта:

Состояние Роль
Flow state x_t Текущий кандидат решения. Начинается со случайного шума и численно перемещается к чистому категориальному ответу.
Recurrent state z_t Скрытые признаки denoiser-а — рабочее состояние, которое переносится между итерациями и накапливает последовательное вычисление.

Поэтому формулировка «hidden state постепенно очищается от шума» неточна: очищается x_t, а z_t помогает предсказывать направление этого движения.

Какую проблему решает метод

Looped-модель многократно применяет одну сеть к скрытому состоянию. Это увеличивает эффективную глубину без добавления новых параметров и позволяет потратить больше вычислений на трудный пример.

Полный backpropagation through time через длинную рекуррентную цепочку дорог по памяти и подвержен исчезающим и взрывающимся градиентам. Поэтому практические модели останавливают градиент между шагами. Поздняя ошибка тогда не учит ранний шаг подготовить состояние, полезное через несколько итераций: каждый шаг оптимизируется локально, а глобально полезная recurrence должна возникнуть косвенно.

Looped flows не восстанавливает длинный BPTT. Градиент между recurrent states по-прежнему остановлен. Вместо этого метод меняет локальные задачи так, чтобы они образовали согласованную временную последовательность.

Обучение через temporally aligned denoising

Для одной задачи берутся правильное решение x₁ и шум x₀. Из них строятся промежуточные состояния:

I_t = (1 − t)x₀ + tx₁

На последовательных шагах t растёт, поэтому шума становится меньше. Одна и та же пара x₀/x₁ используется на всей траектории. Stateful denoiser на каждом шаге локально учится предсказывать чистое решение и передаёт дальше обновлённый z_t.

Temporal alignment создают два условия:

  • decreasing noise — соседние шаги решают последовательно более чистые версии одной задачи;
  • shared noise — промежуточные входы лежат на одной траектории между тем же шумом и тем же решением.

В ablation на ARC удаление временного conditioning, interpolant, убывающего шума или shared noise снижало результат. Самая сильная комбинация без time conditioning и interpolant опустила ARC-AGI-1 с 58,8% до 43,6%, что поддерживает вклад именно flow-постановки, а не только дополнительной recurrence.

Test-time compute

Модель обучалась на k = 16 denoising-шагов, но при inference использовала более мелкую временную сетку: 128 шагов для Sudoku, 64 для ARC-AGI-1 и 32 для ARC-AGI-2. На Sudoku увеличение числа шагов с 8 до 128 подняло accuracy с 74,5% до 97,9%.

Есть две независимые оси дополнительного inference compute:

  1. Finer temporal grid — больше последовательных обновлений одной траектории.
  2. Independent trajectories — разные начальные образцы шума дают несколько кандидатов; best-Q выбирает кандидата с наибольшей вероятностью успеха по ACT-head.

Это не тот же механизм, что Chain of Thought: промежуточное вычисление остаётся в непрозрачных векторах, а не выводится последовательностью токенов. Это также не обычная self-consistency: разные ответы возникают из probability transport, а выбор best-Q использует обученную оценку успеха, не majority vote.

Что показали эксперименты

В статье использованы модели примерно на 5–7 млн параметров: MLP-Mixer для Sudoku и noncausal transformer на остальных задачах. Для ARC применяются task-specific puzzle embeddings и протокол TRM.

Метод ARC-AGI-1, pass@2 ARC-AGI-2, pass@2
TRM, опубликованный baseline 44,6% 7,8%
Looped flows, одна trajectory 58,8 ± 1,8% 12,2 ± 1,9%

Looped flows превзошёл рассмотренные looped-модели на пяти из шести benchmark-задач и остался конкурентным на Maze-Hard. На N-Queens и Graph Coloring разные начальные шумы позволяли получать несколько валидных решений.

Границы вывода

  • Это arXiv v1 от 10 сентября 2026 года, а не независимо воспроизведённый результат.
  • Эксперименты охватывают структурированные категориальные задачи — Sudoku, Maze, ARC, N-Queens и Graph Coloring. Перенос на language reasoning, код или агентные задачи не показан.
  • Подробная кривая scaling по числу шагов приведена для Sudoku; из неё нельзя заключать, что качество любого benchmark или LLM монотонно растёт с recurrence depth.
  • ARC-числа — pass@2, а не pass@1. Baseline-результаты взяты из публикаций, а не получены единым контролируемым перезапуском авторов.
  • Training interpolants содержат долю правильного решения. Авторы обнаружили риск shortcut и переобучения; для Sudoku и ARC-AGI-2 применялись pseudotargets. Улучшение от дополнительных inference-шагов показывает, что модель не только повторяет первую догадку, но полностью возможность shortcut этим не исключается.
  • Это изменение обучения и архитектуры модели. Его нельзя добавить в существующего API-агента промптом или новой политикой harness.

Практическое значение

Reasoning Effort нельзя сводить к числу reasoning-токенов. Test-time compute может находиться в трёх разных слоях:

  • token-space — дополнительные токены Chain of Thought;
  • latent-space — повторные обновления скрытого состояния, как в looped flows;
  • system-space — дополнительные вызовы, ветви и проверки агентного harness.

Эти режимы различаются наблюдаемостью, стоимостью и способом проверки. У latent reasoning нет читаемого транскрипта: качество нужно оценивать по выходу и кривой score → inference steps/compute, а не по правдоподобию скрытого «хода мысли».

Связано с

  • Chain of Thought — token-space reasoning как контраст к скрытой recurrence
  • Reasoning Effort — test-time compute как управляемый ресурс
  • Backpropagation — BPTT, stop-gradient и credit assignment между шагами
  • Model Scaling — inference compute как дополнительная ось помимо параметров, данных и training compute