Два состояния, которые нельзя смешивать
На каждом шаге stateful denoiser получает условие задачи c и обновляет два разных объекта:
| Состояние | Роль |
|---|---|
Flow state x_t |
Текущий кандидат решения. Начинается со случайного шума и численно перемещается к чистому категориальному ответу. |
Recurrent state z_t |
Скрытые признаки denoiser-а — рабочее состояние, которое переносится между итерациями и накапливает последовательное вычисление. |
Поэтому формулировка «hidden state постепенно очищается от шума» неточна: очищается x_t, а z_t помогает предсказывать направление этого движения.
Какую проблему решает метод
Looped-модель многократно применяет одну сеть к скрытому состоянию. Это увеличивает эффективную глубину без добавления новых параметров и позволяет потратить больше вычислений на трудный пример.
Полный backpropagation through time через длинную рекуррентную цепочку дорог по памяти и подвержен исчезающим и взрывающимся градиентам. Поэтому практические модели останавливают градиент между шагами. Поздняя ошибка тогда не учит ранний шаг подготовить состояние, полезное через несколько итераций: каждый шаг оптимизируется локально, а глобально полезная recurrence должна возникнуть косвенно.
Looped flows не восстанавливает длинный BPTT. Градиент между recurrent states по-прежнему остановлен. Вместо этого метод меняет локальные задачи так, чтобы они образовали согласованную временную последовательность.
Обучение через temporally aligned denoising
Для одной задачи берутся правильное решение x₁ и шум x₀. Из них строятся промежуточные состояния:
I_t = (1 − t)x₀ + tx₁
На последовательных шагах t растёт, поэтому шума становится меньше. Одна и та же пара x₀/x₁ используется на всей траектории. Stateful denoiser на каждом шаге локально учится предсказывать чистое решение и передаёт дальше обновлённый z_t.
Temporal alignment создают два условия:
- decreasing noise — соседние шаги решают последовательно более чистые версии одной задачи;
- shared noise — промежуточные входы лежат на одной траектории между тем же шумом и тем же решением.
В ablation на ARC удаление временного conditioning, interpolant, убывающего шума или shared noise снижало результат. Самая сильная комбинация без time conditioning и interpolant опустила ARC-AGI-1 с 58,8% до 43,6%, что поддерживает вклад именно flow-постановки, а не только дополнительной recurrence.
Test-time compute
Модель обучалась на k = 16 denoising-шагов, но при inference использовала более мелкую временную сетку: 128 шагов для Sudoku, 64 для ARC-AGI-1 и 32 для ARC-AGI-2. На Sudoku увеличение числа шагов с 8 до 128 подняло accuracy с 74,5% до 97,9%.
Есть две независимые оси дополнительного inference compute:
- Finer temporal grid — больше последовательных обновлений одной траектории.
- Independent trajectories — разные начальные образцы шума дают несколько кандидатов; best-Q выбирает кандидата с наибольшей вероятностью успеха по ACT-head.
Это не тот же механизм, что Chain of Thought: промежуточное вычисление остаётся в непрозрачных векторах, а не выводится последовательностью токенов. Это также не обычная self-consistency: разные ответы возникают из probability transport, а выбор best-Q использует обученную оценку успеха, не majority vote.
Что показали эксперименты
В статье использованы модели примерно на 5–7 млн параметров: MLP-Mixer для Sudoku и noncausal transformer на остальных задачах. Для ARC применяются task-specific puzzle embeddings и протокол TRM.
| Метод | ARC-AGI-1, pass@2 | ARC-AGI-2, pass@2 |
|---|---|---|
| TRM, опубликованный baseline | 44,6% | 7,8% |
| Looped flows, одна trajectory | 58,8 ± 1,8% | 12,2 ± 1,9% |
Looped flows превзошёл рассмотренные looped-модели на пяти из шести benchmark-задач и остался конкурентным на Maze-Hard. На N-Queens и Graph Coloring разные начальные шумы позволяли получать несколько валидных решений.
Границы вывода
- Это arXiv v1 от 10 сентября 2026 года, а не независимо воспроизведённый результат.
- Эксперименты охватывают структурированные категориальные задачи — Sudoku, Maze, ARC, N-Queens и Graph Coloring. Перенос на language reasoning, код или агентные задачи не показан.
- Подробная кривая scaling по числу шагов приведена для Sudoku; из неё нельзя заключать, что качество любого benchmark или LLM монотонно растёт с recurrence depth.
- ARC-числа —
pass@2, а неpass@1. Baseline-результаты взяты из публикаций, а не получены единым контролируемым перезапуском авторов. - Training interpolants содержат долю правильного решения. Авторы обнаружили риск shortcut и переобучения; для Sudoku и ARC-AGI-2 применялись pseudotargets. Улучшение от дополнительных inference-шагов показывает, что модель не только повторяет первую догадку, но полностью возможность shortcut этим не исключается.
- Это изменение обучения и архитектуры модели. Его нельзя добавить в существующего API-агента промптом или новой политикой harness.
Практическое значение
Reasoning Effort нельзя сводить к числу reasoning-токенов. Test-time compute может находиться в трёх разных слоях:
- token-space — дополнительные токены Chain of Thought;
- latent-space — повторные обновления скрытого состояния, как в looped flows;
- system-space — дополнительные вызовы, ветви и проверки агентного harness.
Эти режимы различаются наблюдаемостью, стоимостью и способом проверки. У latent reasoning нет читаемого транскрипта: качество нужно оценивать по выходу и кривой score → inference steps/compute, а не по правдоподобию скрытого «хода мысли».
Связано с
- Chain of Thought — token-space reasoning как контраст к скрытой recurrence
- Reasoning Effort — test-time compute как управляемый ресурс
- Backpropagation — BPTT, stop-gradient и credit assignment между шагами
- Model Scaling — inference compute как дополнительная ось помимо параметров, данных и training compute