Содержит быстро устаревающие данные (текущие топ-модели, цены $/токен, лидерборды) — status/volatile. Сверяй конкретные модели и цены при ревизии.
Суть
- Качество — benchmark score + свои evals на домене (см. Benchmarks Agents); «bench ≠ прод».
- Контекст — 128K/200K/1M (см. Context Window); больше контекст → больше «забываний» и не бесплатно.
- Стоимость — $/1M токенов (input+output); агент делает десятки вызовов → цена умножается.
- Latency + tool use — reasoning-модели дают качество ценой времени; агентам критична надёжность tool calls.
Зачем это нужно
«Флагман на каждую задачу» — главный источник перерасхода: разница цены между Tier 1 и Tier 3 моделями ~17–19×, а на простых задачах (классификация, FAQ) gap качества < 2%. Отсюда — роутинг (см. Agent Routing).
Как работает
- Качество — под задачу: одна модель топ в коде (SWE-bench), другая — в long-context, третья — в computer use.
- Reasoning modes дают +5–10% качества ценой −2–5× по latency и цене (см. Reasoning Effort).
- Практика: подбирай разные модели на роли (классификатор / «мозг» / исполнитель), решай по evals на своём домене, а не по общим лидербордам.
- Классы моделей с ценами: проприетарные модели верхнего тира (на 2026-08 — Claude Opus 5 и Fable 5, GPT-5.6 Sol) — лучший reasoning и низкий error-rate на edge-кейсах, но дорого; open-source 32B (Qwen3, DeepSeek-R1/V3) — почти GPT-4-level, в разы дешевле (~$0.05–0.1/1k ток), хватает на простую разметку и удобно «запускать несколько для голосования» (self-consistency, см. Chain of Thought).
- API vs self-host (экономика): API быстро/дёшево на прототипе, но на больших RPS дорого (10 RPS ≈ 864k запросов/день → на флагманской модели порядка $2 тыс./день, около $58 тыс./мес) и данные уходят наружу; своя инфраструктура (Local LLM Deployment) выгоднее при объёме/приватности, но без облачного fine-tuning.
Сетка тиров и плато качества
FinOps-подход формализует выбор модели в три тира с явной привязкой задач:
| Tier | Целевые задачи | Примеры на 2026-08 |
|---|---|---|
| 1 — small / fast | Маршрутизация, извлечение сущностей, фильтрация | Claude Haiku 4.5 ($1 / $5 за 1M), Gemini 3.6 Flash, открытые модели 8–32B |
| 2 — medium / balanced | RAG-ответы, суммаризация, черновая генерация | Claude Sonnet 5 ($2 / $10), GPT-5.6 Luna или Terra |
| 3 — reasoning / top | Анализ контрактов, многошаговый код, архитектурные рассуждения | Claude Opus 5 ($5 / $25), Claude Fable 5 ($10 / $50), GPT-5.6 Sol |
Читать эту таблицу надо по левым двум столбцам, а не по правому. Тир — это роль в системе, и она держится годами; имена в третьем столбце устаревают за квартал, и в этой заметке они уже один раз протухли на два поколения. Прежняя версия таблицы называла тиром 3 модели o1 и Claude Opus поколения 3.x, а тиром 2 — GPT-4o и Claude 3.5 Sonnet, тогда как соседний абзац в той же заметке уже говорил о поколении 2026 года. Противоречие внутри одного файла — характерный признак того, что список моделей живёт в тексте дольше положенного.
Одно наблюдение против интуиции «новее значит дороже». Sonnet 5 стоит $2 / $10 за миллион токенов против $3 / $15 у Sonnet 4.6 и 4.5 — новое поколение среднего тира вышло дешевле предыдущего. Поэтому пересчёт стоимости при обновлении модели делают заново, а не переносят старую смету: она может оказаться завышенной.
Привязка задач к тирам держится в конфиге, а не в коде — иначе смена модели превращается в релиз:
task_routing:
intent_classification: "tier_1_haiku"
contract_analysis: "tier_3_opus"
Правило, определяющее экономику выбора: качество растёт круто на дешёвом участке и выходит на плато — зону убывающей отдачи, где деньги уже не покупают точность. 80% задач классификации и извлечения сущностей выходят на это плато на младших моделях. Верхний тир оплачивается ради оставшихся процентов, которые нужны меньшинству запросов.
Выбор при этом всегда компромисс трёх величин: стоимость за 1000 запросов ↔ точность ↔ время до первого токена. Улучшение одной вершины оплачивается другими. Механизм, позволяющий не выбирать заранее, — Cascade Routing.
Связано с
- Benchmarks Agents — как мерить «качество»
- Agent Routing — как использовать разные модели по цене/качеству
- Reasoning Effort — глубина рассуждения как отдельный рычаг
- Context Window — критерий «контекст»
- Local LLM Deployment — локальная open-weight модель как дешёвый tier