Model Selection

Выбор модели под задачу по 4 критериям: качество, контекст, стоимость, latency + tool use. Нет одной «лучшей» модели — есть подходящая под конкретную задачу.

Содержит быстро устаревающие данные (текущие топ-модели, цены $/токен, лидерборды) — status/volatile. Сверяй конкретные модели и цены при ревизии.

Суть

  • Качество — benchmark score + свои evals на домене (см. Benchmarks Agents); «bench ≠ прод».
  • Контекст — 128K/200K/1M (см. Context Window); больше контекст → больше «забываний» и не бесплатно.
  • Стоимость — $/1M токенов (input+output); агент делает десятки вызовов → цена умножается.
  • Latency + tool use — reasoning-модели дают качество ценой времени; агентам критична надёжность tool calls.

Зачем это нужно

«Флагман на каждую задачу» — главный источник перерасхода: разница цены между Tier 1 и Tier 3 моделями ~17–19×, а на простых задачах (классификация, FAQ) gap качества < 2%. Отсюда — роутинг (см. Agent Routing).

Как работает

  • Качество — под задачу: одна модель топ в коде (SWE-bench), другая — в long-context, третья — в computer use.
  • Reasoning modes дают +5–10% качества ценой −2–5× по latency и цене (см. Reasoning Effort).
  • Практика: подбирай разные модели на роли (классификатор / «мозг» / исполнитель), решай по evals на своём домене, а не по общим лидербордам.
  • Классы моделей с ценами: проприетарные модели верхнего тира (на 2026-08 — Claude Opus 5 и Fable 5, GPT-5.6 Sol) — лучший reasoning и низкий error-rate на edge-кейсах, но дорого; open-source 32B (Qwen3, DeepSeek-R1/V3) — почти GPT-4-level, в разы дешевле (~$0.05–0.1/1k ток), хватает на простую разметку и удобно «запускать несколько для голосования» (self-consistency, см. Chain of Thought).
  • API vs self-host (экономика): API быстро/дёшево на прототипе, но на больших RPS дорого (10 RPS ≈ 864k запросов/день → на флагманской модели порядка $2 тыс./день, около $58 тыс./мес) и данные уходят наружу; своя инфраструктура (Local LLM Deployment) выгоднее при объёме/приватности, но без облачного fine-tuning.

Сетка тиров и плато качества

FinOps-подход формализует выбор модели в три тира с явной привязкой задач:

Tier Целевые задачи Примеры на 2026-08
1 — small / fast Маршрутизация, извлечение сущностей, фильтрация Claude Haiku 4.5 ($1 / $5 за 1M), Gemini 3.6 Flash, открытые модели 8–32B
2 — medium / balanced RAG-ответы, суммаризация, черновая генерация Claude Sonnet 5 ($2 / $10), GPT-5.6 Luna или Terra
3 — reasoning / top Анализ контрактов, многошаговый код, архитектурные рассуждения Claude Opus 5 ($5 / $25), Claude Fable 5 ($10 / $50), GPT-5.6 Sol

Читать эту таблицу надо по левым двум столбцам, а не по правому. Тир — это роль в системе, и она держится годами; имена в третьем столбце устаревают за квартал, и в этой заметке они уже один раз протухли на два поколения. Прежняя версия таблицы называла тиром 3 модели o1 и Claude Opus поколения 3.x, а тиром 2 — GPT-4o и Claude 3.5 Sonnet, тогда как соседний абзац в той же заметке уже говорил о поколении 2026 года. Противоречие внутри одного файла — характерный признак того, что список моделей живёт в тексте дольше положенного.

Одно наблюдение против интуиции «новее значит дороже». Sonnet 5 стоит $2 / $10 за миллион токенов против $3 / $15 у Sonnet 4.6 и 4.5 — новое поколение среднего тира вышло дешевле предыдущего. Поэтому пересчёт стоимости при обновлении модели делают заново, а не переносят старую смету: она может оказаться завышенной.

Привязка задач к тирам держится в конфиге, а не в коде — иначе смена модели превращается в релиз:

task_routing:
  intent_classification: "tier_1_haiku"
  contract_analysis: "tier_3_opus"

Правило, определяющее экономику выбора: качество растёт круто на дешёвом участке и выходит на плато — зону убывающей отдачи, где деньги уже не покупают точность. 80% задач классификации и извлечения сущностей выходят на это плато на младших моделях. Верхний тир оплачивается ради оставшихся процентов, которые нужны меньшинству запросов.

Выбор при этом всегда компромисс трёх величин: стоимость за 1000 запросов ↔ точность ↔ время до первого токена. Улучшение одной вершины оплачивается другими. Механизм, позволяющий не выбирать заранее, — Cascade Routing.

Связано с

  • Benchmarks Agents — как мерить «качество»
  • Agent Routing — как использовать разные модели по цене/качеству
  • Reasoning Effort — глубина рассуждения как отдельный рычаг
  • Context Window — критерий «контекст»
  • Local LLM Deployment — локальная open-weight модель как дешёвый tier