LangGraph Observability

Инструменты наблюдаемости и отладки графа: LangGraph Studio (визуальный UI от LangChain), LangFuse (трейсинг в своей инфраструктуре) и LangSmith. Дают трейсы шагов, визуализацию исполнения и воспроизведение — то, без чего недетерминированного агента не отладить.

Суть

Контролируемый workflow требует наблюдаемости: видеть, какой узел сработал, что было в state, почему маршрутизатор выбрал ветку. LangGraph отдаёт эти данные во внешние инструменты трейсинга и в собственный визуальный отладчик.

Как работает

  • LangGraph Studio — UI для пошаговой отладки графа (визуализация узлов/рёбер, состояние на каждом шаге).
  • LangFuse — открытый трейсинг, разворачивается в своей инфраструктуре (важно, когда данные нельзя отдавать наружу).
  • LangSmith — облачная платформа трейсинга/оценки от LangChain. Детальное сравнение с Langfuse (лицензия, self-hosting, экспорт, аудитория) — в LangSmith vs Langfuse.
  • Arize Phoenix — открытый OpenTelemetry-native вариант: самый быстрый путь к рабочему просмотру трейсов (pip install плюс register()) и наиболее полная библиотека готовых LLM-as-judge оценщиков (см. LLM as Judge, OpenInference).
  • Выбор платформы перестал быть выбором инструментовки (сверено 2026-08). Семантические соглашения OpenTelemetry GenAI поддерживают все три платформы, поэтому инструментировать код можно один раз, а платформу менять потом. Раньше это был решающий аргумент лок-ина, сейчас — нет. Практический ориентир: managed LangGraph — LangSmith; нужен self-host и контроль над трейсами — Langfuse; нужен локальный или CI-цикл оценки — Phoenix.
  • На практике связка «трейс шагов + LangGraph Time Travel» закрывает воспроизводимость и отладку; трейс — это ещё и поле trace в самом state (журнал «размышлений» агента, удобно для обучения и контроля).

Связано с

  • Agent Evals — наблюдаемость → метрики и оценка качества агента
  • LangGraph Time Travel — трейсинг + replay/fork = полный цикл отладки
  • LangGraph — «наблюдаемость» как метрика контролируемого workflow