Сначала траектория, потом лог: как быстро найти, где агент сошёл с пути

В LangSmith появились Trajectories — читаемая раскладка сессии агента. Показываем, как с их помощью быстрее находить сбой в длинных сессиях.

· 3 мин чтения

Пользователь жалуется: агент выдал устаревший ответ, проигнорировал подсказку или вызвал не тот инструмент. Открываешь трейс, а там шестьдесят сообщений, девять витков диалога, вложенные запуски, ретраи, субагенты. Источник правды здесь, но чтобы до него добраться, нужно сначала понять, куда вообще смотреть. Авторы LangSmith описывают этот сценарий как типичную точку входа в отладку длинных агентских сессий.

В LangSmith теперь есть Trajectories. Это хронологическая проекция поверх трейса. Она убирает вложенную структуру запусков и оставляет только сообщения и действия в порядке их появления: реплики пользователя, ответы ассистента, вызовы инструментов, их результаты. Из полного дерева выполнения траектория оставляет тот путь, по которому агент реально прошёл.

Что именно даёт траектория

Каждое сообщение встречается один раз и в том порядке, в каком впервые появилось в сессии. Сюда входят сообщения человека, ассистента, инструментов и субагентов. В трейсе тот же материал разложен по дереву запусков с таймингами, ретраями и метаданными. Это нужно, когда уже знаешь, какой шаг разбирать. В траектории видно сам путь, без лишней глубины.

Поддерживаются трассы из LangChain, LangGraph и Deep Agents, из SDK OpenAI и Claude, а также из кодинг-агентов Codex, Claude Code и Cursor.

Почему это ускоряет отладку

  • Сначала видно поведение, потом детали. Можно пролистать девять витков сессии как переписку, найти место, где агент переиспользовал старый результат инструмента вместо нового запроса, и только потом нырять в полный трейс этого шага.
  • Доменным экспертам не нужно парсить вложенные запуски. Врач видит, какие уточняющие вопросы задал клинический агент, финансовый ревьюер проверяет, соблюдался ли процесс комплаенса, тимлид поддержки оценивает, соответствовала ли эскалация политике.
  • Онлайн-оценка качества работает по более чистому входу. Run-level оценщики получают накопленный контекст витка за витком, и вход раздувается и становится шумнее. Траектория даёт последовательность шагов без повторов, и оценщик фокусируется на пути.
  • Низкооценённые сессии летят в очередь ревью. Можно фильтровать по баллу, отправлять плохие разборщикам, хорошие сохранять в датасеты и использовать для supervised fine-tuning: с системными промптами, вызовами инструментов и адаптацией агента по ходу сессии.

Когда траектории не хватает

Траектория остаётся проекцией, а не заменой трейса. Когда уже понятно, на каком шаге агент свернул не туда, нужны полные данные: точные входы и выходы инструмента, тайминги, ретраи, структура вложенных запусков. Стратегия в LangSmith именно такая: сначала прочитать траекторию и найти нужный шаг, потом открыть трейс этого шага. Не наоборот.

Как применить

  1. Откройте любую длинную сессию в LangSmith и пройдите её глазами как переписку, прежде чем лезть в дерево запусков.
  2. Сталкиваетесь с жалобой пользователя, ищите в траектории место расхождения: где агент перестал уточнять, переиспользовал старые данные, проигнорировал вывод инструмента или передал плохой результат субагенту. Затем открывайте трейс именно этого шага.
  3. Подключите онлайн-оценщики к траекториям: так оценка будет работать по чистому пути, а не по раздутому контексту с повторами, и вход станет менее шумным.
  4. Разверните аннотационную очередь для траекторий и отдайте её доменным экспертам. Пусть врач, юрист или аналитик поддержки сами размечают поведение агента в читаемом виде, без разбора вложенных запусков.
  5. Низкооценённые траектории сохраняйте в датасет и используйте как обучающий материал для supervised fine-tuning. Так производственное поведение становится обучающими примерами.