Агент в проде выглядит рабочим: задачи закрывает, ошибок вроде нет. А токены улетают и ответы задумчивые. Источник проблемы часто в неэффективном пути: лишние вызовы инструментов, повторные попытки там, где они не нужны. На глаз это не видно, юзер не жалуется. Видно только по графику latency и по счёту за API. В LangChain к этой проблеме подходят через два слоя: сначала red teaming по проду, потом автоматическая проверка каждого предлагаемого фикса.
Что именно делает Engine v2
LangSmith Engine — это встроенный в платформу агент, который анализирует трассы, то есть записи проходов вашего агента. С релиза в мае он обработал больше 70 миллионов трасс и помог диагностировать десятки тысяч проблем. В версии v2 команда сфокусировалась на двух задачах: находить проблемы и предлагать проверенные фиксы.
Проблемы теперь ищутся проактивно, а не только по факту жалобы. В v2 есть два направления работы.
- Red Teaming в Private Beta: Engine читает продуктовые трассы и репозиторий, понимает цель и поведение агента, затем генерирует сценарии-атаки и ищет слабые места до того, как они проявятся вживую. На выходе список верифицированных проблем, которые предстоит починить.
- Поиск тонких деградаций: Engine смотрит на траекторию, последовательность вызовов и шагов агента. Если он идёт к цели окольным путём, делает лишний или повторный вызов инструмента, это помечается как inefficient work. Параллельно отслеживаются тренды по error rate, latency и стоимости.
Все находки, и от red teaming, и от метрик, попадают в одну очередь. У каждой записи есть вероятная причина, готовый фикс и примеры для вашего датасета оценки качества.
Почему важна автопроверка фикса
«Нашли проблему» и «починили» это разные вещи. Деплой вслепую рискует испортить опыт пользователя. Ручная проверка тормозит разработку. В Engine v2 фикс проходит цикл автоматической валидации: воспроизведение проблемы на тех же входах, предложение изменения, прогон, оценка качества, корректировка. После подтверждения фикс появляется в вашей очереди, и его можно открыть как PR (pull request, запрос на слияние кода) одним кликом.
Команда LangSmith параллельно улучшает базовую производительность Engine: обвязку, промпты и базовые модели. По их измерениям, после августовских улучшений Engine стал более чем вдвое точнее в обнаружении проблем (бенчмарк IssueBench) и выдаёт фиксы, которые на 25% эффективнее по Terminal-Bench.
Как применить схему без LangSmith
- Отберите реальные трассы за период. Этого хватит, чтобы увидеть типичные пути и исключения.
- Сначала red teaming по этим трассам. Попросите отдельного агента или ревьюера сгенерировать сценарии-атаки: сбивающие формулировки, противоречивые инструкции, попытки вытянуть системный промпт, конфликтующие данные в инструментах. Прогоните свой агент по этим сценариям и соберите ответы в отдельный набор оценки качества.
- Потом метрики пути. По каждой трассе посчитайте длину, число вызовов инструментов, повторные вызовы, токены на единицу успеха. То, что отличается от медианы больше чем на половину, это кандидаты на inefficient work.
- Соберите найденное в одну очередь задач: для каждой проблемы корневая причина, предложенный фикс (промпт или код), проверочные примеры из реальных трасс.
- Любой фикс сначала прогоняйте автотестом по этим примерам и по red team набору. В продакшен только после зелёного прогона.
- В конце цикла заново прогоните red team. Модель и инструменты меняются, и то, что было безопасно месяц назад, перестаёт быть безопасным.