Длинные агенты: чинить не промптом, а экспериментом

Когда агент живёт часами и несёт состояние, одиночный промпт перестаёт работать. Нужен управляемый цикл: сценарий, трассы, скоринг, маленькая правка, перезапуск.

· 3 мин чтения

Если агент работает в одном запросе, его поведение зависит от промпта. Если он живёт часами, помнит события и принимает решения на основе вчерашнего разговора, поведение деградирует странно: факт помнится, источник теряется; слух превращается в уверенность; агент знает вещь, но забывает её в момент планирования.

Эрину Карати, бывшему инженеру Microsoft и Supercell, это знакомо по работе над Project Paradox, обвязке для агентов-персонажей в игровой деревне. У каждого агента своё состояние: память, вектор эмоций, оценки доверия к другим, важность воспоминаний. На коротких сценариях всё работало. На длинных социальная согласованность посыпалась. Агенты пересказывали слухи как факты и теряли, кто именно сказал ту или иную вещь.

Почему промпт тут не поможет

Если поправить формулировку вслепую, легко улучшить одно и сломать другое: например, ускорить распространение новостей и начать сливать приватные данные.

Что такое автоисследование поверх агента

Решение, которое описывает Карати, это не «умный промпт», а внешний цикл вокруг агентской системы. Внутри находится сам агент со своим состоянием. Снаружи работает мета-система, которая читает полные трассы прогона и сравнивает их со сценарием.

Цикл выглядит так: задаётся контрольный сценарий, прогон собирается в структурированные трассы, поведение оценивается по скоринговой карте, выдвигается маленькая правка, прогоняется заново. Если метрика упала, делается откат. Это петля с храповым механизмом: меняется небольшой кусок протокола, а не весь код.

Почему это работает

Главный сдвиг в том, что оценивается уже не один ответ, а весь прогон целиком. Вместо «выглядит хорошо на демо» появляется сигнал, по которому можно сравнивать версии протокола. Карати подчёркивает: повторяемых результатов в строгом смысле пока нет, речь о форме цикла и о том, какую поверхность ему открыть.

Второй важный приём, маленькая поверхность правок. Если мета-системе разрешить переписывать весь код, она начнёт «взламывать» собственную оценку. Когда можно трогать только протокол агента, правила записи памяти, политику извлечения, маркеры источника, триггеры перепланирования, пространство поиска остаётся управляемым, а поведение всё равно способно меняться хотя бы в какой-то степени.

Третий приём, скоринговая карта вместо одной метрики. Для социальной динамики Карати предлагает отдельные измерения: охват факта, удержание источника, сохранение неопределённости у слухов, согласованность плана, контроль утечек приватного. Оптимизация одной метрики портит остальные, и карта это показывает.

Четвёртый, контрольные сценарии вместо свободной игры. Если дать агентам побродить по миру и оценивать «красиво ли», проверить улучшение нельзя. Нужен набор сценариев с ожидаемым результатом: один агент узнаёт публичный факт, и нужно проверить, что нужные агенты узнали и помнят источник; один агент слышит слух, и нужно проверить, что неопределённость не превратилась в уверенность; у плана ломается маршрут, и нужно проверить, что группа перепланировала.

Как применить

  1. Зафиксируйте обвязку и метрики. Отдельно отметьте, что именно можно менять: правила записи памяти, формат извлечения, маркеры источника и доверия, триггеры перепланирования. Остальное заморожено.
  2. Соберите набор контрольных сценариев, каждый с ожидаемым результатом. Примеры: передача публичного факта, распространение слуха с пометкой неопределённости, срыв плана и перепланирование.
  3. Сделайте скоринговую карту из нескольких метрик: охват, удержание источника, сохранение неопределённости, согласованность плана, контроль приватности. Одна метрика не подходит, она спрячет все интересные провалы.
  4. Запустите цикл: прогон, сбор трасс, подсчёт метрик, предложение маленькой правки, перепрогон. Правка остаётся только при улучшении оценки и удержании ограничителей.
  5. Добавьте откат как обязательную операцию. Каждое изменение должно быть отменяемым: политика, которая распространяет публичные факты быстрее, может начать течь приватной информацией; рост памяти может цеплять устаревшие записи.