Вы пишете агенту «как дела?», он отвечает одной строкой, а в счёте тысячи токенов. Кажется, что где-то ошибка. Её нет — просто модель на каждый ваш шаг читает гораздо больше, чем вы видите.
Хорошо это разобрал блогер Shad, у которого команда агентов OpenClaw в какой-то момент тратила до 800 долларов за пять дней.
Что отправляется модели на каждом шаге
Модель ничего не помнит между запросами. Поэтому при каждом обращении агент заново отправляет ей всё:
- системные инструкции OpenClaw;
- файлы вашего агента: его «характер», правила, память, расписание;
- описания всех включённых инструментов;
- всю историю текущего разговора;
- и в самом конце — ваше «как дела?».
Первые три пункта почти не меняются от шага к шагу, но оплачиваются каждый раз. У Shad вышло примерно 900 миллионов токенов на вход и только 8 миллионов на выход. На вход в сто с лишним раз больше. Скорее всего, у вас похожая картина.
Кеш: главная экономия
Провайдеры моделей умеют кешировать повторяющееся начало запроса. Если оно такое же, как в прошлый раз, его не пересчитывают и берут за это примерно десятую часть цены.
Подвох в том, что кеш живёт недолго, по умолчанию обычно минуты. Пока вы переписываетесь с агентом, всё отлично. Но агент, который просыпается по расписанию раз в час, каждый раз приходит к пустому кешу и платит полную цену. А у некоторых провайдеров сама запись в кеш стоит дороже обычного ввода.
Что сделал Shad:
- проверил, как долго держит кеш его провайдер, и включил более долгое хранение, где оно бесплатное;
- подобрал интервал «пробуждения» агентов под срок жизни кеша;
- понял, что любая правка инструкций агента сбрасывает кеш, так что править их по мелочи десять раз в день — дорого.
Точные цены и сроки у разных провайдеров разные и часто меняются. Смотрите актуальные на странице тарифов своего провайдера.
Две другие дыры
Агент, который сошёл с ума. Позже Shad обнаружил, что главная утечка была не в кеше: один-два агента на каждый запуск делали около 300 шагов и дёргали сотню инструментов. После исправления расходы упали до 15 долларов в день.
Слишком частые запуски. Он увеличил интервал между запусками агентов с 30 минут до часа, а редко нужным поставил раз в два часа. И на время отладки запускал их только в рабочие часы, чтобы видеть, что они делают.
Как проверить у себя
- Откройте статистику у провайдера: сколько токенов на вход и сколько на выход. Если вход в десятки раз больше — дело в том, что отправляется каждый раз.
- Посмотрите расходы по агентам, если это возможно. Обычно виноват один.
- Проверьте, сколько шагов агент делает за один запуск. Сотни — повод разобраться.
- Сравните интервал запусков по расписанию со сроком жизни кеша у провайдера.
- Оставьте дорогую модель только тому агенту, который принимает решения. Рутине хватит дешёвой: у Shad самая сильная модель была только у главного агента.