Harbor в Vercel Sandbox: как гонять агентские бенчмарки в облаке

Terminal-Bench со своим реестром бенчмарков запускается в Vercel Sandbox: каждая попытка в отдельной Firecracker microVM, и их легко параллелить.

· 2 мин чтения

Любой, кто мерил агента на бенчмарках, знает боль. Локально прогон занимает время, десять параллельных запусков упираются в ресурсы машины, а воспроизводимость страдает.

В Vercel рассказали, как решить эту задачу. Открытая обвязка Harbor теперь умеет работать в Vercel Sandbox. Каждая попытка бенчмарка запускается в отдельной изолированной microVM на Firecracker, а параллелить прогоны можно намного шире, чем на своём ноутбуке.

Что такое Harbor и зачем он нужен

Harbor — это открытая обвязка (harness), программа, которая гоняет агента по задачам и собирает результаты. По данным Vercel, реестр заданий включает терминальные сценарии из Terminal-Bench, а также SWE-bench, tau3-bench, OSWorld и другие бенчмарки.

Что меняется с Vercel Sandbox

С флагом –env vercel Harbor уходит в облако. Каждая попытка выполняется в отдельной Firecracker microVM. Параллелизм задаётся флагом –n-concurrent, в примере от Vercel это 8 одновременных прогонов.

Про безопасность и ключи

В Vercel подчёркивают две вещи про изоляцию. Сетевая политика задачи применяется на фаерволе песочницы, снаружи microVM. Ключи и токены, если они нужны агенту, подставляются в исходящие запросы прямо на этом фаерволе, и внутрь VM они не попадают.

Про модели и AI Gateway

Чтобы сравнивать модели на бенчмарке, в Harbor достаточно сменить флаг –model. Vercel AI Gateway даёт один ключ AI_GATEWAY_API_KEY и доступ к сотням моделей у разных провайдеров. В примере Vercel ставят одну модель, а затем меняют на другую — и бенчмарк идёт на ней.

Почему это работает

Главная идея — вынести «железо и изоляцию» из эксперимента в инфраструктуру. Исследователь думает не «как мне запустить агента», а «что я измеряю и на чём». Параллелизм больше не упирается в процессор ноутбука: можно поднять число одновременных попыток через –n-concurrent. Переключение моделей сводится к смене одного флага в команде Harbor.

В итоге меняется экономика оценки. Прогонять Terminal-Bench можно чаще, сравнение моделей делается сменой –model, а число параллельных попыток задаётся флагом, а не мощностью рабочей станции.

Как применить

  1. Поставьте Harbor с поддержкой Vercel: uv tool install ‘harbor[vercel]’. Нужна версия 0.22.0 или новее.
  2. Заведите токен Vercel (VERCEL_TOKEN) и ключ AI Gateway (AI_GATEWAY_API_KEY). Экспортируйте их в окружение, из которого будете запускать harbor run.
  3. Запустите первый тест на небольшом бенчмарке, например terminal-bench-2-1: harbor run -d terminal-bench/terminal-bench-2-1 –agent fx –model vercel_ai_gateway/anthropic/claude-fable-5 –env vercel –n-concurrent 8. Так вы увидите, что всё поднялось и результаты собираются.
  4. Подберите –n-concurrent под свои квоты и бюджет.
  5. Сравните модели, меняя только –model: например, vercel_ai_gateway/openai/gpt-5.6-luna вместо anthropic-варианта.
  6. Сохраняйте результаты и условия прогона (версию Harbor, модель, дату). Через месяц та же команда — и видно, что изменилось.