Open Agent Safety Platform: что Anthropic и NVIDIA предлагают для контроля агентов

Разбор совместной инициативы как источника модели угроз и требований к изоляции.

· 2 мин чтения

28 сентября 2026 года NVIDIA анонсировала Open Agent Safety Platform. Это открытая платформа и референсный дизайн для контроля агентов в компаниях. Anthropic участвовала как партнёр и добавила свои уровни защиты в стек агента.

Почему контроль важнее, чем год назад

В блоге Anthropic пишут, что компании переходят от ИИ, который отвечает на вопросы, к агентам. Агенты выполняют сложную работу, используют проприетарные данные и действуют от имени пользователя. Чем больше доступов у агента, тем жёстче нужны контроль и проверка того, что он делает.

Защита слоями

Ограничители внутри модели остаются. К ним добавляются внешние слои, которые действуют на то, что агент делает. Каждый слой применяет свои правила независимо, защита не зависит от одного слоя. Слои модульные: компания берёт те, что подходят её инфраструктуре.

Где лежат учётные данные

Цикл агента (agent loop) крутится на отдельном сервере, отделённом от песочницы — изолированной среды, где выполняется работа. Учётные данные (пароли, ключи доступа) хранятся в отдельном хранилище (vault), и агент их никогда не видит. Managed Agents даёт журнал аудита и интеграцию с системами контроля доступа компании.

OpenShell: что агент может достать

Второй элемент платформы — открытая среда исполнения NVIDIA OpenShell под лицензией Apache 2.0. Её логика: блокировать всё, кроме того, что разрешено правилом. OpenShell проверяет каждый вызов инструмента, который пытается сделать агент. К каждому вызову применяются правила к файлам, сетевым соединениям и данным, к которым агент обращается. Правила действуют вне агента, и OpenShell логирует каждое разрешённое и заблокированное решение. Есть встроенный верификатор политик (policy prover), который математически доказывает, до чего агент может дотянуться при заданных правилах.

Как это использовать в работе

В блоге Anthropic описан такой цикл. Команда стартует с узких разрешений, смотрит лог OpenShell. Затем средствами Claude подтягивает правила до минимально необходимых прав (least access). Верификатор подтверждает, что агенту доступно то, что задано правилами.

Что проверить у себя

  1. Разнесены ли цикл агента и песочница, в которой он работает, или они крутятся в одном процессе.
  2. Видит ли агент учётные данные напрямую или обращается через отдельный слой, где они хранятся.
  3. Есть ли журнал аудита, который записывает каждое действие агента: какие инструменты вызваны, какие файлы и сети задействованы.
  4. Применяется ли правило «запрещено всё, что явно не разрешено», или агенту по умолчанию открыт широкий доступ.
  5. Существует ли способ формально проверить (тестом, математической верификацией, ревью), что политика даёт ровно тот доступ, который задуман.
  6. Можно ли применить OpenShell или аналогичный слой политик к уже работающим агентам, не переписывая их.