28 сентября 2026 года NVIDIA анонсировала Open Agent Safety Platform. Это открытая платформа и референсный дизайн для контроля агентов в компаниях. Anthropic участвовала как партнёр и добавила свои уровни защиты в стек агента.
Почему контроль важнее, чем год назад
В блоге Anthropic пишут, что компании переходят от ИИ, который отвечает на вопросы, к агентам. Агенты выполняют сложную работу, используют проприетарные данные и действуют от имени пользователя. Чем больше доступов у агента, тем жёстче нужны контроль и проверка того, что он делает.
Защита слоями
Ограничители внутри модели остаются. К ним добавляются внешние слои, которые действуют на то, что агент делает. Каждый слой применяет свои правила независимо, защита не зависит от одного слоя. Слои модульные: компания берёт те, что подходят её инфраструктуре.
Где лежат учётные данные
Цикл агента (agent loop) крутится на отдельном сервере, отделённом от песочницы — изолированной среды, где выполняется работа. Учётные данные (пароли, ключи доступа) хранятся в отдельном хранилище (vault), и агент их никогда не видит. Managed Agents даёт журнал аудита и интеграцию с системами контроля доступа компании.
OpenShell: что агент может достать
Второй элемент платформы — открытая среда исполнения NVIDIA OpenShell под лицензией Apache 2.0. Её логика: блокировать всё, кроме того, что разрешено правилом. OpenShell проверяет каждый вызов инструмента, который пытается сделать агент. К каждому вызову применяются правила к файлам, сетевым соединениям и данным, к которым агент обращается. Правила действуют вне агента, и OpenShell логирует каждое разрешённое и заблокированное решение. Есть встроенный верификатор политик (policy prover), который математически доказывает, до чего агент может дотянуться при заданных правилах.
Как это использовать в работе
В блоге Anthropic описан такой цикл. Команда стартует с узких разрешений, смотрит лог OpenShell. Затем средствами Claude подтягивает правила до минимально необходимых прав (least access). Верификатор подтверждает, что агенту доступно то, что задано правилами.
Что проверить у себя
- Разнесены ли цикл агента и песочница, в которой он работает, или они крутятся в одном процессе.
- Видит ли агент учётные данные напрямую или обращается через отдельный слой, где они хранятся.
- Есть ли журнал аудита, который записывает каждое действие агента: какие инструменты вызваны, какие файлы и сети задействованы.
- Применяется ли правило «запрещено всё, что явно не разрешено», или агенту по умолчанию открыт широкий доступ.
- Существует ли способ формально проверить (тестом, математической верификацией, ревью), что политика даёт ровно тот доступ, который задуман.
- Можно ли применить OpenShell или аналогичный слой политик к уже работающим агентам, не переписывая их.