Слои нового агентского стека OpenAI: что внутри и что можно заменить своим

Разбор computer use, Decisions API и UltraFast как набора слоёв: где модель решает, где обвязка исполняет, а где вы справитесь сами.

· 5 мин чтения

Когда выходит сразу несколько продуктов (Dots, GPT-6.1, Agents API, Decisions API), мозг пытается оценить каждый по отдельности и тонет. Полезнее смотреть на стек как на слои: модель, обвязка (harness), инференс, песочница, API для вызовов. Тогда понятно, что именно изменилось и где граница между «берём готовое» и «делаем сами».

На Dev Day 2026 Ари Вайнштейн, руководитель направления продуктов и инженерии computer use в OpenAI, и Никундж Ханда из продуктовой команды API разложили этот стек по полочкам в подкасте Latent Space. Разберём его вместе с ними, без маркетинга, в терминах слоёв.

Слой модели: GPT-6.1 как двигатель computer use

Ари Вайнштейн говорит, что главный сдвиг последних месяцев касается не архитектуры, а способности модели отлаживать себя. Раньше агент надёжно начинал задачу, но ломался на середине. Теперь он хорошо делает три вещи: запускает задачу заново, интроспектирует, что пошло не так, и пробует другие пути.

Новая модель GPT-6.1 Sol дешевле для computer use: в пять раз дешевле Astra в общем случае и в семь раз дешевле именно в сценариях computer use. Вайнштейн отдельно отмечает ещё один источник ускорения: модель часто пишет JavaScript, который компьютер выполняет сразу пачкой действий. Если открыть tool calls в Codex и развернуть их вручную, видно, что вместо последовательности «скриншот-клик-скриншот» там сгенерированный код.

Слой обвязки: что видит и чем управляет агент

Вайнштейн перечисляет модальности, которые обвязка теперь умеет комбинировать: скриншоты, дерево доступности (accessibility tree), прямой доступ к DOM, Playwright для браузера и собственный сгенерированный код. Конкретный пример: раньше агент тратил время на скролл страницы с результатами (скриншот, действие, следующий скриншот). С доступом к DOM и accessibility модель видит всю страницу или всё приложение целиком и пишет код, который обрабатывает несколько шагов за раз.

App Shot — это способ перенести контекст из приложения в Codex или ChatGPT. В Codex можно нажать две клавиши Command, сделать App Shot, открыть вложение и нажать маленькую кнопку в правом верхнем углу. Там видно «сырое» текстовое представление и дерево доступности. Вайнштейн говорит, что это требует усилий по эффективности токенов: нужно выгрузить всё содержимое, но компактно.

Слой песочницы: Dots и личный Linux-компьютер

Dots — это персональный ассистент, у которого есть собственный Linux-компьютер в облаке. Не браузер, как в старых продуктах, а полноценная виртуалка: можно запускать десктопные приложения и открывать внутри неё браузер. Для разработчика это меняет уравнение «агент или скрипт». Когда есть своя виртуалка, проще отдать агенту задачу, для которой нет API. Вайнштейн приводит пример: он подписан на сервис доставки еды, где заказ с граммовками занимает у него два часа, а агент справляется за 15 минут. Swyx добавляет свой кейс: автоматизация YouTube, где A/B-тесты и посты в сообществе не отдаются через API, и агенту приходится крутить их в виртуалке.

Слой API: Decisions API и асинхронные вызовы

Decisions API — это отдельная история. Swyx уточняет у Вайнштейна: та же модель, что в computer use, или другая? Ответ: меньшая модель, без reasoning (цепочки рассуждений), с параллельным инференсом. За счёт этого Decisions API быстрее, но хуже справляется с длинными горизонтами планирования. В OpenAI сами говорят, что объединять эти подходы пока открытая исследовательская задача.

Внутри OpenAI Decisions API уже используют для классификации обращений в поддержку и внутренних процессов. Это маленькие, но частые решения, где reasoning-модель избыточна. В Latent Space отмечают, что на момент записи это «обёртка над Luna» и команда «клонировала хорошие паттерны» Jev.

Рядом идут асинхронные вызовы инструментов: модель больше не обязана ждать ответа тула, пока тот работает. Можно уйти в mid-turn steering (перенаправление модели в середине хода) и держать WebSocket-соединение. Вайнштейн рассказывает, что внутри OpenAI сотрудник из команды инференса и сотрудник из инфраструктуры за четыре недели собрали прототип, вдохновлённый Jev, и теперь «взбираются на холм» по задержкам перед запуском.

Слой долгого контекста: кэш и сжатие

Два механизма держат длинные сессии: кэширование промптов с предзагрузкой (pre-warming) и серверное сжатие контекста (compaction). Ханда и Вайнштейн подчёркивают разницу: ручное сжатие, когда вы сами решаете, что выкинуть, и серверное, когда платформа сама уплотняет историю.

Что из этого можно заменить своим

Стек естественно делится на «придётся взять у вендора» и «можно собрать самому». Модель и обвязку вокруг неё часто проще взять готовыми. А вот песочницу, логику вызовов, кэширование промптов, сжатие контекста и длинные сессии — это то, где у вас уже есть инфраструктура и где замена даёт прямой контроль над расходами и поведением.

Как применить

  1. Опишите свои задачи через слои: модель, обвязка, песочница, API вызовов, долгий контекст. Для каждой задачи отметьте, что берёте у вендора, а что строите сами.
  2. Если задача короткая и частая, попробуйте Decisions API вместо модели с цепочкой рассуждений. Без длинного планирования он быстрее.
  3. Если задача длинная, заранее продумайте кэширование промптов и предзагрузку.
  4. Разделите ручное и серверное сжатие контекста. Ручное для чувствительных мест, где вы решаете, что забыть. Серверное для всего остального.
  5. Для computer use начинайте с DOM и дерева доступности, а скриншоты добавляйте по необходимости. Модель видит страницу целиком и пишет код сразу на несколько шагов.
  6. Перед тем как отдавать задачу агенту, спросите себя: есть ли API? Если есть, пишите код. Если нет, тогда computer use.