← МоделиМодель

Grok 4.7 в Amazon Bedrock: 500K контекста и четыре уровня рассуждения

Модель xAI доступна через Responses, Chat Completions и Converse API. Разбираем, что это даёт агентским пайплайнам.

· 2 мин чтения

Grok 4.7 от xAI теперь доступна в каталоге Amazon Bedrock. Пост об этом опубликован 28 сентября 2026 года. Модель принимает текст и изображения, возвращает текст и доступна через четыре API: Responses, Chat Completions, InvokeModel и Converse. На Bedrock она обслуживается через кросс-региональные inference profiles: us.xai.grok-4.7 и global.xai.grok-4.7.

Главное для инженеров: окно контекста 500K токенов и четыре уровня reasoning effort (low, medium, high, xhigh). Уровень задаётся через параметр reasoning у Responses API и через additionalModelRequestFields у Converse. По умолчанию стоит high. В Bedrock также работают implicit prompt caching на повторяющихся префиксах, Guardrails, structured outputs под JSON Schema и логирование вызовов в CloudWatch с токенами, включая reasoning.

Доступны три сервисных уровня: Standard (pay-per-token), Priority (ускоренный за премию) и Flex (дешевле для нечувствительных ко времени задач). Ставки смотрите на странице Amazon Bedrock pricing, чтобы считать экономику уровней рассуждения под свой трафик.

Artificial Analysis сравнивает Grok 4.7 (на xhigh) с Grok 4.6: Intelligence Index 46 против 44, Coding Agent Index 56 против 47, AA-Briefcase Elo 1657 против 1546, GDPval-AA Elo 1695 против 1605, AA-Omniscience Index 32 против 30 при снижении галлюцинаций с 34% до 29%. Цена этих улучшений — рост выходных токенов на задачу примерно вдвое, с ~38k до ~81k.

Что это значит для агентов

В xAI модель позиционируют как самую сильную для программирования и интеллектуальной работы. Упомянутые бенчмарки: CursorBench, DeepSWE, Terminal-Bench, AA Briefcase, EEBench, Harvey Legal Agent Benchmark и HealthBench Professional. В xAI также подчёркивают, что Grok 4.7 тщательнее проверяет собственный вывод перед продолжением, и обучали его понимать обвязку Grok Bot.

Четыре уровня effort на одной модели дают оркестратору удобный рычаг. Дешёвые классификации и извлечения фактов можно гонять на low. Основной цикл агента стоит держать на high, а тяжёлые ветки, где ранняя ошибка дорого распространяется по шагам, поднимать до xhigh. Уровни стоит прогнать на своих длинных задачах, прежде чем зашивать в продакшене.

Отдельный практический момент: reasoning-токены в Chat Completions не возвращаются. Чтобы возвращать и подавать обратно собственный ход рассуждений между ходами, нужен Responses API с include: [“reasoning.encrypted_content”].