30 сентября 2026 года Google DeepMind анонсировала Gemini 4 Argon. Это первый почти за год флагман крупнее Flash-линейки. В посте на сайте DeepMind модель подаётся как решение для долгих многошаговых задач: реальной разработки, юридических и финансовых документов, автономной киберзащиты. Подписал пост Корай Кавукчуоглу, SVP Google и Chief AI Architect в DeepMind.
Главная техническая новость: лимит выхода вырос с 64К до 1М токенов за один ответ. Google объясняет, что с таким запасом модель может «думать» и генерировать сотни тысяч токенов в одной траектории, не разрезая ответ на куски. Контекстное окно в посте отдельно не названо.
Artificial Analysis отмечает, что Vals API сейчас выдаёт максимум 262К выходных токенов. До миллиона удалось дойти через экспериментальную фичу Long Decode Continuation: она ставит длинный ответ на паузу и продолжает в следующих вызовах. Вводная цена $2 за 1М входных и $10 за 1М выходных токенов, кэш входа дешевле на 95%. Без скидки $4/$20.
Доступ пока закрытый. Argon получают участники Fairwind, программы для проверенных киберзащитников. Широкий релиз начнётся с платных клиентов API и подписчиков Google AI Ultra. Конкретных сроков нет: «как только получится». Параллельно Google проходит добровольную предрелизную проверку в правительстве США.
Цифры из таблицы Google
На Vals Index Argon набирает 68,9%, Opus 5.5 67%, Astra 63,1%. На AutomationBench 51,3% против 42,5% у Opus 5.5 и 31,4% у Fable 5.1.
По замерам Artificial Analysis, на длинной траектории Argon выгоднее по цене задачи: $1,99 против $3,26 у Astra. Экономия идёт от цены, а не от эффективности: Argon в среднем тратит 62К выходных токенов на задачу против 27К у Astra. На AutomationBench-AA Argon первый с 77,5%, на Terminal Bench 4 набирает 57% и уступает Sonnet 5.5, Opus 5.5 и Astra. На Intelligence Index у Argon и Astra по 53 балла.
Слабые места тоже есть. На FrontierSWE v2 Argon отстаёт от Astra: 55% против 65,5%. На OSWorld-2.0 Argon 69,2% против 72,6% у Astra.
Что проверить у себя, когда откроют доступ
- Не переписывать пайплайны под модель, которой пока нет в открытом доступе.
- Собрать личный мини-бенчмарк из 5–10 реальных задач и прогнать на Argon и текущей модели.
- Если работа идёт в длинных документах или больших репозиториях, смотреть на Argon первым: длинный контекст у неё в таблице самый сильный.
- Ждать независимых замеров: часть цифр Google посчитала сама, без внешней проверки.