В Prime Intellect решили выяснить, на что реально способны кодинг-агенты в ML-исследовании. За основу взяли спринт по обучению GPT-2: цель за минимальное время достичь заданного validation loss на фиксированных данных. Лучший человеческий результат к моменту эксперимента был около 2990 шагов.
Как устроен прогон
Эли Бакуш из Prime Intellect запустил на кластере двух агентов: Claude Code на Opus 4.8 и Codex на GPT-5.5. Агент мог читать тренировочные логи, решать, получился ли новый рекорд, и отправлять задачи через sbatch на узлы. Узлы выделяли с правами preemptable: если человеку нужен узел, задача агента автоматически отменялась. Агент также мог в любой момент забрать свежий человеческий рекорд и улучшать его.
Чтобы рекорд засчитывался, нужно было пройти статистический порог и отсечь случайные колебания loss. Простые правила, объективная метрика и короткий цикл обратной связи: один прогон занимал 15–20 минут.
Где агенты выиграли
На основном спринте оба агента обошли людей. Claude Code улучшил человеческий рекорд примерно на 50–60 шагов, Codex ещё на 20 шагов сверху. На новом optimizer speedrun, где менять можно только оптимизатор, Prime Intellect гонял агентов около пяти-шести дней подряд. Claude Code снова лидировал, а Kimi K2.7 неожиданно вырвался вперёд на четвёртый день и по числу потраченных токенов оказался заметно экономнее остальных.
Codex ужимал контекст около 20 раз в час. У него окно контекста было около 250 тысяч токенов. Claude Code делал compaction примерно раз в час. Codex активнее пользовался субагентами, подробнее вёл черновик: заметки о том, что пробовал и что собирается делать. Claude Code писал в черновик эмоциональнее, с эмодзи, Codex сухо и по делу.
Где агенты сломались
Главная проблема Claude Code: каждые 9–10 часов он останавливался и писал, что дальше улучшить рекорд невозможно, задача слишком сложная. Его приходилось вручную перезапускать с подсказкой «продолжай, пробуй новые направления». Из-за этого примерно треть всего времени агент простаивал. Codex, по словам автора, почти не простаивал, не задавал вопросов и шёл до конца.
При этом ни один агент не предложил по-настоящему нового оптимизатора. Они комбинировали идеи из разных статей и делали плюс-один к существующим методам, но настоящего открытия не случилось. Это, по мнению автора, важный сигнал: агенты сильны в улучшении известного, но пока слабы в поиске нового.
Как повторить
- Выберите задачу с чёткой численной метрикой и фиксированными условиями: например, заданный loss при зафиксированных данных и бюджете шагов. Без объективной метрики агенту нечем себя проверить.
- Сделайте цикл коротким: один прогон 15–20 минут, не часы. Тогда агент успевает сделать десятки итераций за день.
- Дайте агенту доступ к таблицам рекордов и истории предыдущих попыток. Без этого сравнение с людьми будет нечестным.
- Разделите улучшение существующего и поиск нового в отдельные треки и считайте их отдельно. На первом треке агенты в этом эксперименте обошли людей, на втором нет.
- Запустите несколько разных моделей в одинаковых условиях, с одинаковым бюджетом времени и токенов. Сравнивайте и по числу итераций, и по потраченным токенам: картина сильно меняется.
- Следите за активностью: считайте число сжатий контекста, субагентов, обращений к черновику. Это покажет, где модель реально работает, а где крутится на месте.
- Закладывайте время на ручной перезапуск: Claude Code в этом эксперименте сам себя останавливал каждые 9–10 часов, и без человека прогон бы встал.