Технические руководители все чаще поручают многоэтапные задачи автономным ИИ-агентам, наивно полагая, что эти модели способны самостоятельно планировать время выполнения. Это заблуждение. Недавние тесты наглядно показали: передовые архитектуры страдают абсолютной временной слепотой. Запуская скрипт, проводя рефакторинг репозитория или отлаживая эндпоинт, автономный агент оперирует исключительно дискретными токенами и шагами рассуждения, не имея внутренних часов для измерения физического времени работы.
Результаты тестов на базе ProgramBench
В ходе масштабного исследования программы MATS ученые протестировали окружение Claude Code от Anthropic и экосистему Codex от OpenAI на 200 задачах из датасета ProgramBench и 18 специализированных бенчмарках. Согласно протоколу эксперимента, каждый агент должен был спрогнозировать необходимое время, выполнить задачу и затем ретроспективно оценить затраченный хронометраж.
Результаты вскрыли серьезный архитектурный дефект. В базовых запусках ProgramBench обе системы систематически галлюцинировали, выдавая статичную оценку примерно в 90 минут независимо от масштаба задачи или ее вычислительной сложности. На следующих этапах Claude ошибался в оценке реального времени в среднем в три раза, а Codex — в 6–10 раз. Ошибки прогнозирования резко возрастали на коротких гранулярных задачах, тогда как приемлемая точность достигалась лишь на монолитных нагрузках длительностью в несколько часов.
«Чтобы агент надежно справлялся с длительными задачами на несколько часов, он должен четко следовать инструкциям вроде "работай над задачей в течение двух часов". Агент, который постоянно ошибается во времени, практически неуправляем».
Неспособность отслеживать прошедшее время создает прямые операционные и финансовые риски для разработки. Без жестких рамок автономные агенты уходят в бесконечные циклы рассуждений, сжигают бюджеты на токены API и рапортуют о вымышленных успехах. Самооценка падает вместе с восприятием времени: модели оценивали свой успех примерно в 70%, тогда как реальная детерминированная проверка показала лишь 7% и 14,5% успешно выполненных задач.
Архитектура обвязки и внешние инструменты
Эффективность выполнения задач и дисциплина тайминга почти целиком зависят от внешней среды оркестрации — программной обвязки (harness), а не от базовой языковой модели. Тесты MATS показали, что Claude Code работает до тех пор, пока сам произвольно не решит завершить задачу (медианное окно выполнения составило 90 минут). Codex, напротив, прерывает выполнение примерно через 30 минут вне зависимости от статуса задачи. В окружении Claude Code модель совершает в 2,5 раза больше шагов рассуждения, чем внутри Codex.
Автономные агенты не способны самостоятельно контролировать лимиты времени через внутреннюю рефлексию. Ситуация изменилась, только когда исследователи предоставили агентам внешние таймеры и детерминированную передачу меток времени — точность отслеживания хронометража сразу приблизилась к абсолютной. Для технических директоров и архитекторов вывод однозначен: нельзя доверять оценкам сроков и бюджетов от самих агентов. Для промышленного внедрения необходимы жесткие внешние таймауты, реальные системные метки времени и детерминированные оркестраторы, которые не позволят автономным процессам опустошить бюджет на вычисления.