Постоянные автономные агенты работают часами над сложными задачами — от рефакторинга кодовых баз до создания качественных документов и презентаций. Поскольку эти системы выполняют последовательность запросов к API, которые надстраиваются друг над другом, часто перенося из предыдущих шагов те же инструкции, определения инструментов и контекст, избыточная обработка токенов быстро ухудшает время отклика и увеличивает счета за API. 22 сентября 2026 года компания OpenAI запустила усовершенствованную систему кэширования промптов в семействе моделей GPT-6, чтобы по умолчанию обеспечить более высокие показатели попадания в кэш и снизить вычислительные накладные расходы.
Изменение юнит-экономики автономного контекста
Чтобы сделать долгосрочное выполнение многошаговых задач практичным, OpenAI предоставляет скидки на кэширование для подходящих общих префиксов, повторно используемых в течение 30-минутного окна, предлагая разработчикам скидки до 90% на кэшированные входные токен-данные. Эта модель ценообразования напрямую меняет экономику фонового запуска агентов, гарантируя, что идентичные префиксы контекста тарифицируются по цене ниже стандартной во время повторяющихся циклов выполнения.
Масштабные внедрения показывают, как кэширование меняет требования к инфраструктуре для корпоративных рабочих нагрузок. Как заявил Марио Родригес, директор по продуктам:
"Кэширование промптов от OpenAI играет важнейшую роль в обеспечении быстрой и эффективной работы GitHub Copilot в масштабом режиме. За последние несколько месяцев мы сократили более чем на 50% долю токенов промптов, требующих свежей обработки при миллиардах запросов к моделям OpenAI, по сравнению с нашим предыдущим базовым уровнем. Результатом стал более эффективный стек инференса и сокращение времени до получения первого отклика для разработчиков".
Родригес отметил, что GitHub Copilot добился этих результатов на миллиардах запросов, повысив эффективность стека инференса и сократив время до первого отклика.
Инструменты диагностики и механика инвалидации кэша
Мелкие детали реализации при вызове инструментов и составлении промптов могут нарушить сопоставление префиксов в длинных цепочках агентских циклов. Чтобы бороться со скрытыми промахами кэша, компания OpenAI представила новую панель управления кэшированием промптов (Prompt Caching Dashboard) для оценки кэшированных и некэшированных токенов, а также диагностический инструмент, который определяет, привели ли настройки модели, схемы инструментов или входные данные промпта к инвалидации кэша.
Незначительные изменения показателей попадания в кэш приводят к существенному снижению затрат в производственных средах. Проведите аудит конвейеров многошаговых агентов на предмет переменных префиксов в определениях инструментов.