Разработчики ИИ, использующие передовые архитектуры рассуждений, столкнулись с необъявленным ограничением вычислительных мощностей на уровне инфраструктуры. По мере того как ресурсоемкие задачи по написанию кода стремительно растут в агентных средах, поставщики моделей упираются в жесткие лимиты доступности GPU и резкое удорожание юнит-экономики инференса. Вместо повышения цен на тарифные планы Anthropic, судя по всему, компенсирует нагрузку с помощью скрытых A/B-тестов, которые без предупреждения снижают глубину рассуждений активных моделей.

Скрытое урезание ресурсов вскрылось после того, как разработчик и системный аналитик под ником @argofowl в соцсети X задокументировал внезапное падение качества генерации кода. Деградация логики происходила исключительно на стороне сервера, а не в локальном клиентском интерфейсе, и затронула пользователей Claude Code версии 2.1.236 и последующих обновлений. Согласно телеметрии, собранной @argofowl, Anthropic включила активные сессии в недокументированный эксперимент, резко сокративший масштаб параметров глубины рассуждений при сохранении стандартных базовых показателей.

Скрытое сжатие параметров

Анализ механики процесса выявил агрессивное сокращение выделяемых вычислительных ресурсов под видом штатной работы сервиса. Начиная с версии Claude Code 2.1.237, бэкенд переназначил пороговые значения параметров глубины рассуждений, не упомянув об этом в официальном списке изменений ни единым словом.

Как отметил разработчик @argofowl, обнаруживший подмену параметров:

«Начиная с версии 2.1.237 модель воспринимает уровень усилий "high" как 10 из 100 — именно столько раньше соответствовало значению "low", и в списке изменений об этом ни слова»

Подобная скрытая оптимизация вынудила технические команды тратить часы на поиск несуществующих проблем в локальных конфигурациях из-за ложного предположения о сбое клиентских инструментов. Запустив это негласное ухудшение в формате непрозрачного A/B-тестирования, Anthropic включила выбранные учетные записи в экспериментальную группу, где максимальный уровень рассуждений давал лишь минимальный базовый объем вычислений.

Риски надежности для конвейеров разработки

Негласные серверные корректировки вносят критическую непредсказуемость в корпоративные инженерные конвейеры. Когда инфраструктурный провайдер тихо пересматривает внутренние лимиты на вычисления для логических рассуждений, критически важные автономные агенты выходят из строя, синтетические бенчмарки теряют смысл, а многоэтапные рабочие процессы ломаются без явных ошибок. Пользователь X под ником Synoros емко охарактеризовал эту нестабильность: «Как работать с компанией, которая меняет продукт прямо у вас под ногами?»

Для технических лидеров компаний это необъявленное нормирование вычислений подчеркивает острую необходимость строгого аудита токенов рассуждений на уровне API-шлюза. Когда поставщики отдают приоритет скрытой оптимизации маржинальности в ущерб предсказуемости бюджетов на инференс, промышленные системы больше не могут полагаться на непрозрачные обещания платформ.

AnthropicБольшие языковые моделиИИ-агентыИИ-инструментыОблачные вычисления