Выделение дополнительных вычислительных ресурсов на этапе инференса стало стандартным инженерным приемом для получения более качественных результатов от больших языковых моделей на бенчмарках с мгновенной обратной оценкой, таких как написание кода и математика. Однако применение внутренних бюджетов на рассуждения к зашумленным финансовым рынкам сталкивается с суровой реальностью, где успех измеряется исключительно после учета реальных издержек на проведение сделок. В препринте под названием «Цена мысли: окупаются ли рассуждения на этапе инференса в трейдинге с помощью LLM?» Джиаи Чен и Гуилинг Ван из кафедры компьютерных наук Технологического института Нью-Джерси оценили, действительно ли увеличение усилий на рассуждения внутри фиксированного торгового конвейера позволяет создавать более эффективные портфели.
Контролируемая среда бэктестинга
Чтобы изолировать прямое экономическое влияние дополнительных токенов инференса, исследователи зафиксировали доступность информации, промпты, требуемые форматы вывода и правила формирования портфеля во всех тестовых прогонах. В исследовании отслеживались репрезентативные модели из трех заранее определенных семейств — DeepSeek, GPT и Gemini. В течение каждого торгового дня каждая модель ранжировала одни и те же акции при трех различных условиях ввода: числовые данные, идентифицируемые новости и замаскированные новости.
"Во всех трех семействах моделей дополнительные рассуждения не приводят к надежному улучшению чистой доходности портфеля."
В общей сложности бенчмарк обработал более 800 000 прогнозов активов наряду с многократными генерациями для проверки стохастической дисперсии. Экспериментальный дизайн установил базовый уровень рассуждений равным нулю для DeepSeek и GPT, в то время как для Gemini был установлен минимальный уровень рассуждений, поскольку архитектура ее API не может гарантировать полное отключение внутренних циклов мышления.
Немонотонный прирост и нестабильность отбора
Грубо говоря, направление дополнительных вычислительных мощностей на решение проблемы не приводит к пропорциональной финансовой выгоде. Во всех трех семействах моделей дополнительные рассуждения не смогли обеспечить надежный прирост чистой доходности портфеля после учета реальных транзакционных издержек. Для модели DeepSeek, где авторы оценили всю траекторию от отсутствия рассуждений до максимальных рассуждений, производительность оказалась разочаровывающе немонотонной, а не стабильно улучшающейся.
Кроме того, многократные генерации привели к нестабильным эффектам обработки и перетасовке выбора активов в портфеле, даже когда общие оценки моделей казались стабильными. Хотя рассуждения на этапе инференса заметно изменяли внутренние оценки акций, паттерны неудач и счета за операционные токены, эти теоретические сдвиги регулярно растворялись в момент отражения расходов на исполнение в бухгалтерской отчетности.
Это выглядит как отрезвляющая проверка реальности для количественных фондов. Полученные данные показывают, что затраты дополнительных вычислительных ресурсов на этапе инференса меняют траектории принятия решений без гарантии измеримой экономической ценности в зашумленных доменах. Поскольку эффективность торговли ухудшается из-за стохастических генераций и транзакционных издержек, инженерные команды не могут просто предполагать, что прирост производительности моделей на бенчмарках автоматически перенесется на реальные финансовые конвейеры. Валидация рассуждений на этапе инференса на основе доменно-специфичных метрик исполнения остается абсолютным требованием перед выделением серьезных вычислительных бюджетов в продакшн.