Передовые большие языковые модели успешно справляются со сложными многоэтапными рассуждениями в тестах вроде MATH и GSM8K, однако стабильно спотыкаются на школьной арифметике. Масштабное исследование группы ученых под руководством Аосиня Ни из Университета Китайской академии наук вскрывает неудобную правду: флагманские архитектуры регулярно галлюцинируют при сложении многозначных чисел, сравнении величин, вычислении дробей и обработке экспоненциальной записи чисел.

Корень проблемы носит структурный характер и не решается простым увеличением масштаба. Авторегрессионные трансформеры воспринимают числа как семантические фрагменты текста, а не как дискретные математические сущности. Токенизация на основе байтовых пар (BPE) произвольно разбивает цифры на части, тогда как позиционное кодирование не сохраняет пространственное выравнивание разрядов, необходимое для многозначных вычислений. Новые архитектурные решения, эффективные при обучении с нуля — например, обратный порядок байтов (Little-Endian) или позиционные эмбеддинги Abacus, — оказываются бесполезными при попытке внедрить их поверх готовых предобученных базовых моделей.

Для технических лидеров и финтех-команд использование авторегрессионной модели в качестве автономного калькулятора в количественных пайплайнах гарантированно приведет к операционному сбою. Прямая донастройка весов не способна устранить фундаментальные ограничения токенизации. Корпоративная точность расчетов требует детерминированного вызова внешних инструментов, интерпретаторов кода и гибридных вычислительных надстроек на этапе инференса.

Большие языковые моделиИскусственный интеллектМашинное обучениеИИ в финансахДообучение моделей