Постобучающее квантование остается базовым методом оптимизации для сжатия нейросетей под периферийные устройства. В сетях прямого распространения округление весов и активаций порождает лишь ограниченный, локализованный шум. Однако в рекуррентных нейросетях (RNN) эта логика дает сбой: внутреннее состояние постоянно перезаписывается и передается на последующие шаги вывода. Когда стандартные алгоритмы сжатия обрабатывают эти временные состояния, округление перестает быть пассивным шумом и начинает критически искажать вычислительную траекторию модели на длинных последовательностях.

Разрушение временных обновлений

В исследовании Политехнического института Ренсселера ученые Исмаил Эрбас, Ксавье Интес и Викас Пандей системно выделили процесс перезаписи рекуррентного состояния — алгоритмическое правило, применяемое для дискретизации и сохранения памяти между шагами — и показали, как он искажает последовательный вывод. Тестируя компактный энкодер-декодер GRU для визуализации времени жизни флуоресценции в условиях сильного шума, команда оценила погрешность расчета биологических констант затухания τ1 и τ2.

При неизменных весах модели замена вычислений с полной точностью на детерминированное 4-битное сохранение состояния привела к росту ошибки оценки примерно в 70 раз для τ1 и почти в 300 раз для τ2.

Сбой происходит тогда, когда регулярные малые обновления не достигают порога записи: сохраненное состояние остается практически статичным, хотя сеть продолжает рассчитывать изменения.

Поскольку рекуррентное состояние работает как динамический накопитель, грубое квантование становится непреодолимым барьером. Когда тонкие временные сдвиги оказываются ниже порога округления, значение состояния перестает инкрементироваться. Траектория состояния замирает, фактически стирая контекст последовательности, несмотря на продолжающиеся вычисления сети.

Динамика разрядности и архитектурные особенности

Исследование показало, что надежность рекуррентных сетей не масштабируется линейно вместе с разрядностью: при определенных условиях перезаписи произвольное увеличение точности состояния лишь усиливало дрейф и ухудшало результат. Точность удалось вернуть без повторного обучения — за счет внедрения механизмов обратной связи по ошибке, накопления остатков или сохранения направления для переноса подпороговых изменений между шагами.

Авторы подтвердили идентичные сценарии отказов на независимо обученных архитектурах LSTM. Грубая перезапись приводила к такому же замораживанию траектории, а покомпонентный анализ показал, что состояния ячеек LSTM значительно более чувствительны к дрейфу квантования, чем скрытые состояния.

Для инженеров, развертывающих потоковые модели на периферии, вывод однозначен: рекуррентные состояния нельзя рассматривать как статические тензоры активаций. Простое квантование моделей с памятью без динамической компенсации ошибок неизбежно приводит к деградации контекста при длительной работе.

НейросетиМашинное обучениеЛокальный ИИAI-чипы