Эпоха гадания на кофейной гуще нейросетей подходит к концу: концепция Kolmogorov–Arnold Networks (KAN) бросает вызов традиционному непрозрачному обучению. Исследователи Фелиппе Алвес и Ренато Висенте из Университета Сан-Паулу и TELUS Digital Research Hub в своей работе детально разобрали фундаментальный архитектурный сдвиг. Вместо застывших функций активации в узлах стандартных перцептронов (MLP), KAN используют обучаемые одномерные функции непосредственно на ребрах графа. Для технических директоров, работающих с Edge AI, это не просто замена одного блока на другой, а переход к по-настоящему аудируемому интерфейсу, где внутренние вычисления можно декомпозировать и буквально «прочитать».

Аудит 884 736 функций ребер

Главный аргумент в пользу KAN — беспрецедентная прозрачность на масштабе моделей в 10 млн параметров. В шестислойной архитектуре на базе B-сплайнов исследователям удалось восстановить все 884 736 функций ребер. Данные показывают хирургическую точность: 87,8% этих функций преодолевают порог нелинейности, в то время как лишь 0,4% остаются балластом. Такая детализация позволяет проводить прунинг не «вслепую», а осознанно. Выяснилось, что до 25% наименее активных ребер можно удалить без ощутимого роста потерь на валидации — результат, оставляющий случайное отсечение далеко позади.

KAN предоставляют практичный и переносимый между корпусами интерфейс аудита для скалярных преобразований в малых языковых моделях.

Эта функциональная прозрачность доказывает, что проблема «черного ящика» — не физический закон, а побочный эффект выбранной когда-то архитектуры. Впрочем, авторы добавляют порцию скепсиса: структурированный прунинг нейронов в обычных MLP дает сопоставимую разреженность. Хотя KAN и позволяют визуализировать логику, само по себе изящное сокращение весов не является их эксклюзивной привилегией. Более того, четкие аналитические выводы и аппроксимации в закрытой форме пока остаются особенностью моделей малой емкости, и их масштабируемость на гигантские системы под большим вопросом.

Паритет производительности и границы масштабирования

Как только мы переходим от интерпретируемости к «грубой силе», семейство KAN — включая групповые функции Чебышева и рациональные GR-KAN — сталкивается с суровой реальностью. В тестах BabyLM эти модели лишь незначительно обошли стандартные MLP с активацией GELU. Однако на zero-shot бенчмарках преимущество испарилось. Точность на десятках тысяч тестов BLiMP замерла в диапазоне 62,4–63,1%. Исследователи констатировали: кросс-энтропия на валидации больше не является надежным предиктором качества, и в ряде сценариев классические MLP даже вырывались вперед.

Протестированные варианты KAN не демонстрируют стабильного преимущества над сильными MLP-базлайнами ни в качестве, по результатам бенчмарков, ни в задержках (latency).

Для тех, кто планирует заменить MLP на KAN в продакшене, есть повод для осторожности. Модель MLPEdge проиграла на Wikitext-103, а прогон GR-KAN на 286 млн параметров не смог дотянуться до показателей SwiGLU. Сложность B-сплайнов создает классический трейд-офф: вы получаете математическое окно в «душу» модели, но не обязательно получаете более быстрый или точный движок. KAN — это в первую очередь инструмент глубокого аудита и научных открытий, позволяющий верифицировать логику малых моделей с почти полной видимостью. Для бизнеса это не «серебряная пуля» производительности, а способ застраховаться в критических узлах, где понимание того, почему модель приняла решение, стоит дороже, чем лишняя миллисекунда скорости инференса.

Машинное обучениеНейросетиПроизводительностьKAN