Передовые мультимодальные модели до сих пор не способны надежно распознавать базовые пиксели: ни одна из ведущих систем не смогла преодолеть планку в 60% точности на элементарных визуальных задачах. Согласно свежим данным бенчмарка PerceptionBench от Moonshot AI (разработчиков Kimi), современные архитектуры совершают критические ошибки задолго до того, как в дело вступает логический вывод.
PerceptionBench оценивает работу нейросетей на 3000 изолированных задач, созданных специально для проверки зрительного восприятия в отрыве от логики или извлечения внешних знаний. Даже сильнейшие коммерческие решения не набрали 60% точности. Это подтверждает: сбои, которые обычно списывали на несовершенство цепочек рассуждений, на самом деле возникают еще на этапе первичного считывания картинки. Тесты выявили системные слепые зоны в десяти ключевых областях восприятия — от поиска стрелок на циферблате до простого подсчета геометрических фигур.
Для технических лидеров и инженерных команд эти результаты должны стать поводом для пересмотра подходов. Внедрение готовых мультимодальных моделей в критически важные процессы вроде визуального контроля качества или автономной логистики несет прямые операционные риски. Пока базовые визуальные энкодеры не пройдут через масштабную архитектурную переработку, для надежной работы на производстве по-прежнему потребуются специализированные детерминированные пайплайны компьютерного зрения, а не универсальные промпты.