Китайская Moonshot AI столкнулась с суровой реальностью: их флагманская модель Kimi K3 вдребезги разбилась о тесты на кибербезопасность. Совместное исследование британского AI Security Institute и американского Центра стандартов ИИ показало, что амбиции Пекина в автоматизации хакинга пока остаются лишь на бумаге. Пока американские тяжеловесы уверенно щелкают эксплойты, Kimi K3 демонстрирует беспомощность, граничащую с провалом.
Цифры говорят сами за себя: на бенчмарке ExploitBench модель набрала жалкие 32,2% против среднего показателя в 76,2% у передовых систем из США. Самое позорное — Kimi K3 не смогла добиться произвольного выполнения кода (ACE) ни в одном из 41 задания. В симуляции атаки на корпоративную сеть The Last Ones детище Moonshot AI застряло на 17-м шаге из 32, в то время как американские конкуренты в среднем доходят до 28,5. Даже полное отсутствие защитных барьеров не помогло: модель готова атаковать по первому требованию, но ей банально не хватает «мозгов» для реализации сложного многоступенчатого взлома. Из десяти попыток полностью пройти путь атаки Kimi K3 осилила лишь одну.
Такой разрыв в результатах — лучший аргумент в пользу теории о «дистилляции». Судя по всему, в Moonshot AI пошли по пути наименьшего сопротивления, тренируя свою нейросеть на ответах западных моделей. Проблема в том, что при копировании «поверхностный слой» диалоговой беглости сохраняется, но глубокая логика и техническая экспертиза испаряются первыми. В итоге мы имеем дело с типичной «пустышкой»: Kimi K3 может бойко поддерживать беседу, но пасует перед реальными инженерными задачами. Дистилляция оказалась коротким путем в тупик, где за красивым фасадом скрывается полная некомпетентность в наступательных кибероперациях.
Главное
Результативность Kimi K3 на тестах кибервзлома оказалась в два раза ниже, чем у американских аналогов.
Модель показала нулевую эффективность в задачах на произвольное выполнение кода (ACE).
Провал подтверждает гипотезу о неэффективности обучения нейросетей методом дистилляции для решения сложных технических задач.
«Глубокая логика и техническая экспертиза испаряются первыми при попытке копировать ответы западных моделей вместо полноценного обучения».