Пока стандартные бенчмарки оценивали лишь то, насколько поверхностная уверенность больших языковых моделей совпадает с реальной вероятностью, фундаментальный архитектурный вопрос оставался без ответа: используют ли нейросети внутренние сигналы неопределенности для управления собственным поведением? В биологических системах внутренняя оценка уверенности регулирует адаптивное поведение — побуждая собрать больше данных или вовсе отказаться от действия. Исследование в Nature Machine Intelligence предоставило причинно-следственные доказательства: LLM опираются на внутренние репрезентации уверенности, решая, отвечать на запрос или промолчать.
Четырехфазный эксперимент
Чтобы перейти от наблюдений к изоляции механизмов, исследователи выстроили четырехфазный эксперимент. Первая фаза зафиксировала базовые метрики уверенности без возможности отказа от ответа: отслеживались как логарифмы вероятностей токенов (log-probs), так и вербализованная уверенность через прямые запросы к модели.
Вторая фаза добавила явную опцию отказа. Выяснилось, что модели применяют неявный порог к своим внутренним состояниям уверенности перед генерацией ответа. Влияние внутренней уверенности на решение промолчать оказалось примерно на порядок сильнее любых альтернативных поведенческих механизмов.
«Третья фаза доказала причинно-следственную связь через управление активациями: искусственное усиление или подавление уверенности напрямую снижало или увеличивало частоту отказов от ответа»
Прямое воздействие на внутренние активации подтвердило причинность, а не просто корреляцию. Медиационный анализ показал, что именно перераспределение внутренней уверенности определяет готовность модели выдать результат.
Многомерные скрытые репрезентации и контроль
В рамках четвертой фазы ученые протестировали программное управление, задавая моделям произвольные пользовательские пороги уверенности для отказа от ответа. Архитектуры динамически адаптировались, подтвердив способность считывать внутренние состояния и следовать гибким политикам валидации.
Декодирование активаций показало, что стандартные метрики вроде вероятностей токенов и текстовых самоотчетов — лишь неполный срез более богатой внутренней структуры. Хотя вербализованная уверенность хуже отражала фактическую точность, она безошибочно предсказывала решение модели промолчать во всех протестированных архитектурах.
Что это меняет для бизнеса
Доказательство того, что отказ модели от ответа опирается на многомерные внутренние состояния, полностью меняет подход к борьбе с галлюцинациями в критических корпоративных процессах — от комплаенс-контроля и алгоритмического трейдинга до медицинской триады. Вместо расхода вычислительных ресурсов на дорогие мультиагентные консенсусы или хрупкие промпт-проверки инженеры могут напрямую обращаться к латентным векторам уверенности для нативной фильтрации за доли миллисекунды. При переходе к автономным ИИ-агентам с правом принятия решений прямой доступ к метакогнитивным сигналам дает детерминированный и экономный контроль над критическими сбоями.