Автономные ИИ-системы долгое время опирались на физические модели мира как на золотой стандарт прогнозирования динамики среды. Базовые архитектуры почти полностью сфокусированы на отслеживании объектов, координат траекторий, векторов движения и визуального перекрытия. Однако недавнее исследование фреймворка MENTIS показало: передовые архитектуры — включая генераторы видео и предиктивные модели вроде Sora, Genie и вариаций JEPA — регулярно ошибаются в прогнозировании действий людей, поскольку их пространство состояний игнорирует убеждения, намерения и социальный контекст.

Пределы чисто физической симуляции

Исключительно физические модели мира дают сбой в тот момент, когда попадают в общее с людьми пространство — будь то ячейка с промышленным коботом, логистический склад или клинический процесс. Рассмотрим сценарий с ложным убеждением: если инструмент рабочего переложили на полку, пока тот стоял спиной, физическая модель безупречно зафиксирует истинные координаты, но не сможет предугадать, куда рабочий на самом деле потянется рукой. Чтобы прогнозировать поведение человека, необходимо моделировать его представления об окружающей среде, а не только фактическое положение материи.

«Существующие модели мира, такие как Sora, Genie 3, JEPA и Marble, моделируют только физический уровень реальности: объекты, координаты, движение и перекрытия. То, во что верят люди, чего они хотят или что считают социально приемлемым, никогда не попадает в пространство состояний этих систем».

Чтобы устранить этот разрыв, фреймворк Mental World Modeling разделяет наблюдаемые взаимодействия на два компонента: физический носитель (речь, указание жестом, захват) и ментальное содержание (утешение, обман, помощь или отказ). Движение детали по верстаку может означать передачу, отбраковку или случайное смещение. Фреймворк учитывает такие пограничные случаи, связывая физические переменные со скрытыми ментальными состояниями — убеждениями, вниманием, целями и корпоративными регламентами. При этом действия оцениваются с эгоцентрической точки зрения агента с неполным обзором, а не исходя из предположения о всеведении.

Архитектура и результаты тестов

Исследователи подтвердили эффективность подхода с помощью MENTIS — модульной эталонной реализации, не требующей дополнительного обучения. Система принимает эгоцентрический обзор сцены, разделяет возможные действия на физические и ментальные составляющие, параллельно симулирует контрфактические состояния и оценивает траектории по строгой триаде критериев: физическая правдоподобность, ментальная непротиворечивость и социальная приемлемость. Важное преимущество для внедрения на регулируемых предприятиях: каждый этап формирует структурированные графы состояний, что обеспечивает полную проверяемость без необоснованных спекуляций о сознании машины.

Для технических лидеров, внедряющих автономных агентов и коботов в человекоориентированные процессы, вывод однозначен: одной визуальной симуляции недостаточно для безопасной совместной работы. Без встроенной оценки ментальных состояний автономные агенты останутся источником повышенной опасности в общих рабочих зонах.

Искусственный интеллектРоботизацияИИ-агентыБезопасность ИИКомпьютерное зрение