Исследование показало фундаментальный недостаток мировых моделей вроде Sora: они игнорируют убеждения людей
Новое исследование выявило критический пробел в современных мировых моделях, таких как Sora от OpenAI и Genie от Google: они симулируют лишь физику, полностью игнорируя ментальные состояния людей, что ведет к ошибочным предсказаниям их действий. Предложенная структура Mental World Modeling, добавляющая переменные убеждений и намерений, позволяет даже более слабым языковым моделям превосходить мощные аналоги без такого учета.
Флагманские мировые модели для генерации видео хорошо симулируют физические взаимодействия. Но новое исследование выявило их фундаментальный недостаток: эти системы моделируют только физику, игнорируя ментальные состояния людей - их убеждения, намерения и чувства. Без этого внутреннего контекста даже идеальная физическая симуляция часто ошибается в предсказании человеческих действий.
Проблема - в подходе. Современные мировые модели учатся предсказывать следующее состояние мира на основе визуальных данных, фокусируясь на движении объектов. Но поведение человека определяют не только физические условия, но и его мысли, желания, убеждения. Например, человек потянется к пустой коробке, если верит, что в ней что-то есть, или будет обходить комнату, в которой, как ему кажется, есть опасность. Модель, учитывающая только физику, не спрогнозирует такие действия, что ведет к абсурдным сценариям в контенте или при планировании действий автономного агента.
В ответ исследователи предлагают концепцию Mental World Modeling (MWM). Эта структура расширяет классическое моделирование мира, добавляя ментальные переменные: убеждения и намерения агентов. Эксперименты показывают, что даже слабые языковые модели, оснащенные таким ментальным контекстом, начинают превосходить в предсказании действий более мощные модели без него. В одном из тестов, где модели предсказывали действия в 1047 сценариях, подход с учетом убеждений показал значительное преимущество. Ключ к точному прогнозу - не только вычислительная мощность, но и архитектурная способность моделировать совместную эволюцию физического и ментального состояний. Основная сложность - предсказать, как эти два типа состояний изменяются вместе и влияют друг на друга.
Для индустрии генеративного ИИ и разработки автономных агентов эти выводы важны. Создание реалистичных видео, симуляций для обучения роботов или надежных ИИ-ассистентов требует интеграции теорий разума в архитектуру моделей. Без этого системы будут выдавать технически безупречные, но смыслово ошибочные результаты, где персонажи действуют вопреки логике своих убеждений. Это смещает фокус исследований с чисто физического моделирования на гибридные когнитивно-физические архитектуры.
Настоящее интеллектуальное поведение, будь то в генеративном видео или робототехнике, требует от машин понимания не только того, что происходит в мире, но и того, что агенты в нем думают. Игнорирование этого аспекта ограничивает применимость даже самых продвинутых мировых моделей. Внедрение принципов Mental World Modeling может стать следующим шагом для перехода от впечатляющих демонстраций к созданию полезных и контекстуально осознанных систем. Исследователи отмечают, что для достижения этой цели необходима работа над архитектурами, способными обрабатывать и физические, и ментальные состояния как единую динамическую систему.


