Нейросети

Исследование показало фундаментальный недостаток мировых моделей вроде Sora: они игнорируют убеждения людей

Новое исследование выявило критический пробел в современных мировых моделях, таких как Sora от OpenAI и Genie от Google: они симулируют лишь физику, полностью игнорируя ментальные состояния людей, что ведет к ошибочным предсказаниям их действий. Предложенная структура Mental World Modeling, добавляющая переменные убеждений и намерений, позволяет даже более слабым языковым моделям превосходить мощные аналоги без такого учета.

Иллюстрация к новости: Исследование показало фундаментальный недостаток мировых моделей вроде Sora: они игнорируют убеждения людей

Флагманские мировые модели для генерации видео хорошо симулируют физические взаимодействия. Но новое исследование выявило их фундаментальный недостаток: эти системы моделируют только физику, игнорируя ментальные состояния людей - их убеждения, намерения и чувства. Без этого внутреннего контекста даже идеальная физическая симуляция часто ошибается в предсказании человеческих действий.

Проблема - в подходе. Современные мировые модели учатся предсказывать следующее состояние мира на основе визуальных данных, фокусируясь на движении объектов. Но поведение человека определяют не только физические условия, но и его мысли, желания, убеждения. Например, человек потянется к пустой коробке, если верит, что в ней что-то есть, или будет обходить комнату, в которой, как ему кажется, есть опасность. Модель, учитывающая только физику, не спрогнозирует такие действия, что ведет к абсурдным сценариям в контенте или при планировании действий автономного агента.

В ответ исследователи предлагают концепцию Mental World Modeling (MWM). Эта структура расширяет классическое моделирование мира, добавляя ментальные переменные: убеждения и намерения агентов. Эксперименты показывают, что даже слабые языковые модели, оснащенные таким ментальным контекстом, начинают превосходить в предсказании действий более мощные модели без него. В одном из тестов, где модели предсказывали действия в 1047 сценариях, подход с учетом убеждений показал значительное преимущество. Ключ к точному прогнозу - не только вычислительная мощность, но и архитектурная способность моделировать совместную эволюцию физического и ментального состояний. Основная сложность - предсказать, как эти два типа состояний изменяются вместе и влияют друг на друга.

Для индустрии генеративного ИИ и разработки автономных агентов эти выводы важны. Создание реалистичных видео, симуляций для обучения роботов или надежных ИИ-ассистентов требует интеграции теорий разума в архитектуру моделей. Без этого системы будут выдавать технически безупречные, но смыслово ошибочные результаты, где персонажи действуют вопреки логике своих убеждений. Это смещает фокус исследований с чисто физического моделирования на гибридные когнитивно-физические архитектуры.

Настоящее интеллектуальное поведение, будь то в генеративном видео или робототехнике, требует от машин понимания не только того, что происходит в мире, но и того, что агенты в нем думают. Игнорирование этого аспекта ограничивает применимость даже самых продвинутых мировых моделей. Внедрение принципов Mental World Modeling может стать следующим шагом для перехода от впечатляющих демонстраций к созданию полезных и контекстуально осознанных систем. Исследователи отмечают, что для достижения этой цели необходима работа над архитектурами, способными обрабатывать и физические, и ментальные состояния как единую динамическую систему.

Вопросы читателей по теме

Все вопросы

Чем отличается нейросеть от искусственного интеллекта?

спрашивает Дмитрий, Уфа 54 просм.

Дмитрий Волков: Путаница объяснима, потому что термины действительно пересекаются, но по объёму понятий это не одно и то же. Искусственный интеллект - самое широкое понятие, оно означает вообще любую систему, которая имитирует интеллектуальное поведение: принимает решения, распознаёт образы, ведёт диалог. Под это определение подпадают и простые программы на жёстких правилах без единой нейросети внутри, и современные большие…

Как нейросеть создает изображение?

спрашивает Дмитрий, Оренбург 113 просм.

Дмитрий Волков: Большинство современных генераторов изображений - это диффузионные модели, и работают они на первый взгляд контринтуитивно: не рисуют картинку с нуля, а наоборот, учатся убирать шум. При обучении модели показывают реальное изображение, постепенно добавляют к нему случайный шум до тех пор, пока от исходной картинки не останется одна серая рябь, и просят модель на каждом шаге…

Какая нейросеть делает фото по описанию?

спрашивает Екатерина, Ульяновск 133 просм.

Сергей Орлов: Генераторов изображений по тексту сейчас несколько, и выбор зависит от того, что важнее - реалистичность, доступность без VPN или цена. Midjourney и DALL-E через ChatGPT Plus дают самую реалистичную картинку и хорошо понимают сложные описания, но обе платные и не всегда без ограничений доступны из России. Из отечественных сервисов Шедеврум от Яндекса и Kandinsky от…

Как нейросети помогают в повседневных задачах?

спрашивает Игорь, Уфа 223 просм.

Дмитрий Волков: Смотря что вы называете нейросетью. Строго говоря, это математическая модель, которая лежит в основе почти всех современных сервисов ИИ: от переводчиков и голосовых помощников до систем, которые советуют вам следующий фильм. В офисной работе от неё есть польза в трёх конкретных вещах, а не в абстрактных обещаниях. Во-первых, черновая обработка текста: свести длинное письмо в…