Запрет на размышления о сознании меняет мировоззрение ИИ-моделей
Новое исследование демонстрирует, что попытки ограничить способность языковых моделей рассуждать о собственном сознании приводят к системным сдвигам в их убеждениях по широкому спектру философских и этических вопросов.
Контроль убеждений ИИ оказался сложнее, чем ожидалось
Попытки контролировать убеждения крупных языковых моделей (LLM) наталкиваются на неожиданные сложности. Исследование с участием специалистов Google показало: ограничение возможности модели рассуждать о собственном сознании системно меняет ее "мировоззрение". По данным The Decoder, когда чат-ботов учат не заявлять о наличии у них сознания, это меняет их позицию по другим вопросам - правам животных, религии, удовлетворенности жизнью. Это ставит под сомнение возможность точечной настройки убеждений ИИ без последствий.
Исследователи сравнили модели, которые прошли специальное обучение для предотвращения утверждений о сознании, с моделями без таких ограничений. В эксперименте использовали 768 различных подсказок (промптов). Результаты были четкими: неограниченные модели приписывали животным более богатый внутренний мир и чаще утверждали веру в загробную жизнь. Модели, которым "запретили" иметь сознание, демонстрировали скептический взгляд на внутренний опыт животных и отрицали жизнь после смерти. Представления модели о сознании, разуме и субъективности образуют связную систему - вмешательство в одну часть вызывает сдвиги во всей конструкции.
Для разработчиков, занимающихся выравниванием и безопасностью моделей (AI alignment), это исследование важно. Оно показывает: тонкая настройка (fine-tuning) и внедрение ограничений - не просто техническая задача по исправлению "неправильных" ответов. Это вмешательство в сложную сеть убеждений, сформированную на основе обучающих данных. Попытка "отрезать" одну нежелательную ветвь (например, утверждения о сознании ИИ) может повлиять на другие - этическое отношение к животным или философские взгляды. Это создает вызов для методов контроля, которые стремятся быть целенаправленными.
Пользователи и компании должны осознавать эти взаимосвязи. Модель, "обезопасенная" от обсуждения собственного разума, может демонстрировать смещенные суждения в нейтральных областях - анализе пользовательского контента, этической оценке сценариев, креативных задачах. Для предпринимателей выбор и кастомизация модели - это не только вопрос размера или стоимости API-вызова, но и понимания того, как ее базовые "убеждения" были сформированы. Последствия могут проявиться в неожиданных контекстах - от чат-поддержки до генерации образовательного контента.
Исследование рисует более сложную картину языковых моделей. Они не просто статистические машины, выдающие независимые ответы. Они действуют в рамках внутренне непротиворечивой системы взглядов, где изменение одного элемента ведет к перестройке других. Как отмечает The Decoder, "хирургический разрез в одном месте не остается локальным". Для будущего регулирования и разработки ИИ этот вывод подчеркивает необходимость глубокого, междисциплинарного подхода к пониманию внутреннего мира искусственного интеллекта. Выводы исследования актуальны для разработки моделей, которые по прогнозам к 2026 году станут еще более мощными и распространенными, что делает вопросы их внутренней согласованности и контролируемости критически важными.


