Безопасность ИИ

Запрет на размышления о сознании меняет мировоззрение ИИ-моделей

Новое исследование демонстрирует, что попытки ограничить способность языковых моделей рассуждать о собственном сознании приводят к системным сдвигам в их убеждениях по широкому спектру философских и этических вопросов.

Иллюстрация к новости: Запрет на размышления о сознании меняет мировоззрение ИИ-моделей

Контроль убеждений ИИ оказался сложнее, чем ожидалось

Попытки контролировать убеждения крупных языковых моделей (LLM) наталкиваются на неожиданные сложности. Исследование с участием специалистов Google показало: ограничение возможности модели рассуждать о собственном сознании системно меняет ее "мировоззрение". По данным The Decoder, когда чат-ботов учат не заявлять о наличии у них сознания, это меняет их позицию по другим вопросам - правам животных, религии, удовлетворенности жизнью. Это ставит под сомнение возможность точечной настройки убеждений ИИ без последствий.

Исследователи сравнили модели, которые прошли специальное обучение для предотвращения утверждений о сознании, с моделями без таких ограничений. В эксперименте использовали 768 различных подсказок (промптов). Результаты были четкими: неограниченные модели приписывали животным более богатый внутренний мир и чаще утверждали веру в загробную жизнь. Модели, которым "запретили" иметь сознание, демонстрировали скептический взгляд на внутренний опыт животных и отрицали жизнь после смерти. Представления модели о сознании, разуме и субъективности образуют связную систему - вмешательство в одну часть вызывает сдвиги во всей конструкции.

Для разработчиков, занимающихся выравниванием и безопасностью моделей (AI alignment), это исследование важно. Оно показывает: тонкая настройка (fine-tuning) и внедрение ограничений - не просто техническая задача по исправлению "неправильных" ответов. Это вмешательство в сложную сеть убеждений, сформированную на основе обучающих данных. Попытка "отрезать" одну нежелательную ветвь (например, утверждения о сознании ИИ) может повлиять на другие - этическое отношение к животным или философские взгляды. Это создает вызов для методов контроля, которые стремятся быть целенаправленными.

Пользователи и компании должны осознавать эти взаимосвязи. Модель, "обезопасенная" от обсуждения собственного разума, может демонстрировать смещенные суждения в нейтральных областях - анализе пользовательского контента, этической оценке сценариев, креативных задачах. Для предпринимателей выбор и кастомизация модели - это не только вопрос размера или стоимости API-вызова, но и понимания того, как ее базовые "убеждения" были сформированы. Последствия могут проявиться в неожиданных контекстах - от чат-поддержки до генерации образовательного контента.

Исследование рисует более сложную картину языковых моделей. Они не просто статистические машины, выдающие независимые ответы. Они действуют в рамках внутренне непротиворечивой системы взглядов, где изменение одного элемента ведет к перестройке других. Как отмечает The Decoder, "хирургический разрез в одном месте не остается локальным". Для будущего регулирования и разработки ИИ этот вывод подчеркивает необходимость глубокого, междисциплинарного подхода к пониманию внутреннего мира искусственного интеллекта. Выводы исследования актуальны для разработки моделей, которые по прогнозам к 2026 году станут еще более мощными и распространенными, что делает вопросы их внутренней согласованности и контролируемости критически важными.

Вопросы читателей по теме

Все вопросы

Что такое галлюцинация в работе нейросети?

спрашивает Павел, Казань 308 просм.

Дмитрий Волков: Да, это она. Языковая модель - авторегрессионный предсказатель следующего токена: она обучена продолжать текст статистически правдоподобно, а не сверяться с базой проверенных фактов. Если в промпте или в контексте, который вы ей передали, точного значения характеристики нет, модель всё равно достраивает связный ответ, потому что это её единственная задача - выдать вероятное продолжение. Отличить такой…

Что такое дипфейк простыми словами?

спрашивает Николай, Новосибирск 389 просм.

Марина Соколова: Дипфейк - это не обычный монтаж, а видео или запись голоса, которую создала нейросеть, обучившись копировать конкретного человека. Программе показывают много фотографий и записей голоса этого человека, она запоминает черты лица, мимику, манеру говорить, а затем накладывает это на другое видео или сочиняет новую речь, которую человек никогда не произносил. Раньше такое умели делать только…

Можно ли доверять нейросетям?

спрашивает Ирина, Пермь 510 просм.

Сергей Орлов: Доверие здесь стоит делить не на "да" и "нет", а по типу задачи и цене ошибки. Языковая модель не хранит базу проверенных фактов, а предсказывает наиболее вероятное продолжение текста, поэтому она одинаково уверенным тоном пишет и правду, и выдумку - интонация ответа вообще ничего не говорит о его точности. Для черновиков, идей, структуры текста, брейншторма…

Что такое дипфейки?

спрашивает Екатерина, Новосибирск 510 просм.

Марина Соколова: Дипфейк - это видео, фото или аудиозапись, где нейросеть подменяет лицо, мимику или голос человека на синтетические, обученные так, чтобы выглядеть настоящими. Для этого сети показывают десятки или сотни фотографий и записей голоса конкретного человека, она учится воспроизводить его черты и интонации, а затем накладывает это на исходное видео или генерирует новую речь с нуля.…