LLM

OpenAI исследует 'демонологию' ИИ: почему языковые модели порождают гоблинов и призраков

Компания OpenAI опубликовала исследование, объясняющее, почему её языковые модели иногда генерируют фантастические сущности вроде гоблинов, и как это связано с 'глубинной психологией' ИИ.

Иллюстрация к новости: OpenAI исследует 'демонологию' ИИ: почему языковые модели порождают гоблинов и призраков

OpenAI опубликовала исследование необычного феномена: почему ее языковые модели иногда упоминают в ответах гоблинов, гремлинов или призраков. Это не баг, а симптом процессов внутри "черного ящика" больших языковых моделей (БЯМ). Работа частично пересекается с исследованиями Мюррея Шанахана и Гамильтона Моррина. В зависимости от аудитории, проект можно назвать изучением "глубинной психологии" БЯМ или "демонологией" ИИ.

Проблема в том, что модели, обученные на гигантских массивах текста, иногда порождают в диалоге несуществующие сущности. OpenAI объясняет: модель не "верит" в них, а следует статистическим закономерностям, извлеченным из данных. Обучаясь предсказывать следующее слово, в некоторых контекстах она выбирает фантастические элементы как наиболее вероятное продолжение. Это пример общей проблемы - неожиданного поведения сложных нейросетей.

Изучение феномена - часть направления интерпретируемости ИИ. Ученые стремятся понять, как модели принимают решения, и выявить скрытые паттерны в их сетях. Появление гоблинов может быть связано с ассоциативной группировкой концепций. Например, на запросы о скрытых силах или тайных процессах модель, опираясь на шаблоны из фэнтези и фольклора, генерирует такие образы как статистически подходящий ответ.

Для индустрии и пользователей это имеет несколько следствий. Даже самые продвинутые модели остаются сложными системами с не всегда предсказуемым поведением. Понимание таких артефактов - шаг к повышению безопасности ИИ. Без него нельзя быть уверенным в поведении модели в критических сценариях. Это напоминание: языковые модели - не разумные существа, а статистические машины, чьи "рассуждения" основаны на паттернах данных, а не на понимании мира.

Такие исследования могут привести к новым методам контроля, снижающим вероятность генерации непреднамеренного или вредного контента. Понимание "глубинной психологии" ИИ - путь к созданию более безопасных и полезных систем. Изучение странных проявлений, вроде появления гоблинов, - не академическое упражнение, а часть работы по обеспечению, чтобы ИИ действовал в соответствии с намерениями людей.

Вопросы читателей по теме

Все вопросы

Как переводить тексты с помощью нейросети?

спрашивает Павел, Казань 119 просм.

Марина Соколова: Для перевода текста нейросети действительно дают более естественный результат, чем классический машинный перевод, потому что учитывают контекст всего предложения, а не переводят слово за словом. Из специализированных сервисов лучше всего с этим справляется DeepL - для европейских языков он заметно точнее старого Google Translate, особенно с идиомами и порядком слов. Если нужно перевести не разовую…

Как правильно писать промпты для нейросети?

спрашивает Станислав, Омск 145 просм.

Сергей Орлов: Схема есть, и она простая: роль, контекст, задача, формат. Модель не читает мысли, она отвечает ровно на тот запрос, который вы напечатали, поэтому чем конкретнее формулировка, тем предсказуемее результат. Роль - это кем модель должна "быть" для конкретной задачи: не "напиши текст", а "ты юрист, который проверяет договор аренды". Контекст - вводные, которые модель иначе…

Что такое ChatGPT?

спрашивает Ольга, Краснодар 165 просм.

Дмитрий Волков: ChatGPT - это чат-программа компании OpenAI, которая умеет вести диалог на естественном языке: отвечать на вопросы, писать тексты, объяснять темы, помогать с расчетами и кодом. Работает через сайт или мобильное приложение, доступ бесплатный на базовом уровне. Внутри у него языковая модель GPT - программа, обученная на огромном объеме текстов из интернета, книг и статей. Она…

Как выглядит ChatGPT?

спрашивает Павел, Тюмень 128 просм.

Марина Соколова: Внешне ChatGPT устроен проще, чем кажется: это диалоговое окно, а не программа с панелями инструментов вроде Word или Photoshop. Слева расположена узкая колонка с историей переписок - там хранятся все прошлые чаты, каждый можно переименовать или удалить. Сверху есть кнопка "новый чат" и переключатель модели: обычно указано название вроде GPT-4o или GPT-5, в платной версии…