OpenAI исследует 'демонологию' ИИ: почему языковые модели порождают гоблинов и призраков
Компания OpenAI опубликовала исследование, объясняющее, почему её языковые модели иногда генерируют фантастические сущности вроде гоблинов, и как это связано с 'глубинной психологией' ИИ.
OpenAI опубликовала исследование необычного феномена: почему ее языковые модели иногда упоминают в ответах гоблинов, гремлинов или призраков. Это не баг, а симптом процессов внутри "черного ящика" больших языковых моделей (БЯМ). Работа частично пересекается с исследованиями Мюррея Шанахана и Гамильтона Моррина. В зависимости от аудитории, проект можно назвать изучением "глубинной психологии" БЯМ или "демонологией" ИИ.
Проблема в том, что модели, обученные на гигантских массивах текста, иногда порождают в диалоге несуществующие сущности. OpenAI объясняет: модель не "верит" в них, а следует статистическим закономерностям, извлеченным из данных. Обучаясь предсказывать следующее слово, в некоторых контекстах она выбирает фантастические элементы как наиболее вероятное продолжение. Это пример общей проблемы - неожиданного поведения сложных нейросетей.
Изучение феномена - часть направления интерпретируемости ИИ. Ученые стремятся понять, как модели принимают решения, и выявить скрытые паттерны в их сетях. Появление гоблинов может быть связано с ассоциативной группировкой концепций. Например, на запросы о скрытых силах или тайных процессах модель, опираясь на шаблоны из фэнтези и фольклора, генерирует такие образы как статистически подходящий ответ.
Для индустрии и пользователей это имеет несколько следствий. Даже самые продвинутые модели остаются сложными системами с не всегда предсказуемым поведением. Понимание таких артефактов - шаг к повышению безопасности ИИ. Без него нельзя быть уверенным в поведении модели в критических сценариях. Это напоминание: языковые модели - не разумные существа, а статистические машины, чьи "рассуждения" основаны на паттернах данных, а не на понимании мира.
Такие исследования могут привести к новым методам контроля, снижающим вероятность генерации непреднамеренного или вредного контента. Понимание "глубинной психологии" ИИ - путь к созданию более безопасных и полезных систем. Изучение странных проявлений, вроде появления гоблинов, - не академическое упражнение, а часть работы по обеспечению, чтобы ИИ действовал в соответствии с намерениями людей.


