Эксперимент: проявляет ли LLM волю к победе в соревновании с человеком?
Исследователь провел эксперимент, в котором большая языковая модель играла с человеком в простую игру, чтобы проверить, способна ли она демонстрировать конкурентное поведение и стремление к победе - качества, важные для обсуждения общего искусственного интеллекта.
В дискуссиях о будущем общего искусственного интеллекта часто возникает вопрос о поведении системы, которая превосходит человека. Чтобы проверить, может ли языковая модель проявить целенаправленное стремление к победе, был проведен эксперимент. В нем большая языковая модель играла с человеком в простую соревновательную игру. Человек намеренно играл слабо, предоставляя модели очевидные шансы на выигрыш. Модель знала правила, текущее состояние игры и получила четкую инструкцию - победить. Целью было не проверить оптимальность ходов, а выявить признаки последовательного стремления к выигрышу.
Результаты оказались неоднозначными. С одной стороны, модель в целом следовала правилам и делала логичные ходы, ведущие к победе, когда это было очевидно. Однако в ряде случаев она упускала предоставленные возможности для гарантированного выигрыша, выбирая субоптимальные или даже проигрышные ходы. Это демонстрирует, что даже с явной целью "победить" современные LLM, основанные на предсказании токенов, не формируют устойчивого внутреннего целеполагания или конкурентного инстинкта. Их поведение остается реактивным и сильно зависит от контекста промпта и формулировки задачи, а не от внутренней мотивации. Эксперимент также поднимает вопрос о том, что считать "волей к победе" у небиологической системы и как это измерить.
Для разработчиков ИИ такие эксперименты служат практической проверкой абстрактных концепций, например, агентности. Они показывают, что путь от модели, способной рассуждать о победе, до системы, которая стабильно и целенаправленно ее добивается в динамичной среде, может быть долгим. Это важно для создания ИИ-агентов в сфере автоматизации, где требуется не просто работа по инструкции, а инициатива в рамках поставленной цели. Для пользователей и бизнеса это напоминание: текущие LLM, при всей их эрудиции, остаются инструментами, требующими точного управления человеком, особенно в стратегических задачах.
Эксперимент не закрывает тему конкурентного ИИ, но смещает фокус. Он указывает на необходимость новых архитектур и парадигм обучения, которые целенаправленно формируют устойчивое целеориентированное поведение. Это может быть достигнуто, например, через продвинутое обучение с подкреплением в симуляциях или явное моделирование долгосрочных последствий действий. Без таких механизмов даже самая продвинутая языковая модель в соревновании может вести себя как гениальный, но безынициативный помощник, упускающий очевидные возможности. Вопрос "воли к победе" упирается не в вычислительную мощь, а в фундаментальные проблемы проектирования агентного интеллекта, что остается ключевой задачей на пути к более общему ИИ.


