LLM

Qwen от Alibaba возглавила Code Arena WebDev, но статистическая значимость результата под вопросом

Модель Qwen3.8-Max-0902 от Alibaba заняла первую строчку в общем зачёте бенчмарка Code Arena WebDev, однако её лидерство носит предварительный характер из-за небольшого количества голосов и перекрывающихся доверительных интервалов с ближайшим конкурентом Claude Opus.

Иллюстрация к новости: Qwen от Alibaba возглавила Code Arena WebDev, но статистическая значимость результата под вопросом

Модель Qwen3.8-Max-0902 от Alibaba заняла первую строчку в общем зачете бенчмарка Code Arena WebDev. По данным Habr, на момент публикации модель набрала 1691 очко, опередив Claude Opus 5 Max от Anthropic всего на три пункта.

Однако результат Qwen помечен как предварительный. Рейтинг Code Arena формируется на основе голосов сообщества. Количество голосов за решения Qwen в несколько раз меньше, чем у основных конкурентов. Доверительные интервалы Qwen и Claude Opus сильно перекрываются. Текущий отрыв в три очка не является статистически значимым - при увеличении выборки голосов позиции могут легко поменяться. Даже за время подготовки материала количество голосов и отрыв успели измениться.

Code Arena WebDev - это открытая платформа для сравнительного тестирования ИИ на задачах веб-разработки. Пользователи голосуют за лучшие, по их мнению, решения для одних и тех же промптов. Рейтинг отражает субъективные предпочтения сообщества. Alibaba анонсировала модель Qwen3.8-Max, и её результат быстро добавили в таблицу. Небольшое количество голосов, собранное новой моделью за короткое время, и стало причиной широких доверительных интервалов.

Для разработчиков и компаний это означает, что к подобным точечным результатам стоит относиться как к индикаторам потенциальных возможностей, а не как к окончательному вердикту. Лидерство Qwen, даже если подтвердится, не делает её универсальным выбором для всех задач. Разные модели могут показывать разную эффективность в зависимости от контекста и конкретной подзадачи. Перекрывающиеся интервалы между Qwen и Claude Opus показывают, что разрыв между топовыми моделями может быть невелик. Выбор часто сводится к личным предпочтениям, стоимости API или интеграции в рабочий процесс.

Событие демонстрирует растущую конкуренцию на рынке ИИ-кодинга, где Alibaba наступает на позиции лидеров вроде Anthropic. Появление модели, способной конкурировать с Claude Opus в субъективных оценках сообщества, - важный сигнал для отрасли. Разрыв между коммерческими и передовыми открытыми моделями продолжает сокращаться. Для разработчиков и инженерных команд это напоминание о необходимости критически оценивать данные бенчмарков, проверяя методику их формирования и статистическую значимость результатов.

Вопросы читателей по теме

Все вопросы

Как переводить тексты с помощью нейросети?

спрашивает Павел, Казань 119 просм.

Марина Соколова: Для перевода текста нейросети действительно дают более естественный результат, чем классический машинный перевод, потому что учитывают контекст всего предложения, а не переводят слово за словом. Из специализированных сервисов лучше всего с этим справляется DeepL - для европейских языков он заметно точнее старого Google Translate, особенно с идиомами и порядком слов. Если нужно перевести не разовую…

Как правильно писать промпты для нейросети?

спрашивает Станислав, Омск 145 просм.

Сергей Орлов: Схема есть, и она простая: роль, контекст, задача, формат. Модель не читает мысли, она отвечает ровно на тот запрос, который вы напечатали, поэтому чем конкретнее формулировка, тем предсказуемее результат. Роль - это кем модель должна "быть" для конкретной задачи: не "напиши текст", а "ты юрист, который проверяет договор аренды". Контекст - вводные, которые модель иначе…

Что такое ChatGPT?

спрашивает Ольга, Краснодар 165 просм.

Дмитрий Волков: ChatGPT - это чат-программа компании OpenAI, которая умеет вести диалог на естественном языке: отвечать на вопросы, писать тексты, объяснять темы, помогать с расчетами и кодом. Работает через сайт или мобильное приложение, доступ бесплатный на базовом уровне. Внутри у него языковая модель GPT - программа, обученная на огромном объеме текстов из интернета, книг и статей. Она…

Как выглядит ChatGPT?

спрашивает Павел, Тюмень 128 просм.

Марина Соколова: Внешне ChatGPT устроен проще, чем кажется: это диалоговое окно, а не программа с панелями инструментов вроде Word или Photoshop. Слева расположена узкая колонка с историей переписок - там хранятся все прошлые чаты, каждый можно переименовать или удалить. Сверху есть кнопка "новый чат" и переключатель модели: обычно указано название вроде GPT-4o или GPT-5, в платной версии…