LLM

Qwen 4: архитектурное превью бросает вызов вычислительной сложности LLM

Команда Qwen представила раннее превью архитектуры Qwen 4, в основе которой лежат новые механизмы внимания, призванные кардинально снизить потребление памяти и вычислительных ресурсов при работе с длинным контекстом.

Иллюстрация к новости: Qwen 4: архитектурное превью бросает вызов вычислительной сложности LLM

Команда Qwen (Alibaba) представила превью архитектуры Qwen 4. Ее цель - решить ключевую проблему больших языковых моделей: экспоненциальный рост затрат на вычисления и память с увеличением длины контекста. Вместо масштабирования старых подходов разработчики предлагают новые механизмы внимания: Gated Disentangled Attention (GDN) и Query Slicing Attention (QSA).

GDN призван разделять потоки информации через гейтирование, чтобы снизить избыточные вычисления. QSA, вероятно, разбивает запросы на срезы для более эффективной параллельной обработки длинных последовательностей. Архитектура также включает Gated Residual и 51 N-gram эмбеддинги, что указывает на комплексную оптимизацию всех слоев модели.

Контекст разработки - растущий стандарт на модели с контекстом в сотни тысяч и миллионы токенов, где стоимость инференса из-за квадратичной сложности внимания остается высокой. Qwen 4, сравниваемый с плотной моделью Qwen 3.8 27B, может при сопоставимых параметрах значительно повысить эффективность обработки длинного контекста. Это снизит стоимость запросов и позволит развертывать модели на менее мощном оборудовании.

В основе разработки лежат данные из статьи с номером 1075526. Согласно материалу, в одном из экспериментов использовалась модель с 4 слоями, 48 головами внимания и скрытым размером 917. Размер словаря составлял 1897 токенов, а размер пакета - 215. В другом тесте модель с 9 слоями и 3 головами внимания показала точность в 99% на определенной задаче. Также упоминается модель с 345 миллионами параметров и 4 слоями, которая демонстрирует базовые возможности.

Эти цифры иллюстрируют исследовательский контекст, в котором ведется работа над оптимизацией. Основной фокус - на поиске архитектур, которые обеспечивают хорошее качество при меньших вычислительных затратах, а не на простом увеличении масштаба. Например, сравнение моделей с 4 и 9 слоями помогает понять, как глубина сети влияет на эффективность.

Успех подобной архитектуры может привести к нескольким изменениям. Во-первых, это может удешевить работу с продвинутыми языковыми моделями для стартапов и исследователей. Во-вторых, это может стимулировать волну архитектурных оптимизаций у других игроков, сместив фокус с масштабирования параметров на эффективность. В-третьих, это может привести к появлению более доступных инструментов для разработчиков, работающих с объемными документами или длинными диалогами. Наконец, это может снизить операционные расходы на ИИ-инфраструктуру для бизнеса.

Анонс Qwen 4 сигнализирует о переходе к фазе, где ключевой метрикой становится не только качество ответов, но и вычислительная эффективность. Если новые механизмы внимания докажут свою эффективность в релизах и бенчмарках, это может перераспределить силы на рынке и сделать мощные языковые модели более практичным инструментом. Основная задача - преодолеть барьер квадратичной сложности, который ограничивает работу с длинными контекстами. Решение этой проблемы откроет путь к более широкому и экономичному применению технологий искусственного интеллекта.

Вопросы читателей по теме

Все вопросы

Как переводить тексты с помощью нейросети?

спрашивает Павел, Казань 119 просм.

Марина Соколова: Для перевода текста нейросети действительно дают более естественный результат, чем классический машинный перевод, потому что учитывают контекст всего предложения, а не переводят слово за словом. Из специализированных сервисов лучше всего с этим справляется DeepL - для европейских языков он заметно точнее старого Google Translate, особенно с идиомами и порядком слов. Если нужно перевести не разовую…

Как правильно писать промпты для нейросети?

спрашивает Станислав, Омск 145 просм.

Сергей Орлов: Схема есть, и она простая: роль, контекст, задача, формат. Модель не читает мысли, она отвечает ровно на тот запрос, который вы напечатали, поэтому чем конкретнее формулировка, тем предсказуемее результат. Роль - это кем модель должна "быть" для конкретной задачи: не "напиши текст", а "ты юрист, который проверяет договор аренды". Контекст - вводные, которые модель иначе…

Что такое ChatGPT?

спрашивает Ольга, Краснодар 165 просм.

Дмитрий Волков: ChatGPT - это чат-программа компании OpenAI, которая умеет вести диалог на естественном языке: отвечать на вопросы, писать тексты, объяснять темы, помогать с расчетами и кодом. Работает через сайт или мобильное приложение, доступ бесплатный на базовом уровне. Внутри у него языковая модель GPT - программа, обученная на огромном объеме текстов из интернета, книг и статей. Она…

Как выглядит ChatGPT?

спрашивает Павел, Тюмень 128 просм.

Марина Соколова: Внешне ChatGPT устроен проще, чем кажется: это диалоговое окно, а не программа с панелями инструментов вроде Word или Photoshop. Слева расположена узкая колонка с историей переписок - там хранятся все прошлые чаты, каждый можно переименовать или удалить. Сверху есть кнопка "новый чат" и переключатель модели: обычно указано название вроде GPT-4o или GPT-5, в платной версии…