Qwen 4: архитектурное превью бросает вызов вычислительной сложности LLM
Команда Qwen представила раннее превью архитектуры Qwen 4, в основе которой лежат новые механизмы внимания, призванные кардинально снизить потребление памяти и вычислительных ресурсов при работе с длинным контекстом.
Команда Qwen (Alibaba) представила превью архитектуры Qwen 4. Ее цель - решить ключевую проблему больших языковых моделей: экспоненциальный рост затрат на вычисления и память с увеличением длины контекста. Вместо масштабирования старых подходов разработчики предлагают новые механизмы внимания: Gated Disentangled Attention (GDN) и Query Slicing Attention (QSA).
GDN призван разделять потоки информации через гейтирование, чтобы снизить избыточные вычисления. QSA, вероятно, разбивает запросы на срезы для более эффективной параллельной обработки длинных последовательностей. Архитектура также включает Gated Residual и 51 N-gram эмбеддинги, что указывает на комплексную оптимизацию всех слоев модели.
Контекст разработки - растущий стандарт на модели с контекстом в сотни тысяч и миллионы токенов, где стоимость инференса из-за квадратичной сложности внимания остается высокой. Qwen 4, сравниваемый с плотной моделью Qwen 3.8 27B, может при сопоставимых параметрах значительно повысить эффективность обработки длинного контекста. Это снизит стоимость запросов и позволит развертывать модели на менее мощном оборудовании.
В основе разработки лежат данные из статьи с номером 1075526. Согласно материалу, в одном из экспериментов использовалась модель с 4 слоями, 48 головами внимания и скрытым размером 917. Размер словаря составлял 1897 токенов, а размер пакета - 215. В другом тесте модель с 9 слоями и 3 головами внимания показала точность в 99% на определенной задаче. Также упоминается модель с 345 миллионами параметров и 4 слоями, которая демонстрирует базовые возможности.
Эти цифры иллюстрируют исследовательский контекст, в котором ведется работа над оптимизацией. Основной фокус - на поиске архитектур, которые обеспечивают хорошее качество при меньших вычислительных затратах, а не на простом увеличении масштаба. Например, сравнение моделей с 4 и 9 слоями помогает понять, как глубина сети влияет на эффективность.
Успех подобной архитектуры может привести к нескольким изменениям. Во-первых, это может удешевить работу с продвинутыми языковыми моделями для стартапов и исследователей. Во-вторых, это может стимулировать волну архитектурных оптимизаций у других игроков, сместив фокус с масштабирования параметров на эффективность. В-третьих, это может привести к появлению более доступных инструментов для разработчиков, работающих с объемными документами или длинными диалогами. Наконец, это может снизить операционные расходы на ИИ-инфраструктуру для бизнеса.
Анонс Qwen 4 сигнализирует о переходе к фазе, где ключевой метрикой становится не только качество ответов, но и вычислительная эффективность. Если новые механизмы внимания докажут свою эффективность в релизах и бенчмарках, это может перераспределить силы на рынке и сделать мощные языковые модели более практичным инструментом. Основная задача - преодолеть барьер квадратичной сложности, который ограничивает работу с длинными контекстами. Решение этой проблемы откроет путь к более широкому и экономичному применению технологий искусственного интеллекта.


