LLM

Mamba: архитектура без внимания, которая бросила вызов трансформерам

Исследователи Альберт Гу и Три Дао представили архитектуру Mamba, полностью отказавшись от механизма внимания - основы современных LLM. Модель показала высокую скорость обработки длинных последовательностей при меньшем потреблении памяти.

Иллюстрация к новости: Mamba: архитектура без внимания, которая бросила вызов трансформерам

В декабре 2023 года научная статья о модели Mamba вызвала дискуссию о возможных альтернативах архитектуре трансформеров. Вместо механизма внимания, который является основой для таких моделей, как GPT, Mamba использует селективные пространства состояний. Этот подход позволяет эффективнее работать с длинными последовательностями данных.

Главное различие заключается в вычислительной сложности. Self-attention в трансформерах требует попарного сравнения элементов, что приводит к квадратичному росту затрат с увеличением длины контекста. Архитектура Mamba, основанная на State Space Models (SSM), демонстрирует линейную сложность. Это достигается за счет использования дифференциальных уравнений и селективного управления информацией в скрытом состоянии модели. На практике это означает, что Mamba может обрабатывать длинные тексты значительно быстрее и с меньшим потреблением памяти, чем классический трансформер, что открывает возможности для работы с контекстами в сотни тысяч токенов.

Хотя трансформеры остаются доминирующей архитектурой, Mamba представляет собой рабочую и перспективную альтернативу. Ее начали применять не только для обработки текста, но и в других областях, таких как анализ аудиосигналов, геномика и работа с временными рядами. Научное сообщество активно исследует гибридные подходы, комбинируя принципы Mamba с отдельными элементами трансформеров, и создает на ее основе новые языковые модели. Вероятно, будущее развитие лежит не в полной замене одной архитектуры другой, а в их синтезе и адаптации под конкретные задачи.

Для индустрии появление таких альтернатив означает движение к более эффективным и масштабируемым решениям. Повышенная эффективность Mamba при работе с длинными контекстами потенциально может снизить вычислительные затраты на обучение моделей и их последующее использование, что важно для проектов с ограниченными ресурсами. Это дает разработчикам новый инструмент для анализа объемных документов, длинных видео- или аудиопотоков. Конкуренция между разными архитектурными подходами стимулирует инновации и ведет к созданию более мощных и специализированных моделей. Mamba наглядно показала, что развитие больших языковых моделей не замыкается на эволюции трансформеров, и открыла новое, плодотворное направление для исследований в области машинного обучения.

Вопросы читателей по теме

Все вопросы

Как переводить тексты с помощью нейросети?

спрашивает Павел, Казань 119 просм.

Марина Соколова: Для перевода текста нейросети действительно дают более естественный результат, чем классический машинный перевод, потому что учитывают контекст всего предложения, а не переводят слово за словом. Из специализированных сервисов лучше всего с этим справляется DeepL - для европейских языков он заметно точнее старого Google Translate, особенно с идиомами и порядком слов. Если нужно перевести не разовую…

Как правильно писать промпты для нейросети?

спрашивает Станислав, Омск 145 просм.

Сергей Орлов: Схема есть, и она простая: роль, контекст, задача, формат. Модель не читает мысли, она отвечает ровно на тот запрос, который вы напечатали, поэтому чем конкретнее формулировка, тем предсказуемее результат. Роль - это кем модель должна "быть" для конкретной задачи: не "напиши текст", а "ты юрист, который проверяет договор аренды". Контекст - вводные, которые модель иначе…

Что такое ChatGPT?

спрашивает Ольга, Краснодар 165 просм.

Дмитрий Волков: ChatGPT - это чат-программа компании OpenAI, которая умеет вести диалог на естественном языке: отвечать на вопросы, писать тексты, объяснять темы, помогать с расчетами и кодом. Работает через сайт или мобильное приложение, доступ бесплатный на базовом уровне. Внутри у него языковая модель GPT - программа, обученная на огромном объеме текстов из интернета, книг и статей. Она…

Как выглядит ChatGPT?

спрашивает Павел, Тюмень 128 просм.

Марина Соколова: Внешне ChatGPT устроен проще, чем кажется: это диалоговое окно, а не программа с панелями инструментов вроде Word или Photoshop. Слева расположена узкая колонка с историей переписок - там хранятся все прошлые чаты, каждый можно переименовать или удалить. Сверху есть кнопка "новый чат" и переключатель модели: обычно указано название вроде GPT-4o или GPT-5, в платной версии…