AIRI представила метод сжатия LLM с полной матрицей Фишера для сохранения точности
Исследователи AIRI разработали новый подход к сжатию больших языковых моделей, который использует полную матрицу Фишера для точного учета корреляций между параметрами, что позволяет значительно сократить вычислительные затраты при минимальной потере качества.
Эффективное сжатие LLM с помощью полной матрицы Фишера
Сжатие больших языковых моделей (LLM) для работы на устройствах с ограниченными ресурсами - сложная задача. Стандартные методы прунинга, которые оценивают важность параметров по упрощенным метрикам, часто игнорируют связи между этими параметрами. Это приводит к значительной потере качества модели после сжатия.
Исследователи предложили новый метод, который использует полную матрицу Фишера для оценки важности параметров, учитывая их корреляции. Ключевая идея в том, чтобы сделать работу с этой матрицей вычислительно осуществимой. Для линейных слоев LLM полную матрицу Фишера можно представить в виде кронекерова произведения двух матриц меньшей размерности. Такое разложение позволяет хранить и обрабатывать информацию о всей матрице, занимая при этом на порядки меньше памяти. В результате сохраняется полная информация о кривизне пространства параметров, что критически важно для точной оценки.
В экспериментах метод тестировали на прунинге моделей. Использование полной матрицы Фишера показало лучшее соотношение между степенью сжатия и сохранением качества по сравнению с подходом, использующим только диагональное приближение. Модели, сжатые с учетом корреляций, демонстрировали меньшую деградацию производительности на стандартных тестовых наборах задач.
Этот подход открывает возможности для более эффективного сжатия LLM с целью их внедрения в продукты, где есть жесткие ограничения по памяти и вычислительной мощности - например, в мобильные приложения или на периферийные (edge) устройства. Метод наглядно показывает, что учет взаимосвязей между параметрами является ключевым фактором при оптимизации нейросетевых архитектур. Снижение вычислительных и ресурсных барьеров способствует более широкому практическому применению больших языковых моделей в различных бизнес-задачах, где стоимость и эффективность инференса играют решающую роль.
Предложенный метод представляет собой значимый шаг в области посттренировочной оптимизации моделей, делая передовые техники на основе матрицы Фишера практически применимыми для реальных задач. Это создает основу для разработки более стандартизированных и надежных процессов подготовки LLM к промышленному использованию, где баланс между размером, скоростью и точностью модели имеет первостепенное значение.


