Железо и GPU

Инженеры ускорили Qwen3.8 до 75 токенов в секунду на двух RTX 3090 через оптимизацию llama.cpp

Детальный разбор узких мест в llama.cpp позволил более чем вдвое увеличить скорость генерации 27-миллиардной модели Qwen3.8 на двух видеокартах RTX 3090, продемонстрировав эффективные методы использования доступного железа.

Иллюстрация к новости: Инженеры ускорили Qwen3.8 до 75 токенов в секунду на двух RTX 3090 через оптимизацию llama.cpp

Инженеры увеличили скорость генерации плотной модели Qwen3.8 с 32 до 75 токенов в секунду на двух видеокартах NVIDIA RTX 3090. Исходная производительность в llama.cpp не использовала весь потенциал двух карт с 24 ГБ памяти и пропускной способностью 936 ГБ/с каждая. Это указало на узкие места в конвейере вычислений.

Анализ выявил несколько ключевых проблем, которые удалось устранить настройкой флагов запуска в llama.cpp без изменения весов модели. Основными инструментами стали Multi-Token Prediction (MTP) и грамотная реализация тензорного параллелизма. MTP позволяет предсказывать несколько токенов за один проход, снижая число вычислительных циклов. Тензорный параллелизм распределяет нагрузку от больших матричных операций между GPU, минимизируя простои и используя пропускную способность памяти. Комбинация этих подходов и дала финальный результат в 75 токенов в секунду.

Этот кейс важен для разработчиков и стартапов, работающих с большими моделями без доступа к дорогим серверным кластерам. Он показывает, что значительный прирост часто лежит в тонкой настройке существующих инструментов, а не в покупке нового оборудования. Умение правильно распределять вычисления между несколькими GPU становится критически важным навыком. Оптимизация позволяет запускать модели в десятки миллиардов параметров на относительно доступном железе, снижая порог входа.

Для конечных пользователей и компаний такие оптимизации означают более отзывчивые системы на том же аппаратном обеспечении, что влияет на пользовательский опыт и операционную эффективность. Тенденция к детальной оптимизации фреймворков под конкретные конфигурации будет усиливаться с ростом моделей и требований к инференсу в реальном времени. Эта работа также подчеркивает важность open-source экосистемы: гибкость llama.cpp позволила провести детальный анализ и поделиться рецептами настройки с сообществом. Результаты демонстрируют, что даже на паре карт уровня RTX 3090 можно достичь высокой скорости генерации, если правильно настроить конвейер вычислений и задействовать все доступные аппаратные ресурсы, включая память и пропускную способность.