DeepSeek 0731 на DGX Spark: как обновление vLLM и явный выбор бэкенда дали прирост до 68 токенов в секунду
Детальный разбор производительности модели DeepSeek 0731 на кластере DGX Spark показал, что значительное ускорение генерации достигается не только железом, но и правильной конфигурацией софта. Ключевыми шагами стали переход на новую версию vLLM и явное указание специализированного бэкенда для Mixture of Experts.
Инженерный анализ развертывания DeepSeek 0731 на кластере DGX Spark выявил ключевые факторы, влияющие на скорость генерации текста. Целевой показатель в 57 токенов в секунду для одиночного запроса был не просто достигнут, а превышен. Фактическая скорость составила 68 токенов в секунду. Этот прирост получен не заменой оборудования, а оптимизацией программного обеспечения, что особенно важно для дорогих вычислительных ресурсов.
Тестирование проводилось на кластере из двух узлов NVIDIA DGX Spark с 128 ГБ памяти на каждом, соединенных интерконнектом QSFP 200G. Исходная конфигурация использовала runtime-образ на базе vLLM версии 0.21.
Первый шаг: обновление vLLM Переход на свежий образ с vLLM 0.25.2 дал прирост производительности в 22% на том же чекпоинте модели. Обновленное программное обеспечение изменило внутреннюю механику работы: частота verification-шагов снизилась на 17%, но количество выходных токенов за один шаг выросло с 3.27 до 4.80. Это обеспечило чистый выигрыш в скорости генерации.
Второй шаг: явная активация MoE-бэкенда DeepSeek 0731 использует архитектуру Mixture of Experts (MoE). Режим автоматического выбора бэкенда в vLLM не активирует оптимальный для данной задачи вариант. Его принудительное указание добавило 13.3% к средней скорости по пяти прогонам (с 59.7 до 67.6 токенов в секунду) и 16.6% к медианному значению.
Этот специализированный бэкенд работает по иному принципу: он увеличивает частоту verification-шагов на 16-18%, незначительно снижая количество выходных токенов за шаг (примерно на 2.5%). Общий баланс смещается в сторону ускорения, что дает чистый положительный эффект для decode speed.
Итоговые показатели Скорость генерации для одиночного запроса достигла 67.6 токенов в секунду. При обработке 12 параллельных запросов суммарная пропускная способность системы составила 260 токенов в секунду.
Вывод: для раскрытия потенциала современных больших моделей, особенно с такими архитектурами как MoE, недостаточно только мощного железа. Требуется тонкая настройка программного обеспечения, в частности фреймворков для инференса. Регулярное обновление инструментов и ручная проверка конфигураций для нестандартных архитектур должны стать стандартной практикой. Потенциал для оптимизации часто скрыт в деталях, и правильные настройки могут дать прирост, сопоставимый с дорогостоящим аппаратным обновлением.


