Железо и GPU

Загадка низкой скорости ИИ на M3 Ultra: почему Qwen3.8-27B выдавал лишь 12 токенов в секунду

Разработчик столкнулся с неожиданно низкой производительностью оптимизированной модели Qwen3.8-27B на максимальной конфигурации Mac Studio с M3 Ultra, что заставило его искать узкое место в системе.

Иллюстрация к новости: Загадка низкой скорости ИИ на M3 Ultra: почему Qwen3.8-27B выдавал лишь 12 токенов в секунду

Разработчик, работающий с большими языковыми моделями на Apple Silicon, столкнулся с неожиданно низкой производительностью. На мощном Mac Studio (Apple M3 Ultra: 32 ядра CPU, 80 ядер GPU, 512 ГБ RAM, пропускная способность 819 ГБ/с) оптимизированная модель в формате MLX выдавала лишь 12 токенов в секунду.

Несмотря на то что модель целиком помещалась в память и использовался нативный фреймворк, результат был плохим. Анализ загрузки системы показал: GPU был загружен на 3-4%, а производительные CPU-ядра - на 1-2%. Такие цифры четко указывают, что проблема не в нехватке вычислительной мощности. Ограничителем, скорее всего, стала латентность доступа к памяти или пропускная способность шины.

Основной гипотезой стала проблема с реализацией Key-Value (KV) кэша во фреймворке. KV-кэш в трансформерах хранит промежуточные результаты для уже обработанных токенов, чтобы избежать их пересчета. Неоптимальная работа с этим кэшем - из-за размещения данных или алгоритмов доступа - может приводить к постоянным и дорогостоящим ожиданиям. На архитектуре Apple Silicon с объединенной памятью такая проблема способна полностью нивелировать преимущества высокой пропускной способности, заявленной в спецификациях.

Этот случай имеет значение для всей экосистемы ИИ на Apple Silicon. Он наглядно демонстрирует: даже при использовании мощного железа и оптимизированных моделей итоговая производительность может упираться в тонкие детали реализации низкоуровневых механизмов во фреймворках. Для тех, кто рассматривает подобные системы как платформу для локального запуска больших моделей, это важный сигнал. Необходимы тщательное профилирование и реалистичные тесты, а не слепая опора на технические спецификации. Пользователи, ожидающие высокой скорости интерактивной работы, могут столкнуться с разочарованием, если подобные узкие места не будут выявлены и устранены.

Производительность систем ИИ - это не простая функция от числа ядер или объема памяти. Это сложный баланс алгоритмов, управления памятью, оптимизации фреймворка и аппаратных особенностей. Разработчикам фреймворков для Apple Silicon предстоит серьезная работа по поиску и оптимизации таких узких мест, особенно связанных с KV-кэшем и эффективным планированием вычислений. Только после глубокой проработки этих инженерных задач системы на базе топовых чипов смогут раскрыть свой полный потенциал для работы с генеративным ИИ. Опыт показывает, что без этого даже впечатляющие на бумаге характеристики могут не привести к ожидаемой скорости генерации текста.