Google TurboQuant: 3-битная квантизация LLM потрясла рынок памяти
Представленный Google алгоритм TurboQuant позволяет сжимать веса языковых моделей до 3 бит, что в разы снижает требования к оперативной памяти и вызвало обвал акций производителей памяти на $90 млрд.
В 2026 году Google представил алгоритм TurboQuant, который сжимает веса больших языковых моделей до 3 бит, тогда как традиционный подход использует 16 бит. Это значительно снижает требования к оперативной памяти. Новость сразу повлияла на финансовые рынки: акции крупных производителей памяти за короткий срок потеряли около 90 миллиардов долларов капитализации. По данным Habr, инвесторы начали сомневаться в будущем спросе на память, если модели станут потреблять меньше ресурсов. Этот случай показывает, насколько чувствительна индустрия к прорывам в эффективности искусственного интеллекта.
TurboQuant - это не просто очередной метод посттренировочной квантизации. Алгоритм упаковывает параметры модели в формат с крайне низкой битностью, стараясь сохранить приемлемое качество работы. Основная идея заключается в умном распределении ограниченного битового бюджета между разными слоями и типами весов, а не в их равномерном обрезании. Критически важные параметры сохраняют высокую точность, а менее значимые сжимаются сильнее. Технология имеет рабочие реализации и доступна для тестирования, постепенно переходя из исследовательских лабораторий в практический инструментарий инженеров.
TurboQuant серьезно снижает барьеры для развертывания мощных языковых моделей. Модели, которым раньше требовались десятки гигабайт видеопамяти графических процессоров, теперь могут работать на более доступном оборудовании - например, на потребительских видеокартах или даже центральных процессорах. Это открывает возможности для сложных ИИ-ассистентов на периферийных устройствах, в мобильных приложениях и небольших дата-центрах. Снижаются операционные затраты на инфраструктуру, что может сделать сервисы на основе ИИ дешевле. Однако TurboQuant - не универсальное решение. Его эффективность и способность сохранять качество зависят от архитектуры конкретной модели и решаемой задачи. Для сценариев, где нужна максимальная точность, может все еще потребоваться более высокая битность.
Долгосрочные последствия выходят за рамки простой экономии памяти. Рынок аппаратного обеспечения для ИИ, который рос очень быстро из-за высокого потребления ресурсов большими моделями, может столкнуться с изменением спроса. Производителям чипов и памяти, возможно, придется сместить акцент с наращивания сырой производительности и объемов в сторону энергоэффективности, специализированных ускорителей для низкобитных моделей и решений для периферийных вычислений. Удешевление инфраструктуры ускорит демократизацию ИИ, позволив небольшим компаниям и исследовательским группам экспериментировать с современными моделями без огромных инвестиций в оборудование. Это может привести к всплеску инноваций на новых направлениях.
TurboQuant от Google - серьезный фактор изменений на стыке программного и аппаратного обеспечения. Он заставляет пересмотреть экономику развертывания больших моделей и ставит под вопрос прежние траектории роста некоторых сегментов полупроводниковой индустрии. У технологии есть ограничения, но ее появление - важный этап, когда оптимизация и эффективность начинают играть роль, сравнимую с простым увеличением масштаба моделей. Дальнейшее развитие подобных методов во многом определит, как быстро передовые возможности ИИ будут интегрированы в повседневные продукты и сервисы.


