Google DeepMind представила DiffusionGemma: текстовую диффузионную модель на базе Gemma 4
Исследователи Google DeepMind модифицировали языковую модель Gemma 4, создав текстовую диффузионную модель DiffusionGemma, затратив менее 10% от первоначального бюджета на обучение. Новая архитектура позволяет генерировать до 256 токенов параллельно со скоростью около 1500 токенов в секунду, что значительно быстрее традиционных авторегрессионных методов.
Google DeepMind создала текстовую диффузионную модель на основе Gemma
Исследователи Google DeepMind модифицировали авторегрессионную языковую модель, создав на ее основе DiffusionGemma. Ключевой результат: процесс адаптации потребовал менее 10% от бюджета на обучение оригинальной модели. Это показывает путь к более экономичному созданию моделей с альтернативными архитектурами.
Как работает DiffusionGemma
DiffusionGemma меняет принцип генерации текста. Вместо последовательного создания токенов модель генерирует до 256 токенов параллельно за один проход. Исследователи дообучили уже готовую модель, избежав затрат на обучение с нуля. В основе подхода лежит идея, что для создания текстовой диффузионной модели не обязательно начинать с чистого листа.
Компромиссы и ограничения
Скорость DiffusionGemma имеет обратную сторону. Качество модели в стандартных тестах пока отстает от оригинальной версии, особенно в задачах на сложные логические рассуждения. Параллельная генерация больших блоков текста хуже справляется с поддержанием длинной связной структуры. Однако для задач, где важна скорость, а не глубокая аргументация - быстрые черновики, краткие описания, заполнение шаблонов - модель может найти применение.
Значение для развития технологий
Появление DiffusionGemma указывает на две тенденции. Во-первых, диффузионные подходы выходят за рамки генерации изображений и аудио, осваивая текстовую сферу. Во-вторых, растет важность переиспользования и адаптации существующих больших моделей вместо их создания с нуля. Это снижает барьеры для входа и позволяет командам с ограниченными ресурсами экспериментировать с передовыми архитектурами.
Вероятное направление развития - гибридные модели, которые будут комбинировать скорость параллельной диффузионной генерации для одних задач и точность авторегрессии для других. Такой подход может сделать создание новых моделей более доступным, не требуя огромных вычислительных ресурсов на каждом этапе. Это особенно важно для исследовательских групп, которые хотят тестировать новые идеи без необходимости полного цикла обучения.


