Авито строит собственную Inference-платформу для ML-сервисов, отказавшись от PaaS
Компания Авито раскрыла детали создания собственной платформы для инференса ML-моделей на open-source ядре, объяснив это неэффективностью стандартных PaaS-решений для задач машинного обучения.
Российский маркетплейс Авито создает собственную платформу для инференса ML- и LLM-моделей. Причиной стал рост потребностей бизнеса и неспособность стандартных PaaS-решений эффективно работать с ML-нагрузкой. По данным habr_ai, универсальные PaaS плохо масштабируются, не учитывают специфику управления GPU и требуют сложной оптимизации под конкретные модели.
Изначально Авито, как и другие компании, пытался размещать ML-сервисы на общей PaaS. Этот подход быстро выявил недостатки. GPU в PaaS рассматривались как обычные вычислительные единицы, что вело к неэффективному использованию дорогого оборудования. Традиционный автоскейлинг, не рассчитанный на ML-модели, работал плохо: он не умел управлять целыми GPU-нодами с предзагруженными весами, создавая риски простоя или нехватки ресурсов. Отсутствовала и встроенная поддержка ключевых для экономики ML-стратегий, например, динамической батчировки запросов для повышения утилизации GPU.
Команда отказалась от доработки существующей PaaS и решила построить отдельную Inference-платформу с нуля на open-source ядре. Новая платформа строится вокруг Kubernetes с GPU-поддержкой и фреймворков вроде Triton Inference Server. Полный контроль над инфраструктурой позволил проводить тонкую настройку под каждую модель, реализовывать эффективный батчинг и оптимизировать загрузку GPU. По данным habr_ai, это привело к экономии: например, обслуживание 34 моделей на 40 GPU. Платформа также обеспечивает изоляцию сервисов, повышая общую стабильность.
Опыт Авито показывает, что универсальные PaaS перестают быть оптимальным решением для высоконагруженных ML-ворклоадов. Специализированная inference-инфраструктура становится конкурентным преимуществом, снижая затраты и повышая качество сервиса. Для пользователей это означает более быстрые и точные рекомендации, улучшенный поиск и умную модерацию. Тренд на кастомизацию под ML ведет к росту спроса на MLOps-инженеров. Внедрение таких платформ - необходимое условие для масштабирования AI-возможностей бизнеса, когда модели растут, а требования к задержкам и стоимости инференса ужесточаются.


