Автоматизация

Авито строит собственную Inference-платформу для ML-сервисов, отказавшись от PaaS

Компания Авито раскрыла детали создания собственной платформы для инференса ML-моделей на open-source ядре, объяснив это неэффективностью стандартных PaaS-решений для задач машинного обучения.

Иллюстрация к новости: Авито строит собственную Inference-платформу для ML-сервисов, отказавшись от PaaS

Российский маркетплейс Авито создает собственную платформу для инференса ML- и LLM-моделей. Причиной стал рост потребностей бизнеса и неспособность стандартных PaaS-решений эффективно работать с ML-нагрузкой. По данным habr_ai, универсальные PaaS плохо масштабируются, не учитывают специфику управления GPU и требуют сложной оптимизации под конкретные модели.

Изначально Авито, как и другие компании, пытался размещать ML-сервисы на общей PaaS. Этот подход быстро выявил недостатки. GPU в PaaS рассматривались как обычные вычислительные единицы, что вело к неэффективному использованию дорогого оборудования. Традиционный автоскейлинг, не рассчитанный на ML-модели, работал плохо: он не умел управлять целыми GPU-нодами с предзагруженными весами, создавая риски простоя или нехватки ресурсов. Отсутствовала и встроенная поддержка ключевых для экономики ML-стратегий, например, динамической батчировки запросов для повышения утилизации GPU.

Команда отказалась от доработки существующей PaaS и решила построить отдельную Inference-платформу с нуля на open-source ядре. Новая платформа строится вокруг Kubernetes с GPU-поддержкой и фреймворков вроде Triton Inference Server. Полный контроль над инфраструктурой позволил проводить тонкую настройку под каждую модель, реализовывать эффективный батчинг и оптимизировать загрузку GPU. По данным habr_ai, это привело к экономии: например, обслуживание 34 моделей на 40 GPU. Платформа также обеспечивает изоляцию сервисов, повышая общую стабильность.

Опыт Авито показывает, что универсальные PaaS перестают быть оптимальным решением для высоконагруженных ML-ворклоадов. Специализированная inference-инфраструктура становится конкурентным преимуществом, снижая затраты и повышая качество сервиса. Для пользователей это означает более быстрые и точные рекомендации, улучшенный поиск и умную модерацию. Тренд на кастомизацию под ML ведет к росту спроса на MLOps-инженеров. Внедрение таких платформ - необходимое условие для масштабирования AI-возможностей бизнеса, когда модели растут, а требования к задержкам и стоимости инференса ужесточаются.

Вопросы читателей по теме

Все вопросы

Какая нейросеть работает с Excel?

спрашивает Виталий, Барнаул 173 просм.

Сергей Орлов: Вариантов сейчас несколько, и они по-разному обращаются с вашими данными, что для рабочих таблиц важнее выбора самой удачной формулы. Microsoft Copilot в Excel (доступен в подписке Microsoft 365 Copilot) - самый безопасный вариант для рабочих отчетов: он встроен прямо в приложение, и по условиям Microsoft корпоративные данные из таких запросов не используются для обучения общих…

Как подключить чат-бота в ВК?

спрашивает Павел, Екатеринбург 85 просм.

Дмитрий Волков: Подключение бота к сообществу ВКонтакте начинается не с кода, а с настроек самого сообщества - там нужно получить доступ к API. Порядок действий такой: В управлении сообществом откройте раздел "Работа с API" и создайте ключ доступа сообщества (токен) с нужными правами - как минимум "Сообщения сообщества". Там же включите один из двух способов получения сообщений:…

Как создавать чат-ботов и зарабатывать на этом?

спрашивает Марина, Тверь 228 просм.

Марина Соколова: Спрос реальный, особенно среди небольшого локального бизнеса: магазины, салоны красоты, частные специалисты часто не готовы платить разработчику за индивидуальную разработку, но вполне готовы заплатить за настройку готового конструктора под свои задачи, это дешевле и быстрее. По ценам на фрилансе простой бот, приём заявок, FAQ, рассылка расписания, обычно стоит от 5 до 15 тысяч рублей за…

Что такое инструменты для ИИ-агента?

спрашивает Ольга, Воронеж 195 просм.

Марина Соколова: Инструменты для ИИ-агента - это конкретные функции или программы, которые агент может вызвать сам, чтобы получить данные или выполнить действие, вместо того чтобы просто отвечать текстом на основе того, что он уже "знает". Обычная языковая модель без инструментов может только генерировать текст по своим внутренним знаниям, поэтому иногда ошибается или выдаёт устаревшие сведения. Агент с…