MLOps Engineer (Devops)

з/п не указана
RWB (Wildberries & Russ)
Москва Постоянная занятость Удаленная работа

Описание

Направление работы: ML Platform – платформенная команда в отделе Trust & Safety Wildberries. Мы отвечаем за ML-инфраструктуру модерации контента и карточек товаров. Ежедневно через наши системы проходят десятки миллионов карточек – это сотни миллионов предсказаний по 100+ ML-моделям. Модели крутятся в Nvidia Triton Inference Server на GPU-кластере в нескольких дата-центрах; пиковая нагрузка на инференс – порядка 400–500K RPS, десятки инстансов Triton. Исторически платформа выросла из модерации, сейчас становится самостоятельным юнитом и расширяется на все направления T&S. В отделе работают 50+ DS, и единой платформы для них пока нет. Мы это меняем – строим общую мультитенантную ML-платформу для всего отдела. Ищем ML Infrastructure Engineer (MLOps) на инфраструктурный слой платформы: GPU-кластер, разделение ресурсов между командами, ML-тулинг, среда обучения, стандартизация пайплайнов. Стань частью команды! Вам предстоит: Отвечать за GPU-кластер целиком: драйверы, GPU Operator, DCGM-мониторинг, утилизация, планирование ёмкости; Выстроить стратегию разделения GPU между командами в гетерогенной среде, квоты и приоритеты; Поднять единый Kubeflow и ClearML как стандарт для DS-команд отдела; Оптимизировать inference-инфраструктуру - автоскейлинг GPU-нод, bin-packing, утилизация; Строить инфраструктуру Embedding Store (pgvector, FAISS, qdrant); Общаться с DS-командами, понимать их потребности и переводить в инфраструктурные решения; Раскатать платформу на остальные команды Trust & Safety с полноценной мультитенантностью. Формат работы - гибридный или удаленный по договоренности с руководителем. Вы нам подходите, если: Имеете глубокое понимание Kubernetes: операторы, scheduling, resource management, GPU в K8s (device plugin, GPU Operator); Имеете практический опыт с NVIDIA GPU: драйверы и CUDA-стек, DCGM, MIG или time-slicing; Имеете опыт развёртывания и поддержки MLOps-платформ для DS-команд (ClearML, MLflow, Kubeflow, Airflow или аналоги); Владеете Linux и bare-metal, IaC (Ansible или Terraform), Helm; Имеете опыт разработки на Python или Go: операторы, экспортеры, внутренний тулинг; Умеете взаимодействовать с DS-командами и переводить потребности в технические решения; Будет плюсом: Опыт с Triton Inference Server, vLLM, KServe или аналогами; Опыт разделения и виртуализации GPU в Kubernetes для multi-tenant окружений; Понимание векторных БД и их оптимизации (pgvector, FAISS, Milvus); Сторадж под данные обучения: S3, Ceph, NFS; Multi-node training: NCCL, InfiniBand, RDMA.

Откликнуться
Источник: hh · 4 дня назад

Похожие вакансии в городе Москва

Все вакансии в городе Москва →