{"id":1141150,"url":"https://alion.io/job/wildberries-mlops-engineer-devops","title":"MLOps Engineer (Devops)","company":{"id":99582,"name":"Wildberries","domain":"wb.ru","url":"https://alion.io/company/wildberries-ru","size_band":"1001-5000","is_staffing_agency":false,"is_intermediary":false,"ats_vendor":"HeadHunter","truth_index":{"grade":"A","score":98,"open_postings":44,"ghost_share":0.091,"stale_share":0,"repost_share":0.091,"time_to_fill_p50_days":5,"computed_at":"2026-09-23T05:45:00Z"}},"role":"AI/ML","role_family":"AI/ML","seniority":null,"employment_type":null,"work_mode":"remote","remote_scope":"stated_regions","hiring_geo_confidence":"inferred","locations":["Moscow, Russia"],"countries":["RU"],"hiring_countries":["RU","BY","KZ","KG","AM"],"hiring_countries_total":5,"salary":null,"salary_estimate":{"min_usd":32000,"max_usd":86000,"period":"year","method":"role_country_seniority_unknown","sample_n":116},"experience_years_min":null,"visa_sponsorship":false,"relocation_package":false,"has_equity":false,"technologies":[{"name":"Ansible","optional":false},{"name":"ClearML","optional":false},{"name":"CUDA","optional":false},{"name":"CUDA Toolkit","optional":false},{"name":"FAISS","optional":false},{"name":"Helm","optional":false},{"name":"Kubeflow","optional":false},{"name":"Kubernetes","optional":false},{"name":"Linux","optional":false},{"name":"MLFlow","optional":false},{"name":"pgvector","optional":false},{"name":"Python","optional":false},{"name":"Qdrant","optional":false},{"name":"Terraform","optional":false},{"name":"Triton","optional":false},{"name":"Triton Inference Server","optional":false},{"name":"Amazon S3","optional":true},{"name":"InfiniBand","optional":true},{"name":"KServe","optional":true},{"name":"Milvus","optional":true},{"name":"NCCL","optional":true},{"name":"PostgreSQL","optional":true},{"name":"vLLM","optional":true}],"status":"live","first_seen_at":"2026-09-23T11:31:44Z","employer_posted_date":"2026-09-23","last_verified_at":"2026-09-22T23:40:11Z","board_verified":true,"closed_at":null,"days_open":0,"trust":{"level":"ok","repost_count":null,"flags":[],"days_open":0},"description":"Направление работы:\n ML Platform - платформенная команда в отделе Trust & Safety Wildberries. Мы отвечаем за ML-инфраструктуру модерации контента и карточек товаров. Ежедневно через наши системы проходят десятки миллионов карточек - это сотни миллионов предсказаний по 100+ ML-моделям. Модели крутятся в Nvidia Triton Inference Server на GPU-кластере в нескольких дата-центрах; пиковая нагрузка на инференс - порядка 400-500K RPS, десятки инстансов Triton.\n Исторически платформа выросла из модерации, сейчас становится самостоятельным юнитом и расширяется на все направления T&S. В отделе работают 50+ DS, и единой платформы для них пока нет. Мы это меняем - строим общую мультитенантную ML-платформу для всего отдела.\n Ищем ML Infrastructure Engineer (MLOps) на инфраструктурный слой платформы: GPU-кластер, разделение ресурсов между командами, ML-тулинг, среда обучения, стандартизация пайплайнов.\n Стань частью команды!\n Вам предстоит:\n Отвечать за GPU-кластер целиком: драйверы, GPU Operator, DCGM-мониторинг, утилизация, планирование ёмкости;\n\n Выстроить стратегию разделения GPU между командами в гетерогенной среде, квоты и приоритеты;\n\n Поднять единый Kubeflow и ClearML как стандарт для DS-команд отдела;\n\n Оптимизировать inference-инфраструктуру - автоскейлинг GPU-нод, bin-packing, утилизация;\n\n Строить инфраструктуру Embedding Store (pgvector, FAISS, qdrant);\n\n Общаться с DS-командами, понимать их потребности и переводить в инфраструктурные решения;\n\n Раскатать платформу на остальные команды Trust & Safety с полноценной мультитенантностью.\n\n Формат работы - гибридный или удаленный по договоренности с руководителем.\n Вы нам подходите, если:\n Имеете глубокое понимание Kubernetes: операторы, scheduling, resource management, GPU в K8s (device plugin, GPU Operator);\n\n Имеете практический опыт с NVIDIA GPU: драйверы и CUDA-стек, DCGM, MIG или time-slicing;\n\n Имеете опыт развёртывания и поддержки MLOps-платформ для DS-команд (ClearML, MLflow, Kubeflow, Airflow или аналоги);\n\n Владеете Linux и bare-metal, IaC (Ansible или Terraform), Helm;\n\n Имеете опыт разработки на Python или Go: операторы, экспортеры, внутренний тулинг;\n\n Умеете взаимодействовать с DS-командами и переводить потребности в технические решения;\n\n Будет плюсом:\n Опыт с Triton Inference Server, vLLM, KServe или аналогами;\n\n Опыт разделения и виртуализации GPU в Kubernetes для multi-tenant окружений;\n\n Понимание векторных БД и их оптимизации (pgvector, FAISS, Milvus);\n\n Сторадж под данные обучения: S3, Ceph, NFS;\n\n Multi-node training: NCCL, InfiniBand, RDMA.","description_format":"text","description_chars":2552,"description_truncated":false,"requirements":{"experience_years_min":null,"management_years_min":null,"team_size_min":null,"manages_managers":false,"education":null,"security_clearance":false,"languages":[{"language":"Russian","level":"Advanced (C1)","optional":false}]},"benefits":[],"hiring_locations":[{"name":"Russia","iso":"RU","kind":"country"},{"name":"Belarus","iso":"BY","kind":"region"},{"name":"Kazakhstan","iso":"KZ","kind":"region"},{"name":"Kyrgyzstan","iso":"KG","kind":"region"},{"name":"Armenia","iso":"AM","kind":"region"}],"hiring_excludes":[],"relocation_offered":false,"industries":[],"lifecycle":[{"event":"open","at":"2026-09-23T11:36:36Z"}],"liveness":{"score":86,"band":"hot","label":"Hiring now","p_open":1,"p_active":0.86,"p_room":1,"age_days":0,"expected_fill_days":5,"reasons":["conf:5","win:early"],"computed_at":"2026-09-23T17:06:42Z"},"pay":null,"html_url":"https://alion.io/job/wildberries-mlops-engineer-devops","json_url":"https://alion.io/job/wildberries-mlops-engineer-devops.json","meta":{"generated_at":"2026-09-23T17:06:42Z","cache_seconds":300,"methodology":"https://alion.io/methodology","terms":"https://alion.io/terms","contact":"https://alion.io/contact","api":"https://alion.io/developers"}}