{"id":1141197,"url":"https://alion.io/job/wildberries-team-lead-v-komandu-inference-platform","title":"Team Lead в команду Inference Platform","company":{"id":99582,"name":"Wildberries","domain":"wb.ru","url":"https://alion.io/company/wildberries-ru","size_band":"1001-5000","is_staffing_agency":false,"is_intermediary":false,"ats_vendor":"HeadHunter","truth_index":{"grade":"A","score":98,"open_postings":44,"ghost_share":0.091,"stale_share":0,"repost_share":0.091,"time_to_fill_p50_days":5,"computed_at":"2026-09-23T05:45:00Z"}},"role":"Leadership","role_family":"Leadership","seniority":"lead","employment_type":null,"work_mode":"remote","remote_scope":"stated_regions","hiring_geo_confidence":"inferred","locations":["Moscow, Russia"],"countries":["RU"],"hiring_countries":["RU","BY","KZ","KG","AM"],"hiring_countries_total":5,"salary":null,"salary_estimate":{"min_usd":53000,"max_usd":125000,"period":"year","method":"role_seniority_country_remote_cell","sample_n":8},"experience_years_min":null,"visa_sponsorship":false,"relocation_package":false,"has_equity":false,"technologies":[{"name":"ClearML","optional":false},{"name":"Go","optional":false},{"name":"gRPC","optional":false},{"name":"Kubernetes","optional":false},{"name":"ONNX","optional":false},{"name":"Python","optional":false},{"name":"SLI/SLO/SLA","optional":false},{"name":"TensorRT","optional":false},{"name":"Triton Inference Server","optional":false},{"name":"vLLM","optional":false},{"name":"Kubeflow","optional":true},{"name":"LLM","optional":true},{"name":"MLFlow","optional":true},{"name":"ONNX Runtime","optional":true}],"status":"live","first_seen_at":"2026-09-23T11:35:16Z","employer_posted_date":"2026-09-23","last_verified_at":"2026-09-22T23:40:11Z","board_verified":true,"closed_at":null,"days_open":0,"trust":{"level":"ok","repost_count":null,"flags":[],"days_open":0},"description":"Направление работы:\n Мы - направление модерации в отделе Trust & Safety, отвечаем за безопасность и модерацию контента и карточек товаров на WB. Ежедневно через наши системы проходят десятки миллионов карточек товаров, мы обрабатываем сотни миллионов решений по более чем 100 ML-моделям. Модели инферятся через Nvidia Triton Inference Server и vLLM на десятках инстансов в нескольких дата-центрах, GPU-парк гетерогенный, с MIG и HAMi, пиковая нагрузка порядка 400-500K RPS.\n Мы строим единую ML-платформу для всех DS-направлений Trust & Safety, где уже 20+ DS в модерации и 50+ во всём отделе. Платформа растёт, и вместе с ней растёт команда. Рядом соседняя команда Moderation Engine из 5 backend-инженеров, которая владеет логикой модерации и является главным потребителем платформы.\n Стань частью команды!\n Вам предстоит:\n Отвечать за инференс под нагрузкой (~200K запросов/сек в среднем, до 400-500K в пике), включая дежурства в ротации, инцидент-менеджмент, постмортемы и безопасные обновления;\n\n Проектировать единый inference gateway и hot reload моделей как основу self-service деплоя;\n\n Вести capacity planning и миграцию моделей между поколениями GPU;\n\n Стандартизировать путь модели от эксперимента до прода вместе с DS, в том числе ClearML pipelines, model registry, конвертацию в ONNX и TensorRT, профилирование инференса;\n\n Выстроить взаимодействие через API-контракты и SLA между командами;\n\n Подключать DS-направления за пределами модерации и вести прозрачный intake их запросов;\n\n Вести команду, включая найм на две открытые позиции, онбординг, рост инженеров и распределение ответственности.\n\n Формат работы - гибридный или удаленный по договоренности с руководителем.\n Вы нам подходите, если:\n Ваш опыт руководства командой инженеров от 5 человек, включая 1:1, планы развития, распределение ответственности и найм;\n\n Имеете опыт эксплуатации ML-инференса в проде на Triton Inference Server, vLLM или аналогах, в том числе деплой и обновление моделей без потери качества;\n\n Имеете сильный инженерный бэкграунд в Go/Python, асинхронных сервисах, gRPC и Kubernetes, в том числе с GPU-ресурсами;\n\n Имеете опыт эксплуатации высоконагруженных систем с SLA/SLO, мониторингом, инцидент-менеджментом и безопасными релизами;\n\n Имеете опыт построения внутренней платформы для других команд с self-service, API-контрактами, roadmap и метриками использования;\n\n Умеете проектировать - декомпозиция систем, архитектурные решения и их защита, техническое ревью;\n\n Готовы работать «наставником и архитектором», делегировать, растить инженеров и управлять через систему;\n\n Имеете опыт работы со стейкхолдерами вроде DS-команд, продакт-менеджеров и смежных платформ.\n\n Будет плюсом:\n Разделение GPU в multi-tenant Kubernetes (MIG, HAMi, time-slicing);\n\n vLLM и LLM-gateway в проде, учёт стоимости и качества LLM-проверок;\n\n ClearML, Kubeflow или MLflow на уровне пайплайнов обучения и model registry;\n\n Оптимизация инференса с TensorRT, ONNX Runtime и dynamic batching;\n\n Опыт выделения платформенной команды из продуктовой с разделением зон ответственности и переносом дежурств.","description_format":"text","description_chars":3079,"description_truncated":false,"requirements":{"experience_years_min":null,"management_years_min":null,"team_size_min":null,"manages_managers":false,"education":null,"security_clearance":false,"languages":[{"language":"Russian","level":"Advanced (C1)","optional":false}]},"benefits":[],"hiring_locations":[{"name":"Russia","iso":"RU","kind":"country"},{"name":"Belarus","iso":"BY","kind":"region"},{"name":"Kazakhstan","iso":"KZ","kind":"region"},{"name":"Kyrgyzstan","iso":"KG","kind":"region"},{"name":"Armenia","iso":"AM","kind":"region"}],"hiring_excludes":[],"relocation_offered":false,"industries":[],"lifecycle":[{"event":"open","at":"2026-09-23T11:41:39Z"}],"liveness":{"score":86,"band":"hot","label":"Hiring now","p_open":1,"p_active":0.86,"p_room":1,"age_days":0,"expected_fill_days":5,"reasons":["conf:5","win:early"],"computed_at":"2026-09-23T17:02:57Z"},"pay":null,"html_url":"https://alion.io/job/wildberries-team-lead-v-komandu-inference-platform","json_url":"https://alion.io/job/wildberries-team-lead-v-komandu-inference-platform.json","meta":{"generated_at":"2026-09-23T17:02:57Z","cache_seconds":300,"methodology":"https://alion.io/methodology","terms":"https://alion.io/terms","contact":"https://alion.io/contact","api":"https://alion.io/developers"}}