Confirmed on the employer's own hiring board on Sep 22, 2026. First seen by Alion on Sep 23, 2026. Wildberries scores A on the Alion truth index.
Направление работы:
Мы - направление модерации в отделе Trust & Safety, отвечаем за безопасность и модерацию контента и карточек товаров на WB. Ежедневно через наши системы проходят десятки миллионов карточек товаров, мы обрабатываем сотни миллионов решений по более чем 100 ML-моделям. Модели инферятся через Nvidia Triton Inference Server и vLLM на десятках инстансов в нескольких дата-центрах, GPU-парк гетерогенный, с MIG и HAMi, пиковая нагрузка порядка 400-500K RPS.
Мы строим единую ML-платформу для всех DS-направлений Trust & Safety, где уже 20+ DS в модерации и 50+ во всём отделе. Платформа растёт, и вместе с ней растёт команда. Рядом соседняя команда Moderation Engine из 5 backend-инженеров, которая владеет логикой модерации и является главным потребителем платформы.
Стань частью команды!
Вам предстоит:
-
Отвечать за инференс под нагрузкой (~200K запросов/сек в среднем, до 400-500K в пике), включая дежурства в ротации, инцидент-менеджмент, постмортемы и безопасные обновления;
-
Проектировать единый inference gateway и hot reload моделей как основу self-service деплоя;
-
Вести capacity planning и миграцию моделей между поколениями GPU;
-
Стандартизировать путь модели от эксперимента до прода вместе с DS, в том числе ClearML pipelines, model registry, конвертацию в ONNX и TensorRT, профилирование инференса;
-
Выстроить взаимодействие через API-контракты и SLA между командами;
-
Подключать DS-направления за пределами модерации и вести прозрачный intake их запросов;
-
Вести команду, включая найм на две открытые позиции, онбординг, рост инженеров и распределение ответственности.
Формат работы - гибридный или удаленный по договоренности с руководителем.
Вы нам подходите, если:
-
Ваш опыт руководства командой инженеров от 5 человек, включая 1:1, планы развития, распределение ответственности и найм;
-
Имеете опыт эксплуатации ML-инференса в проде на Triton Inference Server, vLLM или аналогах, в том числе деплой и обновление моделей без потери качества;
-
Имеете сильный инженерный бэкграунд в Go/Python, асинхронных сервисах, gRPC и Kubernetes, в том числе с GPU-ресурсами;
-
Имеете опыт эксплуатации высоконагруженных систем с SLA/SLO, мониторингом, инцидент-менеджментом и безопасными релизами;
-
Имеете опыт построения внутренней платформы для других команд с self-service, API-контрактами, roadmap и метриками использования;
-
Умеете проектировать - декомпозиция систем, архитектурные решения и их защита, техническое ревью;
-
Готовы работать «наставником и архитектором», делегировать, растить инженеров и управлять через систему;
-
Имеете опыт работы со стейкхолдерами вроде DS-команд, продакт-менеджеров и смежных платформ.
Будет плюсом:
-
Разделение GPU в multi-tenant Kubernetes (MIG, HAMi, time-slicing);
-
vLLM и LLM-gateway в проде, учёт стоимости и качества LLM-проверок;
-
ClearML, Kubeflow или MLflow на уровне пайплайнов обучения и model registry;
-
Оптимизация инференса с TensorRT, ONNX Runtime и dynamic batching;
-
Опыт выделения платформенной команды из продуктовой с разделением зон ответственности и переносом дежурств.

