«Детмир Тех» - команда, развивающая цифровую экосистему группы компаний «Детский мир». Делаем продукты для миллионов клиентов и сервисы, которые помогают бизнесу работать быстрее.
Кого ищем:
ИИ-платформа «Детского Мира» уже работает в проде: LLM-гейтвей с квотами, RAG, агентные сценарии, трассировка и собственный инференс на GPU. Ищем MLOps-инженера ИИ-платформы и агентской платформы. Основная задача роли - работа над качеством решений и улучшение утилизации ресурсов (GPU/токены).
Чем предстоит заниматься:
-
Строить систему оценки качества LLM-решений: golden set, LLM-as-judge, метрики retrieval (recall@k, groundedness), регрессионные гейты промптов и RAG в CI.
-
Развивать ML мониторинг: дашборды p95, RPS, uptime, утилизации GPU и расхода токенов, централизованные логи, алерты.
-
Управлять инференсом: собственный vLLM плюс внешние модели через провайдеров - роутинг по сложности, fallback, semantic cache.
-
Настраивать квоты GPU и токенов по командам и доменам, приоритетные очереди, учёт стоимости в рублях.
-
Искать проблемы с качествов на живом трафике раньше, чем поступят жалобы пользователей.
-
Развивать CI/CD: eval-гейты, canary, откат; тестовый контур, бэкапы и восстановление.
-
Развивать STT-контур: транскрипция и саммеризация встреч.
Что ожидаем от вас:
- Опыт вывода ML-моделей в production и их сопровождения;
- Практический опыт с Docker, Kubernetes и CI/CD;
- Понимание полного жизненного цикла ML-модели: эксперименты, валидация, версионирование моделей и данных, Model Registry;
- Опыт разработки ML-платформ и сервисов, а не только поддержки инфраструктуры;
- Понимание принципов мониторинга ML-систем: latency, uptime, error rate, drift данных и моделей, контроль качества и алертинг;
- Опыт построения и сопровождения асинхронных пайплайнов;
- Знание Kafka или RabbitMQ;
- Уверенный Python: автоматизация, скрипты, ML-пайплайны, работа с API;
- Понимание подходов к оценке качества LLM и AI-агентов: eval-датасеты, сценарные метрики, LLM-as-a-Judge.
Будет плюсом:
- Опыт LLMOps: vLLM, Triton, кэширование, батчинг, оптимизация затрат на инференс;
- Опыт работы с Langfuse, LangSmith или OpenTelemetry;
- MLflow, ClearML, Kubeflow или W&B;
- Terraform / Ansible;
- GitLab CI / GitHub Actions;
- Опыт работы с GPU-кластерами.
Мы предлагаем:
-
Официальное оформление в соответствии с ТК РФ в IT-аккредитованную компанию;
-
Совокупный доход: оклад + годовой бонус;
-
График работы: 5/2 (гибридный формат работы/ удаленный);
-
Вакансия открыта для кандидатов, проживающих в РФ, удалённый формат работы из других стран не рассматривается;
-
Техника для работы;
-
Полис ДМС;
-
Программа Best Benefits;
-
Внутреннее обучение;
-
Спортивные и развлекательные мероприятия, участие в корпоративной жизни компании.
Присоединяйтесь к нам и станьте частью истории бренда с историей!

