{"id":1135140,"url":"https://alion.io/job/wildberries-senior-data-engineer-v-trust-safety","title":"Senior Data Engineer в Trust & Safety","company":{"id":99582,"name":"Wildberries","domain":"wb.ru","url":"https://alion.io/company/wildberries-ru","size_band":"1001-5000","is_staffing_agency":false,"is_intermediary":false,"ats_vendor":"HeadHunter","truth_index":{"grade":"A","score":98,"open_postings":44,"ghost_share":0.091,"stale_share":0,"repost_share":0.091,"time_to_fill_p50_days":5,"computed_at":"2026-09-23T05:45:00Z"}},"role":"Data Science","role_family":"Data Science","seniority":"senior","employment_type":null,"work_mode":"on_site","remote_scope":null,"hiring_geo_confidence":"structured","locations":["Moscow, Russia"],"countries":["RU"],"hiring_countries":[],"hiring_countries_total":0,"salary":null,"salary_estimate":{"min_usd":50000,"max_usd":101000,"period":"year","method":"role_seniority_country_cell","sample_n":9},"experience_years_min":4,"visa_sponsorship":false,"relocation_package":false,"has_equity":false,"technologies":[{"name":"Amazon S3","optional":false},{"name":"Apache Iceberg","optional":false},{"name":"Apache Kafka","optional":false},{"name":"Cassandra","optional":false},{"name":"ClickHouse","optional":false},{"name":"Flink","optional":false},{"name":"Machine Learning","optional":false},{"name":"Redis","optional":false},{"name":"SLI/SLO/SLA","optional":false},{"name":"Trino","optional":false},{"name":"Airflow","optional":true},{"name":"Apache Hudi","optional":true},{"name":"dbt","optional":true},{"name":"Feast","optional":true},{"name":"Presto","optional":true},{"name":"Python","optional":true},{"name":"Redpanda","optional":true},{"name":"Spark","optional":true},{"name":"SQL","optional":true}],"status":"live","first_seen_at":"2026-09-23T07:19:37Z","employer_posted_date":"2026-09-23","last_verified_at":"2026-09-22T23:40:11Z","board_verified":true,"closed_at":null,"days_open":0,"trust":{"level":"ok","repost_count":null,"flags":[],"days_open":0},"description":"Мы - команда платформы данных в направлении Trust & Safety. Делаем данные и признаки для моделей машинного обучения, которые используются в антифроде, модерации контента и других продуктах. У нас есть как потоковая платформа (Databus/Kafka + Flink + Redis/Cassandra), так и “озеро” данных на S3/Apache Iceberg с доступом через Trino.\n Мы ищем дата-инженера, который обеспечит расчёт и поставку признаков для ML-моделей - от чтения сырых событий до записи финальных значений в онлайн- и офлайн-хранилища.\nВам предстоит:\n Проектировать и разрабатывать потоковые процессы, которые читают события из Databus/Kafka и считают онлайн-признаки, записывая их в Redis и Cassandra;\n Проектировать и разрабатывать пакетные процессы, которые читают данные из S3/Iceberg через Trino, считают офлайн-признаки и пишут результаты обратно в S3/Iceberg и/или ClickHouse;\n Следить за тем, чтобы один и тот же признак был согласован между обучением и продакшеном (одна логика расчёта, единый контракт);\n Настраивать расписания, пересчёты и бэки, чтобы признаки обновлялись вовремя и выдерживали SLA по свежести;\n Работать с качеством данных: добавлять проверки, мониторить аномалии, разбирать инциденты, когда “признак поехал”;\n Совместно с DS и аналитиками придумывать новые признаки и помогать перевести их из экспериментальных скриптов в стабильные пайплайны.\n Вы нам подходите, если есть: 4-5+ лет опыта в роли Data Engineer / Backend+Data;\n\n Уверенный опыт работы с Kafka-подобными очередями (Databus/Kafka): продюсеры/консьюмеры, партиционирование, ключи, обработка ошибок;\n\n Практический опыт со streaming-движком (желательно Flink; Spark Structured Streaming подойдёт, если есть реальный прод-опыт);\n\n Опыт работы с Redis или Cassandra как онлайновым хранилищем данных/признаков;\n\n Опыт работы с S3-подобным хранилищем и табличным форматом (Iceberg/Delta/Hudi) и доступа к ним через SQL-движок (Trino/Presto/Spark SQL);\n\n Отличное знание SQL и опыт работы с ClickHouse;\n\n Python на уровне уверенной разработки data-скриптов и сервисной логики;\n\n Опыт настройки и сопровождения пайплайнов в Airflow;\n\n Понимание задач ML-пайплайнов: train/serve skew, пересчёты признаков, влияние задержек и потерь событий.\n\n Стек технологий\n Потоковая обработка и очереди: Databus(Redpanda)/Kafka, Apache Flink (или Spark Structured Streaming при готовности переучиться на Flink (java));\n\n Онлайновое хранение признаков: Redis, Cassandra;\n\n Хранение и офлайн-фичи: S3 + Apache Iceberg, доступ через Trino;\n\n Аналитическое хранилище: ClickHouse;\n\n Оркестрация и обработка: Airflow, Python, dbt (для batch-части и моделирования в DWH);\n\n Плюсом будет опыт с одним из feature-store решений (Feast или аналоги) - многие компани.","description_format":"text","description_chars":2694,"description_truncated":false,"requirements":{"experience_years_min":4,"management_years_min":null,"team_size_min":null,"manages_managers":false,"education":null,"security_clearance":false,"languages":[{"language":"Russian","level":"Advanced (C1)","optional":false}]},"benefits":[],"hiring_locations":[],"hiring_excludes":[],"relocation_offered":false,"industries":[],"lifecycle":[{"event":"open","at":"2026-09-23T07:23:54Z"}],"liveness":{"score":86,"band":"hot","label":"Hiring now","p_open":1,"p_active":0.86,"p_room":1,"age_days":0,"expected_fill_days":5,"reasons":["conf:8","win:early"],"computed_at":"2026-09-23T15:26:50Z"},"pay":null,"html_url":"https://alion.io/job/wildberries-senior-data-engineer-v-trust-safety","json_url":"https://alion.io/job/wildberries-senior-data-engineer-v-trust-safety.json","meta":{"generated_at":"2026-09-23T15:26:50Z","cache_seconds":300,"methodology":"https://alion.io/methodology","terms":"https://alion.io/terms","contact":"https://alion.io/contact","api":"https://alion.io/developers"}}