{"id":1465371,"url":"https://alion.io/job/detsky-mir-data-engineer-hadoop-spark","title":"Data Engineer (Hadoop / Spark)","company":{"id":61813,"name":"Detsky Mir","domain":"detmir.ru","url":"https://alion.io/company/detsky-mir","size_band":"5000+","is_staffing_agency":false,"employer_type":"direct","is_intermediary":false,"listed_via":null,"ats_vendor":"HeadHunter","truth_index":{"grade":"D","score":43,"open_postings":26,"ghost_share":0.808,"stale_share":0,"repost_share":0.885,"time_to_fill_p50_days":6,"computed_at":"2026-10-01T05:45:00Z"}},"role":"Data Science","role_family":"Data Science","seniority":"middle","employment_type":null,"work_mode":"remote","remote_scope":"stated_regions","remote_scope_basis":"board_field","remote_working_hours":null,"hiring_geo_confidence":"structured","locations":["Moscow, Russia"],"countries":["RU"],"hiring_countries":["RU","BY","KZ","KG","AM"],"hiring_countries_total":5,"salary":null,"salary_estimate":{"min_usd":22000,"max_usd":48000,"period":"year","method":"role_seniority_country_cell","sample_n":10},"experience_years_min":3,"visa_sponsorship":false,"relocation_package":false,"has_equity":false,"technologies":[{"name":"Airflow","optional":false},{"name":"Amazon S3","optional":false},{"name":"Apache Kafka","optional":false},{"name":"Apache NiFi","optional":false},{"name":"ClickHouse","optional":false},{"name":"dbt","optional":false},{"name":"ETL/ELT","optional":false},{"name":"Hadoop","optional":false},{"name":"Kubernetes","optional":false},{"name":"MinIO","optional":false},{"name":"Spark","optional":false},{"name":"SQL","optional":false},{"name":"Superset","optional":false},{"name":"CI/CD","optional":true},{"name":"Docker","optional":true},{"name":"GitLab CI","optional":true},{"name":"Grafana","optional":true},{"name":"Helm","optional":true},{"name":"Scala","optional":true},{"name":"VictoriaMetrics","optional":true}],"status":"live","first_seen_at":"2026-09-29T14:36:41Z","employer_posted_date":"2026-09-29","last_verified_at":"2026-10-01T14:50:00Z","board_verified":true,"closed_at":null,"days_open":2,"trust":{"level":"ok","repost_count":null,"flags":[],"days_open":2},"description":"«Детмир Тех» развивает цифровую экосистему группы компаний «Детский мир». Мы создаём продукты для миллионов клиентов и сервисы, которые помогают бизнесу принимать решения на основе данных.\n Ищем Data Engineer в команду Big Data Platform. Платформа построена на Hadoop 3 и Apache Spark и является основным источником данных для всей группы компаний.\n Главная задача - развивать надёжную и производительную платформу обработки больших объёмов данных: проектировать пайплайны, оптимизировать Spark-приложения, развивать Data Lake и совершенствовать архитектуру Hadoop-кластера.\n Чем предстоит заниматься:\n Разрабатывать и оптимизировать batch-процессы на Apache Spark.\n Проектировать ETL/ELT-пайплайны для обработки больших объёмов данных.\n Создавать и поддерживать витрины данных в Hadoop.\n Оптимизировать Spark jobs: partitioning, shuffle, data skew, использование памяти и ресурсов кластера.\n Развивать архитектуру Data Lake и подходы к организации и хранению данных.\n Организовывать загрузку и передачу данных через Kafka и S3 API (MinIO).\n Автоматизировать процессы с помощью Apache Airflow и Apache NiFi.\n Поддерживать трансформации данных в dbt Core.\n Развивать и поддерживать витрины данных в ClickHouse.\n Оптимизировать запросы и процессы загрузки данных в ClickHouse, разбираться с проблемами производительности.\n Поддерживать аналитическую платформу на Apache Superset, решать возникающие технические проблемы.\n Внедрять проверки качества данных и мониторинг пайплайнов.\n Исследовать причины сбоев и деградации производительности.\n Помогать аналитикам и дата-сайентистам эффективно работать с платформой.\n Участвовать в развитии внутренних инструментов и стандартов Data Engineering.\n Участвовать в развёртывании и эксплуатации компонентов платформы в Kubernetes.\n Что для нас важно:\n От трёх лет опыта работы с Hadoop и Apache Spark.\n Знание основных компонентов Hadoop и принципов работы HDFS и Spark.\n Глубокое понимание архитектуры Spark и принципов распределённых вычислений.\n Опыт разработки и оптимизации Spark batch jobs.\n Уверенное владение SQL.\n Опыт проектирования DWH или Data Lake.\n Опыт построения ETL/ELT-процессов.\n Практический опыт работы с Apache Airflow.\n Знание форматов хранения данных.\n Понимание принципов партиционирования и организации данных в Data Lake.\n Умение диагностировать проблемы с shuffle, partitioning, data skew, памятью и использованием ресурсов кластера.\n Умение анализировать производительность распределённых приложений и находить узкие места.\n Умение писать чистый, тестируемый и поддерживаемый код.\n Готовность принимать технические решения и отвечать за результат.\n Будет преимуществом:\n Опыт разработки на Scala.\n Знание Kafka и принципов потоковой обработки данных.\n Опыт работы с ClickHouse и оптимизации запросов.\n Опыт работы с Apache Superset.\n Знакомство с Apache NiFi и dbt Core.\n Опыт эксплуатации приложений в Kubernetes.\n Знание Docker, Helm и GitLab CI/CD.\n Опыт работы с DataHub или другими Data Catalog решениями.\n Опыт построения мониторинга data-платформ и пайплайнов.\n Знакомство с VictoriaMetrics, Grafana, Hue или Jupyter.\n Опыт работы с большими Hadoop-кластерами и высокими объёмами данных.\n Наш стек:\n Хранение и обработка: Hadoop 3, HDFS, Apache Spark\n Доставка и обмен данными: Kafka, S3\n Оркестрация и трансформации: Apache Airflow, Apache NiFi, dbt Core\n Аналитические хранилища: ClickHouse\n Ad-hoc аналитика: Hue, Jupyter\n Каталог данных: DataHub\n BI и визуализация: Apache Superset, Grafana\n Мониторинг: VictoriaMetrics, Grafana\n Инфраструктура: Kubernetes, Docker, Helm\n CI/CD: GitLab CI/CD\n Мы предлагаем:\n Официальное оформление в соответствии с ТК РФ в IT-аккредитованную компанию;\n Совокупный доход: оклад + годовой бонус;\n График работы: 5/2 (гибридный формат работы);\n Вакансия открыта для кандидатов, проживающих в РФ, удалённый формат работы из других стран не рассматривается;\n Техника для работы;\n Полис ДМС;\n Программа Best Benefits;\n Внутреннее обучение;\n Спортивные и развлекательные мероприятия, участие в корпоративной жизни компании.\n Присоединяйтесь к нам и станьте частью истории бренда с историей!","description_format":"text","description_chars":4098,"description_truncated":false,"requirements":{"experience_years_min":3,"management_years_min":null,"team_size_min":null,"manages_managers":false,"education":null,"security_clearance":false,"languages":[{"language":"Russian","level":"Advanced (C1)","optional":false}]},"benefits":[],"hiring_locations":[{"name":"Russia","iso":"RU","kind":"country"},{"name":"Belarus","iso":"BY","kind":"region"},{"name":"Kazakhstan","iso":"KZ","kind":"region"},{"name":"Kyrgyzstan","iso":"KG","kind":"region"},{"name":"Armenia","iso":"AM","kind":"region"}],"hiring_excludes":[],"relocation_offered":false,"industries":["Toys, Games & Puzzles","Baby Products","Children's Clothing"],"lifecycle":[{"event":"open","at":"2026-09-29T14:42:12Z"}],"liveness":{"score":63,"band":"ok","label":"Likely open","p_open":1,"p_active":0.629,"p_room":1,"age_days":1,"expected_fill_days":6,"reasons":["conf:22","stale_co","velocity","win:early"],"computed_at":"2026-10-01T05:45:00Z"},"pay":null,"html_url":"https://alion.io/job/detsky-mir-data-engineer-hadoop-spark","json_url":"https://alion.io/job/detsky-mir-data-engineer-hadoop-spark.json","meta":{"generated_at":"2026-10-01T19:42:10Z","cache_seconds":300,"methodology":"https://alion.io/methodology","terms":"https://alion.io/terms","contact":"https://alion.io/contact","api":"https://alion.io/developers","usage":{"tier":"crawler","counted_by":"address","units_charged":1,"used_today":2361,"day_limit":5000,"remaining_today":2639,"minute_limit":60,"resets_at":"2026-10-02T00:00:00Z"}}}