Ozon Банк - это современные финансовые технологии для людей и бизнеса. Мы сами реализуем ключевые системы: процессинг, учётное ядро, переводы. Даём возможность влиять на результат, ценим открытость и поддерживаем коллег.
Ищем дата-инженера в команду машинного обучения. Вам предстоит строить и поддерживать пайплайны больших данных для скоринга, антифрода и других ML-продуктов: от загрузки и обработки данных до доставки фичей и результатов моделей в продакшн.
Вас ждут задачи с большими объёмами данных, прямое влияние на запуск ML-продуктов и работа вместе с дата-сайентистами, MLOps-инженерами и аналитиками.
Вам предстоит:
-
разрабатывать batch-пайплайны на Spark/PySpark под управлением Airflow
-
готовить витрины и датасеты для обучения, скоринга и мониторинга моделей
-
работать с HDFS: организовывать слои и партиционирование данных, контролировать хранение и квоты
-
оптимизировать производительность и ресурсоёмкость Spark-задач
-
проектировать загрузку и хранение данных в ClickHouse, оптимизировать запросы и структуру таблиц
-
обеспечивать надёжность пайплайнов: DQ-проверки, мониторинг, алерты и разбор инцидентов
Для нас важны:
-
опыт разработки промышленных пайплайнов данных
-
уверенное знание Spark/PySpark, HDFS, Python и SQL
-
опыт работы с Airflow и ClickHouse
-
понимание распределённых вычислений, партиционирования и оптимизации ETL-процессов
Будет плюсом:
-
опыт работы с Kafka, Feature Store и данными для ML, скоринга или антифрода

