О роли
Twinby - один из крупнейших российских дейтинг-сервисов, миллионы пользователей. Мы перестраиваем разработку Twinby CIS и собираем команду данных заново. Данные продукта приходят из множества источников - продуктовые сервисы, события приложений, платежи, маркетинг - и должны надёжно доезжать туда, где на них строят аналитику и принимают решения.
Data Engineer здесь - единая точка ответственности за движение данных: чтобы они доехали полностью, без потерь и дублей, вовремя и в предсказуемом виде. Ты строишь и держишь пайплайны как настоящий продакшн-сервис, а не как набор разовых выгрузок.
За что ты отвечаешь
-
Захват и доставку данных из продуктовых источников в аналитический контур: потоковый и пакетный ingestion, изменения и удаления, а не только «снимок на вчера».
-
Надёжность доставки: идемпотентность и дедупликация, обработка поздних и переупорядоченных событий, воспроизводимый пересчёт после сбоя.
-
Оркестрацию пайплайнов: запуск по готовности источников, а не по таймеру; зависимости, ретраи, бэкфиллы без даунтайма и без задвоения.
-
Качество данных: тесты данных, проверки свежести и полноты, сверки с источниками, обнаружение аномалий - так, чтобы расхождение было видно раньше, чем его заметит потребитель.
-
Наблюдаемость пайплайнов: метрики доставки, лаг, алерты на разрыв; разбор инцидентов данных до причины и защита от повтора.
-
Контракты и эволюцию схемы: изменения источника не должны молча ломать поток; обратная совместимость и понятные границы ответственности.
Ты работаешь в связке с командой аналитики: ты отвечаешь за то, что данные доезжают надёжно, аналитика - за модель и метрики поверх них.
Кого мы ищем
Data Engineer, который владел движением данных целиком, а не писал разовые выгрузки. Для этого направления это значит:
-
Инженерия доставки. Ты думаешь про гарантии доставки, идемпотентность и дедуп на рефлексе; перезапуск пайплайна для тебя не повод бояться дублей.
-
Поток, а не только снапшот. Тебе близок захват изменений из меняющихся под тобой баз, поздние и out-of-order события, инкрементальная загрузка на больших объёмах.
-
Качество как часть инженерии. Ты сам ставишь тесты данных, проверки свежести и сверки, а не ждёшь, пока кто-то заметит, что данных не хватает.
-
Надёжность пайплайнов. SLA на свежесть, наблюдаемость, разбор инцидентов без поиска виноватого - для тебя это обычная инженерная гигиена.
-
Зрелость в выборе. Ты решаешь, где достаточно at-least-once с дедупом, а где нужна более строгая семантика, и не усложняешь там, где не нужно.
Мы смотрим на доказанную глубину владения движением данных, а не на длину списка инструментов.
Будет плюсом
-
Опыт построения потоковой доставки или захвата изменений с продуктовых баз на масштабе.
-
Опыт бэкафилла большой истории и миграции хранилища без остановки потока.
-
Опыт работы с платёжными или иными потоками, где дубль и потеря стоят дорого.
Чего НЕ требуем
Заученного синтаксиса конкретного оркестратора, сертификатов, знания именно нашего стека или домена дейтинга. Важнее инженерная зрелость и то, что данные у тебя доезжают надёжно и предсказуемо.
Технический стек
Потоковая и пакетная обработка данных, захват изменений (CDC), оркестрация пайплайнов, аналитические хранилища, Python и SQL.
Clickhouse, Apache Airflow
Что предлагаем
-
Планку с нуля: команда данных собирается заново - то, что ты заложишь в надёжность и качество данных, станет стандартом.
-
Настоящую инженерную систему: пайплайны как продакшн-сервис, тесты данных и наблюдаемость вместо ручных сверок, разбор инцидентов без вины.
-
Автономию владельца - ты решаешь «как» движется поток данных; цели и направление обсуждаешь с командой и руководителем.
-
Масштаб и большие данные, где инженерия движения имеет вес.
-
Формат: удалёнка, РФ.

