В IntellectDialog ищем Senior DevOps / Strong Middle+ инженера с реальным опытом работы с production-инфраструктурой.
Нам нужен инженер, который не просто умеет развернуть Docker, написать pipeline или поднять VPN по инструкции, а понимает инфраструктуру целиком: Linux, сети, маршрутизацию, контейнеры, базы данных, отказоустойчивость и прохождение трафика между сервисами. Специалист, который способен не только поддерживать уже работающую инфраструктуру, но и проектировать её, находить слабые места и предлагать технически обоснованные решения.
Формат работы: удалённо, частичная / дополнительная занятость, гибкий график.
Оплата: 6 000 тенге в час.
В перспективе возможно обсуждение доли в компании.
Что у нас за инфраструктура
У нас распределённая архитектура с большим количеством сервисов и существенным объёмом сетевого трафика.
В работе приходится решать задачи, связанные с:
- контейнеризацией и оркестрацией;
- высокой доступностью сервисов;
- горизонтальным масштабированием;
- эксплуатацией stateful-компонентов;
- CI/CD;
- мониторингом и observability;
- сетевой связностью между сервисами и инфраструктурными сегментами;
- проксированием и управлением маршрутами трафика;
- построением VPN-сетей;
- эксплуатацией инфраструктуры, где необходимо понимать не только отдельный сервис, но и полный путь прохождения трафика через систему.
Поэтому нам нужен человек, который уже самостоятельно решал подобные задачи в production и способен принимать инфраструктурные решения, а не только выполнять готовые инструкции.
Отдельное внимание уделяем сетевому опыту.
Ожидаем уверенное понимание L3/L4 networking и практический опыт построения сложных схем маршрутизации трафика.
Будет важно, если вы самостоятельно проектировали и эксплуатировали:
- сложные таблицы и правила маршрутизации;
- policy-based routing / source-based routing;
- разделение разных типов и потоков трафика по различным маршрутам и uplink'ам;
- управление ingress/egress traffic;
- NAT/SNAT/DNAT;
- маршрутизацию между несколькими сетями, подсетями, VPN и инфраструктурными сегментами;
- site-to-site и point-to-site VPN;
- WireGuard / OpenVPN / IPsec или аналогичные технологии;
- split tunneling и selective routing;
- проксирование TCP/HTTP(S) трафика;
- forward/reverse proxy;
- цепочки proxy и несколько уровней проксирования;
- балансировку и распределение трафика между backend-сервисами;
- HAProxy / Nginx и аналогичные решения;
- DNS и его влияние на маршрутизацию и доступность сервисов;
- Linux networking: routing tables, ip rule, ip route, network namespaces;
- iptables/nftables;
- диагностику packet loss, latency, MTU/MSS, asymmetric routing, connection tracking и проблем сетевой связности.
Особенно интересен опыт, когда необходимо было разделять несколько потоков трафика и динамически или политиками направлять их через разные VPN, proxy, интерфейсы, шлюзы или внешние каналы.
Важно не просто знать названия технологий, а понимать, почему пакет пошёл по конкретному маршруту, где возникает bottleneck и как будет вести себя схема при отказе одного из узлов или каналов.
Основной технологический стек
Нужен production-опыт с существенной частью следующего стека:
- Docker;
- Docker Swarm - clustering, overlay networking, HA;
- GitLab CI/CD;
- Redis;
- Memcached;
- MongoDB;
- MySQL;
- ClickHouse;
- MinIO;
- Grafana;
- Zabbix;
- Linux.
По базам данных ожидаем понимание эксплуатации, а не только подключения приложения к БД:
- replication;
- backup/restore;
- PITR;
- failover;
- восстановление после аварий;
- диагностика проблем производительности и доступности.
Что предстоит делать
- Развивать и поддерживать production-инфраструктуру.
- Проектировать инфраструктурные и сетевые решения.
- Настраивать и оптимизировать маршрутизацию разных потоков трафика.
- Строить и поддерживать VPN- и proxy-инфраструктуру.
- Диагностировать сетевые проблемы на уровне Linux/network stack.
- Развивать Docker Swarm-кластеры и обеспечивать их отказоустойчивость.
- Оптимизировать CI/CD и deployment-процессы.
- Работать с разработчиками при проектировании и запуске новых сервисов.
- Настраивать monitoring, alerting и централизованное логирование.
- Разбирать production-инциденты и находить root cause, а не ограничиваться рестартом сервиса.
- Повышать reliability и availability системы.
- Автоматизировать инфраструктурные операции.
- Проектировать решения с учётом отказов отдельных серверов, сетей, каналов и сервисов.
Что ожидаем от кандидата
- 3+ года коммерческого опыта DevOps / SRE / Infrastructure Engineer либо сопоставимый по глубине production-опыт.
- Уверенная работа с Linux.
- Глубокое понимание Docker и контейнерных сетей.
- Практический опыт Docker Swarm или сопоставимых систем оркестрации.
- Сильное понимание TCP/IP, routing, NAT, DNS, VPN и proxy.
- Практический опыт построения нестандартных схем маршрутизации.
- Опыт эксплуатации MongoDB / MySQL и других stateful-сервисов.
- Опыт построения backup/recovery и failover-механизмов.
- Опыт мониторинга и диагностики production-систем.
- Понимание принципов построения fault-tolerant и distributed systems.
- Способность самостоятельно разбираться в проблеме от уровня приложения до контейнера, ОС, сети и инфраструктуры.
Большим плюсом будет опыт эксплуатации highload / high-traffic инфраструктуры, где сетевые и архитектурные ошибки напрямую влияют на доступность сервиса.
Кого мы ищем
Нам будет особенно интересно поговорить, если вы уже сталкивались с ситуациями, когда:
- падение одного компонента могло повлиять на значительную часть production;
- необходимо было искать причину проблемы одновременно в приложении, контейнере, Linux и сети;
- приходилось проектировать маршрутизацию нескольких независимых потоков трафика;
- трафик необходимо было направлять через разные VPN/proxy/gateway в зависимости от источника, назначения или типа трафика;
- требовалось обеспечить HA не только приложения, но и сетевого контура;
- приходилось разбирать реальные production-инциденты под нагрузкой;
- вы проектировали инфраструктуру с пониманием failure scenarios, а не только happy path.
Мы ценим инженеров, которые могут не только ответить «как это настроить», но и объяснить «почему архитектура должна быть устроена именно так, где она сломается и что произойдёт при отказе каждого компонента».
Что написать при отклике
Пожалуйста, не ограничивайтесь отправкой резюме. Нам важно сразу понять ваш реальный технический уровень.
В сопроводительном сообщении ответьте на несколько вопросов:
1. С какой самой сложной production-инфраструктурой вы работали?
Коротко опишите масштаб: количество серверов/сервисов, примерную нагрузку и за что конкретно отвечали лично вы.
2. Какую сложную сетевую задачу вы решали самостоятельно?
Например: несколько VPN, несколько шлюзов, разделение трафика, сложная маршрутизация, прокси, NAT.
Важно описать не просто используемые технологии, а примерно так:
«Было X → требовалось добиться Y → я спроектировал Z → в результате получили …»
3. Приходилось ли вам направлять разные потоки трафика по разным маршрутам?
Если да - коротко опишите схему и по какому принципу выбирался маршрут.
4. Расскажите об одном серьёзном инциденте в production.
Что сломалось, как вы диагностировали проблему, в чём оказалась причина и что сделали, чтобы ситуация не повторилась.
5. С какими базами данных работали в production?
Что именно настраивали самостоятельно: репликацию, резервное копирование, PITR, автоматическое переключение, восстановление после аварий.
6. Какой у вас практический опыт Docker / Docker Swarm?
Интересует именно эксплуатация кластеров, сети, обновления, отказоустойчивость и реальные проблемы, которые приходилось решать.
7. Если есть опыт ML / LLM - коротко опишите его.
JupyterHub, MLflow, Spark, Ray, DVC, GPU, развёртывание и эксплуатация LLM и т. д.
8. И обязательно подтвердите условия:
Подходит ли вам удалённая частичная занятость с почасовой оплатой 6 000 тенге в час?
Нам не нужен длинный текст. Достаточно нескольких конкретных примеров из вашего опыта.
По ответам должно быть понятно что именно вы делали своими руками, а не только какие технологии были перечислены в стеке компании.
Ждём в команде IntellectDialog.

