Overview
Company
Profile match
Impact
Conditions
Benefits
Hiring process
Similar jobs
Cloud.ru is a major Russian provider of cloud services and artificial intelligence solutions, formerly operating under the name SberCloud. The company offers full-stack infrastructure and platform tools (IaaS, PaaS, and machine learning environments) to support enterprises, startups, and developers across various industries. Operating through robust Tier III data centers, it delivers high-performance compute resources, managed cloud products, and enterprise-grade security compliance.
Навыки: SQL. Квалификация: Lead. Специализации: Разработчик приложений.
Чем предстоит заниматься:
- управление надежностью сервисов: проектирование, внедрение и поддержка SLO/SLI, error budget, координация процесса соблюдения SLO, управление использованием Error Budget;
- мониторинг и алертинг: разработка метрик, алертов, дашбордов, ранбуков (и их регулярный анализ/рефакторинг);
- capacity planning: прогнозирование нагрузки и планирование ресурсов; - performance optimization: выявление и устранение bottleneck, оптимизация производительности;
- incident & problem management: участие в устранении инцидентов (роль Incident Commander), расследование причин (RCA); ревью postmortems, разработка и внедрение corrective actions, при необходимости
- заведение проблем и контроль их решения;
- повышение отказоустойчивости: улучшение observability (логи, трейсы, метрики: обогащение, добавление, ревизия...);
- ревью DRP, участие в качестве координатора в DRT, поддержание DRP в актуальном состоянии; автоматизация: устранение рутины
- IaC (Terraform/Ansible) и Python/Go/Bash;
- менторство и обучение: проведение внутренних воркшопов для команд разработки по темам надёжности, observability, помощь в развитии навыков SRE у других инженеров, code review внутри команды;
- активное участие в разработке модели здоровья продукта и quality gates.
Что мы ждем от кандидата:
- экспертиза и практический опыт в SRE-практиках: глубокое понимание SLO/SLI, error budget, toil reduction, automation first... умение применять это практически для обеспечения надежности сервисов;
- умение проводить code review для оценки готовности к выходу в production новых функций и сервисов с точки зрения надёжности, наблюдаемости и эффективности, понимание, как изменения в коде влияют на смежные системы и общую стабильность платформы;
- практический опыт построения и внедрения quality gates в CI/CD процесс для управления рисками при развертывании: для предотвращения попадания нестабильных изменений в production;
- эксперт в эксплуатации Linux, включая диагностику на уровне ядра (процессы, память, сеть); глубокие знания и понимание того, как работают сети на уровнях L2-L7;
- опыт работы с Kubernetes и понимание его internal'ов для диагностики сложных проблем.
Дополнительно:
- системное мышление и умение анализировать сложные failure-сценарии, выявлять корневые причины, находить способы их устранения;
- опыт написания и ревью технической документации (runbooks, postmortems...);
- опыт коммуникации с разработчиками и бизнесом (объяснение trade-offs между reliability и feature dev).
Recommended for you based on this role
Similar stack
Same company
In your city
DevOps (Кибербезопасность)
1 day ago
Remote • Moscow
DevOps
Ansible
ArgoCD
CI/CD
Git
GitOps
Kubernetes
Terraform
Cybersecurity
Least Privilege
Apply
Менеджер продукта Evo CNI
1 day ago
In office • 3+ years exp • Moscow
DevOps
AWS
Azure
GCP
Kubernetes
Yandex Cloud
Apply
Apply
Apply
Руководитель группы дежурных аналитиков SOC
13 days ago
In office • Full-Time • Moscow
DevOps
SLI/SLO/SLA
Cybersecurity
MITRE ATT&CK
Apply
In office • Full-Time • Bachelor's Degree • Moscow
DevOps
Kubernetes
OpenStack
Management
Confluence
Jira
Apply
Инженер технической поддержки
1 month ago
In office • Full-Time • Moscow
DevOps
Grafana
KVM
QEMU
Red Hat
SLI/SLO/SLA
VMWare
Zabbix
Apply
Платформенный SRE
1 month ago
In office • Full-Time • Moscow
DevOps
CI/CD
Loki
OpenTelemetry
Prometheus
SLI/SLO/SLA
Grafana
Chips/EDA
PoC Library
Apply
Дежурный сетевой инженер (L2)
1 month ago
Remote • Full-Time • Moscow
Python
SQL
DevOps
Ansible
Grafana
Prometheus
SLI/SLO/SLA
Terraform
VMWare
Zabbix
Cybersecurity
Tcpdump
Wireshark
Apply
SRE-инженер
1 month ago
Remote • Full-Time • Moscow
Bash
Python
SQL
Node JS
JavaScript
Node JS
Commander.js
DevOps
Ansible
CI/CD
Error Budget
Kubernetes
SLI/SLO/SLA
Terraform
Apply
Career impact
Discover how this job can transform your career
Get a personal career forecast for this job - salary uplift, next-level role, skill boost and a 3-year financial impact, all calculated from your profile.
Personal salary uplift vs. your current pay
Your 3-year career trajectory
Skills you will level up in this role
3-year financial impact in dollars
Free forever • Less than a minute • No credit card
Work setup
Location
Moscow
Remote work
Remote (Russia)
Employment
Full-Time

