Overview
Company
Profile match
Impact
Conditions
Benefits
Hiring process
Similar jobs
Cloud.ru is a major Russian provider of cloud services and artificial intelligence solutions, formerly operating under the name SberCloud. The company offers full-stack infrastructure and platform tools (IaaS, PaaS, and machine learning environments) to support enterprises, startups, and developers across various industries. Operating through robust Tier III data centers, it delivers high-performance compute resources, managed cloud products, and enterprise-grade security compliance.

Навыки: SQL. Квалификация: Lead. Специализации: Разработчик приложений.

Чем предстоит заниматься:

  • управление надежностью сервисов: проектирование, внедрение и поддержка SLO/SLI, error budget, координация процесса соблюдения SLO, управление использованием Error Budget;
  • мониторинг и алертинг: разработка метрик, алертов, дашбордов, ранбуков (и их регулярный анализ/рефакторинг);
  • capacity planning: прогнозирование нагрузки и планирование ресурсов; - performance optimization: выявление и устранение bottleneck, оптимизация производительности;
  • incident & problem management: участие в устранении инцидентов (роль Incident Commander), расследование причин (RCA); ревью postmortems, разработка и внедрение corrective actions, при необходимости
  • заведение проблем и контроль их решения;
  • повышение отказоустойчивости: улучшение observability (логи, трейсы, метрики: обогащение, добавление, ревизия...);
  • ревью DRP, участие в качестве координатора в DRT, поддержание DRP в актуальном состоянии; автоматизация: устранение рутины
  • IaC (Terraform/Ansible) и Python/Go/Bash;
  • менторство и обучение: проведение внутренних воркшопов для команд разработки по темам надёжности, observability, помощь в развитии навыков SRE у других инженеров, code review внутри команды;
  • активное участие в разработке модели здоровья продукта и quality gates.

Что мы ждем от кандидата:

  • экспертиза и практический опыт в SRE-практиках: глубокое понимание SLO/SLI, error budget, toil reduction, automation first... умение применять это практически для обеспечения надежности сервисов;
  • умение проводить code review для оценки готовности к выходу в production новых функций и сервисов с точки зрения надёжности, наблюдаемости и эффективности, понимание, как изменения в коде влияют на смежные системы и общую стабильность платформы;
  • практический опыт построения и внедрения quality gates в CI/CD процесс для управления рисками при развертывании: для предотвращения попадания нестабильных изменений в production;
  • эксперт в эксплуатации Linux, включая диагностику на уровне ядра (процессы, память, сеть); глубокие знания и понимание того, как работают сети на уровнях L2-L7;
  • опыт работы с Kubernetes и понимание его internal'ов для диагностики сложных проблем.

Дополнительно:

  • системное мышление и умение анализировать сложные failure-сценарии, выявлять корневые причины, находить способы их устранения;
  • опыт написания и ревью технической документации (runbooks, postmortems...);
  • опыт коммуникации с разработчиками и бизнесом (объяснение trade-offs между reliability и feature dev).

Recommended for you based on this role

Similar stack
Same company
In your city
Remote • Moscow
DevOps
Ansible
ArgoCD
CI/CD
Git
GitOps
Kubernetes
Terraform
Cybersecurity
Least Privilege
Apply
In office • 3+ years exp • Moscow
DevOps
AWS
Azure
GCP
Kubernetes
Yandex Cloud
Apply
Remote/Hybrid • Moscow
AI/ML
Embeddings
Fine-tuning
LLM
RAG
Apply
In office • Full-Time • Moscow
Python
SQL
AI/ML
LLM
Apply
In office • Full-Time • Moscow
DevOps
SLI/SLO/SLA
Cybersecurity
MITRE ATT&CK
Apply
In office • Full-Time • Bachelor's Degree • Moscow
DevOps
Kubernetes
OpenStack
Management
Confluence
Jira
Apply
In office • Full-Time • Moscow
DevOps
Grafana
KVM
QEMU
Red Hat
SLI/SLO/SLA
VMWare
Zabbix
Apply
In office • Full-Time • Moscow
DevOps
CI/CD
Loki
OpenTelemetry
Prometheus
SLI/SLO/SLA
Grafana
Chips/EDA
PoC Library
Apply
Remote • Full-Time • Moscow
Python
SQL
DevOps
Ansible
Grafana
Prometheus
SLI/SLO/SLA
Terraform
VMWare
Zabbix
Cybersecurity
Tcpdump
Wireshark
Apply
SRE-инженер 1 month ago
Remote • Full-Time • Moscow
Bash
Python
SQL
Node JS
JavaScript
Node JS
Commander.js
DevOps
Ansible
CI/CD
Error Budget
Kubernetes
SLI/SLO/SLA
Terraform
Apply
Career impact
Discover how this job can transform your career
Get a personal career forecast for this job - salary uplift, next-level role, skill boost and a 3-year financial impact, all calculated from your profile.
Personal salary uplift vs. your current pay
Your 3-year career trajectory
Skills you will level up in this role
3-year financial impact in dollars
Create free account
Free forever • Less than a minute • No credit card

Work setup

Location
Moscow
Remote work
Remote (Russia)
Employment
Full-Time