Overview
Company
Profile match
Impact
Conditions
Benefits
Hiring process
Similar jobs
Cloud.ru is a major Russian provider of cloud services and artificial intelligence solutions, formerly operating under the name SberCloud. The company offers full-stack infrastructure and platform tools (IaaS, PaaS, and machine learning environments) to support enterprises, startups, and developers across various industries. Operating through robust Tier III data centers, it delivers high-performance compute resources, managed cloud products, and enterprise-grade security compliance.
Навыки: CI/CD. Специализации: Инженер по доступности сервисов.
На этой позиции тебе предстоит:
- Участие в продуктовой RUN команде
- Методология наблюдаемости - формировать требования к данным и метрикам; внедрять стандарты надёжности данных и лучшие практики наблюдаемости
- Анализ потоков и метрик - работать с Prometheus, Loki, OpenTelemetry и др.; выявлять отклонения, узкие места и возможности оптимизации
- Data QA (контроль качества данных) - проверять полноту, корректность и соответствие требованиям; автоматизировать проверки через Quality Gates (правильность схемы, покрытие метрик, отсутствие дублирования, соответствие SLA/SLO) → оценка качества перед попаданием в прод
- Тестирование и R&D Ops - писать и поддерживать автоматические тесты компонентов мониторинга; проверять наличие и корректность метрик, логов, трассировок после деплоя; планировать тесты надёжности (отказы узлов, сетевые задержки, падения зависимостей) и канарейковые/теневые развертывания с автоматическим откатом; проводить нагрузочное тестирование, сравнивать результаты с базовым профилем; исследовать новые технологии, собирать метрики,готовить рекомендации; интегрировать Quality Gates в CI/CD - каждый релиз проходит проверку качества и надёжности; отслеживать эффективность через SRE-KPIs (MTTR, доля неудачных изменений, коэффициент успешных хаос-тестов, переход PoC → прод) и публиковать их в дашбордах
- Разбор инцидентов и RCA - анализировать логи, трассировки, метрики, ETL-pipeline; документировать причины, фиксировать ошибки, предлагать решения; вести базу знаний (post-mortem, операционные руководства)
- Техническая документация - создавать и актуализировать схемы потоков данных, инструкции, описания архитектуры платформы
- Развитие внутренней платформы мониторинга - улучшать функциональность и производительность; автоматизировать наблюдаемость и оповещения как код ); интегрировать пороги проверки качества в CI/CD для проверки перед деплоем
- Обучение и передача знаний - готовить обучающие материалы, проводить воркшопы. Способствовать принятию единых практик наблюдаемости
Что мы ждем от кандидата:
- Знаете, как сделать отказоустойчивый масштабируемый сервис
- Имеете опыт написания и ревью технической документации Имеете опыт коммуникации с разработчиками и бизнесом (объяснение компромиссов между надёжностью и разработкой функций)
- Обладаете системным мышлением и умением анализировать сложные сценарии отказа, выявлять корневые причины, находить способы их устранения
- Имеете практический опыт построения и внедрения quality gates в CI/CD процесс для управления рисками при развертывании: для предотвращения попадания нестабильных изменений в прод
- Знаете, как определять SLISLO для сервиса, у которого нет исторических данных о надежности
- Знаете, как рассчитать композитные SLO для сервиса, зависящего от 10+ микросервисов
- Имеете опыт внедрения наблюдаемости как код (observability as code), оповещения как код (alerting as code))
Recommended for you based on this role
Similar stack
Same company
In your city
Apply
Apply
Руководитель группы дежурных аналитиков SOC
13 days ago
In office • Full-Time • Moscow
DevOps
SLI/SLO/SLA
Cybersecurity
MITRE ATT&CK
Apply
In office • Full-Time • Bachelor's Degree • Moscow
DevOps
Kubernetes
OpenStack
Management
Confluence
Jira
Apply
Инженер технической поддержки
1 month ago
In office • Full-Time • Moscow
DevOps
Grafana
KVM
QEMU
Red Hat
SLI/SLO/SLA
VMWare
Zabbix
Apply
Дежурный сетевой инженер (L2)
1 month ago
Remote • Full-Time • Moscow
Python
SQL
DevOps
Ansible
Grafana
Prometheus
SLI/SLO/SLA
Terraform
VMWare
Zabbix
Cybersecurity
Tcpdump
Wireshark
Apply
SRE-инженер
1 month ago
Remote • Full-Time • Moscow
Bash
Python
SQL
Node JS
JavaScript
Node JS
Commander.js
DevOps
Ansible
CI/CD
Error Budget
Kubernetes
SLI/SLO/SLA
Terraform
Apply
Технический лидер SRE
1 month ago
Remote • Full-Time • Moscow
Bash
Go
Python
SQL
Node JS
JavaScript
Node JS
Commander.js
DevOps
Ansible
CI/CD
Error Budget
Kubernetes
SLI/SLO/SLA
Terraform
Apply
Ведущий SRE-инженер (Москва)
1 month ago
In office • Full-Time • Moscow
SQL
DevOps
Grafana
OpenStack
Prometheus
SLI/SLO/SLA
Apply
Архитектор по кибербезопасности
1 month ago
In office • Full-Time • Bachelor's Degree • Moscow
Cybersecurity
ISO 27001
PCI DSS
Apply
Career impact
Discover how this job can transform your career
Get a personal career forecast for this job - salary uplift, next-level role, skill boost and a 3-year financial impact, all calculated from your profile.
Personal salary uplift vs. your current pay
Your 3-year career trajectory
Skills you will level up in this role
3-year financial impact in dollars
Free forever • Less than a minute • No credit card
Work setup
Location
Moscow
Remote work
In office
Employment
Full-Time

