Overview
Company
Profile match
Impact
Conditions
Benefits
Hiring process
Similar jobs
Cloud.ru is a major Russian provider of cloud services and artificial intelligence solutions, formerly operating under the name SberCloud. The company offers full-stack infrastructure and platform tools (IaaS, PaaS, and machine learning environments) to support enterprises, startups, and developers across various industries. Operating through robust Tier III data centers, it delivers high-performance compute resources, managed cloud products, and enterprise-grade security compliance.

Навыки: CI/CD. Специализации: Инженер по доступности сервисов.

На этой позиции тебе предстоит:

  • Участие в продуктовой RUN команде
  • Методология наблюдаемости - формировать требования к данным и метрикам; внедрять стандарты надёжности данных и лучшие практики наблюдаемости
  • Анализ потоков и метрик - работать с Prometheus, Loki, OpenTelemetry и др.; выявлять отклонения, узкие места и возможности оптимизации
  • Data QA (контроль качества данных) - проверять полноту, корректность и соответствие требованиям; автоматизировать проверки через Quality Gates (правильность схемы, покрытие метрик, отсутствие дублирования, соответствие SLA/SLO) → оценка качества перед попаданием в прод
  • Тестирование и R&D Ops - писать и поддерживать автоматические тесты компонентов мониторинга; проверять наличие и корректность метрик, логов, трассировок после деплоя; планировать тесты надёжности (отказы узлов, сетевые задержки, падения зависимостей) и канарейковые/теневые развертывания с автоматическим откатом; проводить нагрузочное тестирование, сравнивать результаты с базовым профилем; исследовать новые технологии, собирать метрики,готовить рекомендации; интегрировать Quality Gates в CI/CD - каждый релиз проходит проверку качества и надёжности; отслеживать эффективность через SRE-KPIs (MTTR, доля неудачных изменений, коэффициент успешных хаос-тестов, переход PoC → прод) и публиковать их в дашбордах
  • Разбор инцидентов и RCA - анализировать логи, трассировки, метрики, ETL-pipeline; документировать причины, фиксировать ошибки, предлагать решения; вести базу знаний (post-mortem, операционные руководства)
  • Техническая документация - создавать и актуализировать схемы потоков данных, инструкции, описания архитектуры платформы
  • Развитие внутренней платформы мониторинга - улучшать функциональность и производительность; автоматизировать наблюдаемость и оповещения как код ); интегрировать пороги проверки качества в CI/CD для проверки перед деплоем
  • Обучение и передача знаний - готовить обучающие материалы, проводить воркшопы. Способствовать принятию единых практик наблюдаемости

Что мы ждем от кандидата:

  • Знаете, как сделать отказоустойчивый масштабируемый сервис
  • Имеете опыт написания и ревью технической документации Имеете опыт коммуникации с разработчиками и бизнесом (объяснение компромиссов между надёжностью и разработкой функций)
  • Обладаете системным мышлением и умением анализировать сложные сценарии отказа, выявлять корневые причины, находить способы их устранения
  • Имеете практический опыт построения и внедрения quality gates в CI/CD процесс для управления рисками при развертывании: для предотвращения попадания нестабильных изменений в прод
  • Знаете, как определять SLISLO для сервиса, у которого нет исторических данных о надежности
  • Знаете, как рассчитать композитные SLO для сервиса, зависящего от 10+ микросервисов
  • Имеете опыт внедрения наблюдаемости как код (observability as code), оповещения как код (alerting as code))

Recommended for you based on this role

Similar stack
Same company
In your city
Remote/Hybrid • Moscow
AI/ML
Embeddings
Fine-tuning
LLM
RAG
Apply
In office • Full-Time • Moscow
Python
SQL
AI/ML
LLM
Apply
In office • Full-Time • Moscow
DevOps
SLI/SLO/SLA
Cybersecurity
MITRE ATT&CK
Apply
In office • Full-Time • Bachelor's Degree • Moscow
DevOps
Kubernetes
OpenStack
Management
Confluence
Jira
Apply
In office • Full-Time • Moscow
DevOps
Grafana
KVM
QEMU
Red Hat
SLI/SLO/SLA
VMWare
Zabbix
Apply
Remote • Full-Time • Moscow
Python
SQL
DevOps
Ansible
Grafana
Prometheus
SLI/SLO/SLA
Terraform
VMWare
Zabbix
Cybersecurity
Tcpdump
Wireshark
Apply
SRE-инженер 1 month ago
Remote • Full-Time • Moscow
Bash
Python
SQL
Node JS
JavaScript
Node JS
Commander.js
DevOps
Ansible
CI/CD
Error Budget
Kubernetes
SLI/SLO/SLA
Terraform
Apply
Remote • Full-Time • Moscow
Bash
Go
Python
SQL
Node JS
JavaScript
Node JS
Commander.js
DevOps
Ansible
CI/CD
Error Budget
Kubernetes
SLI/SLO/SLA
Terraform
Apply
In office • Full-Time • Moscow
SQL
DevOps
Grafana
OpenStack
Prometheus
SLI/SLO/SLA
Apply
In office • Full-Time • Bachelor's Degree • Moscow
Cybersecurity
ISO 27001
PCI DSS
Apply
Career impact
Discover how this job can transform your career
Get a personal career forecast for this job - salary uplift, next-level role, skill boost and a 3-year financial impact, all calculated from your profile.
Personal salary uplift vs. your current pay
Your 3-year career trajectory
Skills you will level up in this role
3-year financial impact in dollars
Create free account
Free forever • Less than a minute • No credit card

Work setup

Location
Moscow
Remote work
In office
Employment
Full-Time