Confirmed on the employer's own hiring board on Sep 25, 2026. First seen by Alion on Sep 25, 2026. T1 Group scores A on the Alion truth index.
Чем предстоит заниматься:
- Отвечать за надёжность и стабильную работу закреплённых ключевых сервисов облачной платформы в production.
- Глубоко разбираться в устройстве сервисов, их компонентах, зависимостях и сценариях отказа.
- Участвовать в выводе новых сервисов и версий в production, обеспечивать безопасный и воспроизводимый deployment.
- Разрабатывать и поддерживать Helm charts и deployment-конфигурации.
- Помогать командам разработки с подготовкой и выполнением deployment в production.
- При необходимости самостоятельно настраивать и доустанавливать необходимые инфраструктурные компоненты в production.
- Организовывать получение необходимых доступов и взаимодействовать с профильными инфраструктурными командами.
- Настраивать и развивать мониторинг, метрики, логирование, алертинг и другие средства observability.
- Контролировать работу сервисов в production и выявлять деградации и потенциальные проблемы до их влияния на клиентов.
- Участвовать в расследовании инцидентов, ошибок и деградаций, определять первопричины и координировать их устранение.
- Анализировать повторяющиеся проблемы и инициировать изменения, предотвращающие их повторное возникновение.
- Участвовать в postmortem и улучшении эксплуатационных процессов.
- Автоматизировать рутинные операции и снижать объём ручной работы.
- Участвовать в определении и контроле SLI/SLO для закреплённых сервисов.
- Оценивать влияние технических проблем на доступность, производительность и основные пользовательские функции сервисов.
- Взаимодействовать с разработчиками на всём жизненном цикле сервиса: от подготовки production до устранения эксплуатационных проблем.
Какие навыки для нас важны:
- Высшее техническое образование (ИТ, вычислительная техника, автоматизация, телекоммуникации или смежные направления).
- Опыт работы от 3-5 лет в эксплуатации, SRE, DevOps, Platform Engineering или близких направлениях. Желателен опыт сопровождения высоконагруженных или критичных production-сервисов.
Знания и навыки:
- Linux на уровне продвинутого администратора/инженера.
- Kubernetes.
- Helm.
- CI/CD и принципы автоматизированного deployment.
- Мониторинг и observability: метрики, логи, алертинг.
- Понимание принципов отказоустойчивости и эксплуатации production-систем.
- Навыки диагностики проблем и анализа первопричин.
- Git.
- Умение работать с API, CLI и shell/python-скриптами.
- Понимание сетевого взаимодействия и основных инфраструктурных компонентов.
- Готовность глубоко разбираться в устройстве закреплённых сервисов.
- Практический опыт SRE-подхода: SLI/SLO, error budget, incident/problem management.
- Опыт эксплуатации OpenStack или других облачных платформ.
- Prometheus, Grafana, Loki/ELK/OpenSearch или аналогичные системы.
- Опыт работы с PostgreSQL, Redis, Kafka/RabbitMQ или другими распределёнными компонентами.
- Опыт построения и улучшения production-инфраструктуры.
- Опыт performance/capacity анализа.
- Опыт автоматизации рутинных операций.
- Знание принципов release engineering и безопасного rollout.
- Опыт взаимодействия с командами разработки.
Требования к личным качествам:
- Высокая ответственность за результат и production.
- Системное мышление.
- Умение самостоятельно расследовать незнакомые проблемы.
- Техническая любознательность и готовность глубоко разбираться в работе сервисов.
- Проактивность: способность выявлять проблемы до появления обращений от клиентов.
- Умение конструктивно взаимодействовать с разработчиками и инфраструктурными командами.
- Способность доводить проблему от обнаружения до устранения первопричины.
- Способность работать самостоятельно и принимать технические решения.
-
Знание иностранного языка: Английский - чтение технической документации, понимание issue/troubleshooting материалов; B1-B2 и выше.
Знание стека: Kubernetes, Helm, Linux, Git, CI/CD, Prometheus, Grafana, Docker, REST/API, сетевые технологии, системы логирования и мониторинга. Желательно OpenStack и связанные cloud-инфраструктурные технологии.
Профессиональные навыки:
- Deployment и сопровождение сервисов в production.
- Разработка и поддержка Helm charts.
- Помощь командам разработки при подготовке и выводе сервисов в production.
- Настройка production-инфраструктуры и необходимых инфраструктурных компонентов.
- Подготовка необходимых доступов и взаимодействие с ответственными инфраструктурными командами.
- Настройка мониторинга, метрик, логирования и алертинга.
- Контроль production-состояния и раннее выявление деградаций.
- Анализ incidents и системных ошибок.
- Поиск root cause и организация устранения проблем.
- Участие в postmortem и предотвращении повторения инцидентов.
- Повышение отказоустойчивости и наблюдаемости сервисов.
- Автоматизация эксплуатационных операций и снижение ручного труда.
- Участие в определении и контроле SLI/SLO для закреплённых сервисов.
- Анализ влияния технических проблем на пользовательский опыт и работоспособность основных функций сервиса.
- Взаимодействие с разработкой на всём жизненном цикле сервиса.
Специализированные программы: Kubernetes, Helm, GitLab/GitHub или аналогичные CI/CD-системы, Prometheus, Grafana, системы централизованного логирования, Linux CLI, Terraform/Ansible или аналоги

