Sobre a oportunidade
Buscamos uma pessoa com forte experiência em observabilidade, monitoramento e troubleshooting de aplicações, para atuar como facilitadora técnica junto aos times de desenvolvimento.
Essa pessoa será responsável por apoiar a evolução da maturidade de observabilidade, analisar indicadores técnicos, identificar oportunidades de melhoria e contribuir para a confiabilidade e performance das aplicações.
Responsabilidades
Apoiar tecnicamente os times de desenvolvimento na análise e resolução de incidentes e problemas de performance;
Analisar indicadores técnicos, logs e métricas para identificação de gargalos e oportunidades de melhoria;
Criar e manter dashboards de monitoramento e observabilidade;
Apoiar na definição, revisão e evolução de SLOs e indicadores de confiabilidade;
Elaborar e evoluir documentos de troubleshooting;
Criar playbooks e promover a disseminação de conhecimento entre os times;
Acompanhar e apoiar a adoção de ferramentas, processos e práticas de observabilidade;
Realizar Proofs of Concept (PoCs) para avaliação de novas ferramentas e soluções;
Contribuir para a evolução das práticas de confiabilidade, monitoramento e experiência do usuário.
Requisitos
Experiência sólida com observabilidade e ferramentas de monitoramento, como Dynatrace, Prometheus, Grafana, Datadog ou similares;
Experiência com análise de logs, métricas e troubleshooting de aplicações;
Conhecimento em aplicações desenvolvidas em Java e Angular, com capacidade para apoiar análises técnicas e troubleshooting;
Familiaridade com Docker e conceitos de containerização;
Experiência com Git e workflows de versionamento, como GitFlow ou trunk-based development;
Conhecimento de práticas de segurança, incluindo WAF e segmentação de ambientes;
Vivência com metodologias ágeis, como Scrum e Kanban;
Capacidade de análise de performance e identificação de gargalos em aplicações.
Diferenciais
Conhecimento em Kubernetes e OpenShift;
Experiência com estratégias de deployment, como Canary, Blue/Green e Rolling Deployment;
Familiaridade com Azure Cloud;
Conhecimento em práticas de Site Reliability Engineering (SRE);
Experiência com ferramentas de CI/CD, como GitHub Actions;
Conhecimento em Apdex e métricas relacionadas à experiência do usuário;
Experiência com automação de processos e desenvolvimento de scripts;
Conhecimento em OpenTelemetry e padrões de observabilidade;
Certificações Microsoft Azure.
Excelente comunicação técnica, com capacidade de interagir com diferentes públicos, incluindo desenvolvedores, arquitetos e gestores;
Perfil colaborativo e capacidade de atuar de forma autônoma;
Mentalidade de facilitador, apoiando e empoderando os times;
Interesse e capacidade para compartilhar conhecimento e promover aculturamento técnico;
Visão analítica para identificar oportunidades de melhoria e propor soluções;
Didática e paciência para conduzir treinamentos e apoiar times técnicos.

