Clurgo to firma stworzona przez developerów dla developerów. Nasze zespoły łączą pełne spektrum kompetencji - od rozwoju oprogramowania i infrastruktury, przez analizę oraz testy, aż po strategiczne zarządzanie produktem i procesami. Realizujemy różnorodne projekty IT dla klientów z wielu branż, dbając o dobre praktyki programistyczne i zachowanie work-life balance. Tworzymy rozwiązania, które mają znaczenie - dla firm w Polsce i na całym świecie.
Dołącz do zespołu odpowiedzialnego za stabilność i niezawodność środowiska produkcyjnego dla Klienta z branży finansowej. W tej roli będziesz zajmować się obsługą incydentów, analizą problemów technicznych oraz automatyzacją działań operacyjnych. Będziesz pracować z systemami monitoringu i observability, analizować logi oraz metryki, a także współpracować z zespołami developerskimi i infrastrukturalnymi przy identyfikowaniu przyczyn problemów i zapobieganiu ich ponownemu występowaniu.
Technologie i narzędzia: Datadog, Chronosphere, PagerDuty, Backstage, Jira, Python, Kafka, API.
Szukamy Ciebie, jeśli:
masz minimum 5 lat doświadczenia w obszarze IT Operations, Site Reliability Engineering (SRE), Technical Operations lub podobnej roli
masz praktyczne doświadczenie w obsłudze incydentów produkcyjnych, analizie problemów oraz prowadzeniu działań troubleshootingowych w środowiskach o wysokiej dostępności
bardzo dobrze znasz narzędzia observability i monitoringu, takie jak Datadog, Chronosphere lub rozwiązania o podobnym zastosowaniu, oraz potrafisz pracować z systemami alertowania, np. PagerDuty
potrafisz analizować logi, metryki i dane systemowe, identyfikować przyczyny problemów oraz przekładać wnioski z incydentów na konkretne usprawnienia
masz doświadczenie z integracjami API, automatyzacją procesów oraz skryptowaniem w Pythonie; znajomość Kafka będzie dodatkowym atutem
potrafisz zachować skuteczność działania podczas incydentów, jasno komunikować status i współpracować z zespołami technicznymi oraz biznesowymi
Zadania:
monitorowanie logów, metryk i alertów w celu szybkiego wykrywania oraz rozwiązywania incydentów
prowadzenie i koordynowanie działań związanych z incident response oraz troubleshootingiem problemów produkcyjnych
analiza przyczyn źródłowych incydentów oraz identyfikowanie możliwości poprawy niezawodności systemów
tworzenie i utrzymywanie runbooków, procedur operacyjnych oraz dokumentacji związanej z obsługą incydentów
automatyzacja powtarzalnych zadań operacyjnych z wykorzystaniem skryptów i integracji API
współpraca z zespołami developerskimi, infrastrukturalnymi i produktowymi przy rozwiązywaniu problemów oraz wdrażaniu usprawnień
rozwój dashboardów, alertów i mechanizmów monitorowania wspierających proaktywne wykrywanie problemów
udział w działaniach post-incident, wyciąganie wniosków i wdrażanie usprawnień zapobiegających podobnym incydentom w przyszłości
Czego możesz się spodziewać:
współpracy w oparciu o kontrakt B2B
pracy zdalnej
benefitów: opieka medyczna, karta multisport, lekcje języka angielskiego
integracji - lubimy spędzać razem czas
profesjonalnego procesu rekrutacyjnego - zawsze otrzymasz od nas feedback niezależnie od decyzji

