{"id":1179176,"url":"https://alion.io/job/vessl-site-reliability-engineer-senior","title":"Site Reliability Engineer (Senior)","company":{"id":2220123,"name":"VESSL AI","domain":"vessl.ai","url":"https://alion.io/company/vessl","size_band":"51-200","is_staffing_agency":false,"employer_type":"direct","is_intermediary":false,"listed_via":null,"ats_vendor":"Ashby","truth_index":null},"role":"DevOps","role_family":"DevOps","seniority":"senior","employment_type":"full_time","work_mode":"hybrid","remote_scope":null,"remote_scope_basis":null,"remote_working_hours":null,"hiring_geo_confidence":"structured","locations":["Seoul, South Korea"],"countries":["KR"],"hiring_countries":[],"hiring_countries_total":0,"salary":null,"salary_estimate":{"min_usd":49000,"max_usd":127000,"period":"year","method":"global_role_cell_scaled_by_country","sample_n":2013},"experience_years_min":5,"visa_sponsorship":false,"relocation_package":false,"has_equity":false,"technologies":[{"name":"Chaos Engineering","optional":false},{"name":"Docker","optional":false},{"name":"eBPF","optional":false},{"name":"Git","optional":false},{"name":"InfiniBand","optional":false},{"name":"Kubernetes","optional":false},{"name":"Linux","optional":false},{"name":"NVLink","optional":false},{"name":"Python","optional":false},{"name":"SLI/SLO/SLA","optional":false},{"name":"SLURM","optional":false},{"name":"TPU","optional":false}],"status":"live","first_seen_at":"2026-08-26T07:42:43Z","employer_posted_date":"2026-08-26","last_verified_at":"2026-09-30T15:56:39Z","board_verified":true,"closed_at":null,"days_open":35,"trust":{"level":"ok","repost_count":null,"flags":[],"days_open":35},"description":"About the Role\nVESSL AI의 Senior Site Reliability Engineer는 VESSL GPU 클라우드 플랫폼의 가용성과 성능을 책임지며, 개별 장애 대응을 넘어 시스템 설계와 아키텍처 결정을 리드합니다. Observability와 자동화 체계를 구축하는 데 그치지 않고, 장애가 발생하기 전에 구조적 리스크를 발견해 제거하며, 팀 전반의 안정성 관행을 수립합니다.\n그만큼 안정성이 중요한 건, VESSL GPU 클라우드 플랫폼이 대규모 GPU 클러스터, InfiniBand·RoCE 기반 고성능 네트워크, Kubernetes·Slurm 기반 스케줄링 시스템 등 여러 레이어로 구성되어 있기 때문입니다. GPU 워크로드는 몇 시간에서 몇 주까지 이어지는 경우가 많고, 노드 하나의 장애나 네트워크 지연만으로도 진행 중이던 학습·추론 작업 전체가 중단될 수 있어 일반적인 웹 서비스보다 훨씬 높은 수준의 안정성이 요구됩니다. 이를 위해 GPU, NIC, 드라이버, 커널에서부터 스케줄러, 네트워크 패브릭에 이르기까지 시스템 전 레이어의 상태를 지속적으로 모니터링하고, 장애가 발생했을 때 원인을 빠르게 좁혀 복구하며, 반복되는 운영 작업을 자동화로 줄여나가는 기능 구현 역할이 중요합니다.\nWhat you will do\nReliability & Observability: 메트릭·로그·트레이스 등 Observability 스택을 구축하고, SLI/SLO를 정의해 플랫폼의 안정성을 정량적으로 추적\n\nIncident Response Leadership: 주요 장애 발생 시 대응을 리드하고, Root Cause Analysis와 Postmortem을 통해 재발을 방지하며 장기적인 안정성 개선 과제로 연결\n\nArchitecture & Design: GPU 클러스터, 네트워크, 스케줄링 시스템 등 인프라 레이어의 설계에 참여해 안정성·확장성 관점의 의사결정을 주도\n\nAutomation & Tooling: 반복되는 운영 작업(Toil)을 제거하는 자동화 도구·프레임워크를 직접 구축하고, 여러 팀이 함께 사용할 수 있는 형태로 다듬어 운영\n\nProactive Reliability: 장애가 발생하기 전에 구조적 리스크(단일 장애점, 용량 한계 등)를 발견하고 제거하는 예방적 개선 과제를 주도\n\nCapacity 검증 지원: 신규 인프라 배포 시 팀 내 Supply 조직과 협업하여 East-West/North-South 네트워크 구성, 스토리지 처리량, BIOS·펌웨어 설정 등 운영 관점의 요구사항을 정의하고 검증을 리드\n\n팀 프랙티스 정립 및 멘토링: On-call 정책, Runbook, 알림 기준 등 팀의 안정성 프랙티스를 개선하고 주니어 엔지니어를 멘토링\n\nQualifications\n컴퓨터공학, 전자공학, AI 등 관련 전공 학사 이상 학위 혹은 이에 준하는 실무 경험\n\n5년 이상의 Software/Site Reliability Engineering 경험\n\nGPU/TPU/NPU 등 가속기 기반으로 상용 학습/인퍼런스 시스템을 구축/운영해 본 경험\n\nLinux 시스템의 유저 스페이스와 커널 스페이스에 대한 깊은 이해와 트러블슈팅 경험\n\nPython, Go 등의 언어로 자동화 도구·프레임워크를 직접 설계하고 구축해 본 경험\n\nKubernetes, Docker 등 컨테이너 오케스트레이션 환경을 운영해 본 경험\n\n대규모 서비스의 장애 대응을 주도적으로 리드하고 Postmortem을 작성해 본 경험\n\n여러 팀에 걸친 시스템 설계·안정성 관련 기술적 의사결정을 이끌어 본 경험\n\nOn-call 로테이션에 참여 가능하신 분\n\nHelpful experience (not required)\nInfiniBand/RoCEv2 등 고성능 네트워크 기반 멀티노드 클러스터 환경 운영 경험\n\nGPU, NVLink, InfiniBand 등 하드웨어·드라이버 레벨 이슈를 직접 디버깅해 본 경험\n\nSlurm, Kubernetes 기반 GPU 스케줄링 환경을 대규모로 설계·운영해 본 경험\n\n대규모 서비스의 장애 대응을 리드하고 Postmortem을 작성해 본 경험\n\n여러 해에 걸쳐 핵심 프로덕션 시스템을 지속적으로 소유하고 발전시켜 본 경험\n\n주니어 엔지니어를 멘토링하고 팀의 기술 표준을 정립해 본 경험\n\nperf, eBPF, strace, kernel crash dump 등 저수준 Linux 디버깅 도구 활용 경험\n\nWEKA / VAST / Ceph / Hammerspace 등 고성능 병렬 스토리지 구축/운영 경험\n\nDiRT, Chaos Engineering 등 선제적 안정성 확보 프랙티스를 설계·운영해 본 경험\n\nLife & Benefit\n함께 변화를 만들어갈 수 있도록, 도전과 성장을 지원\n연간 최대 120만원 한도 내 온/오프라인 자기계발 지원\n\n연 1회 미국 시장 경험 기회 제공 (Global Exposure pass)\n\n성장에 필요한 도서 실물 구매 지원 또는 전자도서관 이용\n\n구성원 간의 1on1 음료 지원\n\n업무 생산성을 높여 몰입할 수 있는 환경\n오전 8시~11시 사이 선택하는 시차출퇴근제 운영\n\n이니셔티브 중심의 조직 목표와 Align되어 몰입하는 협업 방식\n\n월 1회 Allhands + Team Gathering 통한 업무 공유\n\n늦은 시간까지 근무 시, 야근식대/택시비 지원\n\n구성원 간의 1on1 음료 지원\n\n몰입한 만큼 휴식과 생활 편의 지원\n개인 간식비 지원 (월 한도)\n\n장기근속자 리프레시 휴가 제공\n\n종합건강검진비 및 휴가 지원 (연 1회)\n\n입사 N주년 축하 선물 제공\n\n생일 반차 휴가 제공\n\n명절 선물, 각종 휴가 및 경조금 지원\n\n본인 및 배우자 출산휴가비 지원\n\nJoinning Process\n서류전형 → Coding Test → Technical Interview → Resume/Culture Interview → CEO Interveiw 순으로 진행됩니다.\n위 내용은 베슬에이아이코리아 경력 채용 기본 프로세스이며, 경우에 따라 절차가 가감될 수 있습니다.\n지원서 (경력 세부 기술) 및 포트폴리오 (또는 Git 링크)를 필수로 제출해주세요. (양식 자유)\n\nTechnical Interview 는 개발 실무자가 참여하며, 구조 설계 및 구현 방식 등 기술 중심의 대화로 문제 해결 역량을 파악하는 시간으로 최대 2시간 정도 소요됩니다.\n\nResume/Culture Interview 는 유관 경험 중심의 기술 역량 및 문화적 핏을 알아보는 시간으로 소속 매니저와 팀 멤버가 참여하며 각 1시간 정도 소요됩니다.\n\n경력직의 경우, 인터뷰 마지막 단계 이후 Reference Check 를 진행하고 있습니다.\n\n이력서 및 제출서류에 허위 사실이 발견될 경우, 합격 발표 후라도 입사가 취소될 수 있습니다.\n\n근무 형태\n정규직 (수습 3개월)\n\n3개월의 수습 피드백 기간 후, 업무 성과 평가 결과에 따라 최종 합류 여부가 결정됩니다.","description_format":"text","description_chars":3367,"description_truncated":false,"requirements":{"experience_years_min":5,"management_years_min":null,"team_size_min":null,"manages_managers":false,"education":null,"security_clearance":false,"languages":[{"language":"Korean","level":"Advanced (C1)","optional":false}]},"benefits":[],"hiring_locations":[{"name":"South Korea","iso":"KR","kind":"country"}],"hiring_excludes":[],"relocation_offered":false,"industries":["MLOps","AI Compute & Inference"],"lifecycle":[{"event":"open","at":"2026-09-24T12:41:59Z"}],"liveness":{"score":52,"band":"ok","label":"Likely open","p_open":1,"p_active":0.698,"p_room":0.75,"age_days":34,"expected_fill_days":42,"reasons":["conf:8","win:late"],"computed_at":"2026-09-30T05:45:00Z"},"pay":null,"html_url":"https://alion.io/job/vessl-site-reliability-engineer-senior","json_url":"https://alion.io/job/vessl-site-reliability-engineer-senior.json","meta":{"generated_at":"2026-10-01T02:05:27Z","cache_seconds":300,"methodology":"https://alion.io/methodology","terms":"https://alion.io/terms","contact":"https://alion.io/contact","api":"https://alion.io/developers","usage":{"tier":"crawler","counted_by":"address","units_charged":1,"used_today":1738,"day_limit":5000,"remaining_today":3262,"minute_limit":60,"resets_at":"2026-10-02T00:00:00Z"}}}