{"id":1179182,"url":"https://alion.io/job/vessl-gpu-cluster-architect","title":"GPU Cluster Architect","company":{"id":2220123,"name":"VESSL AI","domain":"vessl.ai","url":"https://alion.io/company/vessl","size_band":"51-200","is_staffing_agency":false,"employer_type":"direct","is_intermediary":false,"listed_via":null,"ats_vendor":"Ashby","truth_index":null},"role":"AI/ML","role_family":"AI/ML","seniority":"staff","employment_type":"full_time","work_mode":"hybrid","remote_scope":null,"remote_scope_basis":null,"remote_working_hours":null,"hiring_geo_confidence":"structured","locations":["Seoul, South Korea"],"countries":["KR"],"hiring_countries":[],"hiring_countries_total":0,"salary":null,"salary_estimate":{"min_usd":92000,"max_usd":205000,"period":"year","method":"global_role_cell_scaled_by_country","sample_n":775},"experience_years_min":4,"visa_sponsorship":false,"relocation_package":false,"has_equity":false,"technologies":[{"name":"Git","optional":false},{"name":"HPC","optional":false},{"name":"InfiniBand","optional":false},{"name":"Kubernetes","optional":false},{"name":"KVM","optional":false},{"name":"Python","optional":false},{"name":"QEMU","optional":false},{"name":"SLURM","optional":false}],"status":"live","first_seen_at":"2026-08-26T01:05:06Z","employer_posted_date":"2026-08-26","last_verified_at":"2026-09-25T23:55:44Z","board_verified":true,"closed_at":null,"days_open":31,"trust":{"level":"ok","repost_count":null,"flags":[],"days_open":31},"description":"About the role\nVESSL AI GPU Cluster Architect 는 CSP/데이터센터 파트너와 전력, 냉각, 네트워크 등 기술적 조건에 대한 협상을 직접 진행하며, 신규 사이트의 Qualification, 클러스터 아키텍처 설계, 하드웨어 구매, 그리고 완성된 클러스터의 검증까지 인프라가 플랫폼에 최적의 구성으로 전달되는 전 과정을 기술적으로 책임집니다. 이 과정은 단순한 페이퍼 기반의 스펙 검토로 끝나지 않습니다. 설비의 도면과 장비 사양을 직접 들여다보고, 건설 중이거나 운영 중인 데이터센터 현장을 방문해 CSP·시공사·벤더와 대면하여 협의하는 일들이 이 역할의 핵심입니다. 대규모 GPU 클러스터/데이터센터의 구축에서 의사 결정 과정은 클러스터 아키텍처와 시스템 레벨의 기술적 이해가 필수적입니다. 협업할 CSP/데이터센터를 기술적으로 검증하고, 인프라가 어떤 스펙으로 구축·검증될지에 대한 기술 기준을 수립함으로서 GPU 공급망의 기술적 품질과 안정성을 담보하는 핵심 역할을 해나갑니다.\nVESSL AI는 전 세계 여러 CSP와 데이터센터 파트너의 GPU 자원을 하나의 플랫폼으로 연결해 고객에게 제공합니다. 이를 위해서는 우선 플랫폼이 구축될 데이터센터 캠퍼스가 대규모 GPU Workload를 실제로 감당할 수 있는 부분일지, 계약 전력과 수전 방식, 냉각 용량, 랙당 전력 밀도 등 여러 방면에서 기술적으로 검증하는 일이 필수적입니다. 또한 구축할 클러스터의 Network Topology를 설계하고, 실제 구축이 완료된 클러스터가 설계 스펙대로 동작하는지 Slurm, Kubernetes 기반 스케줄링 환경에서 직접 검증하는 과정을 수행합니다. 이 모든 과정은 하드웨어 구매 단계의 의사결정부터 CSP, 벤더사, 현지 운영사(OpCo), 내부 Sales 조직의 다양한 이해관계자 간 기술적 이견 조율을 요구하는 고도의 기술 역량이 필요합니다.\nWhat you will do\nDC/CSP Qualification: 신규·기존 데이터센터가 대규모 GPU 클러스터를 수용할 수 있는지 계약 전력, 수전 방식, 냉각 용량(공랭/액랭, PUE), 랙당 전력 밀도 등을 도면과 장비 사양 레벨에서 직접 검토하고 Go/No-go 판단 기준을 수립\n\nCluster Architecture Design: IP Plan, Network Topology(Rail-optimized, Fat-tree 등), InfiniBand/RoCEv2 기반 High-speed Network 구성을 설계\n\nCluster Validation: 구축 완료된 클러스터를 Slurm, Kubernetes 등 스케줄링 환경 위에서 벤치마크·Burn-in 테스트로 검증하고, 하드웨어·OS·드라이버·네트워크 전 레이어에 걸친 성능·안정성 이슈를 직접 진단\n\nHardware Procurement: GPU 서버, 스위치, 케이블링 등 하드웨어 스펙을 정의하고 벤더/OEM/ODM과 구매·납품 일정을 조율\n\n기술 협상 및 Stakeholder 조율: CSP, 데이터센터, 네트워크/전력 벤더, 내부 Infra·Sales 팀 등 다양한 이해관계자와의 기술 협상을 리드\n\nQualifications\n전기전자, 컴퓨터공학 등 관련 전공 학사 이상 학위 보유\n\nGPU/HPC 클러스터 설계 또는 구축·운영 경력 4년 이상 보유\n\n데이터센터 현장 방문·출장이 가능하며, 현장에서 CSP·운영사(OpCo)·벤더와 직접 대면 협의하는 데 익숙하신 분\n\nInfiniBand, RoCEv2 등 High-speed Fabric 및 Network Topology 설계 경험\n\n데이터센터 구축/운영 관련 실무 경험 중 아래 2개 이상 충족하신 분\n\nSlurm, Kubernetes 등 스케줄러/오케스트레이션 환경에서 클러스터를 검증·운영해 보신 경험\n\n데이터센터의 전력(수전, UPS, PDU), 냉각(공랭/수랭) 등 Facility 요구사항을 이해하고 CSP/데이터센터와 직접 기술 협의를 해보신 경험\n\n수배전·변압기, UPS/PDU, CDU·냉각배관, 배전반 등 DC MEP(전력·냉각·기계) 설비에 대한 실무적 이해 및 엔지니어링 현장 경험\n\nGPU, NIC, PCIe 등 서버·GPU 하드웨어 전반과 OS/드라이버 레벨까지 아우르는 Full-stack 트러블슈팅 능력\n\nNVIDIA Scalable Unit 기준 4SU (Blackwell 2,048장) 규모 이상 단일 GPU 클러스터를 설계·구축·운영해 보신 경험\n\nHelpful experience (not required)\nPython, Go 등을 활용한 인프라 자동화 및 텔레메트리 파이프라인(예측적 장애 탐지 등) 구축 경험\n\nKVM, QEMU, libvirt 등 가상화 기술에 대한 이해\n\nColocation, Powered Shell 등 데이터센터 계약 형태에 대한 이해\n\n다수 글로벌 지역의 데이터센터/CSP와 협업해 보신 경험\n\n비즈니스 레벨의 영어 커뮤니케이션 역량을 보유한 분\n\n정해진 스코프에 갇히기보다, 문제 해결을 위해 필요하면 네트워크·전력·SWE 등 인접 영역까지 넘나드는 extra mile에 거부감이 없으신 분\n\n모호하거나 답이 정해지지 않은 문제를 마주했을 때, 스스로 구조화해서 답을 찾아가는 것에 익숙하신 분\n\nLife & Benefit\n함께 변화를 만들어갈 수 있도록, 도전과 성장을 지원\n연간 최대 120만원 한도 내 온/오프라인 자기계발 지원\n\n연 1회 미국 시장 경험 기회 제공 (Global Exposure pass)\n\n성장에 필요한 도서 실물 구매 지원 또는 전자도서관 이용\n\n구성원 간의 1on1 음료 지원\n\n업무 생산성을 높여 몰입할 수 있는 환경\n오전 8시~11시 사이 선택하는 시차출퇴근제 운영\n\n이니셔티브 중심의 조직 목표와 Align되어 몰입하는 협업 방식\n\n월 1회 Allhands + Team Gathering 통한 업무 공유\n\n늦은 시간까지 근무 시, 야근식대/택시비 지원\n\n구성원 간의 1on1 음료 지원\n\n몰입한 만큼 휴식과 생활 편의 지원\n개인 간식비 지원 (월 한도)\n\n장기근속자 리프레시 휴가 제공\n\n종합건강검진비 및 휴가 지원 (연 1회)\n\n입사 N주년 축하 선물 제공\n\n생일 반차 휴가 제공\n\n명절 선물, 각종 휴가 및 경조금 지원\n\n본인 및 배우자 출산휴가비 지원\n\nJoinning Process\n서류전형 → Take-Home assignments → Technical /Resume Interview → Culture Interview → CEO Interveiw 순으로 진행됩니다.\n위 내용은 베슬에이아이코리아 경력 채용 기본 프로세스이며, 경우에 따라 절차가 가감될 수 있습니다.\n지원서 (경력 세부 기술) 및 포트폴리오 (또는 Git 링크)를 필수로 제출해주세요. (양식 자유)\n\nTechnical/Resume Interview 는 과제 합격자에 한해 과제물 및 유관 경험 중심의 기술 역량적 핏을 알아보는 시간으로 소속 매니저와 팀 멤버가 참여하며 총 1시간 30분 정도 소요됩니다.\n\n경력직의 경우, 인터뷰 마지막 단계 이후 Reference Check 를 진행하고 있습니다.\n\n이력서 및 제출서류에 허위 사실이 발견될 경우, 합격 발표 후라도 입사가 취소될 수 있습니다.\n\n근무 형태\n정규직 (수습 3개월)\n\n3개월의 수습 피드백 기간 후, 업무 성과 평가 결과에 따라 최종 합류 여부가 결정됩니다.","description_format":"text","description_chars":3592,"description_truncated":false,"requirements":{"experience_years_min":4,"management_years_min":null,"team_size_min":null,"manages_managers":false,"education":null,"security_clearance":false,"languages":[{"language":"Korean","level":"Advanced (C1)","optional":false}]},"benefits":[],"hiring_locations":[{"name":"South Korea","iso":"KR","kind":"country"}],"hiring_excludes":[],"relocation_offered":false,"industries":["MLOps","AI Compute & Inference"],"lifecycle":[{"event":"open","at":"2026-09-24T12:41:59Z"}],"liveness":{"score":66,"band":"ok","label":"Likely open","p_open":1,"p_active":0.731,"p_room":0.9,"age_days":30,"expected_fill_days":49,"reasons":["conf:1","win:mid"],"computed_at":"2026-09-25T05:45:01Z"},"pay":null,"html_url":"https://alion.io/job/vessl-gpu-cluster-architect","json_url":"https://alion.io/job/vessl-gpu-cluster-architect.json","meta":{"generated_at":"2026-09-26T02:23:50Z","cache_seconds":300,"methodology":"https://alion.io/methodology","terms":"https://alion.io/terms","contact":"https://alion.io/contact","api":"https://alion.io/developers","usage":{"tier":"crawler","counted_by":"address","units_charged":1,"used_today":2454,"day_limit":5000,"remaining_today":2546,"minute_limit":60,"resets_at":"2026-09-27T00:00:00Z"}}}