---
title: "GPU Cluster Architect"
company: "VESSL AI"
company_url: "https://www.remjobs.works/companies/vessl-ai"
url: "https://www.remjobs.works/job/vessl-ai-gpu-cluster-architect-1da89a15-ea15-4dd7-beb0-dd5a37180147"
apply_url: "https://jobs.ashbyhq.com/vessl-ai/8620d13d-f37f-44d3-b4c5-718b2ae86d62"
workplace: hybrid
location: "Seoul"
employment_type: full-time
seniority: mid
role: software-engineering
region: asia-pacific
skills: ["kubernetes", "python"]
date_posted: 2026-08-26T01:05:06.404Z
first_seen_by_remjobs: 2026-09-19T22:11:12.953Z
---

# GPU Cluster Architect

**VESSL AI** · Seoul

Apply: https://jobs.ashbyhq.com/vessl-ai/8620d13d-f37f-44d3-b4c5-718b2ae86d62

## About VESSL AI

AI Cloud for All Models. Train, fine-tune, and serve across clouds: self-serve A100 and H100, B200 to GB300 as reserved capacity, multi-node clusters, persistent workspaces, and transparent pricing.

## About the role

#### About the role

**VESSL AI GPU Cluster Architect**는 CSP/데이터센터 파트너와 전력, 냉각, 네트워크 등 기술적 조건에 대한 협상을 직접 진행하며, 신규 사이트의 Qualification, 클러스터 아키텍처 설계, 하드웨어 구매, 그리고 완성된 클러스터의 검증까지 인프라가 플랫폼에 최적의 구성으로 전달되는 전 과정을 기술적으로 책임집니다. 이 과정은 단순한 페이퍼 기반의 스펙 검토로 끝나지 않습니다. **설비의 도면과 장비 사양을 직접 들여다보고, 건설 중이거나 운영 중인 데이터센터 현장을 방문해 CSP·시공사·벤더와 대면하여 협의하는 일들이 이 역할의 핵심입니다.** 대규모 GPU 클러스터/데이터센터의 구축에서 의사 결정 과정은 클러스터 아키텍처와 시스템 레벨의 기술적 이해가 필수적입니다. 협업할 CSP/데이터센터를 기술적으로 검증하고, 인프라가 어떤 스펙으로 구축·검증될지에 대한 기술 기준을 수립함으로서 GPU 공급망의 기술적 품질과 안정성을 담보하는 핵심 역할을 해나갑니다.

VESSL AI는 전 세계 여러 CSP와 데이터센터 파트너의 GPU 자원을 하나의 플랫폼으로 연결해 고객에게 제공합니다. 이를 위해서는 우선 플랫폼이 구축될 데이터센터 캠퍼스가 대규모 GPU Workload를 실제로 감당할 수 있는 부분일지, 계약 전력과 수전 방식, 냉각 용량, 랙당 전력 밀도 등 여러 방면에서 기술적으로 검증하는 일이 필수적입니다. 또한 구축할 클러스터의 Network Topology를 설계하고, 실제 구축이 완료된 클러스터가 설계 스펙대로 동작하는지 Slurm, Kubernetes 기반 스케줄링 환경에서 직접 검증하는 과정을 수행합니다. 이 모든 과정은 하드웨어 구매 단계의 의사결정부터 CSP, 벤더사, 현지 운영사(OpCo), 내부 Sales 조직의 다양한 이해관계자 간 기술적 이견 조율을 요구하는 고도의 기술 역량이 필요합니다.

#### What you will do

- DC/CSP Qualification: 신규·기존 데이터센터가 대규모 GPU 클러스터를 수용할 수 있는지 계약 전력, 수전 방식, 냉각 용량(공랭/액랭, PUE), 랙당 전력 밀도 등을 도면과 장비 사양 레벨에서 직접 검토하고 Go/No-go 판단 기준을 수립

- Cluster Architecture Design: IP Plan, Network Topology(Rail-optimized, Fat-tree 등), InfiniBand/RoCEv2 기반 High-speed Network 구성을 설계

- Cluster Validation: 구축 완료된 클러스터를 Slurm, Kubernetes 등 스케줄링 환경 위에서 벤치마크·Burn-in 테스트로 검증하고, 하드웨어·OS·드라이버·네트워크 전 레이어에 걸친 성능·안정성 이슈를 직접 진단

- Hardware Procurement: GPU 서버, 스위치, 케이블링 등 하드웨어 스펙을 정의하고 벤더/OEM/ODM과 구매·납품 일정을 조율

- 기술 협상 및 Stakeholder 조율: CSP, 데이터센터, 네트워크/전력 벤더, 내부 Infra·Sales 팀 등 다양한 이해관계자와의 기술 협상을 리드

#### Qualifications

- 전기전자, 컴퓨터공학 등 관련 전공 학사 이상 학위 보유

- GPU/HPC 클러스터 설계 또는 구축·운영 경력 4년 이상 보유

- 데이터센터 현장 방문·출장이 가능하며, 현장에서 CSP·운영사(OpCo)·벤더와 직접 대면 협의하는 데 익숙하신 분

- InfiniBand, RoCEv2 등 High-speed Fabric 및 Network Topology 설계 경험

- 데이터센터 구축/운영 관련 실무 경험 중 아래 2개 이상 충족하신 분

- Slurm, Kubernetes 등 스케줄러/오케스트레이션 환경에서 클러스터를 검증·운영해 보신 경험

- 데이터센터의 전력(수전, UPS, PDU), 냉각(공랭/수랭) 등 Facility 요구사항을 이해하고 CSP/데이터센터와 직접 기술 협의를 해보신 경험

- 수배전·변압기, UPS/PDU, CDU·냉각배관, 배전반 등 DC MEP(전력·냉각·기계) 설비에 대한 실무적 이해 및 엔지니어링 현장 경험

- GPU, NIC, PCIe 등 서버·GPU 하드웨어 전반과 OS/드라이버 레벨까지 아우르는 Full-stack 트러블슈팅 능력

- NVIDIA Scalable Unit 기준 4SU (Blackwell 2,048장) 규모 이상 단일 GPU 클러스터를 설계·구축·운영해 보신 경험

#### Helpful experience (not required)

- Python, Go 등을 활용한 인프라 자동화 및 텔레메트리 파이프라인(예측적 장애 탐지 등) 구축 경험

- KVM, QEMU, libvirt 등 가상화 기술에 대한 이해

- Colocation, Powered Shell 등 데이터센터 계약 형태에 대한 이해

- 다수 글로벌 지역의 데이터센터/CSP와 협업해 보신 경험

- 비즈니스 레벨의 영어 커뮤니케이션 역량을 보유한 분

- 정해진 스코프에 갇히기보다, 문제 해결을 위해 필요하면 네트워크·전력·SWE 등 인접 영역까지 넘나드는 extra mile에 거부감이 없으신 분

- 모호하거나 답이 정해지지 않은 문제를 마주했을 때, 스스로 구조화해서 답을 찾아가는 것에 익숙하신 분

#### Life & Benefit

**함께 변화를 만들어갈 수 있도록, 도전과 성장을 지원**

- 연간 최대 120만원 한도 내 온/오프라인 자기계발 지원

- 연 1회 미국 시장 경험 기회 제공 (Global Exposure pass)

- 성장에 필요한 도서 실물 구매 지원 또는 전자도서관 이용

- 구성원 간의 1on1 음료 지원 **업무 생산성을 높여 몰입할 수 있는 환경**

- 오전 8시~11시 사이 선택하는 시차출퇴근제 운영

- 이니셔티브 중심의 조직 목표와 Align되어 몰입하는 협업 방식

- 월 1회 Allhands + Team Gathering 통한 업무 공유

- 늦은 시간까지 근무 시, 야근식대/택시비 지원

- 구성원 간의 1on1 음료 지원 **몰입한 만큼 휴식과 생활 편의 지원**

- 개인 간식비 지원 (월 한도)

- 장기근속자 리프레시 휴가 제공

- 종합건강검진비 및 휴가 지원 (연 1회)

- 입사 N주년 축하 선물 제공

- 생일 반차 휴가 제공

- 명절 선물, 각종 휴가 및 경조금 지원

- 본인 및 배우자 출산휴가비 지원

#### Joinning Process

서류전형 → Take-Home assignments → Technical /Resume Interview → Culture Interview → CEO Interveiw 순으로 진행됩니다.

- 위 내용은 베슬에이아이코리아 경력 채용 기본 프로세스이며, 경우에 따라 절차가 가감될 수 있습니다.지원서 (경력 세부 기술) 및 포트폴리오 (또는 Git 링크)를 필수로 제출해주세요. (양식 자유)

- Technical/Resume Interview는 과제 합격자에 한해 과제물 및 유관 경험 중심의 기술 역량적 핏을 알아보는 시간으로 소속 매니저와 팀 멤버가 참여하며 총 1시간 30분 정도 소요됩니다.

- 경력직의 경우, 인터뷰 마지막 단계 이후 Reference Check를 진행하고 있습니다.

- 이력서 및 제출서류에 허위 사실이 발견될 경우, 합격 발표 후라도 입사가 취소될 수 있습니다.

- 근무 형태정규직 (수습 3개월)

- 3개월의 수습 피드백 기간 후, 업무 성과 평가 결과에 따라 최종 합류 여부가 결정됩니다.

---

Source: VESSL AI's own career page, read by RemJobs. Canonical HTML version: https://www.remjobs.works/job/vessl-ai-gpu-cluster-architect-1da89a15-ea15-4dd7-beb0-dd5a37180147
