---
title: "Site Reliability Engineer (Senior)"
company: "VESSL AI"
company_url: "https://www.remjobs.works/companies/vessl-ai"
url: "https://www.remjobs.works/job/vessl-ai-site-reliability-engineer-senior-407f0918-3f3c-4715-b095-7e3499463e51"
apply_url: "https://jobs.ashbyhq.com/vessl-ai/5914ca9c-72cf-4c22-a054-5de153e09e22"
workplace: onsite
location: "Seoul"
employment_type: full-time
seniority: senior
role: devops-infrastructure
region: asia-pacific
skills: ["docker", "kubernetes", "linux", "python"]
date_posted: 2026-08-26T07:42:43.749Z
first_seen_by_remjobs: 2026-09-19T22:11:12.953Z
---

# Site Reliability Engineer (Senior)

**VESSL AI** · Seoul

Apply: https://jobs.ashbyhq.com/vessl-ai/5914ca9c-72cf-4c22-a054-5de153e09e22

## About VESSL AI

AI Cloud for All Models. Train, fine-tune, and serve across clouds: self-serve A100 and H100, B200 to GB300 as reserved capacity, multi-node clusters, persistent workspaces, and transparent pricing.

## About the role

#### About the Role

VESSL AI의 Senior Site Reliability Engineer는 VESSL GPU 클라우드 플랫폼의 가용성과 성능을 책임지며, 개별 장애 대응을 넘어 시스템 설계와 아키텍처 결정을 리드합니다. Observability와 자동화 체계를 구축하는 데 그치지 않고, 장애가 발생하기 전에 구조적 리스크를 발견해 제거하며, 팀 전반의 안정성 관행을 수립합니다.

그만큼 안정성이 중요한 건, VESSL GPU 클라우드 플랫폼이 대규모 GPU 클러스터, InfiniBand·RoCE 기반 고성능 네트워크, Kubernetes·Slurm 기반 스케줄링 시스템 등 여러 레이어로 구성되어 있기 때문입니다. GPU 워크로드는 몇 시간에서 몇 주까지 이어지는 경우가 많고, 노드 하나의 장애나 네트워크 지연만으로도 진행 중이던 학습·추론 작업 전체가 중단될 수 있어 일반적인 웹 서비스보다 훨씬 높은 수준의 안정성이 요구됩니다. 이를 위해 GPU, NIC, 드라이버, 커널에서부터 스케줄러, 네트워크 패브릭에 이르기까지 시스템 전 레이어의 상태를 지속적으로 모니터링하고, 장애가 발생했을 때 원인을 빠르게 좁혀 복구하며, 반복되는 운영 작업을 자동화로 줄여나가는 기능 구현 역할이 중요합니다.

#### What you will do

- Reliability & Observability: 메트릭·로그·트레이스 등 Observability 스택을 구축하고, SLI/SLO를 정의해 플랫폼의 안정성을 정량적으로 추적

- Incident Response Leadership: 주요 장애 발생 시 대응을 리드하고, Root Cause Analysis와 Postmortem을 통해 재발을 방지하며 장기적인 안정성 개선 과제로 연결

- Architecture & Design: GPU 클러스터, 네트워크, 스케줄링 시스템 등 인프라 레이어의 설계에 참여해 안정성·확장성 관점의 의사결정을 주도

- Automation & Tooling: 반복되는 운영 작업(Toil)을 제거하는 자동화 도구·프레임워크를 직접 구축하고, 여러 팀이 함께 사용할 수 있는 형태로 다듬어 운영

- Proactive Reliability: 장애가 발생하기 전에 구조적 리스크(단일 장애점, 용량 한계 등)를 발견하고 제거하는 예방적 개선 과제를 주도

- Capacity 검증 지원: 신규 인프라 배포 시 팀 내 Supply 조직과 협업하여 East-West/North-South 네트워크 구성, 스토리지 처리량, BIOS·펌웨어 설정 등 운영 관점의 요구사항을 정의하고 검증을 리드

- 팀 프랙티스 정립 및 멘토링: On-call 정책, Runbook, 알림 기준 등 팀의 안정성 프랙티스를 개선하고 주니어 엔지니어를 멘토링

#### Qualifications

- 컴퓨터공학, 전자공학, AI 등 관련 전공 학사 이상 학위 혹은 이에 준하는 실무 경험

- 5년 이상의 Software/Site Reliability Engineering 경험

- GPU/TPU/NPU 등 가속기 기반으로 상용 학습/인퍼런스 시스템을 구축/운영해 본 경험

- Linux 시스템의 유저 스페이스와 커널 스페이스에 대한 깊은 이해와 트러블슈팅 경험

- Python, Go 등의 언어로 자동화 도구·프레임워크를 직접 설계하고 구축해 본 경험

- Kubernetes, Docker 등 컨테이너 오케스트레이션 환경을 운영해 본 경험

- 대규모 서비스의 장애 대응을 주도적으로 리드하고 Postmortem을 작성해 본 경험

- 여러 팀에 걸친 시스템 설계·안정성 관련 기술적 의사결정을 이끌어 본 경험

- On-call 로테이션에 참여 가능하신 분

#### Helpful experience (not required)

- InfiniBand/RoCEv2 등 고성능 네트워크 기반 멀티노드 클러스터 환경 운영 경험

- GPU, NVLink, InfiniBand 등 하드웨어·드라이버 레벨 이슈를 직접 디버깅해 본 경험

- Slurm, Kubernetes 기반 GPU 스케줄링 환경을 대규모로 설계·운영해 본 경험

- 대규모 서비스의 장애 대응을 리드하고 Postmortem을 작성해 본 경험

- 여러 해에 걸쳐 핵심 프로덕션 시스템을 지속적으로 소유하고 발전시켜 본 경험

- 주니어 엔지니어를 멘토링하고 팀의 기술 표준을 정립해 본 경험

- perf, eBPF, strace, kernel crash dump 등 저수준 Linux 디버깅 도구 활용 경험

- WEKA / VAST / Ceph / Hammerspace 등 고성능 병렬 스토리지 구축/운영 경험

- DiRT, Chaos Engineering 등 선제적 안정성 확보 프랙티스를 설계·운영해 본 경험

#### Life & Benefit

**함께 변화를 만들어갈 수 있도록, 도전과 성장을 지원**

- 연간 최대 120만원 한도 내 온/오프라인 자기계발 지원

- 연 1회 미국 시장 경험 기회 제공 (Global Exposure pass)

- 성장에 필요한 도서 실물 구매 지원 또는 전자도서관 이용

- 구성원 간의 1on1 음료 지원 **업무 생산성을 높여 몰입할 수 있는 환경**

- 오전 8시~11시 사이 선택하는 시차출퇴근제 운영

- 이니셔티브 중심의 조직 목표와 Align되어 몰입하는 협업 방식

- 월 1회 Allhands + Team Gathering 통한 업무 공유

- 늦은 시간까지 근무 시, 야근식대/택시비 지원

- 구성원 간의 1on1 음료 지원 **몰입한 만큼 휴식과 생활 편의 지원**

- 개인 간식비 지원 (월 한도)

- 장기근속자 리프레시 휴가 제공

- 종합건강검진비 및 휴가 지원 (연 1회)

- 입사 N주년 축하 선물 제공

- 생일 반차 휴가 제공

- 명절 선물, 각종 휴가 및 경조금 지원

- 본인 및 배우자 출산휴가비 지원

#### Joinning Process

**서류전형 → Coding Test → Technical Interview → Resume/Culture Interview → CEO Interveiw 순으로 진행됩니다.**

- 위 내용은 베슬에이아이코리아 경력 채용 기본 프로세스이며, 경우에 따라 절차가 가감될 수 있습니다.지원서 (경력 세부 기술) 및 포트폴리오 (또는 Git 링크)를 필수로 제출해주세요. (양식 자유)

- Technical Interview는 개발 실무자가 참여하며, 구조 설계 및 구현 방식 등 기술 중심의 대화로 문제 해결 역량을 파악하는 시간으로 최대 2시간 정도 소요됩니다.

- Resume/Culture Interview는 유관 경험 중심의 기술 역량 및 문화적 핏을 알아보는 시간으로 소속 매니저와 팀 멤버가 참여하며 각 1시간 정도 소요됩니다.

- 경력직의 경우, 인터뷰 마지막 단계 이후 Reference Check를 진행하고 있습니다.

- 이력서 및 제출서류에 허위 사실이 발견될 경우, 합격 발표 후라도 입사가 취소될 수 있습니다.

- 근무 형태정규직 (수습 3개월)

- 3개월의 수습 피드백 기간 후, 업무 성과 평가 결과에 따라 최종 합류 여부가 결정됩니다.

---

Source: VESSL AI's own career page, read by RemJobs. Canonical HTML version: https://www.remjobs.works/job/vessl-ai-site-reliability-engineer-senior-407f0918-3f3c-4715-b095-7e3499463e51
