대형 대학병원 · 헬스케어

H100 GPU 셀프서비스 오케스트레이션 포털

연구팀마다 사람이 조율하던 H100 클러스터를 Kueue 기반 셀프서비스 포털로 전환. 가동률 2배, 18개월째 무중단 운영.

2.1×
GPU 가동률
34%
유휴 자원
18개월
무중단
THE CHALLENGE

왜 어려웠나.

값비싼 H100 카드를 여러 연구팀이 공유했지만, 할당이 전부 사람 손을 거쳤습니다. GPU를 받으려면 평균 1주를 기다렸고, 받은 뒤엔 반납 절차가 없어 카드가 놀아도 다른 팀은 쓰지 못했습니다. 의료 데이터 환경이라 격리와 감사 요구도 높았습니다.

제약 조건

  • 연구가 진행 중이라 무중단이 전제
  • 의료 데이터 — 격리·접근통제·감사 로그 필수
  • 팀마다 워크로드(학습·추론·배치)가 제각각
OUR APPROACH

우리가 한 일.

  1. 계측·진단가동률·대기시간을 측정해 병목을 수치화
  2. 스케줄링 설계Kueue로 큐·쿼터·우선순위·선점 정책 수립
  3. 셀프서비스 포털연구자가 직접 신청·반납하는 워크플로
  4. 운영 인계가동률 대시보드·가드레일·문서 이관
OUTCOME

결과.

할당이 1주에서 당일로 줄고, 같은 카드로 더 많은 실험이 돌아갑니다. 가동률은 두 배가 됐고, 유휴 자원은 줄었습니다. 포털 전환 이후 18개월째 무중단으로 운영되고 있습니다.

STACK

기술 스택.

EKSKueueKarpenterNVIDIA H100GrafanaTerraform

비슷한 과제라면 이 사례를 기준으로 함께 검토합니다.

어디까지 비슷하고 무엇이 다른지 30분이면 짚어 드립니다.

이미 금융·헬스케어·미디어·공공의 팀들과 함께
기술 과제 검토 요청