
데브옵스
분산 학습을 위한 AWS 컴퓨트 선택 가이드 (2편: 초대규모 스케일링과 인스턴스 확보)
두줄요약
AWS 분산 학습용 컴퓨트를 초대규모로 확장하는 울트라클러스터와 울트라서버를 설명했습니다. 또한 ODCR과 Capacity Block으로 GPU 용량을 미리 확보하는 전략을 비교했습니다.
핵심 내용
- AWS 분산 학습용 컴퓨트를 초대규모로 확장하는 두 축으로 울트라클러스터와 울트라서버를 소개
- 울트라클러스터는 EFA 기반의 균일한 non-blocking 패브릭으로 수천~수만 GPU를 연결하고, 울트라서버는 NVLink로 최대 72개 GPU를 하나의 메모리 풀처럼 사용
- 고성능 GPU 인스턴스 확보 수단으로 ODCR과 Capacity Block의 차이, 비용 구조, 유연성, 적합한 사용 시점을 비교
적용해볼 점
- 통신 빈도가 낮은 대규모 학습은 울트라클러스터 중심으로, 통신이 극도로 잦은 워크로드는 울트라서버 중심으로 배치 검토
- 최신 GPU 수요가 높으므로 실제 학습 일정에 맞춰 ODCR 또는 Capacity Block으로 용량 선확보
- 데이터 공급, 오케스트레이션, 체크포인트 복구까지 포함한 전체 학습 인프라 관점으로 설계
