
데브옵스
달파의 Amazon EKS Hybrid Nodes를 활용한 클러스터 안정성 및 비용 절감 사례
두줄요약
온프레미스 GPU와 AWS EKS를 Hybrid Nodes로 통합해 운영했습니다. 비용은 약 70% 절감하고, 장애 시 페일백까지 확보했습니다.
문제 상황
- GPU 기반 AI 워크로드를 클라우드 온디맨드로 운영할 때의 높은 비용 부담
- 온프레미스 별도 Kubernetes 클러스터 운영에서 발생한 관리 부담, 보안 설정 우려, 가용성 확보 어려움
- 클라우드와 온프레미스 이중 운영으로 인한 네트워크 구성 복잡도
해결 방법
- Amazon EKS Hybrid Nodes로 온프레미스 GPU 자원과 AWS EKS를 단일 클러스터로 통합
- Site-to-Site VPN과 strongSwan, keepalived로 연결 안정성 및 active-standby 구조 구성
- BIRD 기반 BGP 설정으로 라우팅 자동화, Transit Gateway로 서비스 통신 단순화
성능/운영 포인트
- AWS 관리형 컨트롤 플레인 활용으로 업그레이드, 패치, 모니터링 부담 감소
- IRSA 적용으로 GPU 워크로드 권한 부여를 세밀하게 분리
- 노드 장애 시 클라우드 GPU 자원으로 페일백 가능한 구조 확보
