
[운영가이드] Kubernetes 기반 Fault-Tolerant GPU 클러스터 유지 관리
Kubernetes 기반 GPU 클러스터를 안정적으로 운영하기 위한 유지 관리 방안을 정리했습니다. 자동화, 관측, 스케줄링 통합, 네트워크·보안 분리를 통해 장애 대응과 성능 안정성을 높이는 방법을 소개했습니다.

Kubernetes 기반 GPU 클러스터를 안정적으로 운영하기 위한 유지 관리 방안을 정리했습니다. 자동화, 관측, 스케줄링 통합, 네트워크·보안 분리를 통해 장애 대응과 성능 안정성을 높이는 방법을 소개했습니다.

Git 평문 시크릿과 K8s Secret 오브젝트를 함께 없애기 위한 Vault 도입 전략을 정리했습니다. 운영 설계와 예외 처리, 감사 로그와 토큰 회수까지 함께 챙겨야 합니다.

GPU 수량 경쟁보다 풀스택 최적화가 AI 인프라 비즈니스의 핵심이라고 설명했습니다. 운영 효율과 총비용 관점에서 AI NIC와 베어메탈 아키텍처의 중요성을 짚었습니다.

장애 복구보다 서비스 연속성을 우선한 kt cloud의 Multi-AZ 설계를 소개했습니다. 2개 AZ와 Satellite Zone으로 Active-Active와 쿼럼 유지를 함께 구현했습니다.
중고 의류 디테일컷 자동 생성을 위해 VLM 대신 Detector와 규칙 기반 크롭을 선택했습니다.\n그 결과 공정 시간을 90% 줄이고 11만 개 상품에 일괄 적용했습니다.

Kubernetes Ingress NGINX 중단 배경과 Gateway API의 필요성을 설명했습니다. Nginx Gateway Fabric 설치와 Gateway, HTTPRoute 기반 트래픽 흐름도 함께 다뤘습니다.
쿠팡 파트너스
이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.

현대오토에버가 Amazon Bedrock과 LangGraph로 다중 AI 에이전트를 구성해 장애 대응을 자동화했습니다.\n장애 분석부터 보고서 생성까지를 연결해 대응 시간을 수 시간에서 5분으로 줄였습니다.

Multi-AZ는 가용성을 높이기 위한 기본 구조이고, Multi-Region은 Region 전체 장애에 대비하는 DR 전략입니다.\nDR 설계에서는 RTO와 RPO를 기준으로 복제, 트래픽 전환, 세션 처리를 함께 고려해야 했습니다.

IaC를 인프라를 코드로 관리하는 표준과 방법론으로 설명했습니다. 수동 관리의 문제와 함께 재현성, 버전 관리, 일관성의 가치를 정리했습니다.


딜라이트룸은 EKS Auto Mode로 멀티 클러스터 운영 복잡도를 크게 줄였습니다. 또한 로그 수집과 진단 자동화를 더해 장애 대응력도 높였습니다.


EKS Auto Mode와 Bifrost, Langfuse를 조합해 자체 관리형 Agentic AI 플랫폼을 구축하는 방법을 소개했습니다. 멀티모델 라우팅과 2계층 관측성으로 운영 안정성과 비용 최적화를 함께 확보했습니다.

Kubernetes v1.35 Timbernetes의 주요 기능과 변경점을 정리했습니다. AI 워크로드 지원과 운영 개선, 업그레이드 시 주의사항을 함께 다뤘습니다.
![[코드가 환경을 모르는 구조 4/7] 타임머신 — 시간 축을 교체한다](https://cdn.sanity.io/images/v31psllp/production/6a70f8e2c090762cbd4b1a9d470f573cbc0fc038-1684x1030.png)

HR SaaS에서는 시간이 급여와 연차 결과를 바꾸는 입력이므로 요청 단위로 교체 가능하게 만들었습니다. Clock 포트와 헤더 기반 Adapter, 비동기 컨텍스트 전파, 환경별 활성화로 타임머신을 구현했습니다.


라포랩스가 AWS AI-DLC로 사내 배포 플랫폼 Raploy를 구축한 사례를 공유했습니다. 비개발 직군도 AI와 플랫폼을 통해 배포·운영할 수 있도록 자동화와 관측성을 함께 강화했습니다.