필터 1
[운영가이드] Kubernetes 기반 Fault-Tolerant GPU 클러스터 유지 관리
KT 클라우드
데브옵스

[운영가이드] Kubernetes 기반 Fault-Tolerant GPU 클러스터 유지 관리

Kubernetes 기반 GPU 클러스터를 안정적으로 운영하기 위한 유지 관리 방안을 정리했습니다. 자동화, 관측, 스케줄링 통합, 네트워크·보안 분리를 통해 장애 대응과 성능 안정성을 높이는 방법을 소개했습니다.

#Kubernetes#GPU
1000
[도입전략] Git 시크릿 관리와 Vault 도입으로 보안 강화하기
KT 클라우드
데브옵스

[도입전략] Git 시크릿 관리와 Vault 도입으로 보안 강화하기

Git 평문 시크릿과 K8s Secret 오브젝트를 함께 없애기 위한 Vault 도입 전략을 정리했습니다. 운영 설계와 예외 처리, 감사 로그와 토큰 회수까지 함께 챙겨야 합니다.

#Vault#Kubernetes
3500
[AI인프라] GPU 5만장 시대, AI 인프라 비즈니스 성공 조건
KT 클라우드
AI

[AI인프라] GPU 5만장 시대, AI 인프라 비즈니스 성공 조건

GPU 수량 경쟁보다 풀스택 최적화가 AI 인프라 비즈니스의 핵심이라고 설명했습니다. 운영 효율과 총비용 관점에서 AI NIC와 베어메탈 아키텍처의 중요성을 짚었습니다.

#AI인프라#GPU
4000
[기술이 장르가 되는 곳, kt cloud] 케클러 인터뷰 시리즈 #2 장애에도 서비스가 멈추지 않는 ‘Multi-AZ’ 엔지니어링 비하인드
KT 클라우드
아키텍처

[기술이 장르가 되는 곳, kt cloud] 케클러 인터뷰 시리즈 #2 장애에도 서비스가 멈추지 않는 ‘Multi-AZ’ 엔지니어링 비하인드

장애 복구보다 서비스 연속성을 우선한 kt cloud의 Multi-AZ 설계를 소개했습니다. 2개 AZ와 Satellite Zone으로 Active-Active와 쿼럼 유지를 함께 구현했습니다.

#Kubernetes#OpenStack
5100
무신사
AI

VLM을 쓰지 않은 이유: Geometric Prior로 25배 빠른 의류 디테일컷 자동화

중고 의류 디테일컷 자동 생성을 위해 VLM 대신 Detector와 규칙 기반 크롭을 선택했습니다.\n그 결과 공정 시간을 90% 줄이고 11만 개 상품에 일괄 적용했습니다.

#LLM#AWS Lambda
9300
[기술 분석] kubernetes Ingress API의 중단. 그 뒤를 잇는 Gateway API 파헤치기
KT 클라우드
데브옵스

[기술 분석] kubernetes Ingress API의 중단. 그 뒤를 잇는 Gateway API 파헤치기

Kubernetes Ingress NGINX 중단 배경과 Gateway API의 필요성을 설명했습니다. Nginx Gateway Fabric 설치와 Gateway, HTTPRoute 기반 트래픽 흐름도 함께 다뤘습니다.

#Kubernetes#Gateway API
6200
현대오토에버의 Amazon Bedrock으로 구축한 다중 AI 에이전트: 장애 대응 시간 5분으로 단축하기
AWS
AI

현대오토에버의 Amazon Bedrock으로 구축한 다중 AI 에이전트: 장애 대응 시간 5분으로 단축하기

현대오토에버가 Amazon Bedrock과 LangGraph로 다중 AI 에이전트를 구성해 장애 대응을 자동화했습니다.\n장애 분석부터 보고서 생성까지를 연결해 대응 시간을 수 시간에서 5분으로 줄였습니다.

#Amazon Bedrock#LangGraph
4900
[백업·DR] kt cloud 재해복구 설계: Multi-AZ와 Multi-Region
KT 클라우드
데브옵스

[백업·DR] kt cloud 재해복구 설계: Multi-AZ와 Multi-Region

Multi-AZ는 가용성을 높이기 위한 기본 구조이고, Multi-Region은 Region 전체 장애에 대비하는 DR 전략입니다.\nDR 설계에서는 RTO와 RPO를 기준으로 복제, 트래픽 전환, 세션 처리를 함께 고려해야 했습니다.

#cloud#Kubernetes
4100
[도입가이드] 인프라 관리의 표준, IaC의 본질과 도입 가치
KT 클라우드
데브옵스

[도입가이드] 인프라 관리의 표준, IaC의 본질과 도입 가치

IaC를 인프라를 코드로 관리하는 표준과 방법론으로 설명했습니다. 수동 관리의 문제와 함께 재현성, 버전 관리, 일관성의 가치를 정리했습니다.

#IaC#Terraform
3600
딜라이트룸의 ‘Amazon EKS Auto Mode’를 활용한 멀티 클러스터 운영 효율화 사례
AWS
데브옵스

딜라이트룸의 ‘Amazon EKS Auto Mode’를 활용한 멀티 클러스터 운영 효율화 사례

딜라이트룸은 EKS Auto Mode로 멀티 클러스터 운영 복잡도를 크게 줄였습니다. 또한 로그 수집과 진단 자동화를 더해 장애 대응력도 높였습니다.

#Kubernetes#EKS
3600
Amazon EKS에서 운영하는 자체 관리형 Agentic AI 플랫폼 : 인프라 자동화와 관측성으로 운영 안정성 확보하기
AWS
데브옵스

Amazon EKS에서 운영하는 자체 관리형 Agentic AI 플랫폼 : 인프라 자동화와 관측성으로 운영 안정성 확보하기

EKS Auto Mode와 Bifrost, Langfuse를 조합해 자체 관리형 Agentic AI 플랫폼을 구축하는 방법을 소개했습니다. 멀티모델 라우팅과 2계층 관측성으로 운영 안정성과 비용 최적화를 함께 확보했습니다.

#Amazon EKS#Kubernetes
7500
[분석] Kubernetes v1.35 Timbernetes: 6년 만의 GA, AI 스케줄링, 기술 부채 개선
KT 클라우드
데브옵스

[분석] Kubernetes v1.35 Timbernetes: 6년 만의 GA, AI 스케줄링, 기술 부채 개선

Kubernetes v1.35 Timbernetes의 주요 기능과 변경점을 정리했습니다. AI 워크로드 지원과 운영 개선, 업그레이드 시 주의사항을 함께 다뤘습니다.

#Kubernetes#container
5400
[코드가 환경을 모르는 구조 4/7] 타임머신 — 시간 축을 교체한다
flex
아키텍처

[코드가 환경을 모르는 구조 4/7] 타임머신 — 시간 축을 교체한다

HR SaaS에서는 시간이 급여와 연차 결과를 바꾸는 입력이므로 요청 단위로 교체 가능하게 만들었습니다. Clock 포트와 헤더 기반 Adapter, 비동기 컨텍스트 전파, 환경별 활성화로 타임머신을 구현했습니다.

#Kotlin#REST API
3900
AWS AI-DLC 기반 라포랩스 사내 배포 플랫폼 Raploy 구축 사례
AWS
데브옵스

AWS AI-DLC 기반 라포랩스 사내 배포 플랫폼 Raploy 구축 사례

라포랩스가 AWS AI-DLC로 사내 배포 플랫폼 Raploy를 구축한 사례를 공유했습니다. 비개발 직군도 AI와 플랫폼을 통해 배포·운영할 수 있도록 자동화와 관측성을 함께 강화했습니다.

#AWS#AI-DLC
5600