목록 보기
총 용량 1EB 초과! 서로 역사가 다른 두 HDFS를 어떻게 연결할까? 데이터 플랫폼 연계 중 직면한 과제와 설계 결정
데브옵스

총 용량 1EB 초과! 서로 역사가 다른 두 HDFS를 어떻게 연결할까? 데이터 플랫폼 연계 중 직면한 과제와 설계 결정

라인
라인
2026년 6월 23일

두줄요약

LY Corporation의 두 HDFS 플랫폼을 통합 운영하며 겪은 스케일링 문제와 연계 설계를 다뤘습니다.권한 모델, Cross-Realm Kerberos, DistCP를 통해 안전한 데이터 전송 구조를 마련한 과정을 소개했습니다.

구조와 흐름

  • 구 LINE과 구 Yahoo Japan의 HDFS 운영 방식 차이 정리
  • ViewFS 기반 클라이언트 해석과 RBF 기반 서버 라우팅의 대비
  • 조직 통합 후 권한 관리 통일과 DistCP 기반 연계 설계

성능/운영 포인트

  • 1EB 초과 규모에서 NameNode 메타데이터 부하와 블록 수 증가 대응
  • 스몰 파일 병합, Balancer 병렬도 조정, msync 빈도 재검토로 지연 완화
  • Cross-Realm Kerberos, 전용 큐, NodeLabel, ACL로 안전한 전송 통제

주의할 점

  • 네트워크 트래픽과 DataNode 증감이 클러스터 전체 운영에 미치는 영향
  • 권한 단위 차이로 인한 사용자 경험과 거버넌스 복잡도
  • WAN 구간 대역폭 상한과 계층별 연결 조건 사전 점검 필요

적용해볼 점

  • 플랫폼 차이를 전제로 운영 경로와 권한 모델부터 먼저 정리
  • 단순 연결보다 실제 운영 가능한 전송·승인·감사 흐름 설계
  • 단계적 전송과 스몰 스타트로 기존 서비스 영향 최소화

다음 읽기

#Hadoop 주제를 이어서 읽기

LINE 서비스의 대규모 광고 데이터를 처리하기 위한 Spark on Kubernetes 적용기

LINE Ads의 대규모 광고 데이터를 처리하기 위해 Spark on Kubernetes를 도입한 사례입니다. 성능 향상, 비용 절감, 버전 유연성을 함께 확보했습니다.

라인
라인
데브옵스

댓글 0

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...