다나와 웹 트래픽 로그 데이터 분석 시스템 도입기
백엔드
다나와 웹 트래픽 로그 데이터 분석 시스템 도입기
두줄요약
다나와 웹 트래픽 로그 분석용 내부 서비스를 도입한 과정을 정리했습니다. 유비쿼터스 언어 정리부터 Opensearch 선택, 필터링과 검증까지의 흐름을 설명했습니다.
문제 상황
- 다나와 웹 트래픽 로그를 내부에서 분석할 새로운 서비스 구축 필요
- 세션 단위 사용자 여정, 광고 클릭, 페이지 카테고리별 조회 등 분석 요구 존재
- 봇·크롤러·어뷰저 필터링과 1분 이내 결과 기대라는 운영 조건 존재
구조와 흐름
- 도메인 전문가와 용어 정리 후 유비쿼터스 언어 사전 구성
- 정책 정의, 기술 검토, 데이터 포맷 설계, 필터링·색인, 검증, API 제공 순으로 진행
- PC/Mobile 영역 분리와 엣지케이스 점검으로 분석 품질 보완
선택 이유
- Hadoop, Hive, Elasticsearch, AWS Athena, Neo4j 등을 검토
- 색인, 검색, 집계의 빠른 처리와 관리 포인트 절감을 이유로 AWS Opensearch 선택
- Elasticsearch와 유사한 스택 경험을 활용해 포맷 설계 난이도 완화