

Spark 7편: Optimising Shuffle Partitions(coalescePartitions)
Spark 3.0의 AQE와 coalescePartitions로 셔플 파티션을 동적으로 최적화하는 내용을 소개했습니다. 셔플 파티션 크기에 따른 성능 저하 문제와 파티션 병합 방식도 설명했습니다.


Spark 3.0의 AQE와 coalescePartitions로 셔플 파티션을 동적으로 최적화하는 내용을 소개했습니다. 셔플 파티션 크기에 따른 성능 저하 문제와 파티션 병합 방식도 설명했습니다.


YARN 라벨링으로 Spark의 AM과 Executor를 서로 다른 노드에 배치하는 방법을 소개했습니다. EMR에서 Spot Instance 사용 시 발생하는 장애와 비용 문제를 완화하는 구성도 설명했습니다.


Spark의 원격 연동 한계를 보완하는 Spark Connect의 등장 배경과 동작 방식을 소개했습니다. 서버·클라이언트 환경을 구성해 Jupyter Notebook에서 실제 연결과 실행을 확인했습니다.


Spark의 Broadcast 기능으로 셔플을 줄이고 join 성능을 높이는 방법을 소개했습니다. 작은 데이터셋에는 자동 broadcast 감지와 설정 조건도 함께 설명했습니다.


Spark에서 파티션이 병렬성, 메모리, 파일 수에 미치는 영향을 설명했습니다.\n입력·출력·셔플 파티션 설정을 조정해 성능을 최적화하는 방법을 소개했습니다.


Spark의 Cache와 Persist 개념과 사용 시 주의점을 설명했습니다. 메모리 부족으로 인한 spill over를 줄이는 대응 방법도 소개했습니다.


Spark의 동작 방식과 Catalyst, Tungsten 최적화 역할을 소개했습니다. 논리 계획과 물리 계획, Predicate Pushdown 같은 핵심 개념을 설명했습니다.
쿠팡 파트너스
이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.
![[BigData] Spark 개요 정리](https://bespin-wordpress-bucket.s3.ap-northeast-2.amazonaws.com/wp-content/uploads/2025/03/image-10.png)

Spark의 개요와 주요 구성요소, 장점을 정리한 글입니다. 대용량 데이터 처리에서 Pandas보다 Spark가 더 적합한 성능 사례도 비교했습니다.


Amazon S3 Tables의 발표 내용과 서비스팀 확인 사항을 정리한 글입니다. 분석 워크로드 성능 향상, 자동 유지보수, 비용과 한계를 함께 살펴보았습니다.
Iceberg를 DataLake에 도입해 Kafka·CDC 입수와 테이블 운영을 더 효율적으로 개선했습니다. 또한 자동화된 모니터링과 유지보수로 실시간 조회와 성능 최적화를 함께 달성했습니다.

하루 6천 개가 넘는 Spark Job을 자동으로 점검하기 위해 Spark Analyzer를 개발했습니다.\nHistory Server 메트릭과 임계치 기반 규칙으로 성능 문제를 탐지하고 알림으로 연결했습니다.


통신사 마케팅을 위해 요금제 변경 예측과 추천을 결합한 하이브리드 ML 모델을 소개했습니다.\nARPU와 고객 만족도의 균형을 고려해 다운그레이드 방어와 업셀 전략에 활용했습니다.


쿠팡이 LLM을 활용해 이미지·텍스트 이해, 약한 라벨 생성, 상품 분류를 개선하는 사례를 소개했습니다. 또한 CJK 언어 특성과 ICL·RAG·SFT·CPT, Kubernetes 기반 훈련 흐름을 함께 설명했습니다.


Pandas와 Spark 사이의 대체제로 Polars를 검토한 실무 적용 경험을 소개했습니다. Lazy API와 streaming으로 메모리와 실행 시간을 크게 줄인 사례를 공유했습니다.