Iceberg는 정말 싸고 빠를까? – 운영 데이터 5가지 벤치마크 솔직한 결과
실제 운영 데이터로 Iceberg와 Hive를 비교해 비용과 속도 차이를 검증했습니다. 큰 테이블부터 옮기고 SQL 패턴을 바꿔야 효과가 커졌습니다.
#Apache Iceberg#Athena#PySpark
3100
PySpark 태그가 달린 국내 IT 기업 기술 블로그 글을 최신순으로 모았습니다.
4개 표시
실제 운영 데이터로 Iceberg와 Hive를 비교해 비용과 속도 차이를 검증했습니다. 큰 테이블부터 옮기고 SQL 패턴을 바꿔야 효과가 커졌습니다.
SparkListener와 Spark History MCP, n8n AI Agent를 연결해 Spark 장애 분석을 자동화했습니다.\n실시간 에러 감지와 히스토리 조회로 원인과 해결책을 Slack으로 전달했습니다.
웹 크롤링 데이터로 LLM 사전학습 데이터셋을 만든 경험과 어려움을 정리했습니다. NVIDIA EMNLP 2024 논문을 통해 품질 필터링과 중복 제거 전략을 체계적으로 살펴봤습니다.

Airflow와 PySpark로 제조업 기준 정보와 생산 데이터를 통합해 Spotfire 대시보드를 자동화했습니다.\n대용량 처리와 정기 갱신으로 현장 의사결정 속도와 데이터 신뢰성을 높였습니다.
