(생성 AI를 기반으로 정리된 내용은 🤖 아이콘으로 표기해두었습니다) 아래 내용은 DE Zoomcamp 강의 내용을 기반으로 작성되었습니다. Spark RDD란?RDD는 스파크의 초기 버전에서 분산 컴퓨팅의 기반이었으며,다음과 같은 특징을 가집니다.Partitioned Collection of Records RDD는 여러 파티션으로 나뉜 데이터 모음이다. 각 파티션은 클러스터의 서로 다른 노드에 분산 저장되고, 일반 정형 테이블뿐 아니라 (key, value) 형태의 데이터도 자연스럽게 다룬다.Spread Across the Cluster, Read-only 데이터는 클러스터 전반에 분산되며 읽기 전용으로 동작한다. 한 번 생성된 RDD는 수정하지 않고, Transformation을 통해 새 RDD를 ..