군집분석
군집 분석 (Cluster Analysis)
군집 분석은 비슷한 특성을 가진 데이터 포인트들을 그룹으로 묶는 비지도 학습 방법입니다. 이 방법은 데이터 내에서 자연스러운 그룹핑이나 패턴을 찾는 데 사용되며, 레이블이 지정되지 않은 데이터 세트에서 유용합니다.
군집 분석 vs 분류
- 군집 분석: 비지도 학습으로, 데이터에 레이블이 지정되어 있지 않습니다. 데이터의 유사성을 바탕으로 그룹을 형성합니다.
- 분류(Classification): 지도 학습 방법으로, 미리 정의된 레이블을 바탕으로 새로운 데이터 포인트를 분류합니다.
K-means 군집화
K-means 군집화는 군집의 수(K)를 사전에 정하고, 데이터 포인트를 가장 가까운 중심점(centroid)에 할당하여 군집을 형성합니다. 군집 내의 분산을 최소화하면서 데이터를 그룹화하는 방법입니다.
계층적 군집 분석
계층적 군집 분석은 데이터를 계층 구조로 군집화하는 방법입니다. 이 방법은 덴드로그램이라는 나무 모양의 그래프를 사용하여 데이터 포인트 간의 유사성을 시각적으로 표현합니다.
계층적 군집 분석의 두 가지 주요 방법
- 집괴적 방법(Agglomerative Method):
- 각 데이터 포인트를 개별 군집으로 시작하여, 가장 유사한 군집들을 차례대로 합쳐나가는 방식입니다. 이 과정은 하나의 군집이 남을 때까지 반복됩니다.
- 유사성 기준에는 최단 연결법, 최장 연결법, 평균 연결법 등이 있습니다.
- 분할적 방법(Divisive Method):
- 전체 데이터 세트를 하나의 군집으로 시작하여, 점차적으로 군집을 세분화해 나가는 방식입니다. 이 과정은 각 데이터 포인트가 개별 군집이 될 때까지 계속됩니다.
- 집괴적 방법에 비해 계산 비용이 더 높지만, 때때로 더 정확한 결과를 제공할 수 있습니다. 군집 분석은 데이터의 내재된 구조를 이해하고, 비슷한 특성을 가진 데이터 포인트들을 식별하는 데 매우 유용합니다. K-means는 특히 대규모 데이터에 효율적인 반면, 계층적 방법은 더 세밀한 데이터 구조를 탐색할 때 유용합니다.