문제
여러 분포가 확률적으로 선형 결합된 형태로, 데이터가 k개의 모수적 모형의 가중합으로 표현되는 모집단 모형에서 나왔다는 가정하에, 추정된 k개의 모형 중 어느 모형으로부터 나왔을 확률이 높은지에 따라 군집 분류를 수행하는 것은 무엇인가?
① 평균연결법 ② 혼합분포군집 ③ SOM ④ DBSCAN
정답
2번
해설
정답: 2. 데이터가 k개의 확률분포(예: 정규분포)의 가중합인 혼합 모형에서 생성되었다고 가정하고, 각 데이터가 어느 분포에서 나왔을 확률에 따라 군집을 정하는 기법은 혼합분포군집(Mixture Distribution Clustering)이다. 보통 EM 알고리즘으로 추정한다.
오답 풀이
- 1번: 평균연결법은 계층적 군집에서 군집 간 모든 쌍 거리의 평균으로 거리를 정하는 방법이다.
- 2번: 확률분포의 가중합 모형을 가정하는 혼합분포군집으로 옳다.
- 3번: SOM(자기조직화지도)은 신경망 기반의 차원 축소·군집 시각화 기법이다.
- 4번: DBSCAN은 밀도 기반 군집으로 분포 가정 없이 밀집 영역을 군집으로 본다.
보충 개념 혼합분포군집은 가우시안 혼합 모형(GMM)이 대표적이며, EM 알고리즘으로 각 분포의 모수와 소속 확률을 반복 추정한다. 확률적(소프트) 할당을 한다는 점이 K-means(하드 할당)와 다르다.