聚类分析是数据挖掘和机器学习中的一个重要技术,它通过对数据进行分组,使同一组内的数据点彼此相似,而不同组的数据点之间差异较大。评估聚类效果的好坏是聚类分析的重要环节。以下介绍五大关键评分指标,帮助你精准评估聚类效果。
1. 调整后的兰德指数(Adjusted Rand Index,ARI)
兰德指数(Rand Index)是一种衡量两个样本集合相似性的指标,它基于成对匹配的方法,可以评估聚类结果的准确度。调整后的兰德指数(ARI)是在原始兰德指数的基础上,考虑了聚类个数对评价结果的影响,适用于不同聚类个数的数据集。
ARI计算公式:
[ ARI = 1 - \frac{1}{N^2} \sum{i=1}^k (n{ij}^2 - n_{ii}^2) ]
其中:
- ( k ) 是聚类个数
- ( N ) 是样本总数
- ( n_{ij} ) 是同时属于第 ( i ) 个簇和第 ( j ) 个簇的样本数
- ( n_{ii} ) 是属于第 ( i ) 个簇的样本数
应用示例:
假设有四个样本,聚类结果如下:
| 真实标签 | 聚类结果 |
|---|---|
| 1 | 1 |
| 2 | 1 |
| 3 | 2 |
| 4 | 2 |
则 ( ARI = 1 - \frac{1}{16} \times (1 - 4) = 0.5 )
2. 轮廓系数(Silhouette Coefficient)
轮廓系数是衡量聚类结果紧密性和分离性的指标,取值范围在[-1, 1]之间。轮廓系数越高,表示聚类结果越好。
轮廓系数计算公式:
[ \text{Silhouette Coefficient}(x) = \frac{b(x) - a(x)}{max(b(x), a(x))} ]
其中:
- ( a(x) ) 是样本 ( x ) 与同一簇内其他样本的平均距离
- ( b(x) ) 是样本 ( x ) 与其他簇样本的平均距离
应用示例:
假设有四个样本,距离矩阵如下:
| x | y | z | w |
|---|---|---|---|
| x | 0 | 0.5 | 1 |
| y | 0.5 | 0 | 0.5 |
| z | 1 | 0.5 | 0 |
| w | 1 | 0 | 0 |
则第一个样本的轮廓系数为:
[ \text{Silhouette Coefficient}(x) = \frac{0.5 - 0.75}{max(0.5, 0.75)} = -\frac{1}{3} ]
3. 同质性(Homogeneity)
同质性是指聚类结果与真实标签的一致程度。同质性取值范围在[0, 1]之间,值越大表示聚类结果越好。
同质性计算公式:
[ \text{Homogeneity} = \frac{2k}{N^2} \sum{i=1}^k \sum{j=1}^k n{ij} \left(\frac{n{ij}}{k} - \frac{n_i \times n_j}{N^2}\right) ]
其中:
- ( k ) 是聚类个数
- ( N ) 是样本总数
- ( n_{ij} ) 是同时属于第 ( i ) 个簇和第 ( j ) 个簇的样本数
应用示例:
假设有四个样本,真实标签和聚类结果如下:
| 真实标签 | 聚类结果 |
|---|---|
| 1 | 1 |
| 2 | 1 |
| 3 | 2 |
| 4 | 2 |
则同质性为:
[ \text{Homogeneity} = \frac{2 \times 2}{16} \times (1 \times 1 - \frac{2}{16}) = 0.25 ]
4. 完整性(Completeness)
完整性是指聚类结果包含真实标签中每个簇的程度。完整性取值范围在[0, 1]之间,值越大表示聚类结果越好。
完整性计算公式:
[ \text{Completeness} = \frac{2k}{N^2} \sum{i=1}^k \sum{j=1}^k n{ij} \left(\frac{n{ij}}{k} - \frac{n_i \times n_j}{N^2}\right) ]
其中:
- ( k ) 是聚类个数
- ( N ) 是样本总数
- ( n_{ij} ) 是同时属于第 ( i ) 个簇和第 ( j ) 个簇的样本数
应用示例:
完整性计算公式与同质性相同,故不再赘述。
5. V-measure
V-measure是结合同质性和完整性的综合指标,取值范围在[0, 1]之间,值越大表示聚类结果越好。
V-measure计算公式:
[ V = \frac{Homogeneity + Completeness}{2} ]
应用示例:
假设有四个样本,同质性和完整性如下:
| 同质性 | 完整性 |
|---|---|
| 0.25 | 0.25 |
则 V-measure 为:
[ V = \frac{0.25 + 0.25}{2} = 0.25 ]
通过以上五大关键评分指标,你可以对聚类结果进行综合评估,从而找到最佳的聚类模型。在实际应用中,可以根据具体问题和数据特点选择合适的指标进行评估。
