聚类分析是数据挖掘和机器学习中的一个重要技术,它通过对数据进行分组,使同一组内的数据点彼此相似,而不同组的数据点之间差异较大。评估聚类效果的好坏是聚类分析的重要环节。以下介绍五大关键评分指标,帮助你精准评估聚类效果。

1. 调整后的兰德指数(Adjusted Rand Index,ARI)

兰德指数(Rand Index)是一种衡量两个样本集合相似性的指标,它基于成对匹配的方法,可以评估聚类结果的准确度。调整后的兰德指数(ARI)是在原始兰德指数的基础上,考虑了聚类个数对评价结果的影响,适用于不同聚类个数的数据集。

ARI计算公式:

[ ARI = 1 - \frac{1}{N^2} \sum{i=1}^k (n{ij}^2 - n_{ii}^2) ]

其中:

  • ( k ) 是聚类个数
  • ( N ) 是样本总数
  • ( n_{ij} ) 是同时属于第 ( i ) 个簇和第 ( j ) 个簇的样本数
  • ( n_{ii} ) 是属于第 ( i ) 个簇的样本数

应用示例:

假设有四个样本,聚类结果如下:

真实标签 聚类结果
1 1
2 1
3 2
4 2

则 ( ARI = 1 - \frac{1}{16} \times (1 - 4) = 0.5 )

2. 轮廓系数(Silhouette Coefficient)

轮廓系数是衡量聚类结果紧密性和分离性的指标,取值范围在[-1, 1]之间。轮廓系数越高,表示聚类结果越好。

轮廓系数计算公式:

[ \text{Silhouette Coefficient}(x) = \frac{b(x) - a(x)}{max(b(x), a(x))} ]

其中:

  • ( a(x) ) 是样本 ( x ) 与同一簇内其他样本的平均距离
  • ( b(x) ) 是样本 ( x ) 与其他簇样本的平均距离

应用示例:

假设有四个样本,距离矩阵如下:

x y z w
x 0 0.5 1
y 0.5 0 0.5
z 1 0.5 0
w 1 0 0

则第一个样本的轮廓系数为:

[ \text{Silhouette Coefficient}(x) = \frac{0.5 - 0.75}{max(0.5, 0.75)} = -\frac{1}{3} ]

3. 同质性(Homogeneity)

同质性是指聚类结果与真实标签的一致程度。同质性取值范围在[0, 1]之间,值越大表示聚类结果越好。

同质性计算公式:

[ \text{Homogeneity} = \frac{2k}{N^2} \sum{i=1}^k \sum{j=1}^k n{ij} \left(\frac{n{ij}}{k} - \frac{n_i \times n_j}{N^2}\right) ]

其中:

  • ( k ) 是聚类个数
  • ( N ) 是样本总数
  • ( n_{ij} ) 是同时属于第 ( i ) 个簇和第 ( j ) 个簇的样本数

应用示例:

假设有四个样本,真实标签和聚类结果如下:

真实标签 聚类结果
1 1
2 1
3 2
4 2

则同质性为:

[ \text{Homogeneity} = \frac{2 \times 2}{16} \times (1 \times 1 - \frac{2}{16}) = 0.25 ]

4. 完整性(Completeness)

完整性是指聚类结果包含真实标签中每个簇的程度。完整性取值范围在[0, 1]之间,值越大表示聚类结果越好。

完整性计算公式:

[ \text{Completeness} = \frac{2k}{N^2} \sum{i=1}^k \sum{j=1}^k n{ij} \left(\frac{n{ij}}{k} - \frac{n_i \times n_j}{N^2}\right) ]

其中:

  • ( k ) 是聚类个数
  • ( N ) 是样本总数
  • ( n_{ij} ) 是同时属于第 ( i ) 个簇和第 ( j ) 个簇的样本数

应用示例:

完整性计算公式与同质性相同,故不再赘述。

5. V-measure

V-measure是结合同质性和完整性的综合指标,取值范围在[0, 1]之间,值越大表示聚类结果越好。

V-measure计算公式:

[ V = \frac{Homogeneity + Completeness}{2} ]

应用示例:

假设有四个样本,同质性和完整性如下:

同质性 完整性
0.25 0.25

则 V-measure 为:

[ V = \frac{0.25 + 0.25}{2} = 0.25 ]

通过以上五大关键评分指标,你可以对聚类结果进行综合评估,从而找到最佳的聚类模型。在实际应用中,可以根据具体问题和数据特点选择合适的指标进行评估。