机器学习 / 聚类评估
数据只在您的浏览器里处理:文件在本机读取和计算,不会上传到任何服务器,关闭页面即清除。免登录、免费使用。
轮廓系数衡量每个样本与本簇的贴近程度相对最近的其他簇:接近 1 表示归属明确,接近 0 表示处在两簇之间,负值可能被分错。轮廓图按簇排列,负值多的簇值得复查。
CH 指数(簇间与簇内离散度之比)越大越好、DB 指数(各簇与最相似簇的平均相似度)越小越好;两者都只适合在同一数据上比较不同的聚类方案。
提供已知类别时给出 ARI(调整兰德指数,随机分组约为 0)和 NMI(标准化互信息,0–1),并列出簇 × 类别的列联表,便于看哪些类别被合并或拆分。
距离为欧氏距离;特征量纲不同时建议保留「标准化」。没有聚类列时工具会对 k = 2 到所设最大值做 k-means,并按平均轮廓系数推荐 k,供参考而非定论。
PCA 散点图用前两个主成分展示各簇的分布,只是投影,重叠不一定代表在高维空间里也重叠。
轮廓系数:Rousseeuw (1987) J Comput Appl Math 20:53–65;CH:Caliński & Harabasz (1974) Commun Stat 3:1–27;DB:Davies & Bouldin (1979) IEEE TPAMI 1:224–227;ARI:Hubert & Arabie (1985) J Classif 2:193–218;NMI 采用算术平均归一。各指标的定义与特殊情形处理与 scikit-learn 一致。
轮廓系数需要两两距离,最多 5,000 个样本。