✕
CN EN

降维与聚类 / k-means 聚类

数据只在您的浏览器里处理:文件在本机读取和计算,不会上传到任何服务器,关闭页面即清除。免登录、免费使用。

怎么读

k-means 聚类

k-means 把样本分成 k 个簇,使每个样本到所属簇中心的平方距离之和(类内平方和)最小。散点图在前两个主成分上显示样本,颜色为簇。

如何选 k:肘部图中类内平方和随 k 增大而下降,下降明显变缓处(「肘部」)常作为候选;轮廓系数(−1 到 1)越高说明簇分得越清楚。两者都只是参考,应结合生物学背景决定。

变量单位不同时请勾选 z 分数;k-means 假设簇大致呈球形、大小相近,对离群值敏感。

算法从随机起点出发:本工具用 k-means++ 初始化并重复多次取最优,随机种子固定时结果可重复;簇编号本身没有顺序含义。

提供已知分组列时,调整兰德指数(ARI,1 = 完全一致,约 0 = 随机)衡量聚类与分组的一致程度。

方法说明

Lloyd S. (1982) IEEE Trans Inf Theory 28:129–137;Arthur & Vassilvitskii (2007) k-means++;Rousseeuw (1987) J Comput Appl Math 20:53–65(轮廓系数);Hubert & Arabie (1985) J Classif 2:193–218(ARI)。默认 50 次起点;在示例数据上所选 k 的划分与类内平方和与 scikit-learn KMeans(n_init = 100)一致(相对差 < 1e-6),肘部图各 k 的类内平方和与之相差 < 1%;轮廓系数与 sklearn.metrics.silhouette_score 一致。

数据量

最多 20,000 个样本(超过 4,000 个时不计算轮廓系数)。

需要完整分析?

把数据和研究问题发给我们,1 个工作日内收到书面方案:分析步骤、参数理由、交付物与周期写清楚,按项目报价。