降维与聚类 / 趋势分析
数据只在您的浏览器里处理:文件在本机读取和计算,不会上传到任何服务器,关闭页面即清除。免登录、免费使用。
每个基因先在各条件间做 z 分数(均值 0、标准差 1),只保留「形状」而去掉表达高低,再用 k-means 把形状相近的基因归为同一趋势簇。
第一张图是各簇的平均模式;第二张图按簇分块,灰线为该簇的基因(基因很多时等间隔抽取显示),彩色线为簇平均。
簇数 k 填 0 时,在 2 到上限之间选平均轮廓系数最高的 k;轮廓系数只是参考,簇过多或过少都可手动指定。
列的先后顺序就是条件顺序;有重复样本时请上传样本–条件表,工具按条件求均值,条件顺序取该表中首次出现的顺序。
趋势聚类不做统计检验;建议先用差异分析或方差筛选出有变化的基因,再做趋势分析。
Hartigan & Wong (1979) Appl Stat 28:100–108(k-means);Rousseeuw (1987) J Comput Appl Math 20:53–65(轮廓系数)。z 分数用 n − 1 标准差;报告的簇中心、类内平方和与轮廓系数可由簇划分独立复算(与 scikit-learn 一致)。基因多、模式渐变时存在许多几乎等价的局部最优:示例数据上类内平方和与 scikit-learn KMeans(n_init = 100)相差 < 0.1%,划分的调整兰德指数 > 0.95;增加重复起点数可进一步降低类内平方和。
最多 30,000 个基因(轮廓系数在多于 3,000 个基因时按固定种子抽样 3,000 个计算)。