降维与聚类 / t-SNE
数据只在您的浏览器里处理:文件在本机读取和计算,不会上传到任何服务器,关闭页面即清除。免登录、免费使用。
t-SNE 让高维空间中相近的样本在平面上也相近,适合查看细胞或样本是否形成分群;它主要保留局部邻近关系。
簇的大小、簇间距离和坐标数值本身没有可比的含义,不能据此判断两群「差多少」;分析请用原始数据或 PCA。
困惑度大致等于每个点考虑的有效邻居数:常用 5–50,样本少时取小值;不同困惑度、随机种子得到的图形状会不同,种子固定时结果可重复。
基因表达矩阵建议先对数转换,并用 PCA 降到前 30–50 个主成分再做 t-SNE(默认 50);可信度(0–1,越高越好)衡量局部邻居是否被保留。
计算为精确 t-SNE(O(n²)),在浏览器中 1,000 个样本约需十几秒到一分钟,请改好参数后点「运行」。
van der Maaten L. & Hinton G. (2008) J Mach Learn Res 9:2579–2605。参数与优化细节同 scikit-learn TSNE(method="exact");由于随机数序列不同,坐标与其不逐点相同,示例数据上的可信度与 KL 散度与之相差不超过 0.02 与 10%。
最多 5,000 个样本。