✕
CN EN

降维与聚类 / (O)PLS-DA

数据只在您的浏览器里处理:文件在本机读取和计算,不会上传到任何服务器,关闭页面即清除。免登录、免费使用。

怎么读

(O)PLS-DA

PLS-DA 是有监督的降维:它寻找最能区分已知分组的方向,因此得分图上组间分开是「设计使然」,不能单凭图形证明组间存在差异。

请看交叉验证的 Q²(越接近 1 越好,通常 > 0.5 认为预测能力较好,≤ 0 说明模型没有预测价值)与 R²Y 的差距:R²Y 很高而 Q² 低,提示过拟合;变量数远多于样本数时尤其要注意。

OPLS-DA 把与分组相关的变异集中到一个预测成分(横轴),把与分组无关的系统变异放到正交成分(纵轴),便于解读,但预测能力与同维度的 PLS-DA 相同。

VIP(变量投影重要性)汇总了每个变量对模型的贡献,VIP > 1 是常用的筛选参考;建议再结合单变量检验(如 t 检验并做 FDR 校正)确认差异变量。

代谢组数据常用 Pareto 或单位方差缩放;Q² 的交叉验证按样本顺序轮流分折(第 i 个样本进入第 i mod k 折),结果可重复。

方法说明

Wold S., Sjöström M. & Eriksson L. (2001) Chemom Intell Lab Syst 58:109–130;Trygg J. & Wold S. (2002) J Chemom 16:119–128(OPLS);Chong & Jun (2005) Chemom Intell Lab Syst 78:103–112(VIP)。PLS-DA 得分、权重与 scikit-learn PLSRegression(独热编码的分组)一致;OPLS-DA 与按 Trygg–Wold 算法独立编写的 NumPy 实现一致。

数据量

最多 20,000 个样本或变量(矩阵很大时计算需数秒)。

需要完整分析?

把数据和研究问题发给我们,1 个工作日内收到书面方案:分析步骤、参数理由、交付物与周期写清楚,按项目报价。