✕
CN EN

机器学习 / 分类模型(逻辑回归 / 随机森林)

数据只在您的浏览器里处理:文件在本机读取和计算,不会上传到任何服务器,关闭页面即清除。免登录、免费使用。

怎么读

分类模型(逻辑回归 / 随机森林)

所有指标都来自 k 折交叉验证:每个样本由没见过它的模型预测,因此比在训练数据上算的准确率更接近新样本上的表现。默认分层划分,各折类别比例与整体一致。

ROC 曲线用交叉验证得到的预测概率绘制,AUC 越接近 1 区分能力越强,0.5 相当于随机猜测;多于两类时每类画一条「对其余」曲线。混淆矩阵的对角线是预测正确的样本数。

逻辑回归的系数在特征标准化后可直接比较大小:正值表示该特征越大越倾向于第二类(按类别名排序)。随机森林给出平均 Gini 下降(不纯度重要性),它偏向取值多的特征,宜与置换重要性对照。

置换重要性在每折的测试部分计算:把某个特征随机打乱后准确率下降越多,模型越依赖它;相关的特征会互相「分担」重要性。

样本少、特征多时结果波动大,建议换几个随机种子或折数看是否稳定;模型评估不等于因果结论。

方法说明

逻辑回归目标函数与 scikit-learn LogisticRegression(L2、截距不惩罚、多类为 multinomial)一致,牛顿法求解;随机森林按 Breiman (2001) Machine Learning 45:5–32(CART、bootstrap、每次分裂随机抽特征);分层 k 折划分与 scikit-learn StratifiedKFold 一致;AUC 置信区间为 DeLong 法(DeLong et al. 1988);置换重要性见 Breiman (2001)。

数据量

在浏览器中计算:建议样本 ≤ 5,000、特征 ≤ 200;随机森林较慢,可减少树的数量。

需要完整分析?

把数据和研究问题发给我们,1 个工作日内收到书面方案:分析步骤、参数理由、交付物与周期写清楚,按项目报价。