机器学习 / 回归模型(线性 / 岭 / 随机森林)
数据只在您的浏览器里处理:文件在本机读取和计算,不会上传到任何服务器,关闭页面即清除。免登录、免费使用。
R²、RMSE 与 MAE 都来自 k 折交叉验证:每折用其余样本训练、在本折上预测,再取各折均值;R² 越接近 1 越好,可以为负(比直接用均值预测还差)。
散点图横轴为实际值、纵轴为交叉验证预测值,点越贴近对角线预测越准;呈水平带状说明模型几乎没有解释力。
线性 / 岭回归在特征标准化后,系数表示该特征增加 1 个标准差时结果的变化,可直接比较大小;表中另给出原始单位的系数。岭回归的 α 越大系数越收缩,适合特征多或彼此相关的情形。
随机森林能捕捉非线性和交互作用;不纯度重要性偏向取值多的特征,宜与置换重要性(打乱该特征后 R² 下降多少)对照。
默认不打乱、按行顺序切分折(与常用实现一致);如果表格按结果排序,请勾选「划分前打乱」。
线性与岭回归按正规方程精确求解,目标函数与 scikit-learn LinearRegression / Ridge 一致(截距不惩罚);k 折划分与 scikit-learn KFold 一致;随机森林按 Breiman (2001) Machine Learning 45:5–32;R² 为决定系数 1 − SSE/SST。
在浏览器中计算:建议样本 ≤ 5,000、特征 ≤ 300;随机森林较慢,可减少树的数量。