✕
CN EN

机器学习 / 特征筛选(LASSO)

数据只在您的浏览器里处理:文件在本机读取和计算,不会上传到任何服务器,关闭页面即清除。免登录、免费使用。

怎么读

特征筛选(LASSO)

LASSO 在线性回归上加 L1 惩罚 λ·Σ|系数|:λ 越大,越多系数被压成 0,剩下的就是入选特征。工具先把每个特征标准化(均值 0、标准差 1),使惩罚对各特征公平。

第一张图是不同 λ 下的交叉验证误差(±1 标准误):「误差最小」规则取曲线最低点;「一倍标准误」规则取误差不超过最低点一个标准误的最大 λ,入选特征更少、更稳健。

第二张图是系数路径:从右(λ 大)往左看,越早离开 0 的特征越重要;表中「entry_step_on_path」是首次入选的步数。

相关性很高的特征中 LASSO 往往只留一个,另一个被压成 0 并不代表它与结果无关;样本少时入选结果会随折的划分波动,可换随机种子检查稳定性。

入选特征表给出标准化系数和原始单位系数;CV R² = 1 − 交叉验证 MSE / 结果方差。

方法说明

Tibshirani (1996) J R Stat Soc B 58:267–288;坐标下降求解(Friedman et al. 2010, J Stat Softw 33:1);目标函数 1/(2n)·||y − Xβ||² + λ||β||₁、λ 网格与 k 折选择与 scikit-learn LassoCV 一致;一倍标准误规则见 Hastie et al.《The Elements of Statistical Learning》。

数据量

在浏览器中计算:建议样本 × 特征 ≤ 约 200 万(如 500 × 4,000)。

需要完整分析?

把数据和研究问题发给我们,1 个工作日内收到书面方案:分析步骤、参数理由、交付物与周期写清楚,按项目报价。