机器学习 / 特征筛选(LASSO)
数据只在您的浏览器里处理:文件在本机读取和计算,不会上传到任何服务器,关闭页面即清除。免登录、免费使用。
LASSO 在线性回归上加 L1 惩罚 λ·Σ|系数|:λ 越大,越多系数被压成 0,剩下的就是入选特征。工具先把每个特征标准化(均值 0、标准差 1),使惩罚对各特征公平。
第一张图是不同 λ 下的交叉验证误差(±1 标准误):「误差最小」规则取曲线最低点;「一倍标准误」规则取误差不超过最低点一个标准误的最大 λ,入选特征更少、更稳健。
第二张图是系数路径:从右(λ 大)往左看,越早离开 0 的特征越重要;表中「entry_step_on_path」是首次入选的步数。
相关性很高的特征中 LASSO 往往只留一个,另一个被压成 0 并不代表它与结果无关;样本少时入选结果会随折的划分波动,可换随机种子检查稳定性。
入选特征表给出标准化系数和原始单位系数;CV R² = 1 − 交叉验证 MSE / 结果方差。
Tibshirani (1996) J R Stat Soc B 58:267–288;坐标下降求解(Friedman et al. 2010, J Stat Softw 33:1);目标函数 1/(2n)·||y − Xβ||² + λ||β||₁、λ 网格与 k 折选择与 scikit-learn LassoCV 一致;一倍标准误规则见 Hastie et al.《The Elements of Statistical Learning》。
在浏览器中计算:建议样本 × 特征 ≤ 约 200 万(如 500 × 4,000)。