✕
CN EN

表格工具 / 缺失值处理

数据只在您的浏览器里处理:文件在本机读取和计算,不会上传到任何服务器,关闭页面即清除。免登录、免费使用。

怎么读

缺失值处理

先按阈值删掉缺失太多的列和行(默认超过 50%),再对剩余缺失进行填充;空白、NA、NaN、null、「-」等都视为缺失。

均值、中位数填充简单但会压低方差;最小值或其一半常用于代谢组/蛋白组中「低于检测限」造成的缺失;kNN 用最相似的 k 行(按其余列的欧氏距离)的平均值填充,通常更接近真实值。

kNN 与常用机器学习库的 KNNImputer 一致:距离只在双方都有值的列上计算并按比例放大,近邻只从该列有值的行中选。

「被填充的单元格」列出每个填充位置和数值,便于复核;填充后的数据用于统计检验时,应在方法中说明填充方式。

方法说明

kNN 填充:Troyanskaya et al. 2001(Bioinformatics 17:520);距离定义同 scikit-learn KNNImputer(nan_euclidean)。

数据量

最多 100,000 行;kNN 填充建议 5,000 行以内。

需要完整分析?

把数据和研究问题发给我们,1 个工作日内收到书面方案:分析步骤、参数理由、交付物与周期写清楚,按项目报价。