【R统计】各式各样的插补法解决数据缺失的问题!

  • 💂 个人信息:酷在前行
  • 👍 版权: 博文由【酷在前行】原创、需要转载请联系博主
  • 👀 如果博文对您有帮助,欢迎点赞、关注、收藏 + 订阅专栏
  • 🔖 本文收录于【R统计】,该专栏主要介绍R语言实现统计分析的过程,如数据的描述性统计、t检验、方差分析、相关性、线性回归等等。请大家多多关注点赞和支持,共同进步~ 欢迎大家订阅!

📋 文章目录

  • 构建数据
  • 简单插补
    • 均值/中位数插补
    • 随机插补
  • 基于模型的插补方法
    • 线性回归插补
    • k-最近邻插补 (k-NN)
    • 随机森林插补
  • 多重插补 (Multiple Imputation)
  • 数据插补效果展示

   在日常科研工作中,缺失数据是一个很常见的问题。特别是在大型的数据集中,由于各种不可抗因素,数据缺失几乎是难以避免的。但这就带来一个问题:当我们面对缺失数据时,应该如何处理?直接删除含有缺失值的数据行似乎是一个简单且直接的方法,但这样会导致有效数据的损失。今天,我想为大家分享几种处理数据缺失的方法。请注意,这些方法各有利弊,最适合的方法应该基于具体的数据特点和研究目的来选择。

构建数据

首先,我们要读入一个30行、14列的生态数据集。这个数据集用于示范如何处理数据中的缺失值。通过随机抽样方法,我们在数据集的copy_SOC列中人为地产生了一些缺失值。

# 数据读入test_data<- read.csv('H:/data/test_data.csv')test_data$copy_SOC <- test_data$SOC# 计算需要替换为NA的数据个数
num_na <- round(nrow(test_data) * 0.20)# 随机选择 20%索引
random_indices <- sample(1:nrow(test_data), size=num_na)# 替换选择的索引对应的数据为NA
test_data[random_indices,15] <- NAcolSums(is.na(test_data))sites             NPP            ANPP    Root.biomass             SOC 0               0               0               0               0 TN              pH            Clay            Silt            Sand 0               0               0               0               0 Bulk.density      total.PLFA    Fungal.PLFAs Bacterial.PLFAs        copy_SOC 0               0               0               0               6 

看到其中copy_SOC列有6个缺失值

简单插补

均值/中位数插补

这是一个非常基础且常用的方法。适用于数据缺失是随机的情况。方法是直接用变量的均值或中位数替代缺失值。

# 使用列的均值、中位数或众数来填充缺失值。这是最简单的方法。
test_data$mean_copy_SOC <- test_data$copy_SOC
test_data$mean_copy_SOC[is.na(test_data$mean_copy_SOC)] <- mean(test_data$copy_SOC, na.rm = TRUE)test_data$median_copy_SOC <- test_data$copy_SOC
test_data$median_copy_SOC[is.na(test_data$median_copy_SOC)] <- median(test_data$copy_SOC, na.rm = TRUE)

随机插补

直接从已有的观测值中随机选择一个值来替代缺失值。这种方法适用于数据缺失是完全随机的情况。

# 从已有的观测值中随机选择值来填充缺失值。
library(Hmisc)
test_data$Hmisc_copy_SOC <- test_data$copy_SOC
test_data$Hmisc_copy_SOC <- impute(test_data$Hmisc_copy_SOC,  'random')# 当使用impute函数时,确保你的数据是数值型的,因为这个函数主要针对数值数据设计的。
# impute 也可以使用均值,中值进行插值
# impute(test_data$Hmisc_copy_SOC,  'mean')
# impute(test_data$Hmisc_copy_SOC,  'median')

基于模型的插补方法

线性回归插补

利用其他变量对有缺失值的变量进行线性回归预测,然后用预测值来替代缺失值。

#   使用已知的其他变量作为预测变量,进行线性回归,然后使用该回归模型来预测缺失值。
test_data$lm_copy_SOC <- test_data$copy_SOCtrain_data <- test_data[!is.na(test_data$lm_copy_SOC),]# 使用train_data建立线性模型
lm_fit <- lm(lm_copy_SOC ~ NPP+ANPP+Root.biomass+TN+pH+Clay+Silt+Sand+Bulk.density+total.PLFA+   Fungal.PLFAs+Bacterial.PLFAs,train_data )
# 对线性模型进行逐步回归,筛选变量
lm_fit2 <- step(lm_fit)#模型总结
summary(lm_fit2)Call:
lm(formula = lm_copy_SOC ~ NPP + ANPP + Root.biomass + TN + Clay + Sand + Bulk.density + total.PLFA + Fungal.PLFAs + Bacterial.PLFAs, data = train_data)Residuals:Min      1Q  Median      3Q     Max 
-2.9593 -2.0936  0.2103  1.0633  4.2886 Coefficients:Estimate Std. Error t value Pr(>|t|)    
(Intercept)     -50.34984   29.42610  -1.711   0.1308    
NPP              -0.03340    0.01210  -2.760   0.0281 *  
ANPP             -0.34054    0.27252  -1.250   0.2516    
Root.biomass      0.05054    0.04098   1.233   0.2573    
TN               15.00918    1.48659  10.096 2.01e-05 ***
Clay              1.17952    1.16784   1.010   0.3461    
Sand              0.65299    0.38771   1.684   0.1360    
Bulk.density     -9.35362    8.41716  -1.111   0.3032    
total.PLFA       -1.39401    0.90615  -1.538   0.1678    
Fungal.PLFAs      2.88526    1.91431   1.507   0.1755    
Bacterial.PLFAs   2.53241    1.72284   1.470   0.1850    
---
Signif. codes:  0***0.001**0.01*0.05 ‘.’ 0.1 ‘ ’ 1Residual standard error: 3.586 on 7 degrees of freedom
Multiple R-squared:  0.9934, Adjusted R-squared:  0.984 
F-statistic: 105.4 on 10 and 7 DF,  p-value: 1.149e-06# 删选除用于预测的数据集
predict_data <- test_data[is.na(test_data$lm_copy_SOC),names(coefficients(lm_fit2))[-1]]# 使用该模型预测缺失值
predicted_values <- predict(lm_fit2, newdata = predict_data)# 将预测的值插入到数据中的缺失位置
test_data$lm_copy_SOC[is.na(test_data$lm_copy_SOC)] <- predicted_values

这种方法首先使用其他已知变量建立线性模型,然后用该模型预测缺失值。

k-最近邻插补 (k-NN)

该方法通过查找整个数据集中与缺失值最接近的k个观测值来插补数据。

#   使用DMwR包的knnImputation函数,基于k-NN方法填充缺失值。
remotes::install_github("cran/DMwR")library(DMwR)
test_data$DMwR_copy_SOC <- test_data$copy_SOC
knnImputation_data <- knnImputation(test_data)test_data$DMwR_copy_SOC <- knnImputation_data$DMwR_copy_SOC

随机森林插补

随机森林是一种集成学习方法,可以用来处理缺失数据问题。

#   使用missForest包,该方法基于随机森林算法对缺失值进行插补。library(missForest)
test_data$missForest_copy_SOC <- test_data$copy_SOCresult <- missForest(as.matrix(test_data))
result$OOBerrortest_data_missForest <- as.data.frame(result$ximp)test_data$missForest_copy_SOC <- test_data_missForest$missForest_copy_SOC

多重插补 (Multiple Imputation)

多重插补是一个更为复杂的方法,但也是目前广泛被认为是处理缺失数据的最佳方法之一。

#有多种实现途径使用mice包进行多重插补。这是一种更复杂但被广泛接受的方法,它创建了多个数据集,并在每个数据集上进行分析。library(mice)
test_data$mice_copy_SOC <- test_data$copy_SOC# 进行插补
imputed_test_data <- mice(test_data[c(8:14,22)], m = 5, maxit = 50, method = 'pmm', seed = 10) 
# m代表生成的数据集数量, 最大迭代50次, pmm 方法,也可以使用其他方法,具体有
# pmm                   any Predictive mean matching
# midastouch            any Weighted predictive mean matching
# sample               any Random sample from observed values
# cart                 any Classification and regression trees
# rf                   any Random forest imputations
# mean                 numeric Unconditional mean imputation
# norm                 numeric Bayesian linear regression
# norm.nob              numeric Linear regression ignoring model error
# norm.boot             numeric Linear regression using bootstrap
# norm.predict         numeric Linear regression, predicted values
# lasso.norm           numeric Lasso linear regression
# lasso.select.norm     numeric Lasso select + linear regression
# quadratic             numeric Imputation of quadratic terms
# ri                   numeric Random indicator for nonignorable data
# logreg               binary Logistic regression
# logreg.boot          binary Logistic regression with bootstrap
# lasso.logreg         binary Lasso logistic regression
# lasso.select.logreg   binary Lasso select + logistic regression
# polr                 ordered Proportional odds model
# polyreg               unordered Polytomous logistic regression
# lda                   unordered Linear discriminant analysis
# 2l.norm               numeric Level-1 normal heteroscedastic
# 2l.lmer               numeric Level-1 normal homoscedastic, lmer
# 2l.pan                numeric Level-1 normal homoscedastic, pan
# 2l.bin               binary Level-1 logistic, glmer
# 2lonly.mean          numeric Level-2 class mean
# 2lonly.norm           numeric Level-2 class normal
# 2lonly.pmm           any Level-2 class predictive mean matching# 插补的数据
imputed_test_data$imp$mice_copy_SOC# 选择第一个数据集
completed_test_data <- mice::complete(imputed_test_data) test_data$mice_copy_SOC <- completed_test_data$mice_copy_SOC

数据插补效果展示

最后,我们可以使用散点图来直观地查看各种插补方法与原始数据之间的关系。

library(ggplot2)#设置绘图主题
the <- theme_bw()+theme(legend.position = "none",axis.ticks = element_line(color = "black"),axis.text = element_text(color = "black", size=13),axis.title= element_text(color = "black", size=13),axis.line = element_line(color = "black"),panel.grid.minor = element_blank(),panel.grid.major = element_blank())test_data %>% dplyr::select(SOC, "mean_copy_SOC", "median_copy_SOC", "Hmisc_copy_SOC","lm_copy_SOC", "DMwR_copy_SOC", "missForest_copy_SOC","mice_copy_SOC") %>% pivot_longer(cols = -1, ) %>% ggplot(aes(x=value,y=SOC))+geom_point() +geom_smooth(method = 'lm',se=FALSE) +stat_poly_eq(use_label(c( "R2",  "P"), sep = "*\"; \"*"), formula = y ~ x)+the+labs(x= 'fited', y= 'real')+facet_wrap(name~.,ncol=3)+                     geom_abline(intercept = 0, slope = 1) # 1:1线

在这里插入图片描述
数据缺失是科研中常见的问题,但幸好我们有许多方法可以处理这个问题。本文介绍的方法只是其中的一部分,实际上还有许多其他的方法等待大家去探索和实践。希望这篇文章能对大家有所帮助!如果有任何问题或建议,欢迎留言交流。

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.mzph.cn/news/126597.shtml

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

【计算机视觉】对极几何

文章目录 一、极线约束&#xff08;Epipolar Constraint&#xff09;二、相机标定过的情况三、相机没有标定过的情况四、八点算法&#xff08;eight-point algorithm&#xff09; 我的《计算机视觉》系列参考UC Berkeley的CS180课程&#xff0c;PPT可以在课程主页看到。 在上一…

关于preempt count的疑问

Linux中的preempt_count - 知乎 https://www.cnblogs.com/hellokitty2/p/15652312.html LWN&#xff1a;关于preempt_count()的四个小讨论&#xff01;-CSDN博客 主要是参考这些文章 之前一直认为只要是in_interrupt()返回非0值&#xff0c;那么就可以认为当前在中断上下文。即…

阿昌教你如何优雅的数据脱敏

阿昌教你如何优雅的数据脱敏 Hi&#xff0c;我是阿昌&#xff0c;最近有一个数据脱敏的需求&#xff0c;要求用户可自定义配置数据权限&#xff0c;并对某种类型数据进行脱敏返回给前端 一、涉及知识点 SpringMVCJava反射Java自定义注解Java枚举 二、方案选择 1、需求要求…

Webpack打包图片-js-vue

文章目录 一、Webpack打包图片1.加载图片资源的准备2.认识asset module type3.asset module type的使用4.url-loader的limit效果 二、babel1.为什么需要babel2.babel命令行的使用3.babel插件的使用4.babel的预设preset5.babel-loader6.babel-preset 三、加载Vue文件1.编写App.v…

使用Ansible中的playbook

目录 1.Playbook的功能 2.YAML 3.YAML列表 4.YAML的字典 5.playbook执行命令 6.playbook的核心组件 7.vim 设定技巧 示例 1.Playbook的功能 playbook 是由一个或多个play组成的列表 Playboot 文件使用YAML来写的 2.YAML #简介# 是一种表达资料序列的格式,类似XML #特…

开关电源测试过压保护的测试标准及其方法

过压保护的原理 过压保护是电压超过预定值时降低电压的一种方式&#xff0c;原理是通过电路中的电压检测电路来检测电路中的电压是否超过了设定的阈值&#xff0c;如果超过了阈值&#xff0c;就会触发过压保护器件&#xff0c;使电源断开或使受控设备电压降低&#xff0c;保护电…

网络协议--TCP的交互数据流

19.1 引言 前一章我们介绍了TCP连接的建立与释放&#xff0c;现在来介绍使用TCP进行数据传输的有关问题。 一些有关TCP通信量的研究如[Caceres et al. 1991]发现&#xff0c;如果按照分组数量计算&#xff0c;约有一半的TCP报文段包含成块数据&#xff08;如FTP、电子邮件和U…

使用Fiddler进行Mock测试

1、接口抓包 找到要mock的接口&#xff0c;打开fiddler抓包 以某某接口为例&#xff0c;找到下面的接口 http://XXX/SYSTEMS 2、复制该接口数据到本地 在接口上进行右键点击&#xff0c;选择save -> …and Open as Local File -> 默认会保存至桌面&#xff0c;示例中的数…

uniapp的启动页、开屏广告

uniapp的启动页、开屏广告 启动页配置广告开屏 启动页配置 在manifest.json文件中找到APP启动界面配置&#xff0c;可以看到有Android和iOS的启动页面的配置 &#xff0c;选择自定义启动图即可配置 广告开屏 在pages中新建一个广告开屏文件并在pases.json的最顶部配置这个页…

开发商城系统的一些小建议

电子商务的迅猛发展&#xff0c;商城系统已经成为了企业推广产品和服务、吸引更多消费者的重要工具。然而&#xff0c;要想在竞争激烈的市场中脱颖而出&#xff0c;提升用户体验成为了至关重要的一环。下面就商城系统的开发作一些简单分享&#xff0c;以帮助企业更好地满足用户…

跨国文件传输为什么要用专业的大文件传输软件?

跨国文件传输是许多跨国企业需要的基础工作&#xff0c;对于传输的质量和速度要求也是很严格的&#xff0c;随着数据量的不断增加&#xff0c;寻常传统的传输方式肯定是不行&#xff0c;需要新的技术和方式来进行传输&#xff0c;大文件传输软件应运而出&#xff0c;那它有什么…

联想百应:构建“生态资源池”,打造中小企业转型第一服务平台

与3800多家服务商和100多家SaaS生态伙伴携手&#xff0c;累计支持超过20万中小企业智能化转型……在近日由工业和信息化部和安徽省举办的2023全国中小企业数字化转型大会上&#xff0c;联想集团首次公布供应链、平台、技术、生态与绿色赋能五大赋能能力和助力中小企业“链式”成…

sqlite3 关系型数据库语言 SQL 语言

SQL(Structured Query Language)语言是一种结构化查询语言,是一个通用的,功能强大的关系型数据库操作语言. 包含 6 个部分: 1.数据查询语言(DQL:Data Query Language) 从数据库的二维表格中查询数据,保留字 SELECT 是 DQL 中用的最多的语句 2.数据操作语言(DML) 最主要的关…

神经网络的解释方法之CAM、Grad-CAM、Grad-CAM++、LayerCAM

原理优点缺点GAP将多维特征映射降维为一个固定长度的特征向量①减少了模型的参数量&#xff1b;②保留更多的空间位置信息&#xff1b;③可并行计算&#xff0c;计算效率高&#xff1b;④具有一定程度的不变性①可能导致信息的损失&#xff1b;②忽略不同尺度的空间信息CAM利用…

前端 :用HTML , CSS ,JS 做一个秒表

1.HTML&#xff1a; <body><div id "content"><div id "top"><div id"time">00:00:000</div></div><div id "bottom"><div id "btn_start">开始</div><div …

04.Oracle的体系架构

Oracle的体系架构 一、主要组件 一、主要组件 下面是一张网图&#xff0c;大家可以了解一下oracle的体系架构 Oracle数据库的体系架构可以分为以下几个主要组件&#xff1a;实例&#xff08;Instance&#xff09;、数据库&#xff08;Database&#xff09;、表空间&#xff…

瑞数专题五

今日文案&#xff1a;焦虑&#xff0c;想象力过度发酵的产物。 网址&#xff1a;https://www.iyiou.com/ 专题五主要是分享瑞数6代。6代很少见&#xff0c;所以找理想哥要的&#xff0c;感谢感谢。 关于瑞数作者之前已经分享过4篇文章&#xff0c;全都收录在瑞数专栏中了&am…

21. 合并两个有序链表、Leetcode的Python实现

博客主页&#xff1a;&#x1f3c6;看看是李XX还是李歘歘 &#x1f3c6; &#x1f33a;每天不定期分享一些包括但不限于计算机基础、算法、后端开发相关的知识点&#xff0c;以及职场小菜鸡的生活。&#x1f33a; &#x1f497;点关注不迷路&#xff0c;总有一些&#x1f4d6;知…

正式启航!指导品牌开拓下一个增长蓝海

种草的商品总在不经意间推送到面前&#xff0c;深夜刷了会儿短视频&#xff0c;不小心又下单了一个不太熟悉的产品&#xff0c;明星达人素人全部入局直播带货&#xff0c;社交平台演变成购物场&#xff0c;无人幸免的兴趣电商时代强势来临。尤其到了每年一度的双11大促节点&…

音视频rtsp rtmp gb28181在浏览器上的按需拉流

按需拉流是从客户视角来看待音视频的产品功能&#xff0c;直观&#xff0c;好用&#xff0c;为啥hls flv大行其道也是这个原因&#xff0c;不过上述存在的问题是延迟没法降到实时毫秒级延迟&#xff0c;也不能随心所欲的控制。通过一段时间的努力&#xff0c;结合自己闭环技术栈…