利用PaddleNLP进行文本数据脱敏

最近在脱敏一些客服数据,同事用正则进行了一些处理,但是感觉针对人名、数量等信息还是无法处理,例如“北方种植了很多李子树”,李子树有可能被识别为人名,又如“美国采购坦克1005台,价值4500万比索”,如果之前的正则中没有“台”和“比索”两个词汇,就无法识别。

如果在脱敏过程中忽略了人名、数量等信息,可能造成严重后果。因此尝试使用了paddlenlp中的taskflow进行处理。主要思路就是利用ner工具,识别出所需的信息,并进行替换。整体效果如下:

原始段落:

昆明市公安局毒品中心调查人员江涛和刘明接到市指挥中心通知,前往边境进行毒品打击。10月15日开始在云南省楚雄市刘家洼村进行伏击,随身携带冲锋枪两只,手榴弹4枚。经过13天的等待后,并未抓获嫌疑人。经调查,10月15日傍晚,刘明私自外出会见了可疑分子并交换情报,收受了贿赂4500元,导致抓捕失败。省公安厅查明情况后,决定逮捕刘明。

处理结果:

昆明市公安局毒品中心调查人员【人员_1】和【人员_2】接到【地区_1】指挥中心通知,前往边境进行毒品打击。【时间_1】开始在【地区_2】【地区_3】【地区_4】进行伏击,随身携带冲锋枪【数量_1】,手榴弹【数量_2】。经过13天的等待后,并未抓获嫌疑人。经调查,【时间_2】,【人员_2】私自外出会见了可疑分子并交换情报,收受了贿赂【数量_3】,导致抓捕失败。省公安厅查明情况后,决定逮捕【人员_2】。

在脱敏过程中,如果简单的利用“*”代替原始的敏感内容,可能会造成很多歧义,因此处理时可以参照上面“引用结果”中的形式进行处理。如果不这样处理,可能会影响可读性(阅读者需要自己联想,星号内容究竟是地名还是人名),甚至导致无法阅读(例如上文,将所有的人名都换成星号,你将无法判断是谁会见了可疑分子):

传统处理方式:

昆明市公安局毒品中心调查人员**和**接到***指挥中心通知,前往边境进行毒品打击。******开始在*************进行伏击,随身携带冲锋枪**,手榴弹**。经过13天的等待后,并未抓获嫌疑人。经调查,******,**私自外出会见了可疑分子并交换情报,收受了贿赂*****,导致抓捕失败。省公安厅查明情况后,决定逮捕**。

目前可以处理数量、地名、场所、人名、时间等五种信息,利用正则表达式(replace_long_substrings)还可以处理一些常见的数字/字母混合字符串(例如手机号、订单编号等)。

处理代码如下:

from paddlenlp import Taskflow
ner= Taskflow("ner")# 匹配长度超过5个字符的子串,由阿拉伯数字、常见标点符号、英文大小写字母组成,并用星号代替
# 可以针对订单编号、用户手机号等信息进行处理
def replace_long_substrings(s):pattern = r'[A-Za-z0-9!@$%^&*()+-_#]{5,}'str_index=1# 使用正则表达式查找所有匹配的子串matches = re.findall(pattern, s)# 遍历所有匹配的子串,替换为5个星号for match in matches:s = s.replace(match, "【符号串_"+str(str_index)+"】", 1)  # 只替换一次str_index+=1return s# 判断一个字符串中是否包含中文数字或英文数字
def contains_chinese_and_english_numbers(s):  # 匹配中文数字的正则表达式  chinese_number_pattern = re.compile(r'[一二三四五六七八九十零壹贰叁肆伍陆柒捌玖拾]+')  # 匹配英文数字的正则表达式  english_number_pattern = re.compile(r'[0-9]+')  # 判断字符串中是否包含中文数字和英文数字  contains_chinese_number = chinese_number_pattern.search(s) is not None  contains_english_number = english_number_pattern.search(s) is not None  # 如果字符串同时包含中文数字和英文数字,则返回True,否则返回False  return contains_english_number  or contains_chinese_number# 使用paddle完成敏感信息识别,能够识别数量_单位词(例如45亿元、37个技术提升等)、地名、场所、人名、时间
# 对于楼道单元号,可能处理不干净,比如东东方花园4号楼3单元304,可能无法识别3单元304
def replace_info_with_paddle_ner(s):# 存储返回结果result=[]# 敏感信息和替换词的对应关系,例如在一段文本中,# 敏感人名“张涛”出现了两次,“刘涛”出现了一次,# 需要保证“张涛”被替换为一个符号,例如“人物甲”,# 刘涛被替换为另一个符号,例如“人物乙”entity_dict={}num_index=1region_index=1position_index=1name_index=1time_index=1for i in ner(s):list_0,list_1=list(i)[0],list(i)[1]flag=1# 针对数量_单位词进行处理if list_1=="数量词_单位数量词":if not list_0 in entity_dict.keys():result.append("【数量_"+str(num_index)+"】")entity_dict[list_0]="【数量_"+str(num_index)+"】"num_index+=1else:result.append(entity_dict[list_0])# 针对地区和场所进行处理elif list_1 =="世界地区类":# todo 可能会存在一定的误识别,例如将“吐鲁番苹果”的前个字识别为“地名”if not list_0 in entity_dict.keys():result.append("【地区_"+str(region_index)+"】")entity_dict[list_0]="【地区_"+str(region_index)+"】"region_index+=1else:result.append(entity_dict[list_0])# 针对场所进行处理  elif list_1=="场所类":# todo 可能会存在一定的误识别,例如将“现场”两个字识别为“场所类”if not list_0 in entity_dict.keys() :result.append("【场所_"+str(position_index)+"】")entity_dict[list_0]="【场所_"+str(position_index)+"】"position_index+=1else:result.append(entity_dict[list_0])# 针对人名进行处理elif list_1=="人物类_实体":# todo 可能会存在一定的漏识别,例如生僻名字或者少数民族名字if not list_0 in entity_dict.keys():result.append("【人员_"+str(name_index)+"】")entity_dict[list_0]="【人员_"+str(name_index)+"】"name_index+=1else:result.append(entity_dict[list_0])# 针对时间进行处理elif list_1=="时间类_具体时间" or list_1=="时间类":# 只有包含数字时,才认为是真正的时间。# paddle会将“时间”识别为虚假的时间,因此需要额外处理if contains_chinese_and_english_numbers(list_0):if not list_0 in entity_dict.keys():result.append("【时间_"+str(position_index)+"】")entity_dict[list_0]="【时间_"+str(position_index)+"】"position_index+=1else:result.append(entity_dict[list_0])else:flag=0result.append(list_0)# 不属于上面的任意一个分类else:if flag:result.append(list_0)return "".join(result)if  __name__=="__main__":# 原始文本text="""昆明市公安局毒品中心调查人员江涛和刘明接到市指挥中心通知,前往边境进行毒品打击。10月15日开始在云南省楚雄市刘家洼村进行伏击,随身携带冲锋枪两只,手榴弹4枚。经过13天的等待后,并未抓获嫌疑人。经调查,10月15日傍晚,刘明私自外出会见了可疑分子并交换情报,收受了贿赂4500元,导致抓捕失败。省公安厅查明情况后,决定逮捕刘明。"""# 获得结果print(replace_info_with_paddle_ner(text))

目前还存在一些问题,例如开头的“昆明市公安局”被识别成了组织机构,而没有将“昆明市”三个字识别成地名;又如处理结果中,将“云南省楚雄市刘家洼村”识别为“【地区_2】【地区_3】【地区_4】”,没有将“云南省”“楚雄市”“刘家洼村”识别成一个完整的地名。代码中还注明了其他一些可能出现问题的细节,需要不断结合实际数据进行修改。

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.mzph.cn/news/691224.shtml

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

图的遍历(广度优先遍历BFS,深度优先遍历DFS)

目录 图的遍历概念: 图的广度优先遍历(BFS): 代码实现如下: 测试如下: 注意: 图的深度优先遍历(DFS): 代码实现如下: 测试如下&#xff1…

Web服务器基础

Web服务器基础 【一】前端概述 【1】HTML HTML(超文本标记语言)是用于创建网页结构的标记语言。它定义了网页的骨架,包括标题、段落、列表、链接等元素,但没有样式。可以将HTML视为网页的结构和内容的描述。 【2】CSS css&…

阿里云服务器镜像是什么?如何选择镜像?

阿里云服务器镜像怎么选择?云服务器操作系统镜像分为Linux和Windows两大类,Linux可以选择Alibaba Cloud Linux,Windows可以选择Windows Server 2022数据中心版64位中文版,阿里云服务器网aliyunfuwuqi.com来详细说下阿里云服务器操…

Go 是否有三元运算符?Rust 和 Python 是怎么做的?

嗨,大家好!本文是系列文章 Go 技巧第十四篇,系列文章查看:Go 语言技巧。 今天来聊聊在 Go 语言中是否支持三元运算符。这个问题很简单,没有。 首先,什么是三元运算符? 在其他一些编程语言中&a…

MySQL篇之分库分表

一、为什么要分库分表 1.目的 1. 分担了访问压力 2. 解决存储压力 2.分库分表的时机 1. 前提,项目业务数据逐渐增多,或业务发展迅速,单表的数据量达1000W或20G以后。 2. 优化已解决不了性能问题(主从读写分离、查询索引…&am…

Python | Conda常用命令

一、介绍 1、Anaconda工具 Anaconda是一个用于数据科学和机器学习的开源软件包管理器和环境管理器。它包含了许多流行的数据科学工具和库,如Python、Jupyter Notebook、numpy、pandas、scikit-learn等,可以帮助用户轻松地管理和安装这些工具和库。Anaco…

数据库管理-第152期 Oracle Vector DB AI-04(20240220)

数据库管理152期 2024-02-20 数据库管理-第152期 Oracle Vector DB & AI-04(20240220)1 常用的向量检索方法聚类图搜索哈希量化 2 Oracle Vector DB中的索引索引(默认) 索引(高级)3 EMBEDDINGSSQL EMBE…

masscan使用

masscan简介: masscan 是一种快速的端口扫描工具,旨在快速扫描大量IP地址和端口。masscan的发包速度非常快,在windows中,它的发包速度可以达到每秒30万包;在Linux中,速度可以达到每秒160万。masscan在扫描时会随机选择…

阿里云备案服务器买哪种?多少钱?有什么限制条件?

在阿里云备案服务器需要多少钱?目前符合备案条件的阿里云服务器只要30元,并且这台云服务器可以备案5个网站。2核4G配置,价格为30元3个月,也可以选择2核2G轻量服务器,61元一年,阿里云老用户还可以选择99元一…

通俗易懂地理解稀疏性

今天我想与大家探讨的是一个数学和工程学中的重要概念——稀疏性。这个概念可能听起来很抽象,但它实际上贯穿于我们生活中的许多方面。那么,稀疏性到底是什么呢?简单来说,在数学和信号处理领域,一个信号被称为稀疏&…

vue小记——this

原生和Vue中使用this的这几个坑你都知道吗? - 掘金 (juejin.cn) 在JavaScript中,this是一个特殊的关键字,它在函数被调用时自动定义。this的值在函数被调用时决定,取决于调用的上下文(context)&#xff0c…

Eclipse - Text Editors (文本编辑器)

Eclipse - Text Editors [文本编辑器] References Window -> Preferences -> General -> Editors -> Text Editors Displayed tab witdth: 4 勾选 Insert spaces for tabs 勾选 Show line number References [1] Yongqiang Cheng, https://yongqiang.blog.csdn.n…

力扣(LeetCode)数据结构练习题(2)

今天又写了两道关于链表的练习题,来给大家分享一下。巩固一下上一篇学到的链表知识,题目可以然我们更清楚的认识链表。 目录 给你单链表的头节点 head ,请你反转链表,并返回反转后的链表 给你单链表的头结点 head ,请…

ADO.NET事务处理

在ADO.NET中,事务是一组一起执行的数据库操作,这些操作要么全部成功,要么全部失败。这确保了数据库的一致性和完整性。ADO.NET提供了SqlTransaction类来支持事务处理。 以下是一个使用C#和ADO.NET进行事务处理的示例: csharp代码…

小红书数据分析:sora爆火,为内容行业带来哪些变化

导语 春节还没过完,科技圈就出“大事”了~据悉,OpenAI发布了Sora,一种由文字生成视频的AI工具,且效果极其逼真,打破了多项纪录。Sora的出现,又让人类里通用人工智能AGI近了一步。那么。Sora的出现对于小红…

外贸人做外贸听话要听音

有人说,在做外贸的时候大部分的人都是充当着客服的角色,而且遵循的模式也是一问一答,凡是客户提出的问题,我们都会尽可能详细的回答。 但是对于如何提问客户,却是不知道怎么下手, 于是,在这样的…

从零开始手写mmo游戏从框架到爆炸(十七)— 完善后端报错与客户端显示

导航:从零开始手写mmo游戏从框架到爆炸(零)—— 导航-CSDN博客 我们在前后端交互的请求体的父类中再增加三个字段,分别是失败跳转topic,失败跳转tag,失败原因。 eternity-common - RequestBase.java pac…

hive load data未正确读取到日期

1.源数据CSV文件日期字段值: 2.hive DDL语句: CREATE EXTERNAL TABLE test.textfile_table1(id int COMMENT ????, name string COMMENT ??, gender string COMMENT ??, birthday date COMMENT ????,.......) ROW FORMAT SERDE org.apache.…

wordpress企业网站模板免费

绿色风格的wordpress免费模板,经测试可以免费下载的WP模板。 https://www.wpniu.com/themes/300.html 简洁大气的文化艺术类wordpress模板,可以免费下载,实用易上手,新手也适合。 https://www.wpniu.com/themes/304.html 高端大…

Spring Security对接OIDC(OAuth2)外部认证

前后端分离项目对接OIDC(OAuth2)外部认证,认证服务器可以使用Keycloak。 后端已有用户管理和权限管理,需要外部认证服务器的用户名和业务系统的用户名一致才可以登录。 后台基于Spring Boot 2.7 Spring Security 流程: 前台浏览器跳转到…