关于话题演化关系网络生成的路线思考:从话题聚类到话题网络展示

话题演化关系网络生成,是实现事件演化追踪的一个重要方法。通过对文本话题进行聚类、内容处理、话题演化关联、话题演化网络的展示,能够在一定程度上为用户揭示出一个事件发展的情况。本文就笔者对该方向的实现路线思考进行总结,分享给大家。
一、文本话题聚类
1、使用single-pass趟次聚类算法,将聚类的相似度阈值设置为0.6,对给定主题的所有文本进行聚类,得到多个话题类及每个类别下对应的文档集合。
2、假设一个话题下必须包含的文档数量大于某个阈值,否则不能成为话题。在本次实验中,将类下文档数量小于2的主题进行删除,得到最终的话题类别集合,并选择top30作为高频话题集合,即热点话题集合
3、热点话题热度的计算,某个话题的热度等于该话题下文本数量与该主题文本数量的比值
4、对热点话题集合进行话题内容处理和话题演化关联操作
二、话题内容处理
1、话题开始时间和结束时间获取
1)获取某一话题所有文本的时间,并以日为单位,移除单日发文量小于2的日期,将每个时间点按照持续时间不超过30天则为一个话题的持续时间原则进行时间段合并,划分成若干个时间片段。将时间片段按照包含文本的数量从大到小排序,取得最佳的话题时间范围
2)将得到的时间段中的第一个时间为话题的开始时间
3)将得到的时间段中的最后一个时间为话题的结束时间
2、话题名称抽取
1)获取某一话题下,开始时间和结束时间范围内的所有文本标题,形成标题集合
2)获取所有文本标题中所有标题的最大公共子串:标题两两比对,得到最长公共字串,并计数
3)对最长公共子串中的标题进行得分计算,得分为:log(最长公共字串的频次)*log(最长公共字串的长度)
4)将得分最高的最长公共子串作为该话题的名称
3、话题代表新闻的提取
1)获取每个话题类下离类中心最近的新闻标题作为话题代表新闻。
4、话题标签的提取
1)获取每个话题类下所有的文本集合,形成一个话题文本,使用TFIDF算法进行关键词提取,取关键词的top20作为该话题的标签
三、话题演化关联
1、获取每个话题类别下的所有文本,并利用word2vec词向量做平均池化的方法,形成该话题的向量表示。
2、针对话题集合中每个话题类别进行两两组合(如话题a,话题b),并建立有向演化关系边,满足有效条件:
1)话题演化必须是从一个较早出现的话题演化到一个较晚出现的话题,在时间上满足时序,即话题a的开始时间必定早于话题b的开始时间
2)话题a和话题b之间在时间上必定存在交集,如果两个话题没有时间重叠,那么两个话题存在演化关系的可能性很小
3)话题a和话题b之间时间的交集跨度越大,那么两个话题之间的演化可能性就越大
4)话题a和话题b之间必定存在共用的关键词或者普通词语,即内容相关性。话题a和话题b之间的相似度必须大于某个阈值,才能存在演化关系
5)话题a和话题b之间的相似度越高,那么两个话题之间的演化可能性就越大
3、计算话题之间的演化权重。
1)每两个话题之间的演化权重,为话题间时间相关性与内容相关性之积,即log(话题重叠日期数)*话题内容相似度
2)话题间内容相似度为话题之间的余弦相似度
3)若话题间内容相似度小于阈值,则演化权重为0,本实验中设置阈值等于0.6
4)若话题间演化权重大于0,则在两个话题间构建一条有向边,如a->b,表示由话题a演变成了话题b
四、话题演化网络的展示
1、使用visjs对生成的话题演化图进行有向图可视化展示
2、话题节点以话题名称+话题开始时间+话题结束时间来表示,话题之间演化关系,以两个话题之间的演化权重作为边的标签 。
在这里插入图片描述

关于作者
刘焕勇,liuhuanyong,现任360人工智能研究院算法专家,前中科院软件所工程师,主要研究方向为知识图谱、事件图谱在实际业务中的落地应用。
得语言者得天下,得语言资源者,分得天下,得语言逻辑者,争得天下。
1、个人主页:https://liuhuanyong.github.io。
2、个人博客:https://blog.csdn.net/lhy2014/。
欢迎对自然语言处理、知识图谱、事件图谱理论技术、技术实践等落地应用的朋友一同交流。

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.mzph.cn/news/480186.shtml

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

综述 | 事件抽取及推理 (下)

本文转载在公众号:知识工场 。 上篇事件抽取及推理的推文已经介绍了事件抽取的基本方法,本篇主要介绍事件推理的相关工作。就目前来看,事件方向相关的研究还是以事件抽取为主流任务,当前大多都是在模型的框架和优化方面进行研究。…

Redis系列教程(三):如何解决Redis缓存雪崩、缓存穿透、缓存并发等5大难题

Java相关的面试都会问到缓存的问题:史上最全Redis面试49题(含答案):哨兵复制事务集群持久化等,除此之外还会问到缓存雪崩、缓存穿透、缓存预热、缓存更新、缓存降级等不常见的问题,但却是非常重要的问题,今…

随机森林:提供银行精准营销解决方案

原文地址:https://blog.csdn.net/weixin_34233679/article/details/88480912 本例是根据科赛网练习赛进行练手,学习巩固一下随机森林建模以及应用。 赛题描述本练习赛的数据,选自UCI机器学习库中的「银行营销数据集(Bank Marketing Data Set)…

谁说2021届秋招算法岗一定要灰飞烟灭啦?

没错,这是一碗鸡汤,希望肝完这碗鸡汤的师弟师妹们就不要过度焦虑啦~理性上车,理性下车,希望萌新们都能遇到最适合自己的坑位2014年末入坑AI,一路见证了AI行业的快速起飞、爆炸、焦虑和冷却。小夕前几天在知…

论文浅尝 | 基于深度强化学习的远程监督数据集的降噪

论文链接:https://arxiv.org/pdf/1805.09927.pdf来源:ACL2018Motivation:远程监督是以一种生成关系抽取训练样本的方法,无需人工标注数据。但是远程监督引入了噪音,即存在很多的假正例。本文的出发点非常简单&#xff…

字符串匹配算法(AC自动机 Aho-Corasick)

文章目录1. 多模式串匹配2. 经典多模式串匹配--AC自动机2.1 AC自动机构建2.2 在AC自动机上匹配主串2.3 复杂度分析3. python包1. 多模式串匹配 前面学的BF、RK、BM、KMP都是单模式串匹配算法(一个模式串,一个主串)多模式串匹配,即…

机器学习资源和记录

学习记录: 2019.08.01: 林轩田机器学习技法--Matrix Factorization :https://redstonewill.com/783/ [ 收获 ]:先假设 有用户特征向量(维度为d表示用户对d种特性的不同喜爱程度)、有电影特征&#xff08…

Redis系列教程(五):Redis哨兵、复制、集群的设计原理,以及区别

前一篇文章高并发架构系列:Redis为什么是单线程、及高并发快的3大原因详解谈了Redis高并发快的3个原因,本篇主要谈Redis的高可用,两篇合起来就可以把redis的高并发和高可用搞清楚了。 谈到Redis服务器的高可用,如何保证备份的机器…

老刘说NLP:焦虑被大肆贩卖下的自然语言处理学习思考

一、话题的由来 近期,有不少朋友来信,来询问如何看待自然语言处理这个方向,表示对当前的状态很不满,希望能够尽快地找到一个合适的方向、快速的学习方式,提升自己的自然语言处理能力,从而找到一个算法岗位的…

垃圾分类智能化-垃圾分类机器人

垃圾分类智能化-奇虎机器人: https://www.chatbot.cn/news-253.html 在人工智能眼里,垃圾分类分几步?:https://mp.weixin.qq.com/s/MlKnx77XGOUvZG1J-PtqMw 垃圾邮件分类之朴素贝叶斯算法实践:https://mp.weixin.qq.…

论文浅尝 | 区分概念和实例的知识图谱嵌入方法

链接:https://arxiv.org/pdf/1811.04588.pdf知识图谱的表示学习最近几年被广泛研究,表示学习的结果对知识图谱补全和信息抽取都有很大帮助。本文提出了一种新的区分概念和实例的知识图谱表示学习方法,将上下位关系与普通的关系做了区分&#…

写在校招季,谈谈机器学习岗的Offer选择问题

星标/置顶小屋,带你解锁最萌最前沿的NLP、搜索与推荐技术文 | 吴海波 现在校招开始的越来越早,今年的实习生招聘还是异常火爆,简历一堆,而且是越来越没有区分度,以前面个xgboost的论文细节,就能区分很多人&…

leetcode--数组(Easy)

2019.08.02 1.返回和为指定值的两数的索引 基本思想:哈希表实现:把数组中的值作为key,索引作为value,在一此遍历的过程中,一边转map,一边查找符合要求的两个数 def twoSum(self, nums: List[int], target:…

Redis系列教程(六):Redis缓存和MySQL数据一致性方案详解

需求起因 在高并发的业务场景下,数据库大多数情况都是用户并发访问最薄弱的环节。所以,就需要使用redis做一个缓冲操作,让请求先访问到redis,而不是直接访问MySQL等数据库。 这个业务场景,主要是解决读数据从Redis缓存…

贪心算法(Greedy Algorithm)之霍夫曼编码

文章目录1. 贪心算法2. 应用2.1 找零钱2.2 区间覆盖2.3 霍夫曼编码霍夫曼编码完整代码1. 贪心算法 我们希望在一定的限制条件下,获得一个最优解每次都在当前的标准下做出当下最优决策(整体不一定最优),做出的决策不可以后悔&…

技术思考:也谈知识图谱平台中的数据流程与构建范式思考

笔者之前写过一篇文章《关于知识图谱标准化构建平台的思考:知识图谱只能做项目,不能做平台?》,地址:https://blog.csdn.net/lhy2014/article/details/119857488,从技术实现的难度上,对这一平台的…

数据结构中基本查找算法总结

原文地址:https://www.cnblogs.com/xuzhp/p/4638937.html 基本查找算法 一、查找的基本概念 查找,也可称检索,是在大量的数据元素中找到某个特定的数据元素而进行的工作。查找是一种操作。 二、顺序查找 针对无序序列的一种最简单的查找方式…

领域应用 | 大众点评搜索基于知识图谱的深度学习排序实践

本文转载自公众号:美团技术团队。 本文介绍了大众点评搜索核心排序层模型的演化之路,包括结合知识图谱信息构建适合搜索场景的Listwise深度学习排序模型LambdaDNN以及特征工程实践和相关工具建设。1. 引言挑战与思路搜索是大众点评App上用户进行信息查…

KDD2020 | 揭秘Facebook搜索中的语义检索技术

星标/置顶小屋,带你解锁最萌最前沿的NLP、搜索与推荐技术文 | 江城编 | 可盐可甜兔子酱导读:今天分享一下 Facebook 发表在 KDD2020 的一篇关于社交网络搜索中的 embedding 检索问题的工作,干货很多,推荐一读。论文题目&#xff1…

python下载网上的文件

1.使用 urlretrieve 最最最简单!!!! from urllib.request import urlretrieve # Python 2.7.9 之后版本引入了一个新特性:当你 urllib.urlopen一个 http s的时候会验证一次 SSL 证书 ,当目标使用的是自签…