3d立体相册特效html网页代码_新闻类网页正文通用抽取器

项目起源

开发这个项目，源自于我在知网发现了一篇关于自动化抽取新闻类网站正文的算法论文——《基于文本及符号密度的网页正文提取方法》

这篇论文中描述的算法看起来简洁清晰，并且符合逻辑。但由于论文中只讲了算法原理，并没有具体的语言实现，所以我使用 Python 根据论文实现了这个抽取器。并分别使用今日头条、网易新闻、游民星空、观察者网、凤凰网、腾讯新闻、ReadHub、新浪新闻做了测试，发现提取效果非常出色，几乎能够达到100%的准确率。

项目现状

在论文中描述的正文提取基础上，我增加了标题、发布时间和文章作者的自动化探测与提取功能。

最后的输出效果如下图所示：

目前这个项目是一个非常非常早期的 Demo，发布出来是希望能够尽快得到大家的使用反馈，从而能够更好地有针对性地进行开发。

本项目取名为抽取器，而不是爬虫，是为了规避不必要的风险，因此，本项目的输入是 HTML，输出是一个字典。请自行使用恰当的方法获取目标网站的 HTML。

本项目现在不会，将来也不会提供主动请求网站 HTML 的功能。

如何使用

项目代码中的GeneralNewsCrawler.py提供了本项目的基本使用示例。

本项目的测试代码在test文件夹中
本项目的输入 HTML 为经过 JavaScript 渲染以后的 HTML，而不是普通的网页源代码。所以无论是后端渲染、Ajax 异步加载都适用于本项目。
如果你要手动测试新的目标网站或者目标新闻，那么你可以在 Chrome 浏览器中打开对应页面，然后开启开发者工具，如下图所示：

在Elements标签页定位到标签，并右键，选择Copy-Copy OuterHTML，如下图所示

当然，你可以使用 Puppeteer/Pyppeteer、Selenium 或者其他任何方式获取目标页面的JavaScript渲染后的源代码。
获取到源代码以后，通过如下代码提取信息：

from GeneralNewsCrawler import GeneralNewsExtractorextractor = GeneralNewsExtractor()html = '你的目标网页正文'result = extractor.extract(html)print(result)

对大多数新闻页面而言，以上的写法就能够解决问题了。

但某些新闻网页下面会有评论，评论里面可能存在长篇大论，它们会看起来比真正的新闻正文更像是正文，因此extractor.extract()方法还有一个默认参数noise_mode_list，用于在网页预处理时提前把评论区域整个移除。

noise_mode_list的值是一个列表，列表里面的每一个元素都是 XPath，对应了你需要提前移除的，可能会导致干扰的目标标签。

例如，观察者网下面的评论区域对应的Xpath 为//div[@class="comment-list"]。所以在提取观察者网时，为了防止评论干扰，就可以加上这个参数：

result = extractor.extract(html, noise_node_list=['//div[@class="comment-list"]'])

test文件夹中的网页的提取结果，请查看result.txt。

已知问题

目前本项目只适用于新闻页的信息提取。如果目标网站不是新闻页，或者是今日头条中的相册型文章，那么抽取结果可能不符合预期。
可能会有一些新闻页面出现抽取结果中的作者为空字符串的情况，这可能是由于文章本身没有作者，或者使用了已有正则表达式没有覆盖到的情况。

Todo

使用一个配置文件来存放常量数据，而不是直接 Hard Code 写在代码中。
允许自定义时间、作者的提取Pattern
自动识别新闻列表页
优化内容提取速度
测试更多新闻网站
……

交流沟通

项目地址：https://github.com/kingname/GeneralNewsExtractor

转载自原文：https://www.cnblogs.com/xieqiankun/p/generalnewsextractor.html

作者：青南

本文来自互联网用户投稿，该文观点仅代表作者本人，不代表本站立场。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如若转载，请注明出处：http://www.mzph.cn/news/457871.shtml

如若内容造成侵权/违法违规/事实不符，请联系多彩编程网进行投诉反馈email:809451989@qq.com，一经查实，立即删除！

3d立体相册特效html网页代码_新闻类网页正文通用抽取器

相关文章

ubuntu14.04安装 R16 Tina Linux SDK

分答

字节数组转换为图片_每日一课 | Python 3 TypeError：无法将“字节”对象隐式转换为str...

php版redis插件,SSDB数据库,增强型的Redis管理api实例

加速度计和陀螺仪数据融合

循环嵌套练习题

python leetcode_leetcode 介绍和 python 数据结构与算法学习资料

平衡小车卡尔曼滤波算法

IOS 为UILabel添加长按复制功能

navicat 的查询功能

c++ sleep函数_Linux 多线程应用中如何编写安全的信号处理函数

css特殊情况

CoreAnimation (CALayer 动画)

汇编为什么分段执行总是执行不了_iOS汇编教程（六）CPU 指令重排与内存屏障...

GD32 使用stm32 固件库

干将莫邪

js反混淆还原工具_SATURN反混淆框架

android 弹起键盘把ui顶上去的解决办法

python 多线程并发_寻找python大神！！！python如何多线程并发？

Nginx/Apache发大招