是什么?
Beautiful Soup(简称BS4)是一种强大而灵活的HTML和XML解析库,广泛用于Python爬虫和数据采集中。相比正则表达式更加简洁.
Beautiful Soup提供一些简单的、python式的函数用来处理导航、搜索、修改分析树等功能。它是一个工具箱,通过解析文档为用户提供需要抓取的数据,因为简单,所以不需要多少代码就可以写出一个完整的应用程序。
官网
# 官方
https://beautiful-soup-4.readthedocs.io/en/# 中文版
https://www.crummy.com/software/BeautifulSoup/bs4/doc.zh/
和 xpath以及正则表达式的区别在哪里?
- 正则表达式是进行内容匹配,将符合要求的内容全部获取;
- xpath()能将字符串转化为标签,它会检测字符串内容是否为标签,但是不能检
- 测出内容是否为真的标签;
- Beautifulsoup是Python的一个第三方库,它的作用和 xpath 作用一样,都是用来解析html数据的相比之下
- 三者语法不同,正则表达式使用元字符,将所有获得内容与匹配条件进行匹配,而xpath和bs4将获取的解析后的源码进行按条件筛选,筛选出想要的标签即根据标签属性来找到指定的标签,之后对标签进行对应内容获取。