ctf up怎么写 write_??零基础写网络爬虫的思路??

4e42d8ed5d0585a4fc11e3c12b500eee.png

网络爬虫,用一句话简单总结,就是一种按照一定的规则,自动的抓取万维网信息的程序或者脚本。写这篇文章的初衷是有个知友私信我说,模仿了很多网上用Python写爬虫的例子,但到了需要自己动手写爬虫的时候又不知道怎么写了。我觉得出现这种情况还是很正常的,至少我个人是这么过来的。这篇文章仅供初学者写爬虫程序时作为一个参考,毕竟本人已经很久没写过爬虫程序了,但爬虫程序的大体框架我还是很清晰的,此篇展示的是我对爬虫的一些理解。之前写过的一些爬虫程序PythonCrawler,有兴趣的朋友可以看看,找找自信这些代码现在看来写的确实挺烂的 。

写爬虫遵循的基本框架

我自己在写爬虫时一般基本遵循下面的框架形式,按照这个框架来编写代码。

d965d4a4cbebb693d79946e5f377c28c.png

演示实例

通过对[ONE]这个网站的爬取来演示上述模块的编写,ONE网站的内容展示如下图所示。

0e22ea8aec1a23c893bc5dd8b5fcafa4.png

而数据我只爬取一张图片和一句箴言,备注(该演示远非最佳实践,只是为了演示框架流程)

  • url调度模块编写

通过对ONE网站的分析,发现它的翻页就是在url后面的数字上加一进入下一页。

ROOT_URL = "http://wufazhuce.com/one/"
URL_NUM = 14 #14页之后才开始有数据def yield_url(ROOT_URL, URL_NUM):return ROOT_URL + str(URL_NUM)
  • 网页下载模块编写
import requests as rqdef get_html(url):return rq.get(url).content.decode("utf-8")
  • 数据抽取模块编写

通过对图片和箴言查看元素可知相关代码镶嵌情况。

c8e47b879eeb393d4b50476f2c129a17.png

fb01d33a09fc8d84dd56d356476f42ff.png

因此可以编写数据抽取模块

import redef get_data(html):img_url_regex = re.compile('<img src="(.*?)" alt="" />')cite_regex = re.compile('<div class="one-cita">(.*?)</div>', re.S)img_url = re.findall(img_url_regex, html)[0]cite = re.findall(cite_regex, html)[0].strip()return img_url, cite                        
  • 数据存储模块编写
def save_data(img_url, cite, URL_NUM):with open("./{}.jpg".format(URL_NUM), "wb") as fp:fp.write(rq.get(img_url).content)with open("./cite{}.txt".format(URL_NUM), "w") as fp:fp.write(cite)return URL_NUM + 1

整合所有模块输出爬取结果

import re
import requests as rqROOT_URL = "http://wufazhuce.com/one/"
URL_NUM = 14def yield_url(ROOT_URL, URL_NUM):return ROOT_URL + str(URL_NUM)def get_html(url):return rq.get(url).content.decode("utf-8")def get_data(html):img_url_regex = re.compile('<img src="(.*?)" alt="" />')cite_regex = re.compile('<div class="one-cita">(.*?)</div>', re.S)img_url = re.findall(img_url_regex, html)[0]cite = re.findall(cite_regex, html)[0].strip()return img_url, cite                        def save_data(img_url, cite, URL_NUM):with open("./{}.jpg".format(URL_NUM), "wb") as fp:fp.write(rq.get(img_url).content)with open("./cite{}.txt".format(URL_NUM), "w") as fp:fp.write(cite)return URL_NUM + 1def main(ROOT_URL, URL_NUM, number):for _ in range(number):url = yield_url(ROOT_URL, URL_NUM)html = get_html(url) img_url, cite = get_data(html) URL_NUM = save_data(img_url, cite, URL_NUM)if __name__ == "__main__":try:main(ROOT_URL, URL_NUM, 20)except:pass

结果展示:

0a903bc88dab01536b0f704d830eaae7.png

总结

本文的目的只是为了让初学者对写爬虫的大体流程有较为清晰的了解。天高任鸟飞,海阔凭鱼跃!每个人心中的爬虫框架(流程)各异,实现方法各异自由发挥空间极大,但有一点务必注意那就是遵守中华人民共和国的法律。

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.mzph.cn/news/561404.shtml

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

VMwarestation环境下的centos7(Minimal)静态ip配置(桥接模式)

笔者本来是为了用三台centos7&#xff08;最小化安装版本&#xff09;的虚拟机搭建一个Zookeeper的环境&#xff0c;但是在搭建的过程中遇到了一些问题&#xff0c;遂记录之。 为了便捷&#xff0c;除了希望三台配置了静态ip的虚拟机可以和宿主机之间互相ping通之外&#xff0…

技术系统进化法则包括_技术系统进化论,模式五、技术集成以增加系统功能

阿奇舒勒TRIZ理论三个核心思想&#xff1a;1、无论是一个简单产品还是复杂的技术系统&#xff0c;其核心技术的发展都是遵循着客观的规律发展演变的&#xff0c;即具有客观的进化规律和模式&#xff1b;2、各种技术难题和矛盾的不断解决是推动这种进化过程的动力&#xff1b;3、…

zookeeper一键启动关闭JAVA_HOME在PATH中找不到报错踩坑记

最近看了尚硅谷的zookeeper教程&#xff0c;在集群环境搭建中&#xff0c; 有这么一个脚本zk.sh用来一键启动和查询 #!/bin/bash case $1 in "start"){ for i in zknode2 zknode3 zknode4 doecho ---------- zookeeper $i 启动 ------------ ssh $i "/opt/modu…

里面怎么使用import引用_谈谈模块化的 require 和 import

一、区别require是commonjs的规范&#xff0c;在node中实现的api&#xff0c;import是es的语法&#xff0c;由编译器处理。所以import可以做模块依赖的静态分析&#xff0c;配合webpack、rollup等可以做treeshaking。commonjs导出的值会复制一份&#xff0c;require引入的是复制…

HJ107 求解立方根

https://www.nowcoder.com/practice/caf35ae421194a1090c22fe223357dca 强行二分&#xff0c;这是一种不好的解法&#xff0c;缝缝补补&#xff0c;又臭又长 import java.util.Scanner; import java.math.BigDecimal;public class Main{public static void main(String[] arg…

mysql if exists用法_MySQL中EXISTS的用法

比如在Northwind数据库中有一个查询为SELECT c.CustomerId,CompanyName FROM Customers cWHERE EXISTS(SELECT OrderID FROM Orders o WHERE o.CustomerIDc.CustomerID)这里面的EXISTS是如何运作呢&#xff1f;子查询返回的是OrderId字段&#xff0c;可是外面的查询要找的是Cus…

二叉搜索树的建立和排序

二叉搜索树的建立和排序今天面了一家自研&#xff0c;有一道二叉搜索树的题目&#xff0c;但是自己做的不好 就是有几个学生和成绩&#xff0c;使用树来存储 左子树大于等于root&#xff0c;右节点小于root package org.example;public class Main {public static void main(S…

python绘图矩阵散点图_Python实践:seaborn的散点图矩阵(Pairs Plots)可视化数据

如何快速创建强大的可视化探索性数据分析&#xff0c;这对于现在的商业社会来说&#xff0c;变得至关重要。今天我们就来&#xff0c;谈一谈如何使用python来进行数据的可视化&#xff01;一旦你有了一个很好的被清理过的数据集&#xff0c;下一步就是探索性数据分析(EDA)。EDA…

项目入口_新进展!石家庄地铁项目长安公园站出入口全部封顶

(通讯员 韩静娟)5月3日&#xff0c;伴随着长安公园站C出入口最后一方混凝土的浇筑到位&#xff0c;由中铁隧道局路桥公司承建的石家庄地铁2号线06标长安公园站出入口全部封顶&#xff0c;为石家庄地铁二号线顺利开通打下了坚实的基础。石家庄地铁2号线作为石家庄市南北向骨干线…

echo怎么把日志清空_shell脚本清空系统message日志

1 #/bin/bash2 #此脚本用来清空系统message日志文件3 #author:wyf date:16/10/304 LOG_DIR/var/log5 ROOT_UID06 #必须系统管理员权限才能执行7 if [ "$UID" -ne "${ROOT_UID}" ]8 then9 echo "Must be root to run this script"10 …

一直显示数据格式错误_Excel数据分析,新手最容易犯的10个建表错误

在使用Excel 建立数据表时&#xff0c;养成规范、良好的制表习惯至关重要&#xff0c;这不仅有益于后期数据分析的顺利进行&#xff0c;而且能体现专业素质。下面介绍一些新手容易犯的规范上的错误。1.随意插入空格很多新手在制表时容易随意插入空格&#xff0c;认为这样可以更…

python编程中的运算_Python编程中的四大运算法则

接触过编程的人都知道&#xff0c;编程中的数学知识无处不在&#xff0c;通过数学建模能够解决我们实际生活中的很多问题。当然这并不是说必须要成为一名数学大神才能学编程&#xff0c;但掌握数学知识在编程中的表达方法却是很有必要的&#xff0c;今天南京小码王Python培训班…

python selenium 怎么查找modal悬浮窗的内容_python教程:五分钟从pubmed down几万篇文献...

小编有话说&#xff1a;hello guys!昨天推送的stata做图教程您学会了吗&#xff1f;有任何疑问欢迎后台咨询我们热心的罗仔。今天换个口味&#xff0c;学学python自动化。作为科研小达人&#xff0c;不学一些旁门左道傍身怎么行&#xff01;今天我们扒一扒pubmed&#xff0c;如…

安装git安装路径在哪_Atom插件安装与git的安装配置

一、Atom 插件在线安装1. 安装插件language-asciidoc 》语法高亮asciidoc-preview 》实时预览在dos 下通过cmd命令安装插件打开dos窗口 window可用快捷键 winr 再输入cmd安装language-asciidoc 输入 apm install language-asciidoc 如果apm不能识别请用 npm install language-…

如何让小程序页面更顺滑_小程序怎样让wx.navigateBack更好用的方法实现

相信只要开发过小程序&#xff0c;对wx.navigateBack 这个 api都不会陌生。在摩拜单车的小程序中&#xff0c;它也被改造的更方便满足复杂的业务需求&#xff0c;可谓之 增强型的 wx.navigateBack。先来看看官方文档中的用法&#xff1a;wx.navigateBack({delta: 2})delta 表示…

编制一个c语言成绩记录簿_C语言基础知识点模拟试题

一、单选题(每题2分&#xff0c;共25题&#xff0c;共50分)执行以下程序后&#xff0c;输出结果是( )int a 255;char c;ca;printf("%d",c);A)255 B)0 C)-3 D)-1有以下程序#include void main( ){ FILE *fp; int i,k0,n0; fpfopen("d1.dat&…

opencv方框内图像保存_opencv::将两幅图像合并后,在同一个窗口显示;并将合并的图像流保存成视频文件...

/*** file main-opencv.cpp* date July 2014* brief An exemplative main file for the use of ViBe and OpenCV*///#include #include "vibe-background-sequential.h"using namespacecv;using namespacestd;const int minArea 2; //舍去面积极小的方框const doubl…

闪灯什么意思_开夜车被对方闪了一下是什么意思?老司机:灯语都不懂,晚上别开车...

阅读本文前&#xff0c;请您先点击上面的“蓝色字体”&#xff0c;再点击“关注”&#xff0c;这样您就可以继续免费收到文章了。每天都有分享&#xff0c;完全是免费订阅&#xff0c;请放心关注。 注&#xff1a;本文转载自网络&#xff…

android radiogroup 获取点击位置_屏幕连点器,解放双手[Android]

这里是“微友集市”&#xff0c;我们坚持分享优质的资源&#xff0c;让更多人能用到更好的资源&#xff0c;少花冤枉钱。如果你有什么需要&#xff0c;可以给我们留言&#xff0c;我们会努力去为你寻找&#xff0c;或许你需要的&#xff0c;也是别人需要的...1自动点击器 是一款…

c语言 freopen txt_C语言文件操作函数freopen详细解析

今天做USACO 用到了文件的操作。 之前做USACO只是格式化的些 写 freopen("xxx.in","r",stdin) 和"freopen("xxx.out","w",stdout)"百度百科上是这么介绍的&#xff1a;函数名: freopen功 能: 替换一个流&#xff0c;或者…