python爬取企业电话_Python爬取天眼查企业数据

作者本机环境:

系统-windows10

编程语言-Python

Python版本-Python3.6.8

解析工具-Xpath(解析工具不唯一,均可,这里只演示xpath)

编写工具-Pycharm

本内容使用Python语言进行编写,而Python也是编写爬虫比较好的一款编程语言,小白可以快速入门,语法比其他编程语言稍简单一些,那么这里使用的Python面向对象去写的这么一个爬虫文件,对天眼查网站进行爬取,页面经过分析是静态网页,内容抓取相对动态网站要简单的多;直接是按照这样一个思路来写代码,分析出不同页面的url进行分页处理,而拿到的列表页要对其每一个详情的url进行提取,提取到之后使用详情url发起请求抓取详情页面。

在这里补充一点,我使用的是Python3.6.8,而大家可以根据自己的情况去选择,这里是使用的普通爬虫requests进行爬取,那么Python还有强大的第三方库Scrapy框架,能够达到更高效,并且在RedisSpider的延伸中对于爬取到的数据存储速度上非常快,因为redis数据库是基于内存进行存储数据的,更是有一个可以去重的这样一个功能;而scrapy内部的去重原理在源码中是有一个set集合进行去重的,了解Python的肯定对这点不陌生——set集合去重

import requests

from lxml import etree

class TianYanCha():

def __init__(self, url):

self.url = url

# 请求头

self.headers = {

"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/80.0.3987.149 Safari/537.36",

"Cookie": "aliyungf_tc=AQAAAL9zfjMqLAQAGpXaG0rH+SQSMyir; csrfToken=D4W5eHOZUdVKKtVN8B5RcWil; jsid=SEM-BAIDU-PZ2003-VI-000001; TYCID=ee9c15b0727811eabdfbb3a9464b1d4e; undefined=ee9c15b0727811eabdfbb3a9464b1d4e; ssuid=7522613240; bannerFlag=false; _ga=GA1.2.2024087523.1585567433; _gid=GA1.2.1441861791.1585567433; Hm_lvt_e92c8d65d92d534b0fc290df538b4758=1585567432,1585568902; refresh_page=0; RTYCID=06e1215159ed40e9b936441fe8b79c12; token=9b83740966314eef9746e9fee609fd9a; _utm=8c3b6195c8d347ccab2335d8abd7a664; CT_TYCID=25b749040e3a45c98de53deb2d0d8104; cloud_token=9d4a9eb888e64a1bb4da17049cf08014; Hm_lpvt_e92c8d65d92d534b0fc290df538b4758=1585571475; _gat_gtag_UA_123487620_1=1",

"Content-Type": "application/json; charset=UTF-8",

"Accept-Encoding": "gzip, deflate, br",

}

self.item_list = {} # 存储队列

def zhixing(self):

self.response = requests.get(url=self.url, headers=self.headers).text # 起始URL

# print(self.response)

self.fen1 = etree.HTML(self.response)

self.datas1 = self.fen1.xpath(

'//div[@class="search-result-single "]/div[@class="content"]/div[@class="header"]/a/@href')

# print(self.datas1) # 详情页url

for self.dataaa in self.datas1:

self.urls = self.dataaa # 详情页url地址

# print(self.urls)

def xiang_qing(self):

import time

time.sleep(1)

self.response_content = requests.get(url=self.urls, headers=self.headers).text

self.datalist = etree.HTML(self.response_content)

self.datas = self.datalist.xpath('//div[@class="box -company-box "]')

# 公司数据

for self.data in self.datas:

self.item_list["公司名称"] = self.data.xpath('./div[@class="content"]/div[@class="header"]/h1/text()')

self.item_list['注册资本'] = self.data.xpath(

'//*[@id="_container_baseInfo"]/table[2]/tbody/tr[1]/td[2]/div/text()')

self.item_list['成立日期'] = self.data.xpath(

'//*[@id="_container_baseInfo"]/table[2]/tbody/tr[2]/td[2]/div/text()')

self.item_list['行业'] = self.data.xpath('//*[@id="_container_baseInfo"]/table[2]/tbody/tr[5]/td[4]/text()')

self.item_list['注册地址 '] = self.data.xpath(

'//*[@id="_container_baseInfo"]/table[2]/tbody/tr[10]/td[2]/text()')

self.item_list['经营范围'] = self.data.xpath(

'//*[@id="_container_baseInfo"]/table[2]/tbody/tr[11]/td[2]/span/text()')

self.item_list['法定代表人'] = self.data.xpath(

'//*[@id="_container_baseInfo"]/table[1]/tbody/tr[1]/td[1]/div/div[1]/div[2]/div[1]/a/@title')

print(self.item_list)

if __name__ == '__main__':

for i in range(1,100):

url = "https://www.tianyancha.com/search/p"+str(i)+"?key=%E5%9B%BD%E5%AE%B6%E7%94%B5%E7%BD%91" # 分页

tianyancha = TianYanCha(url)

tianyancha.zhixing()

tianyancha.xiang_qing()

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.mzph.cn/news/465565.shtml

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

开发常用工具

开发常用工具 宗旨:技术的学习是有限的,分享的精神是无限的。一、编辑器 1、Notepad:意外关闭此软件文件不会丢失; 2、PSPad:保持上一次编辑状态,这样在你下次打开编辑器的时候可以直接显示原来的文件。此…

oracle 12.2.0.1 搭建 active dataguard

os: centos 7.4 database:12.2.0.1 dbf 本次是以 oracle database 12.2.0.1 dbf 的形式部署的,后面会记录 rac asm 的形式。 任何时候都要说下三种模式: 最大保护:maximize protection 最高性能:maximize perform…

运行地址与加载地址估计大部分人没弄明白~

本文为【单片机步入嵌入式Linux】系列文章的第二篇,主要是跟大家讲解一下链接过程中几个地址的区分与理解~1 单片机存储分配在玩单片机(以stm32为例)的时候会有RAM空间和ROM空间,RAM空间主要是用于数据的访问,而ROM空间用于存放烧录的固件&am…

foxpro:将表写入excel

oleApp CREATEOBJECT("Excel.Application")oleapp.workbooks.addoleapp.visible.t.SELECT ls*写入表的标题oleapp.cells(1,10).value"这是我的表"*oleapp.cells(1,10).font.fontname"黑体"oleapp.cells(1,10).font.size24nfieldcountAFIELDS(al…

adb打开网页_android 使用指定浏览器打开网页

梳理下流程:枚举对应浏览器包名到数组中数组循环根据包名找到对应的LaunchIntent通过LaunchIntent找到对应的LaunchActivity的包名Intent通过设置activity的包名类名/*** 工具类*/public class CheckApkExist {private static String ucPkgName "com.uc.brows…

博客目录列表(C与Linux部分)

一、C语言 1、C语言——关键字 2、C语言——位操作 3、C语言——数组、函数、指针 4、C语言——结构体 5、C语言——预编译 6、C语言——宏定义 7、C语言——字符串函数 8、C语言——可变参数 9、C语言——回调函数 10、数据结构——链表 11、数据结构——堆栈 12、数据结构——…

python-greenlet模块(协程)

12345678910111213141516from greenlet import greenletdef test1():print(12)gr2.switch()print(34)gr2.switch()def test2():print(56)gr1.switch()print(78)gr1 greenlet(test1)#启动一个协程gr2 greenlet(test2)#启动一个协程gr1.switch()#switch是协程切换高并发&#x…

我妈在深圳的这些日子

今天送了我丈母娘回家,平时在家里,我会叫妈。下面文章中写到的我爸、我妈、指的是我老丈人和丈母娘。上个周末,我跟我妈说,谢谢你过来帮忙我们照顾楠哥,辛苦你了。我说了两遍,可能她听的不是很清楚&#xf…

2010-04-25 搞定aftr

今天终于完全地把aftr给搞定了。 刚开始的时候,建了三台机器,甲,乙,丙,甲和乙通过ipv6相连,甲的ipv6地址为2001:0:0:1::2/64,乙的ipv6地址为2001:0:0:1::1/64,乙和丙通过ipv4相连&am…

linux下解包bin二进制文件_linux下如何使用docker二进制文件安装_docker离线安装

1,下载二进制文件https://download.docker.com/linux/static/stable/x86_64/docker-18.03.1-ce.tgz2,解压二进制文件tar xzvf docker-18.03.1-ce.tgz3,复制二进制文件到/usr/bin目录下cp docker/* /usr/bin/4,检查是否安装docker versionClient:Version: 18.03.1-ceAPI ve…

【腾讯面试题】兔子试毒

大家好,我是牛牛,经过了忙碌的一周,终于盼来了周五。今天给大家分享一道有趣有料的算法题,希望能让大家开启周末的好心情。01故事起源有1000瓶药水,其中有一瓶是毒药,只要喝上一滴,一天之后就必…

git clone 指定分支的内容

使用Git下载指定分支命令为:git clone -b 分支名仓库地址 使用Git下载v.2.8.1分支代码,使用命令:git clone -b v2.8.1 https://git.oschina.net/oschina/android-app.git转载于:https://www.cnblogs.com/pansidong/p/9284967.html

大型网站架构

一个小型的网站,比如个人网站,可以使用最简单的html静态页面就实现了,配合一些图片达到美化效果,所有的页面均存放在一个目录下,这样的网站对系统架构、性能的要求都很简单,随着互联网业务的不断丰富&#…

分享一个剪切板的小软件CopyQ

我是最近在工作的时候经常需要复制一些命令,而且这些命令如果用手敲的话会超级麻烦,所以体验了几个剪切板的小软件,这个是我体验之后觉得最不错的一个,分享给大家。软件链接地址https://github.com/hluk/CopyQ/releases软件图标我…

python2编码问题解决了吗_Python2编码问题

以下内容说的都是 python 2.x 版本简介基本概念Python “帮”你做的事情推荐姿势1、基本概念我们看到的输入输出都是‘字符’(characters),计算机(程序)并不能直接处理,需要转化成字节数据(bytes),因为程序只能处理 bytes 数据。例如&#xf…

GridView自定义分页

有时候的只是需要一些简单的但却是自定义的分页功能,但是又舍不得objectdatasource的排序功能,那就只有把pageddatasoure和objectdatasour结合起来, 由于pageddatasource实现的是IEnumberable,直接把objectdatasource赋给它是不行…

当年年仅18岁韩寒舌战群儒,受尽冷嘲热讽!

https://weibo.com/3251967895/Gk4nNu9Fr转载于:https://www.cnblogs.com/bakblog/p/9287258.html

在朋友圈求助的NTP问题~

之前朋友圈求助的问题最后是我一个朋友尝试了一天的配置「这个配置尝试的过程需要技术基础,但是不管如何的技术基础都是需要去不断的尝试的」,终于找到了方法,所以~我给他们送了秋天的第一杯奶茶~「是他们是因为他们都是一群我很喜欢的同事」…

JRE和JDK 1.3、1.4、1.5(5.0)、6.0 各版本下载地址大全(J2SDK,JavaSE JavaEE)

本文转载(http://hi.baidu.com/y66901356/blog/item/7d32bf0abf7d7c3ab0351d39.html)本人绝对支持原创!!!Java SE Development Kit(JDK)和Java Runtime Envirnment(JRE)1.3、1.4、1.5(5.0)、6.0 各版本下载地址大全 (J…

聊聊身边的嵌入式,英语学习利器点读笔

家里有小孩的朋友,可能对下面的这款产品不陌生。点读笔,一个会发声的电子产品,我当时为了给孩子做英语启蒙,买了小达人点读笔(上图最下方那个,另外两个分别是宝玩英语和巧虎配套的点读笔),用了好几年了&…