
qq:800819103
在线客服,实时响应
qq群
在线客服,实时响应
客服电话
13318873961爬虫如何爬取京东上的手机图片?今天黑洞代理ip就为大家分享一下爬虫是如何爬取京东上的手机图片的。首先我们先打开京东,输入要爬取的商品,比如手机。然后分析页面和网址,查看我们要爬取的信息位置和网址的变化。
代码如下:
import re
import urllib.request
def craw(url,page):
#获取网页源代码
html1 = urllib.request.urlopen(url).read()
html1 = str(html1)
#对网页源码进行过滤,只保留和产品列表相关的信息
pat1 = '<div id="plist".+?
'
result1 = re.compile(pat1).findall(html1)
result1 = result1[0]
#print(result1)
#再次过滤,提取网页中图片的链接,并将链接地址存储在列表中
pat2 = ''
imagelist = re.compile(pat2).findall(result1)
x = 1
#遍历列表,将链接存储到本地
for imageurl in imagelist:
imagename = "D:/jd/img1/" + str(page) + str(x) + ".jpg"
imageurl = "http://" + imageurl
try:
urllib.request.urlretrieve(imageurl,filename=imagename)
except urllib.error.URLError as e:
if hasattr(e,"code"):
x+=1
if hasattr(e,"reason"):
x+=1
x+=1
#通过for循环,将该分类下的所有网页都爬取一遍
for i in range(1,88):
url = "https://list.jd.com/list.html?cat=9987,653,655&page="+str(i)
craw(url,i)
以上就是关于爬虫如何爬取京东上的手机图片的介绍了,黑洞代理ip可为您提供海量IP资源,助您不间断获取行业数据,赢在大数据时代!
相关文章内容简介
1 爬虫如何爬取京东上的手机图片?
爬虫如何爬取京东上的手机图片?今天黑洞代理ip就为大家分享一下爬虫是如何爬取京东上的手机图片的。首先我们先打开京东,输入要爬取的商品,比如手机。然后分析页面和网址,查看我们要爬取的信息位置和网址的变化。 代码如下: import∵re import∵urllib.request def∵craw(url,page): #获取网页源代码 html1∵=∵urllib.request.urlopen(url).rea... [阅读全文]
最新标签
推荐阅读
05
2018-12
爬虫动态代理ip怎么搭建?免费或付费?
爬虫要采集数据,总绕不过去动态代理ip,因为现在几乎所有的网站平台都会设置反爬虫机制,使用动态代理ip是最快突破IP限制的方法。而爬虫需求的IP量非常大,需要搭建IP池才能满足需求...
04
2019-03
什么情况下我们的网络爬虫会被封IP?如何解决?
什么情况下我们的网络爬虫会被封IP?其中最直接的因素的就是访问速度过快,这个别说爬取抓取了,即使用户自己点击过快也是会被提示访问频率过快的。网络爬虫的访问速度若是一直都很快
09
2019-05
代理IP软件有哪些好处
生活中很多人都没有听说过代理IP软件,更不知道它有什么用途,但是对于很多网络推销员或者专门的网上投票公司,以及一些喜欢玩网络游戏的的朋友们,应该就对代理IP软件比较熟悉了,享
02
2019-07
浅谈爬虫的工作原理及三大模块
传统爬虫从一个或若干初始网页的URL开始,获得初始网页上的URL,在抓取网页的过程中,不断从当前页面上抽取新的URL放入队列,直到满足系统的一定停止条件。聚焦爬虫的工作流程较为复杂,
热门文章