网站建设资讯

NEWS

网站建设资讯

Python如何爬取淘女郎照片-创新互联

这篇文章主要讲解了Python如何爬取淘女郎照片,内容清晰明了,对此有兴趣的小伙伴可以学习一下,相信大家阅读完之后会有帮助。

创新互联于2013年成立,先为裕安等服务建站,裕安等地企业,进行企业商务咨询服务。为裕安企业网站制作PC+手机+微官网三网同步一站式服务解决您的所有建站问题。

本篇目标

  1. 抓取淘宝MM的姓名,头像,年龄
  2. 抓取每一个MM的资料简介以及写真图片
  3. 把每一个MM的写真图片按照文件夹保存到本地
  4. 熟悉文件保存的过程 

1.URL的格式

在这里我们用到的URL是 /tupian/20230522/live class="brush:py;">import urllib import urllib2 import re class Spider: def __init__(self): self.siteURL = '/tupian/20230522/live def getPage(self,pageIndex): url = self.siteURL + "?page=" + str(pageIndex) print url request = urllib2.Request(url) response = urllib2.urlopen(request) return response.read().decode('gbk') def getContents(self,pageIndex): page = self.getPage(pageIndex) pattern = re.compile('

.*?(.*?).*?(.*?)',re.S) items = re.findall(pattern,page) for item in items: print item[0],item[1],item[2],item[3],item[4] spider = Spider() spider.getContents(1)
网页名称:Python如何爬取淘女郎照片-创新互联
当前URL:http://cdweb.net/article/hgidi.html