爬取两万多租房数据，告诉你广州房租现状（4）

2019-02-20 11:01:39 小白學Python

概述

前言
统计结果
爬虫代码实现
爬虫分析实现
后记

前言

建议在看这篇文章之前，请看完这三篇文章，因为本文是依赖于前三篇文章的：

爬虫利器初体验（1）

听说你的爬虫又被封了？（2）

爬取数据不保存，就是耍流氓（3）

八月份的时候，由于脑洞大开，决定用 python 爬虫爬取了深圳的租房数据，并写了文章《用Python告诉你深圳房租有多高》，文章得到了一致好评和众多转载。由于我本身的朋友圈大多都在广州、深圳，因此，早就有挺多小伙伴叫我分析一下广州的租房价格现状，这不，文章就这样在众多呼声中出炉了。然后，此次爬虫技术也升级了，完善了更多细节。源码值得细细探究。此次分析采集了广州 11 个区，23339 条数据，如下图：

样本数据

其中后半部分地区数据量偏少，是由于该区房源确实不足。因此，此次调查也并非非常准确，权且当个娱乐项目，供大家观赏。

统计结果

我们且先看统计结果，然后再看技术分析。

广州房源分布：（按区划分）

其中天河占据了大部分房源。但这块地的房租可是不菲啊。

房源分布

房租单价：（每月每平方米单价 -- 平均数）

即是 1 平方米 1 个月的价格。方块越大，代表价格越高。

房租单价：平方米/月

可以看出天河、越秀、海珠都越过了 50 大关，分别是 75.042 、64.249、59.621 ，是其他地区的几倍。如果在天河租个 20 平方的房间：

75.042 x 20 = 1500.84

再来个两百的水电、物业：

1500.84 + 200 = 1700.84

我们按正常生活来算的话，每天早餐 10 块，中午 15 块，晚饭 15 块：

1700.84 + 40 x 30 = 2700.84

那么平时的日常生活需要 2700.84 块。

隔断时间下个馆子，每个月买些衣服，交通费，谈个女朋友，与女朋友出去逛街，妥妥滴加个 2500

2700.84 + 2500 = 5200.84

给爸妈一人一千：

5200.84 + 2000 = 7200.84

月薪一万还是有点存款的，比深圳好一点，但是可能广州的薪资就没深圳那么高了。

房租单价：（每日每平方米单价 -- 平均数）

即是 1 平方米 1 天的价格。

租房单价：平方米/日

哈哈，感受一下寸土寸金的感觉。[捂脸]

崩溃

户型

户型主要以 3 室 2 厅与 2 室 2 厅为主。与小伙伴抱团租房是最好的选择了，不然与不认识的人一起合租，可能会发生一系列让你不舒服的事情。字体越大，代表户型数量越多。

户型

租房面积统计

其中 30 - 90 平方米的租房占大多数，如今之计，也只能是几个小伙伴一起租房，抱团取暖了。

租房面积统计

租房描述词云

这是爬取的租房描述，其中字体越大，标识出现的次数越多。其中【住家、全套、豪华、齐全】占据了很大的部分，说明配套设施都是挺齐全的。

租房描述

爬虫技术分析

请求库：scrapy、requests
HTML 解析：BeautifulSoup
词云：wordcloud
数据可视化：pyecharts
数据库：MongoDB
数据库连接：pymongo

爬虫代码实现

跟上一篇文章不一样，这是使用了 scrapy 爬虫框架来爬取数据，各个方面也进行了优化，例如：自动生成各个页面的地址。

由于房某下各个区域的首页地址和首页以外的地址的形式是不一样的，但是又一定的规律，所以需要拼接各个部分的地址。

首页地址案例：

# 第一页
http://gz.zu.fang.com/house-a073/

非首页地址：

# 第二页
http://gz.zu.fang.com/house-a073/i32/
# 第三页
http://gz.zu.fang.com/house-a073/i33/
# 第四页
http://gz.zu.fang.com/house-a073/i34/

先解析首页 url

def head_url_callback(self, response):
 soup = BeautifulSoup(response.body, "html5lib")
 dl = soup.find_all("dl", attrs={"id": "rentid_D04_01"}) # 获取各地区的 url 地址的 dl 标签
 my_as = dl[0].find_all("a") # 获取 dl 标签中所有的 a 标签，
 for my_a in my_as:
 if my_a.text == "不限": # 不限地区的,特殊处理
 self.headUrlList.append(self.baseUrl)
 self.allUrlList.append(self.baseUrl)
 continue
 if "周边" in my_a.text: # 清除周边地区的数据
 continue
 # print(my_a["href"])
 # print(my_a.text)
 self.allUrlList.append(self.baseUrl + my_a["href"])
 self.headUrlList.append(self.baseUrl + my_a["href"])
 print(self.allUrlList)
 url = self.headUrlList.pop(0)
 yield Request(url, callback=self.all_url_callback, dont_filter=True)

再解析非首页 url

这里先获取到各个地区一共有多少页，才能拼接具体的页面地址。

# 再根据头部 url 拼接其他页码的url
def all_url_callback(self, response): # 解析并拼接所有需要爬取的 url 地址
 soup = BeautifulSoup(response.body, "html5lib")
 div = soup.find_all("div", attrs={"id": "rentid_D10_01"}) # 获取各地区的 url 地址的 dl 标签
 span = div[0].find_all("span") # 获取 dl 标签中所有的 span 标签，
 span_text = span[0].text
 for index in range(int(span_text[1:len(span_text) - 1])):
 if index == 0:
 pass
 # self.allUrlList.append(self.baseUrl + my_a["href"])
 else:
 if self.baseUrl == response.url:
 self.allUrlList.append(response.url + "house/i3" + str(index + 1) + "/")
 continue
 self.allUrlList.append(response.url + "i3" + str(index + 1) + "/")
 if len(self.headUrlList) == 0:
 url = self.allUrlList.pop(0)
 yield Request(url, callback=self.parse, dont_filter=True)
 else:
 url = self.headUrlList.pop(0)
 yield Request(url, callback=self.all_url_callback, dont_filter=True)

最后解析一个页面的数据

def parse(self, response): # 解析一个页面的数据
 self.logger.info("==========================")
 soup = BeautifulSoup(response.body, "html5lib")
 divs = soup.find_all("dd", attrs={"class": "info rel"}) # 获取需要爬取得 div
 for div in divs:
 ps = div.find_all("p")
 try: # 捕获异常，因为页面中有些数据没有被填写完整，或者被插入了一条广告，则会没有相应的标签，所以会报错
 for index, p in enumerate(ps): # 从源码中可以看出，每一条 p 标签都有我们想要的信息，故在此遍历 p 标签， 

 text = p.text.strip()
 print(text) # 输出看看是否为我们想要的信息
 roomMsg = ps[1].text.split("|")
 area = roomMsg[2].strip()[:len(roomMsg[2]) - 1]
 item = RenthousescrapyItem()
 item["title"] = ps[0].text.strip()
 item["rooms"] = roomMsg[1].strip()
 item["area"] = int(float(area))
 item["price"] = int(ps[len(ps) - 1].text.strip()[:len(ps[len(ps) - 1].text.strip()) - 3])
 item["address"] = ps[2].text.strip()
 item["traffic"] = ps[3].text.strip()
 if (self.baseUrl+"house/") in response.url: # 对不限区域的地方进行区分
 item["region"] = "不限"
 else:
 item["region"] = ps[2].text.strip()[:2]
 item["direction"] = roomMsg[3].strip()
 print(item)
 yield item
 except:
 print("糟糕，出现 exception")
 continue
 if len(self.allUrlList) != 0: 
 url = self.allUrlList.pop(0)
 yield Request(url, callback=self.parse, dont_filter=True)

数据分析实现

这里主要通过 pymongo 的一些聚合运算来进行统计，再结合相关的图标库，来进行数据的展示。

数据分析：

 # 求一个区的房租单价（平方米/元）
 def getAvgPrice(self, region):
 areaPinYin = self.getPinyin(region=region)
 collection = self.zfdb[areaPinYin]
 totalPrice = collection.aggregate([{'$group': {'_id': '$region', 'total_price': {'$sum': '$price'}}}])
 totalArea = collection.aggregate([{'$group': {'_id': '$region', 'total_area': {'$sum': '$area'}}}])
 totalPrice2 = list(totalPrice)[0]["total_price"] 

 totalArea2 = list(totalArea)[0]["total_area"]
 return totalPrice2 / totalArea2
 # 获取各个区 每个月一平方米需要多少钱
 def getTotalAvgPrice(self):
 totalAvgPriceList = []
 totalAvgPriceDirList = []
 for index, region in enumerate(self.getAreaList()):
 avgPrice = self.getAvgPrice(region)
 totalAvgPriceList.append(round(avgPrice, 3))
 totalAvgPriceDirList.append({"value": round(avgPrice, 3), "name": region + " " + str(round(avgPrice, 3))})
 return totalAvgPriceDirList
 # 获取各个区 每一天一平方米需要多少钱
 def getTotalAvgPricePerDay(self):
 totalAvgPriceList = []
 for index, region in enumerate(self.getAreaList()):
 avgPrice = self.getAvgPrice(region)
 totalAvgPriceList.append(round(avgPrice / 30, 3))
 return (self.getAreaList(), totalAvgPriceList)
 # 获取各区统计样本数量
 def getAnalycisNum(self):
 analycisList = []
 for index, region in enumerate(self.getAreaList()):
 collection = self.zfdb[self.pinyinDir[region]]
 print(region)
 totalNum = collection.aggregate([{'$group': {'_id': '', 'total_num': {'$sum': 1}}}])
 totalNum2 = list(totalNum)[0]["total_num"]
 analycisList.append(totalNum2)
 return (self.getAreaList(), analycisList)
 # 获取各个区的房源比重
 def getAreaWeight(self):
 result = self.zfdb.rent.aggregate([{'$group': {'_id': '$region', 'weight': {'$sum': 1}}}])
 areaName = []
 areaWeight = []
 for item in result:
 if item["_id"] in self.getAreaList():
 areaWeight.append(item["weight"])
 areaName.append(item["_id"])
 print(item["_id"])
 print(item["weight"])
 # print(type(item))
 return (areaName, areaWeight)
 # 获取 title 数据，用于构建词云
 def getTitle(self):
 collection = self.zfdb["rent"] 

 queryArgs = {}
 projectionFields = {'_id': False, 'title': True} # 用字典指定需要的字段
 searchRes = collection.find(queryArgs, projection=projectionFields).limit(1000)
 content = ''
 for result in searchRes:
 print(result["title"])
 content += result["title"]
 return content
 # 获取户型数据（例如：3 室 2 厅）
 def getRooms(self):
 results = self.zfdb.rent.aggregate([{'$group': {'_id': '$rooms', 'weight': {'$sum': 1}}}])
 roomList = []
 weightList = []
 for result in results:
 roomList.append(result["_id"])
 weightList.append(result["weight"])
 # print(list(result))
 return (roomList, weightList)
 # 获取租房面积
 def getAcreage(self):
 results0_30 = self.zfdb.rent.aggregate([
 {'$match': {'area': {'$gt': 0, '$lte': 30}}},
 {'$group': {'_id': '', 'count': {'$sum': 1}}}
 ])
 results30_60 = self.zfdb.rent.aggregate([
 {'$match': {'area': {'$gt': 30, '$lte': 60}}},
 {'$group': {'_id': '', 'count': {'$sum': 1}}}
 ])
 results60_90 = self.zfdb.rent.aggregate([
 {'$match': {'area': {'$gt': 60, '$lte': 90}}},
 {'$group': {'_id': '', 'count': {'$sum': 1}}}
 ])
 results90_120 = self.zfdb.rent.aggregate([
 {'$match': {'area': {'$gt': 90, '$lte': 120}}},
 {'$group': {'_id': '', 'count': {'$sum': 1}}}
 ])
 results120_200 = self.zfdb.rent.aggregate([
 {'$match': {'area': {'$gt': 120, '$lte': 200}}},
 {'$group': {'_id': '', 'count': {'$sum': 1}}}
 ])
 results200_300 = self.zfdb.rent.aggregate([
 {'$match': {'area': {'$gt': 200, '$lte': 300}}},
 {'$group': {'_id': '', 'count': {'$sum': 1}}}
 ])
 results300_400 = self.zfdb.rent.aggregate([
 {'$match': {'area': {'$gt': 300, '$lte': 400}}},
 {'$group': {'_id': '', 'count': {'$sum': 1}}}
 ]) 

 results400_10000 = self.zfdb.rent.aggregate([
 {'$match': {'area': {'$gt': 300, '$lte': 10000}}},
 {'$group': {'_id': '', 'count': {'$sum': 1}}}
 ])
 results0_30_ = list(results0_30)[0]["count"]
 results30_60_ = list(results30_60)[0]["count"]
 results60_90_ = list(results60_90)[0]["count"]
 results90_120_ = list(results90_120)[0]["count"]
 results120_200_ = list(results120_200)[0]["count"]
 results200_300_ = list(results200_300)[0]["count"]
 results300_400_ = list(results300_400)[0]["count"]
 results400_10000_ = list(results400_10000)[0]["count"]
 attr = ["0-30平方米", "30-60平方米", "60-90平方米", "90-120平方米", "120-200平方米", "200-300平方米", "300-400平方米", "400+平方米"]
 value = [
 results0_30_, results30_60_, results60_90_, results90_120_, results120_200_, results200_300_, results300_400_, results400_10000_
 ]
 return (attr, value)

数据展示：

 # 展示饼图
 def showPie(self, title, attr, value):
 from pyecharts import Pie
 pie = Pie(title)
 pie.add("aa", attr, value, is_label_show=True)
 pie.render()
 # 展示矩形树图
 def showTreeMap(self, title, data):
 from pyecharts import TreeMap
 data = data
 treemap = TreeMap(title, width=1200, height=600)
 treemap.add("深圳", data, is_label_show=True, label_pos='inside', label_text_size=19)
 treemap.render()
 # 展示条形图
 def showLine(self, title, attr, value):
 from pyecharts import Bar
 bar = Bar(title)
 bar.add("深圳", attr, value, is_convert=False, is_label_show=True, label_text_size=18, is_random=True,
 # xaxis_interval=0, xaxis_label_textsize=9,
 legend_text_size=18, label_text_color=["#000"])
 bar.render()
 # 展示词云
 def showWorkCloud(self, content, image_filename, font_filename, out_filename):
 d = path.dirname(__name__) 

 # content = open(path.join(d, filename), 'rb').read()
 # 基于TF-IDF算法的关键字抽取, topK返回频率最高的几项, 默认值为20, withWeight
 # 为是否返回关键字的权重
 tags = jieba.analyse.extract_tags(content, topK=100, withWeight=False)
 text = " ".join(tags)
 # 需要显示的背景图片
 img = imread(path.join(d, image_filename))
 # 指定中文字体, 不然会乱码的
 wc = WordCloud(font_path=font_filename,
 background_color='black',
 # 词云形状，
 mask=img,
 # 允许最大词汇
 max_words=400,
 # 最大号字体，如果不指定则为图像高度
 max_font_size=100,
 # 画布宽度和高度，如果设置了msak则不会生效
 # width=600,
 # height=400,
 margin=2,
 # 词语水平摆放的频率，默认为0.9.即竖直摆放的频率为0.1
 prefer_horizontal=0.9
 )
 wc.generate(text)
 img_color = ImageColorGenerator(img)
 plt.imshow(wc.recolor(color_func=img_color))
 plt.axis("off")
 plt.show()
 wc.to_file(path.join(d, out_filename))
 # 展示 pyecharts 的词云
 def showPyechartsWordCloud(self, attr, value):
 from pyecharts import WordCloud
 wordcloud = WordCloud(width=1300, height=620)
 wordcloud.add("", attr, value, word_size_range=[20, 100])
 wordcloud.render()

后记

距离上一篇租房市场的分析已经3、4 个月了，我的技术水平也得到了一定的提高。所以努力编码才是成长的捷径。最后，应对外界条件的变动，我们还是应该提升自己的硬实力，这样才能提升自己的生存能力。后台回复【scrapy初体验】获取源码。

分享到:

閱讀更多 小白學Python 的文章

關鍵字: 网络爬虫 Mong 爬虫

第二章 IoC容器和Bean配置

bean是一个对象，它是由Spring

运算里不得不说的python模块—math

Help

Devops度量--DevOps 现状快速检查表

今天主要分享一个DevOps

SOP是什么（解读）

SOP不是单个的，是一个体系，虽然我们可以单独地定义每一个SOP，但真正从企业管理来看，SOP不可能只是单个的，必然是一个整体和体系，也是企业不可或缺的。

还不知道交换机上如何配置DHCP，赶紧过来围观吧，一分钟包你学会

随着终端设备的越来越多，人工干预配置IP地址，不仅工作效率低，而且，还很容易导致IP冲突，影响正常的网络访问。到此已经完成了，DHCP服务的配置了，我们可以在终端验证。

还在手动配置IP地址吗？太Low了，一分钟教会您如何配置DHCP

Python爬虫自学笔记：分析头条文章网页源文件

这两天分析了一下头条文章网页的源文件，现在将分析的结果分享给大家。首先以一篇文章为例，其网址如下：https://www.toutiao.com/i6822245428176617998/如上图网页所示，文章中包含文字和图片。

DNS侦查工具

我们只需要打开浏览器输入例如:www.baidu.com就可以解析到该网站.为了便于记住不需要输入长长的IP地址去访问这就是DNS域名解析.关于域名域名的层次划分用点来分割这时DNS把相对应的域名解析成IP地址高的在右边.例如:www. NS简介访问某网站的时候最低在左边

国人开源的异步 Python ORM：GINO

程序测评：Create React App 3.3中有哪些酷炫新功能？

Create

“明学”的魅力？我只要我觉得：驾驭终端，提高生产力

最后一个要介绍的命令是

（必收藏系列）Linux面试题——命令集

关注，后台私信【Linux】分享Linux入门到进阶电子书、Linux入门到精通视频教程（免费）。文件管理命令cat

五分钟学会如何在 IPFS 上部署网站

原文标题:五分钟学会如何在

「正点原子NANO STM32F103开发板资料连载」第29章内存管理实验

1）实验平台：【正点原子】

小白怎么学Web前端开发如何成为技术达人

Web前端开发工程师已经成为了很多年轻人心中的理想工作，不仅入行门槛低、而且薪资待遇和发展前景都不错，自然吸引了大批人加入行业。

如何开发一个web静态服务器

我们都知道如今的web服务器有很多，比如著名的有apache，有nginx，有tomcat，有resin服务器，有sphere，有iis服务器等等，这些服务器都能提供web服务，并且几乎都能和多种语言进行搭配使用，那么一个web服务器都需要那些功能，开发一个web服务器都需要那些

学Java编程还有前景吗如何才能拿到高薪

需求大、薪资高似乎是Java开发人员的标签，不过学Java编程还有前景吗？它架构在操作系统之上，屏蔽了底层的差异，真正实现了“Writeonce run

Python网络爬虫之配置篇（一）

pip

SpringBoot 整合SpringSecurity示例实现前后分离权限注解+JWT登录认证

serverTimezone=UTC&useUnicode=true&characterEncoding=utf-8&zeroDateTimeBehavior=convertTo&useSSL=falseusername:rootpassword:

Python的运行效率太低？几行代码快速提升！

return的就是是你所需要的结果2.3、运行这一步就是最后一步了，只要像下面一样输入上述函数名，赋予参数值，点击运行Run，就能得到你想要的结果arg1=5

python的优点是什么？最新Python400集视频（附教程）

2020，最新Python零基础到精通资料教材，干货分享，新基础Python教材，稳稳找到过万工作，看这里，这里有你想要的所有资源哦，最强笔记，教你怎么入门提升！获取方式：私信小编“

MySQL中OOM故障应如何下手-爱可生

作者：孙祚龙爱可生南区分公司交付服务部成员，实习工程师。负责公司产品问题排查及日常运维工作。本文来源：原创投稿*爱可生开源社区出品，原创内容未经授权不得随意使用，转载请联系小编并注明来源。

像专家一样使用 panic

|go

30种不同的编程语言怎么写“Hello, World”

printfn

percona QAN 介绍

一、背景QAN慢查询日志分析工具是PMM

面试官：你可以用纯CSS判断鼠标进入的方向吗？

虽然没什么软用，但是对付面试官应该是够用了。感谢面试官提出的问题，让我实现了这个功能，对CSS

网络工程师职业生涯中，哪两点是最重要的？

网络工程师最重要的技能是扎实的基础和非常开放的思维，微观知识扎实、宏观能力突出。项目经验也会让网络工程师基础更牢靠，网络工程师是要实战的，要避免纸上谈兵，我认为对基础理论的理解，比你清楚配置更重要。

交换机中相关术语代表什么意思，有必要弄清楚

由浅入深了解以太坊 2.0：最常见问题和最全学习清单

有关以太坊2.0

【Linux简单实用小命令001】CentOS 7、8的防火墙端口开放

yuminstall

吃透这些IPFS硬核知识点，日后抢头矿随时“弯道超车”

今天的你捉住IPFS机遇了吗？我们都知道在Filecoin网络中作为一名存储矿工，信誉对于我们是非常重要的——信誉越高，爆块几率越大。那么信誉系统现在怎么样了呢？

Hive分桶表

fieldsterminated

Spring中资源的加载原来是这么一回事啊！

自己动手搭建邮件系统：怎样让Exchange Server 发出第一封邮件？

编辑Exchange

$【MySQL】RDS物理备份文件(.idb\.frm)恢复到MySQL自建数据库$

【MySQL】RDS物理备份文件(.idb\.frm)恢复到MySQL自建数据库

在阿里云控制台，我们能下载的文件是一个压缩包，解压之后，是.idb和.frm文件，你可能要问了，我可以直接把解压好的问题件覆盖到MySQL的data目录下吗？

NLP算法入门系列：隐含马尔可夫链(HMM)模型的简单介绍

即，最大化

第一章 Spring Framework概述

您可以在任何web

opencv人工智能深度学习这样实现人脸的年龄检测

前期的文章我们分享了人脸的识别以及如何进行人脸数据的训练，本期文章我们结合人脸识别的模型进行人脸年龄的检测人脸年龄的检测步骤1、首先需要进行人脸的检测2、把检测到的人脸数据给年龄检测模型去检测3、把检测结果呈现到图片上人脸年龄检测import

嵌入式linux网络编程之——5年程序员给你深度讲解socket套接字

图8-1

深入了解ProcessFunction的状态操作(Flink-1.10)

先反思为何会有上述疑惑上述疑惑产生的原因，应该是受到平时使用HashMap的影响，HashMap获取值就是在调用get方法时指定key，设置值也是在put时指定key，所以看到state.value，看懂了这些，其实也是在了解DataStream/DataSetAPI的设计思路：

Redis内存分析工具--rdr安装与使用

分析Redis

资深架构师教你源码讲解zookeeper实现分布式锁以及集群搭建步骤

//getData发现前一个子节点被删除，抛出异常

一行代码提升迁移性能

论文原址：https://arxiv.org/pdf/2003.12237.pdf开源地址：https://github.com/cuishuhao/BNM在发表在CVPR2020

利用相似几何信息，做可泛化3D形状分割模型

更具体的有以下三种典型的分割方案：FullyConvolutional-Like

这么好用的开源计算器SpeedCrunch，没有不尝试一下的道理

介绍SpeedCrunch是一款高精度科学计算器，具有快速，键盘驱动的用户界面。获取方式在GitHub上搜索SpeedCrunch，就可以去到

分布式缓存，真香

他是前易宝支付架构师、阿里云MVP、腾讯云

特征工程的力量

在本文中，我希望教给您一些有关特征工程的知识，以及如何使用它来对非线性决策边界进行建模。为了说明这一点，假设恢复时间与身高和体重具有以下关系：Y=β₀+β₁+β2+β₃+noise从第三项来看，我们可以看到Y与身高和体重没有线性关系。

java架构：天天写面向接口编程，你考虑过性能吗？大神都是这么写

public

SpringBoot如何优雅的使用RocketMQ

源码编译需要Maven3.2x，JDK8在根目录进行打包:Copymvn-Prelease-all

css代码规范工具stylelint

"mixin"