Python培训

400-996-5531

热门课程:

惊不惊喜|我用python编程为你甄选端午出游计划

发布：奔跑的鳄鱼+leo
来源：菜鸟学Python
时间：2018-06-06 18:09

旅游也需要新意，如何为自己选择合适的出游地方呢?如何让小伙伴们都臣服于我的计划呢?且看今天python培训带来的新资讯——python编程为你甄选端午出游计划。

旅游是调节心情的有效途径，越来越多的上班族和学生期待利用假期时间外出游玩来开拓眼界、舒缓压力。然而真正有了假期，许多人却会因“去哪玩”的问题倍感困惑，六月份正是出行的好时节，期间还有端午节小长假，就让我们一起来学习如何利用python来安排自己的出行计划吧。

一.数据的获取

最近几年，既省钱又休闲的自助游逐渐成为年轻人出行的首选，这里推荐一个我个人比较喜欢的旅游网站——蚂蜂窝，这次通过分析“驴友”们的出行计划来规划我们自己的行程，第一步当然是爬取网站数据啦

1.分析目标网页

为了获取大家的出行信息，我们进入网站的“结伴”板块，查看“一个月以内”的出行计划，可以看到随着页面的更改url并没有发生变化，初步判断该网页是通过js加载的，要想爬取首先得找到真实url和返回的数据格式。

经过一番尝试，我们成功找到了请求返回的真实url和关键参数，这里返回的是json格式的数据，里面包含了一个html文本。

2.确定抓取内容

在正式开始爬取数据之前，我们要先确定需要爬取哪些数据。行程的列表页清晰地展现了目的地、行程简介、发起人ID和性别(呵呵)，虽然这些信息非常有参考价值，但是如果能获取更多信息无疑会对我们的行程规划更有帮助，所以还是要进入详情页来看一看。

可以看到，详情页中对出发时间、行程历时、出发地点等都有详细说明，此外还有报名结伴人员情况，这项数据能在很大程度上反映小伙伴们的出行意向，所以一定要拿下来。

3.正式爬取数据

总体思路是爬取索引页中每一个行程的发起人和详情页url，之后进入详情页抓取出发时间、历史、目的地、出发城市、希望人数以及报名人员情况等数据，每个行程的索引页数据和详情页数据合并后作为该行程的完整数据进行存储。以下是爬虫程序的总入口:

def entrance(self): start_url = r'#/together/' page_index = self.Start_page while True: payload = { 'flag':3, 'offset':page_index, 'mddid':0, 'timeFlag':3, 'timestart':'' } if self.get_info(start_url, payload): page_index += 1 time.sleep(self.sleep_time) else: break self.df.to_csv('travel.csv', encoding = 'utf_8_sig')

左右滑动看代码

payload参数:flag决定了行程的排序方式，可选值为1、2、3，分别代表“即将出发”、“最新发布”、“热门结伴”;

offset表示当前页数，默认从0开始;middid表示行程目的地，不确定目的地值为0;timeFlage代表出发时间，值为3表示选取一个月内的行程。

get_info()方法:抓取每一页的行程信息并翻页，如果无法获取有效信息则说明爬取结束。

数据存储:由于数据量不大，可以先全部存储到一个dataframe数据结构中，再一次性写入csv文件。

二. 数据清洗

我们来看看获取到的数据是什么样子的，可以看到，每条数据中都有很多干扰信息：

“出发时间”一栏我们想要的仅仅是日期数据;

“报名人数”一栏我们想要的仅仅是数字，而不需要多余的修饰文字等等;

“部分出行” 计划涵盖了多个目的地，这对我们的旅游目的地分析是非常不利的

所以，我们必须先对获取到的数据进行清洗，以期为正式的数据分析奠定基础。

1.规范格式

首先对历时、希望人数、报名人数(女)、报名人数(男)这几项数据进行清洗，仅保留数字部分;其次对出发是按、出发地点相关数据进行情况，取到“:”及前面的内容。感谢pandas.Series.str方法，使我们可以非常简单地完成上述工作，功能函数如下:

def no_colon(self, col_list): for col in col_list: self.df[col] = self.df[col].str.split('：', expand = True)[1]

左右滑动看代码

only_num(self, col_list):去除数据中的非数字部分。

no_colon(self, col_list):去除数据中的“:”及其前面的内容。

2.拆分目的地

刚才说到过，一个行程中包含多个目的地会对我们的分析造成干扰，这里的解决思路是对目的地数据进行拆分。

将一列数据拆分成X列(X为该行程包含的目的地个数)，同样是使用pandas.Series.str方法，代码如下:

def multi_dest(self, col): df = self.df[col].str.split('：', expand = True)[1]\ .str.split('|', expand=True) df.rename(columns={0:'dest1', 1:'dest2', 2:'dest3', 3:'dest4', 4:'dest5'}, inplace=True) # 把拆分后的地址组成的临时df并入到原df中 self.df = self.df.join(df)

三.数据分析

现在我们可以对数据进行分析查找六月份的旅行规律了，为了便于观察，这里使用pyecharts进行可视化处理。

1.男女比例

首先对参与出行计划的人员性别进行分析，利用dataframe的sum()和groupby().count()方法可以很容易获得行程发布者和参与者的性别分布: