不讲武德——不用代码爬虫二
·
之前说过较为简单的条件下使用web scraper,来进行采集豆瓣top250电影数据,这次我们要使用该工具,采集多页数据,不仅是一页,并且进行采集二级页面的数据。
还是拿豆瓣top250,来举例。
-
第一步:在我们之前的操作的基础上只需要简单的修改初始网址名称,就可以:
之前我么使用的网址是:https://movie.douban.com/top250
而我们通过,点击下一页发现,网址的变化有一定的规律,那就是start后面的数是以25进行递增,于是:我们将start后面的写成**[now_page-final_page:step]**,这种形式就可以。其中的now_page是指当前页面的网址,final_page是你要爬取的最后一页网址,step是指页面与下一页面之间的规律。
-
第二步:与之前没有什么不同,具体操作可以看之前写的这篇文章,我们在这里想要获取,二级页面里的描述:
-

我们只需要在之前的基础上,在contents内进行修改,进行一步点击操作,使其模拟人一样进入到二级页面,即新增second_links。

点击second_link,在里面新增一个字段,用来存储电影描述,并且网页应自己手动跳转到二级页面(即电影描述页面)。
操作与之前一样,只不过在这里需要注意,尽量把描述框全选,不然有的电影描述会采集不到。
配置完成后的流程图:张这个样子,就没问题了
当这一步配置成功后就可以进行采集了。
- 第三步:采集

- 这个程序的介绍暂时告一段落,半个月后会在更新此程序的进一步操作,如下一页不能通过,网址的修改进行采集。
- 下期预告:使用pyecharts制作区域地图,并显示出相应数量。以及利用百度地图API,根据地址制作热力图。代码也会下次进行提供。
1.地图
2.热力图
更多推荐




所有评论(0)