之前说过较为简单的条件下使用web scraper,来进行采集豆瓣top250电影数据,这次我们要使用该工具,采集多页数据,不仅是一页,并且进行采集二级页面的数据。

还是拿豆瓣top250,来举例。

  • 第一步:在我们之前的操作的基础上只需要简单的修改初始网址名称,就可以:
    之前我么使用的网址是:https://movie.douban.com/top250
    而我们通过,点击下一页发现,网址的变化有一定的规律,那就是start后面的数是以25进行递增,于是:我们将start后面的写成**[now_page-final_page:step]**,这种形式就可以。其中的now_page是指当前页面的网址,final_page是你要爬取的最后一页网址,step是指页面与下一页面之间的规律。
    在这里插入图片描述

  • 第二步:与之前没有什么不同,具体操作可以看之前写的这篇文章,我们在这里想要获取,二级页面里的描述:

  • 在这里插入图片描述
    我们只需要在之前的基础上,在contents内进行修改,进行一步点击操作,使其模拟人一样进入到二级页面,即新增second_links。
    在这里插入图片描述
    在这里插入图片描述
    点击second_link,在里面新增一个字段,用来存储电影描述,并且网页应自己手动跳转到二级页面(即电影描述页面)。
    在这里插入图片描述
    操作与之前一样,只不过在这里需要注意,尽量把描述框全选,不然有的电影描述会采集不到。
    在这里插入图片描述
    配置完成后的流程图:张这个样子,就没问题了
    在这里插入图片描述

当这一步配置成功后就可以进行采集了。

  • 第三步:采集

在这里插入图片描述

  • 这个程序的介绍暂时告一段落,半个月后会在更新此程序的进一步操作,如下一页不能通过,网址的修改进行采集。
  • 下期预告:使用pyecharts制作区域地图,并显示出相应数量。以及利用百度地图API,根据地址制作热力图。代码也会下次进行提供。

1.地图
在这里插入图片描述
2.热力图
在这里插入图片描述

Logo

加入社区!打开量化的大门,首批课程上线啦!

更多推荐