目标网址:

某招标投标公共服务平台:aHR0cHM6Ly9idWxsZXRpbi5jZWJwdWJzZXJ2aWNlLmNvbS8=

目标

获取当前网页上的详情页面pdf数据,在这里插入图片描述
当前的数据为stream数据,可以通过requests模块中的stream模式
当把get函数的stream参数设置成True时,它不会立即开始下载,当你使用iter_content或iter_lines遍历内容或访问内容属性时才开始下载。需要注意一点:文件没有下载之前,它也需要保持连接。

iter_content:一块一块的遍历要下载的内容
iter_lines:一行一行的遍历要下载的内容
使用上面两个函数下载大文件可以防止占用过多的内存,因为每次只下载小部分数据

参考代码

import requests


headers = {
    "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/107.0.0.0 Safari/537.36",
}
url = "https://details.cebpubservice.com:7443/bulletin/getBulletin/8a94948283ef5a5101844b20cfaa54ad"
response = requests.get(url, headers=headers, stream=True)
print(response.text)
with open('1.pdf', 'wb')as f:
    for i in response.iter_content(chunk_size=512):
        # print(i)
        if i :
            f.write(i)

print(response)
Logo

加入社区!打开量化的大门,首批课程上线啦!

更多推荐