其他分享
首页 > 其他分享> > 毕业设计每日博客--星期二

毕业设计每日博客--星期二

作者:互联网

今天完成了第二层链接爬取的设计,在爬取时发现了一个问题,爬取全部的链接,足足有几百万条可能更多,而使用谷歌驱动的缺点就是,爬取速度特别慢,如果网速差的话更慢,再加上防止知网访问频繁的验证码问题,必需加上休眠,如果要爬取所有链接,运行22天不断才能爬取完成,这还只是链接,所以准备修改代码,每一个专辑只爬取少量链接,这样下来也有10万条数据,相信足够了。

标签:毕业设计,22,--,星期二,网速,爬取,取时,链接
来源: https://www.cnblogs.com/my---world/p/13764159.html