Scrapy 断点续爬

1 天前
 joker2026

使用 scrapy 框架爬一些数据,大概上千万,但是是不是的会出现问题,导致中断,不知道有没有什么办法能够实现断点续爬。爬的类型就是典型的新闻列表,然后进入详情页抓取新闻内容。

感谢

394 次点击
所在节点    问与答
2 条回复
NoOneNoBody
1 天前
你没有记录已经爬过的 link 么?重启任务得到 link 的时候去掉爬过的就是了
Phant0m
1 天前

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.fyfyfm.apispeedy.workers.dev/t/1073689

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX