做python爬虫的时候如何判断是否抓取过了?,python爬虫,以前没有做过爬虫,现在项
做python爬虫的时候如何判断是否抓取过了?,python爬虫,以前没有做过爬虫,现在项
以前没有做过爬虫,现在项目有个需求 就是要爬取指定论坛的某个板块的帖子 下面如果出现 “机械XXX” 等关键字就要抓取通知管理员,
但是现在有个问题,怎么判断是否爬过呢, 目前这个爬虫第一版只爬帖子内容 不爬回复 , 目前想到的思路是 定时爬前20页的id 然后去数据库里对比是否有id 如果不存在此id再继续爬,不知道这个思路怎么样
但是第二版的话就要爬回复内容了 这个应该怎么实现呢? 各位大神有什么思路吗
每个html页面都是一棵dom树,你爬取的时候记录下每一个敏感词在节点中的位置,然后再数据库中对比,完活儿.
记录下爬去过的id的思路很对呀,即使是回复内容,也可以这样子做,记录下回复的id、时间等标识性信息就可以了
请使用布隆过滤器
编橙之家文章,
相关内容
- 求问tornado 3.2 chatdemo如何实现异步,不是很理解,tornad
- 如何用python方法完善平台求手指引,python平台,之前提过
- Python logging日志归集策略问题,pythonlogging,python日志归集
- Python httplib2模拟登陆微信公共平台户名密码错误为什么
- 请问Python框架与框架之间整合应该怎么实现?,python框架
- Python lambda函数最适合出现在什么情况下,pythonlambda,被
- 求个时间复杂度极小的python算法,度极小python算法,有一
- python支持不同模块引入相同变量操作吗?,python变量,例
- 想完成批量转换文本中原有的tab与空格有什么好方法?
- 求Python对比多个函数是否一致的方法,python对比多个函
评论关闭