【PY】没有电影看?来教你用Python爬取电影天堂最新电影!,,项目开始第一步仍然是
【PY】没有电影看?来教你用Python爬取电影天堂最新电影!,,项目开始第一步仍然是
项目开始
第一步仍然是创建scrapy项目与spider文件
切换到工作目录两条命令依次输入
scrapy startproject xunleidianyingscrapy genspider xunleiBT https://www.xl720.com/thunder/years/2019
内容分析
打开目标网站(分类是2019年上映的电影),分析我们需要的数据
进入页面是列表的形式就像豆瓣电影一样,然后我们点进去具体页面看看
这个页面就是我们需要拿到的内容页面,我们来看我们需要哪些数据(某些数据从第一个页面就可以获得,但是下载地址必须到第二个页面)
电影名称
电影信息
电影内容剧情
电影下载地址
分析完成之后就可以首先编写 items.py文件
另外别忘了去settings.py中开启 ITEM_PIPELINES 选项
爬虫文件编写
老样子,为了方便测试我们的爬虫,首先编写一个main.py的文件方便IDE调用
main.py:
import scrapy.cmdlinescrapy.cmdline.execute(‘scrapy crawl xunleiBT‘.split())
首先我们先测试直接向目标发送请求是否可以得到响应
爬虫文件 xunleiBT.py编写如下:
运行 main.py 看看会出现什么
好的,发现直接返回正常的网页也就是我们要的网页,说明该网站没有反爬机制,这样我们就更容易爬取了
然后通过xpath定位页面元素,具体就不再赘述,之前的scarpy教程中都有 继续编写爬虫文件
ITEM爬取完成后该干什么?当然是入库保存了,编写pipelines.py文件进行入库保存
再次提醒别忘了去settings.py中开启 ITEM_PIPELINES 选项
pipelines.py文件代码如下:
再次运行main.py 等待运行完成后打开数据库查询
数据保存完成,这次我们一共导入了380个数据,可以愉快的查看电影了
【PY】没有电影看?来教你用Python爬取电影天堂最新电影!
相关内容
- 运维学python之爬虫中级篇(七)Sqlite3,,前文已经讲过
- pycharm默认的模板修改python script,,#!/usr/bin
- python 字符前缀,运算符、换行符,,运算符python运
- 准备工作——安装python和解析器,,1、安装python
- Python读取文件编码解码问题,,用chardet检测
- python操作文件写入内容,,[root@bogo
- Python零散知识点记录,,1、关于setdef
- python中的global,,https://bl
- python--matplotlib库使用2,,功能:python画
- [Python设计模式] 第1章 计算器——简单工厂模式,,写在
评论关闭