两种python 判断网页编码的方法,python判断网页编码,这段时间在用python
两种python 判断网页编码的方法,python判断网页编码,这段时间在用python
这段时间在用python处理网页抓取这块,互联网很多网页的编码格式都不一样,大体上是GBK,GB2312,UTF-8几种。我们在获取网页的的数据后,先要对网页的编码进行判断,才能把抓取的内容的编码统一转换为我们能够处理的编码。比如beautiful soup内部的编码就是unicode的编码。
下面介绍两种python 判断网页编码的方法:
import urllibf = urllib.urlopen('http://byrx.net/').info()print f.getparam('charset')
2 import chardet 你需要安装一下chardet第3方模块判断编码
data = urllib.urlopen('http://byrx.net/').read()print chardet.detect(data)
希望对你有帮助!
相关内容
- python字符串方法总结,python字符串总结,python的字符串模
- python 使用datetime模块timedelta实现日期时间相加,dateti
- python时间日期模块使用总结,python模块,python中关于时间
- python string to datetime datetime to string,pythondatetime,python日
- 访问需要HTTP Basic Authentication认证的资源的python实现,
- python设置socket的超时时间,pythonsocket超时,在使用urlli
- python卸载模块,python卸载,在python中如果不再
- python的is运算符,pythonis运算符,python的is运算符
- python模拟ajax请求,获得ajax请求响应,pythonajax,有些网站
- python修改mp3 专辑,作者等信息,pythonmp3,使用python修改
评论关闭