python爬虫中文乱码

前几天用python来爬取全国行政区划编码的时候,遇到了中文乱码的问题,折腾了一会儿,才解决。现特记录一下,方便以后查看。

我是用python的requests和bs4库来实现爬虫,这两个库的简单用法可参照python爬取当当网的书籍信息并保存到csv文件

乱码未处理前部分代码

   url = '要爬取的网页'
r = requests.get(url, timeout=30)
soup = BeautifulSoup(r.text, 'lxml')

乱码原因

我爬取的网页使用的编码是GBK。所以要按GBK编码,才能避免中文乱码。

解决乱码的代码

   url = '要爬取的网页'
r = requests.get(url, timeout=30)
r.encoding='GBK' #增加encoding=‘GBK’,解决中文乱码问题
soup = BeautifulSoup(r.text, 'lxml')

【原创声明】转载请标明出处:https://www.cnblogs.com/surecheun/p/9694052.html

最新文章

  1. 学习笔记---C/C++语法
  2. synchronized和ReentrantLock
  3. c#判断闰年
  4. waf2控件名
  5. CSS控制文本超出指定宽度显示省略号和文本不换行
  6. eclipse根据.wsdl文件自动生成webservice的调用客户端
  7. oracle创建表空间、创建用户、授权、夺权、删除用户、删除表空间
  8. hdu 2824The Euler function
  9. 关于shared_ptr与weak_ptr的使用(good)
  10. 《算法》第五章部分程序 part 5
  11. 最短路径Dijkstra matlab
  12. iOS 使用动态库
  13. HTTP中常见的各种状态码详解及解决方案
  14. HDU1115&&POJ1385Lifting the Stone(求多边形的重心)
  15. droup
  16. SQLite 连接两个字符串
  17. requests库安装
  18. Leetcode--easy系列3
  19. BootstrapValidator 解决多属性被同时校验问题《转》
  20. Annotation之四:注解中的-Xlint:unchecked和 -Xlint:deprecation

热门文章

  1. Reveal Jquery 模式对话框插件
  2. Hadoop、Pig、Hive、NOSQL 学习资源收集
  3. 003杰信-在jsp页面输入数据,然后在oracle数据库中插入factory数据,当字段允许为空时要特殊处理
  4. Spring Boot简化了基于Spring的应用开发
  5. hashSet的底层是数组,其查询效率非常高
  6. mysql -- 创建存储过程 往数据表中新增字段
  7. 国际化信息-->MVC
  8. Hibernate 自动生成数据库表
  9. 经验总结20--C#模拟WEB请求
  10. 自学Ajax