一.创建项目

scrapy startproject putu

二.创建spider文件

scrapy genspider  patubole patubole.com

 

三.利用chrome浏览器分析出房价和标题的两个字段的xpath表达式,开始编写patubole.py文件。网络的爬取是通过这个文件进行的

以下代码是最终的代码

所建的patubole.py文件必须实现name,parse函数,start_url这三个属性

 

四.将爬取的数据保存到数据库sufang中。

(1)在pycharm中新建数据库

 

 

完成后会出现

 

(2)将数据存放在新建的数据库zufang的数据表sufang中

数据的爬取是有patubole.py实现的,数据的存储是由pipelines.py实现的,pipelines.py又是有items.py提供数据的支持

所以编写items.py

 

此时就要回过头来修改刚开是为了测试编写的patubole.py 文件

代码如下

 

3)在settings.py中进行PatuPipeline文件配置

ITEM_PIPELINES = {

'patu.pipelines.PatuPipeline': 300,

}

(5)pipelines.py文件代码,实现存储数据到数据库中

其中包含SQL的相关知识

 

最终结果

 

其中main.py文件是为了调式方便而添加的,可以不用,直接用相关命令启动爬虫

 

最新文章

  1. C#高级编程笔记 2016年10月26日 MVC入门 Controller
  2. Selenium2+python 常用函数汇总
  3. [Linux监控]磁盘空间大小
  4. String是引用类型
  5. JQuery asp.net 简单入门
  6. linux tar 命令 --致力于“一眼看懂,随手就用”的随笔
  7. linux ln命令 创建链接(快捷方式)
  8. PHP Fatal error: Cannot pass parameter 2 by reference
  9. Java中this和super的用法总结
  10. jq hide show
  11. 读《图解HTTP》有感-(与HTTP协作的WEB服务器)
  12. 【.NET Core项目实战-统一认证平台】第九章 授权篇-使用Dapper持久化IdentityServer4
  13. 驱动调试(一)-printk
  14. PDF 补丁丁 0.6.0.3369 版发布(修复保存文件时文件名替代符失效的问题)
  15. RESTful API单元测试(十九)
  16. scale.fix.js
  17. 使用 properties 配置文件装配 bean 的方式
  18. Netty高性能之Reactor线程模型
  19. 微服务之springCloud和docker-provide(二)
  20. 关于Behold the Kickmen (球员登场)

热门文章

  1. java8 Stream操作
  2. Selenium自动化-入门1
  3. 自定义工作流活动运行产生System.Security.SecurityException
  4. 关于ajax用户名验证和jquery实现简单表单验证
  5. Android为TV端助力 MediaPlayer 错误代码(error code)总结 转载
  6. GitHub和75亿美金
  7. 执行C#动态代码
  8. Bootstrap -- 导航栏样式、分页样式、标签样式、徽章样式
  9. 英语进阶系列-A05-英语升级练习三
  10. 爬虫系列---selenium详解