获取堆糖网站所有用户的id 昵称及主页地址

#!/usr/bin/env python
# -*- encoding: utf-8 -*-
# Created on 2016-06-21 13:57:13
# Project: duitang from pyspider.libs.base_handler import * class Handler(BaseHandler):
crawl_config = {
} @every(minutes=24 * 60)
def on_start(self):
self.crawl('http://www.duitang.com/napi/friendship/fans/?start=0&limit=1000&user_id=116965', callback=self.index_page) @config(age=10 * 24 * 60 * 60)
def index_page(self, response):
for each in response.json['data']['object_list']:
id = each['id']
self.crawl('http://www.duitang.com/napi/friendship/fans/?start=0&limit=1000&user_id='+str(id), callback=self.index_page)
self.crawl('http://www.duitang.com/napi/people/profile/?user_id='+str(id), callback=self.detail_page)
start = response.json['data']['next_start']
total = response.json['data']['total']
user = response.json['data']['visit_user']['user_id']
if start < total:
self.crawl('http://www.duitang.com/napi/friendship/fans/?start='+str(start)+'&limit=1000&user_id='+str(user),callback=self.index_page) @config(priority=2)
def detail_page(self, response):
return {
"username": response.json['data']['username'],
"id": response.json['data']['id']
}

最新文章

  1. NSStringCompareOptions
  2. spring mvc 快速入门
  3. CURLcode curl_easy_setopt(原创)
  4. Protocol https not supported or disabled in libcurl
  5. .NET开源工作流RoadFlow-表单设计-文本框
  6. FOJ 1858 Super Girl 单调队列
  7. iBatis入手案例
  8. php中的NOTICE 的错误解决方法
  9. Laravel之路——事务
  10. 重新开始学习javase_对象的初始化
  11. Deep Learning(深度学习)学习笔记整理系列之(八)
  12. ajax使用json
  13. MHA-Atlas-MySQL高可用集群
  14. springbank 开发日志 Spring启动过程中对自定义标签的处理
  15. Centos 6.5 搭建阿里云yum源
  16. vue 路由参数变化,页面不更新的问题
  17. 命令行 设置redis 时间
  18. STS热部署,springboot项目中修改代码不用重新启动服务
  19. Java编程的逻辑 (23) - 枚举的本质
  20. django之创建第8-1个项目-数据库之增删改查/数据库数据显示在html页面

热门文章

  1. Linux 日常用法
  2. CSRF总结
  3. 2019南昌网络赛-I(单调栈+线段树)
  4. vue踩坑(二):跨域以及携带cookie
  5. gridview 选中某行后 某行的按钮显示,无选中则隐藏
  6. c# 判断当前版本是Debugger或Release
  7. vue学习笔记(nvm安装)
  8. vue如何使用rules对表单字段进行校验
  9. python简单实现tftp客户端(基于udp)
  10. 使用Json.net对Json进行遍历