这次的主要的目的是从淘宝的搜索页面获取商品的信息。其实分析页面找到信息很容易,页面信息的存放都是以静态的方式直接嵌套的页面上的,很容易找到。主要困难是将信息从HTML源码中剥离出来,数据和网页源码结合的很紧密,剥离数据有一定的难度。

然后将获取的信息写入excel表格保存起来,这次只爬取了前面10页 的内容。在运行代码的过程中发现,30页后面的数据有问题,出现了手机价格为0的情况,这是不符合实际的,码也没有写错误处理的代码。

这次先写个粗略的,有点凌乱的感觉,下次有时间再系统的整理整理吧。

这是爬取的数据的效果图:

这是程序的代码:

import requests
import re
from xlwt import Workbook
import xlrd
import time def key_name( number ):
#获取页面的内容并返回
name = '手机'
URL_1 = "https://s.taobao.com/search?ie=utf8&initiative_id=staobaoz_20170905&stats_click=search_radio_all%3A1&js=1&imgfile=&q="
URL_2 = "&suggest=0_1&_input_charset=utf-8&wq=u&suggest_query=u&source=suggest&p4ppushleft=5%2C48&s="
URL = ( URL_1 + name + URL_2 + str(number))
#print(URL)
res = requests.get( URL )
return res.text def find_date( text):
#根据整个页面的信息,获取商品的数据所在的HTML源码并放回
reg = r',"data":{"spus":\[({.+?)\]}},"header":'
reg = re.compile(reg)
info = re.findall(reg, text)
return info[0] def manipulation_data( info, N, sheet ):
#解析获取的HTML源码,获取数据
Date = eval(info) for d in Date:
T = " ".join([t['tag'] for t in d['tag_info']])
#print(d['title'] + '\t' + d['price'] + '\t' + d['importantKey'][0:len(d['importantKey'])-1] + '\t' + T) sheet.write(N,0,d['title'])
sheet.write(N,1,d['price'])
sheet.write(N,2,T)
N = N + 1
return N def main(): book = Workbook()
sheet = book.add_sheet('淘宝手机数据')
sheet.write(0,0,'品牌')
sheet.write(0,1,'价格')
sheet.write(0,2,'配置')
book.save('淘宝手机数据.xls')
#k用于生成链接,每个链接的最后面的数字相差48.
#N用于记录表格的数据行数,便于写入数据
k = 0
N = 1
for i in range(10+1):
text = key_name( k + i * 48 )
info = find_date(text)
N = manipulation_data( info ,N, sheet ) book.save('淘宝手机数据.xls')
print('下载第' + str(i) + '页完成') if __name__ == '__main__':
main()

最新文章

  1. uva.10020 Minimal coverage(贪心)
  2. C#窗体计算器
  3. SSIS使用OleDB和Ado.Net两种方式调用 存储过程
  4. 使用XML与远程服务器进行交互
  5. uva 11991 Easy Problem from Rujia Liu? vector+map
  6. (asp.net MVC学习)System.Web.Mvc.HtmlHelper学习及使用
  7. jQuery+PHP实现的砸金蛋中奖程序
  8. Log4J1升级Log4J2
  9. LDA 线性判别分析
  10. 时效性福利:MindManager2017 破解攻略
  11. html和js,外部js 的下载执行顺序
  12. Parco_Love_String
  13. linux光标操作
  14. Java高并发 -- 线程池
  15. 053、overlay是如何隔离的?(2019-03-20周三)
  16. Android 获取Activity当前view
  17. JS 进阶知识点及常考面试题
  18. winform的combox下拉框绑定数据源
  19. Python str() 函数
  20. fieldmeta 基于springboot的字段元数据管理,通用代码生成,快速开发引擎

热门文章

  1. C#加密与解密(DES\RSA)学习笔记
  2. UniGUI之UniLabel(31)
  3. ng-简介
  4. Sublime text3 最新版破解,永久有效
  5. 剑指offer-面试题14-剪绳子-动态规划法
  6. 深入理解Java内存模型中的虚拟机栈
  7. Codeforces Round #622 (Div. 2) C2 - Skyscrapers (hard version) 单调栈
  8. 广搜 BFS()
  9. day03_1spring3
  10. AcWing 1049. 大盗阿福