import re
from selenium import webdriver
from selenium.common.exceptions import TimeoutException
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
from pyquery import PyQuery as pq KEYWORD = '小米手机'
MAX_PAGE = 3 # 浏览器驱动
browser = webdriver.Chrome()
wait = WebDriverWait(browser,10) def get_products():
# 获取网页源代码
html = browser.page_source
# 解析
content = pq(browser.page_source)
# 得到所有选择的内容
items = content('#mainsrp-itemlist .m-itemlist .grid.g-clearfix .item').items()
for item in items:
product = {
'image':item.find('.pic .img').attr('data-src'),
'price':item.find('.price').text().strip(),
'deal':item.find('.deal-cnt').text(),
'title':item.find('.title').text(),
'shop':item.find('.shop').text(),
'location':item.find('.location').text()
} print('--------{}----------\n'.format(product)) def index_page(page):
'''
抓取索引页
:param page:
:return:
'''
print(10*'-','正在抓取第{}页'.format(page),10*'-')
try:
url = 'https://s.taobao.com/search?q={}'.format(KEYWORD)
print(url)
browser.get(url)
# 如果抓取的不是第一页,进行跳页操作
if page > 1:
input = wait.until(EC.presence_of_element_located((
By.CSS_SELECTOR,'#mainsrp-pager > div > div > div > div.form > input'
)))
submit = wait.until(EC.element_to_be_clickable((
By.CSS_SELECTOR,'#mainsrp-pager > div > div > div > div.form > span.btn.J_Submit'
)))
input.clear()
input.send_keys(page)
submit.click()
# 等待页面加载完成(当前高亮页码是page)
wait.until(EC.text_to_be_present_in_element((
By.CSS_SELECTOR,'#mainsrp-pager > div > div > div > ul > li.item.active > span'
),str(page)))
# 等待所有商品信息加载完成
wait.until(EC.presence_of_element_located((
By.CSS_SELECTOR,'#mainsrp-itemlist .m-itemlist .grid.g-clearfix .item')
))
get_products()
except TimeoutException:
index_page() def main():
# 遍历每一页
for page in range(1,MAX_PAGE+1):
index_page(page)

最新文章

  1. Xtrabackup2.3.4安装
  2. JavaScript对象 属性
  3. 【转】ios app 应用内购买配置完全指南
  4. 【转载】总结一下Android中主题(Theme)的正确玩法
  5. Android(java)学习笔记170:Activity的生命周期
  6. Eclipse代码自动填充.
  7. 演练5-8:Contoso大学校园管理系统(实现存储池和工作单元模式)
  8. WebService推送数据,数据结构应该怎样定义?
  9. SQL Tuning Advisor一个错误ORA-00600: internal error code, arguments: [kesqsMakeBindValue:obj]
  10. 使用Blend的一些问题
  11. (2-2)SpringCloud-服务注册到Eureka Server集群并消费
  12. Eclipse从数据库逆向生成Hibernate实体类和映射文件(Eclipse插件系列之HibernateTools)
  13. Linux查看用户所属用户组
  14. [zt]C++二维数组讲解、二维数组的声明和初始化
  15. [Swift]LeetCode839. 相似字符串组 | Similar String Groups
  16. [转]eShopOnContainers 看微服务 ①:总体概览
  17. JAVA记录-生成jar包方法
  18. 详解CUDA编程
  19. 如何创建并运行java线程 , 多线程使用
  20. XMPP 安装ejabberd 搭建服务器环境

热门文章

  1. 【51nod】2606 Secondary Substring
  2. Web应用中访问WEB-INF下的资源
  3. PHP学习之PHP的语法糖
  4. nginx浏览器开启密码验证
  5. 调研task_struct结构体
  6. wpf 判断项目中的某个窗体是否已经打开或者已经存在
  7. [Vue]vue-router的push和replace的区别
  8. LeetCode 866. Prime Palindrome
  9. mysql 8.0.13开启远程连接 配置方式
  10. NLog Helpper日志帮助类配置和使用