Python一日一练05----怒刷点击量
2024-09-28 08:39:18
功能
自己主动获取CSDN文章列表,并对每篇文章添加点击量.
源代码
import urllib.request
import re
import time
import random
from bs4 import BeautifulSoup p = re.compile('/a359680405/article/details/........') #自己的博客主页
url = "http://blog.csdn.net/a359680405" #使用build_opener()是为了让python程序模仿浏览器进行訪问
opener = urllib.request.build_opener()
opener.addheaders = [('User-agent', 'Mozilla/5.0')] html = opener.open(url).read().decode('utf-8') allfinds = p.findall(html)
print(allfinds) urlBase = "http://blog.csdn.net"#须要将网址合并的部分
#页面中的网址有反复的,须要使用set进行去反复
mypages = list(set(allfinds))
for i in range(len(mypages)):
mypages[i] = urlBase+mypages[i] print('要刷的网页有:')
for index , page in enumerate(mypages) :
print(str(index), page) #设置每一个网页要刷的次数
brushMax = 200 #全部的页面都刷
print('以下開始刷了哦:')
for index , page in enumerate(mypages) :
brushNum=random.randint(0,brushMax)
for j in range(brushNum):
try :
pageContent = opener.open(page).read().decode('utf-8')
#使用BeautifulSoup解析每篇博客的标题
soup = BeautifulSoup(pageContent)
blogTitle = str(soup.title.string)
blogTitle = blogTitle[0:blogTitle.find('-')]
print(str(j) , blogTitle) except urllib.error.HTTPError:
print('urllib.error.HTTPError')
time.sleep(1)#出现错误。停几秒先 except urllib.error.URLError:
print('urllib.error.URLError')
time.sleep(1)#出现错误,停几秒先
time.sleep(0.1)#正常停顿,以免server拒绝訪问
最新文章
- ASP.NET MVC5----常见的数据注解和验证
- Arch Linux 安装博通 BCM4360 驱动(Arch Linux, Ubuntu, Debian, Fedora...)
- Tools - 常用搜索引擎命令
- 【python cookbook】【字符串与文本】13.对齐文本字符串
- mac终端下运行shell脚本
- Mvc 6 中创建 Web Api
- Javascript-正则表达式-开发中的使用.
- Outlook邮箱配置
- 扒一扒.NET Core的环境配置提供程序
- mac下Android开发环境的配置
- python使用sax实现xml解析
- GET和POST传输方式
- Vue.js项目集成ElementUI
- esxtop 指标%RDY,NUMA,Wide-VMs
- git经常使用命令和问题
- linux如何通过脚本来修改用户的密码?脚本自动化修改用户密码?
- oracle常用数据类型说明
- Oracle创建数据库链接
- HTML 视频(Videos)
- Callable、Future&;阻塞队列&;阻塞栈