工作之余,学习了一下正则表达式,鉴于实践是检验真理的唯一标准,于是便写了一个利用正则表达式抓取百度百家文章的例子,具体过程请看下面源码:

一:获取百度百家网页内容

 public List<string[]> GetUrl()
{
try
{
string url = "http://baijia.baidu.com/";
WebRequest webRequest = WebRequest.Create(url);
WebResponse webResponse = webRequest.GetResponse();
StreamReader reader = new StreamReader(webResponse.GetResponseStream());
string result = reader.ReadToEnd();
reader.Close();
webResponse.Close();
return AnalysisHtml(result);
}
catch (Exception ex)
{
throw ex;
}
}

二:通过正则表达式筛选

 public List<string[]> AnalysisHtml(string htmlContent)
{
List<string[]> list = new List<string[]>();
string strPattern = "<h3><a\\s*.*>(?<Title>[^<]+)</a></h3>.*\\s*<p\\s*class=\"feeds-item-text\">(?<Abstract>[^<]+)<a\\s*href=\"(?<Url>.*)\"\\s*target=\"_blank\"\\s*class=\"feeds-item-more\"\\s*mon=\".*\\s*\">.*\\s*</a></p>";
Regex regex = new Regex(strPattern, RegexOptions.IgnoreCase | RegexOptions.Multiline | RegexOptions.CultureInvariant);
if (regex.IsMatch(htmlContent))
{
MatchCollection matchCollection = regex.Matches(htmlContent);
foreach (Match match in matchCollection)
{
string[] str = new string[];
str[] = match.Groups[].Value;//获取到的是列表数据的标题
str[] = match.Groups[].Value;//获取到的是内容
str[] = match.Groups[].Value;//获取到的是链接到的地址
list.Add(str);
}
}
return list;
}

源码下载

最新文章

  1. UVALive 6885 Flowery Trails 最短路枚举
  2. 第一章 响应式设计之Media Quer
  3. 怎么手写Ajax实现异步刷新
  4. Linux Versus Windows, Ubuntu/Mint V XP/Vista/7
  5. 个人笔记--struts2对Action的权限拦截
  6. Memcached认知[分布式]
  7. Ajax日记
  8. thinkphp phpexcel导入
  9. django1.6.x(python3.3)使用pymysql连接mysql
  10. 第七章——DMVs和DMFs(3)——用DMV和DMF监控TempDB
  11. toFixed()要注意的
  12. Docker+Gogs搭建个人Git服务
  13. JVM三种垃圾收集算法思想及发展过程
  14. 如何在ubuntu开启ssh服务-使 SecureCRT远程登录
  15. c++11の关联容器
  16. Kettle系列:使用Kudu API插入数据到Kudu中
  17. activemq 安装 部署
  18. Eclipse 护眼背景色设置
  19. [AHOI2014/JSOI2014] 解题报告
  20. html5 postMessage解决跨域、跨窗口消息传递(转)

热门文章

  1. java程序员图文并茂细说Unity中调用Android的接口
  2. QString字符串拼接【转载】
  3. Sqoop--Free-form Query Imports 自由查询模式下$CONDITIONS关键字的作用
  4. Python 算法之二分查找
  5. java中final用法
  6. flask之instance_path实例路径
  7. MongoDB 3.4 高可用集群搭建(二)replica set 副本集
  8. JeeSite入门介绍(一)
  9. OpenGL渲染流水线
  10. Java中Return和Finally执行顺序的实现