自从 Web 应用程序自 1993 年 W3C 设立以来就开始发展,而且 HTML 也历经了数个版本的演化(1.0 – 2.0 – 3.0 – 3.2 – 4.0 – 4.01),现在也已经成为Web网页或应用程序的最基础,想要学习如何设计 Web 网页或开发 Web 应用程序,这已经是绝对必须要学的东西了,就算是方便的控件(例如 ASP.NET),但 HTML 仍然有学习它的必要性,因此如果不会 HTML,就等于没学过 Web 网页一般。

  拜 HTML 与 Web 浏览器蓬勃发展之赐,各式各样的应用都在网络上迅速发展,举凡电子商务、企业门户、在线下单、企业间协同应用等,乃至于社交、个性化、Web 2.0 等商务与组织运用等能力,而在信息爆炸的时代,很多信息整合的应用也随之出炉,而这些信息整合的应用程序都会连接到不同的网站下载其信息,并且在重重的 HTML 中剖析出想要的数据(例如每股价格、涨跌幅、成交量等)。

  但是 HTML 本身并不是一个结构严谨的语言,它允许卷标(tag)可以在不 close 的情况下继续使用。这也是因为浏览器设计的高容错性(Fault Tolerance)所致,如此一来,想要依照规则来剖析 HTML 文件几乎变得不可能,而且对方的网站的 HTML 结构也可能会随时变化,在这种情况下,剖析 HTML 变得非常辛苦,虽然 W3C 有另外推展 XHTML(遵守 XML 严谨格式的 HTML),但使用它来设计网页的案例仍为少数,大多数的网站仍然是使用 HTML。因此我们会需要一个工具,能够有方法快速的解析 HTML 以取出我们需要的数据。

  大家都知道,HTML 本身其实只是一个 HTML 标记的字符串而已,因此一般说到要解析 HTML,第一个会想到的大概就是字符串比对(string comparison),自己针对 HTML 的结构写一个 pattern,然后由函式去做逐一的比对,例如:

  [C#]

  1. string pattern = "       ";

  2. html.IndexOf(pattern);

  不过传统的字符串比对效能太差,也没有一个规则性,因而才发展出正则表达式(Regular Expression)技术,例如下列这样的语法:

  [Regular Expression]

  1. \s]+))?)+\s*|\s*)/?>

  但 Regular Expression 的学习曲线很高,若要使用它来解析 HTML,并且再加以定制化(Customization)的话,对于一般开发人员来说,实在没有什么亲和力。

  HTML 还有一个特色,就是它是具层性(Hierarchy)的,因此浏览器在解译它的时候都会以文件树(document tree)的方式,再用递归(recursive)的方法来处理它,但 Regular Expression 没有支持层级性的剖析,而最接近阶层剖析又好用的工具,莫过于 XML Parser 了,它的 DOM 以及 XPath 的特性,都可以让解析 XML 的工作变得轻松,然而 XML Parser 无法读取一般的 HTML(XHTML 可以),因为一般的 HTML 是结构松散的类型,XML Parser 会在读入时检查语法结构是否完整(也就是 Well-known 的结构),若读入的是结构松散的内容的话会掷出例外讯息,因此无法直接使用 XML Parser 来辅助。

  HTML Agility Pack 是由法国的一位软件架构师 Simon Mourier 所开发,并且由 DarthObiwan 以及 Jessynoo 辅助开发出来的一个软件工具,它可以让剖析松散格式 HTML 的工作就像剖析 XML 一样简单,它也有类似于 System.Xml 命名空间中的 XML DOM 的许多类别,除了可以使用阶层的方式存取 HTML 以外,它也支持使用 XPath 的方式来搜寻 HTML,这会较以往使用文字比对或是 Regular Expression 的比对方式来得更明确。

  若要使用 HTML Agility Pack 组件,可先上 Codeplex 的 HTML Agility Pack 网站下载二进制文件(同时也提供源代码、说明文件以及 HAP Explorer 工具程序可下载),并解压缩后,在项目加入对 HtmlAgilityPack.dll 的引用。

  Html Agility Pack 源码中的类大概有28个左右,其实不算一个很复杂的类库,但它的功能确不弱,为解析DOM已经提供了足够强大的功能支持,可以跟jQuery操作DOM媲美:)Html Agility Pack最常用的基础类其实不多,对解析DOM来说,就只有HtmlDocument和HtmlNode这两个常用的类,还有一个 HtmlNodeCollection集合类。

  HTML Agility Pack的操作起来还是很麻烦,下面我们要介绍的这个组件是ScrapySharp,他在2个方面针对Html Agility Pack进行了包装,使得解析Html页面不再痛苦,幸福指数直线上升到90分哈。

  ScapySharp有了一个真实的浏览器包装类(处理Reference,Cookie等),另外一个就是使用类似于jQuery一样的Css选择器和Linq语法。让我们使用起来非常的爽。它的代码放在 https://bitbucket.org/rflechner/scrapysharp。也可以通过Nuget添加

  下面我们来看一段解析博客园的博客文章的代码:

using System; 
using System.Collections.Generic; 
using System.Linq; 
using System.Text; 
using HtmlAgilityPack; 
using ScrapySharp.Extensions; 
using ScrapySharp.Network;

namespace HTMLAgilityDemo 

    class Program 
    { 
        static void Main(string[] args) 
        { 
            var uri = new Uri("http://www.cnblogs.com/shanyou/archive/2012/05/20/2509435.html"); 
            var browser1 = new ScrapingBrowser(); 
            var html1 = browser1.DownloadString(uri); 
            var htmlDocument = new HtmlDocument(); 
            htmlDocument.LoadHtml(html1); 
            var html = htmlDocument.DocumentNode;

var title = html.CssSelect("title"); 
            foreach (var htmlNode in title) 
            { 
                Console.WriteLine(htmlNode.InnerHtml); 
            } 
            var divs = html.CssSelect("div.postBody");

foreach (var htmlNode in divs) 
            { 
                Console.WriteLine(htmlNode.InnerHtml); 
            }

divs = html.CssSelect("#cnblogs_post_body"); 
            foreach (var htmlNode in divs) 
            { 
                Console.WriteLine(htmlNode.InnerHtml); 
            } 
        } 
    } 
}

转载于:https://www.cnblogs.com/wangchuang/p/3566452.html

HTML Agility Pack 搭配 ScrapySharp,彻底解除Html解析的痛苦相关推荐

  1. Html Agility Pack基础类介绍及运用

    Html Agility Pack 源码中的类大概有28个左右,其实不算一个很复杂的类库,但它的功能确不弱,为解析DOM已经提供了足够强大的功能支持,可以跟jQuery操作DOM媲美:) 基础类和基础 ...

  2. WP8 中使用HTML Agility Pack与友盟分享SDK遇到的 System.Xml.XPath加载问题

    今晚在尝试使用友盟最新的社交分享SDK时,按照官方Demo,并未做多少多少改动,就是去除了对微信.脸书和推特的分享.然后运行之后就一直报错 : {System.IO.FileLoadException ...

  3. C# 网络爬虫利器之Html Agility Pack如何快速实现解析Html

    简介 现在越来越多的场景需要我们使用网络爬虫,抓取相关数据便于我们使用,今天我们要讲的主角Html Agility Pack是在爬取的过程当中,能够高效的解析我们抓取到的html数据. 优势 在.NE ...

  4. 爬虫技术 -- 进阶学习(十)网易新闻页面信息抓取(htmlagilitypack搭配scrapysharp)...

    最近在弄网页爬虫这方面的,上网看到关于htmlagilitypack搭配scrapysharp的文章,于是决定试一试~ 于是到https://www.nuget.org/packages/Scrapy ...

  5. 网易新闻页面信息抓取(htmlagilitypack搭配scrapysharp)

    转自原文 网易新闻页面信息抓取(htmlagilitypack搭配scrapysharp) 最近在弄网页爬虫这方面的,上网看到关于htmlagilitypack搭配scrapysharp的文章,于是决 ...

  6. 网易新闻页面信息抓取 -- htmlagilitypack搭配scrapysharp

    网易新闻页面信息抓取 -- htmlagilitypack搭配scrapysharp 最近在弄网页爬虫这方面的,上网看到关于htmlagilitypack搭配scrapysharp的文章,于是决定试一 ...

  7. 【转】Html Agility Pack ── 一个分析HTML的工具

    标签:开源 .NET 框架类库本身没有提供工具分析HTML,以前常用的做法是用正则表达式,或者浏览器控件,或者MSHTML组件,甚至SgmlReader.SgmlReader可以将HTML转化成XML ...

  8. 收集经常使用的.net开源项目

    Json.NET http://json.codeplex.com/ Json.Net是一个读写Json效率比較高的.Net框架.Json.Net 使得在.Net环境下使用Json更加简单.通过Lin ...

  9. 收集一些优秀的DoNet开源项目

    Paste_Image.png Json.NET http://json.codeplex.com/ Json.Net是一个读写Json效率比较高的.Net框架.Json.Net 使得在.Net环境下 ...

  10. .net开源框架开源类库(整理)

    常用库 Json.NET https://github.com/JamesNK/Newtonsoft.Json Json.Net 是一个读写Json效率比较高的.Net框架.Json.Net 使得在. ...

最新文章

  1. Quartz-Java Web项目中使用Quartz
  2. Cookie、Session、Token、JWT分别是什么(三)
  3. html未填写提示,文本框输入信息,未输入的文本框会提示输入,并且未输入的文本框会变红...
  4. 本人复习总结全部资料及其简历供大家參考
  5. 【离散数学】单向连通和弱连通的区别
  6. php中读取文件内容的几种方法。(file_get_contents:将文件内容读入一个字符串)...
  7. SVN安装后bin中没有svn.exe,TortoiseSVN安装后bin目录中没有svn.exe;
  8. JVM HotSpot 可达性分析算法实现细节
  9. vue 默认加载某一子路由
  10. Java实现上传图片到阿里云对象存储OSS
  11. 前端工程师 - 面试题 (最新,最全)
  12. 人工智能产业2021年的五大趋势
  13. 一、ShardingSphere简介(来自官方文档)
  14. 2021-06-04 微信小程序构建mpn
  15. 李炎恢jquery学习笔记
  16. Python ctypes模块
  17. Python案例1—人民币与美元的汇率兑换V_4.0
  18. 2023年的一些规划和想法
  19. tomcat 优化解决方案
  20. web.xm配置详解

热门文章

  1. 实时操作系统与非实时操作系统的区别
  2. python项目小案例:一个网页响应超时提醒小闹钟
  3. 利用nginx+lua+redis实现反向代理方法教程
  4. Django入门10--admin增强
  5. Intellij Idea 创建maven WebAPP项目
  6. 电商实例、业务并发、网站并发及解决方法
  7. 国内maven镜像,快的飞起
  8. android:layout_height、android:layout_width、android:height、android:width的关系与区别
  9. XML案例(简单的考生成绩管理系统)
  10. Linux系统 nginx伪静态配置及nginx重启