网络爬虫技术(新)(共5页).doc
《网络爬虫技术(新)(共5页).doc》由会员分享,可在线阅读,更多相关《网络爬虫技术(新)(共5页).doc(5页珍藏版)》请在淘文阁 - 分享文档赚钱的网站上搜索。
1、精选优质文档-倾情为你奉上网络爬虫技术网络机器人1.概念:它们是Web上独自运行的软件程序,它们不断地筛选数据,做出自己的 决定,能够使用Web获取文本或者进行搜索查询,按部就班地完成各自的任务。2.分类:购物机器人、聊天机器人、搜索机器人(网络爬虫)等。搜索引擎1.概念:从网络上获得网站网页资料,能够建立数据库并提供查询的系统。2.分类(按工作原理):全文搜索引擎、分类目录。 1 全文搜索引擎数据库是依靠网络爬虫通过网络上的各种链接自动获取大量网页信息内容,并按一定的规则分析整理形成的。(百度、Google) 2 分类目录:按目录分类的网站链接列表而已,通过人工的方式收集整理网站资料形成的数
2、据库。(国内的搜狐)网络爬虫1.概念:网络爬虫也叫网络蜘蛛,它是一个按照一定的规则自动提取网页程序,其会自动的通过网络抓取互联网上的网页,这种技术一般可能用来检查你的站点上所有的链接是否是都是有效的。当然,更为高级的技术是把网页中的相关数据保存下来,可以成为搜索引擎。搜索引擎使用网络爬虫寻找网络内容,网络上的HTML文档使用超链接连接了起来,就像织成了一张网,网络爬虫也叫网络蜘蛛,顺着这张网爬行,每到一个网页就用抓取程序将这个网页抓下来,将内容抽取出来,同时抽取超链接,作为进一步爬行的线索。网络爬虫总是要从某个起点开始爬,这个起点叫做种子,你可以告诉它,也可以到一些网址列表网站上获取。2.区别
3、:网络爬虫分类通用爬虫聚集爬虫工作原理从一个或多个初始网页的URL开始,获取初始网页的URL,抓取网页的同时,从当前网页提取相关的URL放入队列中,直到满足程序的停止条件。根据一定的网页分析算法过滤与主题无关的链接,保留有用的链接(爬行的范围是受控的)放到待抓取的队列中,通过一定的搜索策略从队列中选择下一步要抓取的URL,重复以上步骤,直到满足程序的停止条件。不同点1. 增加了一些网页分析算法和网页搜索策略2. 对被爬虫抓取的网页将会被系统存贮,进行一定的分析、过滤,并建立索引,以便之后的查询和检索,这一过程所得到的分析结果还可能对以后的抓取过程给出反馈和指导。缺点1. 不同领域、不同背景的用
4、户有不同的检索目的和需求,通用搜索引擎所返回的结果包含大量用户不关心的网页。2. 通用引擎的目标是大的网络覆盖率。3. 只支持关键字搜索,不支持根据语义的搜索。4. 通用搜索引擎对一些像图片、音频等信息含量密集且具有一定结构的数据无法获取。1. 对抓取目标的描述或定义。2. 对网页和数据的分析和过滤。3. 对URL的搜索策略。以上三个是需要解决的问题。算法广度优先算法现有聚焦爬虫对抓取目标的描述可分为基于目标网页特征、基于目标数据模式和基于领域概念3种。 基于目标网页特征的爬虫所抓取、存储并索引的对象一般为网站或网页。根据种子样本获取方式可分为: (1)预先给定的初始抓取种子样本; (2)预先
5、给定的网页分类目录和与分类目录对应的种子样本,如Yahoo!分类结构等; (3)通过用户行为确定的抓取目标样例,分为:a) 用户浏览过程中显示标注的抓取样本; b) 通过用户日志挖掘得到访问模式及相关样本。 其中,网页特征可以是网页的内容特征,也可以是网页的链接结构特征,等等。3.算法/策略名称网页分析算法网页搜索策略分类1基于网络拓扑结构1网页粒度分析算法2网站粒度分析算法3网页块粒度分析算法2基于网页内容 1针对以文本和超链接为主的网页 2针对从结构化的数据源动态生成的网页。 3针对数据介于第一类和第二类之间3基于用户访问行为1深度优先策略2广度优先策略3最佳优先策略一些算法的介绍1 网页
6、分析算法1.1 基于网络拓扑的分析算法 基于网页之间的链接,通过已知的网页或数据,来对与其有直接或间接链接关系的对象(可以是网页或网站等)作出评价的算法。又分为网页粒度、网站粒度和网页块粒度这三种。1.1.1 网页(Webpage)粒度的分析算法 PageRank和HITS算法是最常见的链接分析算法,两者都是通过对网页间链接度的递归和规范化计算,得到每个网页的重要度评价。PageRank算法虽然考虑了用户访问行为的随机性和Sink网页的存在,但忽略了绝大多数用户访问时带有目的性,即网页和链接与查询主题的相关性。针对这个问题,HITS算法提出了两个关键的概念:权威型网页(authority)和中
7、心型网页(hub)。 基于链接的抓取的问题是相关页面主题团之间的隧道现象,即很多在抓取路径上偏离主题的网页也指向目标网页,局部评价策略中断了在当前路径上的抓取行为。文献21提出了一种基于反向链接(BackLink)的分层式上下文模型(Context Model),用于描述指向目标网页一定物理跳数半径内的网页拓扑图的中心Layer0为目标网页,将网页依据指向目标网页的物理跳数进行层次划分,从外层网页指向内层网页的链接称为反向链接。 1.1.2 网站粒度的分析算法 网站粒度的资源发现和管理策略也比网页粒度的更简单有效。网站粒度的爬虫抓取的关键之处在于站点的划分和站点等级(SiteRank)的计算。
- 配套讲稿:
如PPT文件的首页显示word图标,表示该PPT已包含配套word讲稿。双击word图标可打开word文档。
- 特殊限制:
部分文档作品中含有的国旗、国徽等图片,仅作为作品整体效果示例展示,禁止商用。设计者仅对作品中独创性部分享有著作权。
- 关 键 词:
- 网络 爬虫 技术
限制150内