当前位置: 首页 > 图文教程 > 网站运营 > 网站优化 > 基础教程 搜索引擎优化基础之爬虫程序篇

网站优化
搜索引擎优化基础教程 如何提交你的网站
影响网站在百度中排名的六个方面
谷歌网站管理员 以平常的心看待导出链接
搜索引擎也是用户 优化要杜绝的九个方面
释疑排在搜索引擎的第一名 研读百度圣经
基础教程 外部链接优化操作的概念与分析
什么是黑帽子优化 六个常用链接作弊伎俩
和搜索引擎正在一起 去建立高质量的链接
外部链接优化 提交到DMOZ以及链接诱饵
搜索引擎优化基础知识自测试题 附带答案
资料:19条让Google搜索更有效的技巧
百度对垃圾站处理的根源与影响分析
网站吸引百度收录的三种最有效的方法
学习竞争对手的办法 进行搜索引擎的优化
图片站要想流量高 首先优化网站页面结构
药方:网站被搜索引擎处理掉的十二个原因
从技术到思路 网站内部链接进阶优化操作
八个阶段 搜索引擎优化工作的周期性安排
提高内页权重 把内页当成首页来进行优化
扔掉优化不靠百度 轻松地增加一倍的流量

网站优化 中的 基础教程 搜索引擎优化基础之爬虫程序篇


出处:互联网   整理: 软晨网(RuanChen.com)   发布: 2009-10-17   浏览: 47 ::
收藏到网摘: n/a

《网络营销教程—SEO 》,软晨学习网()独家在线发布。

如有转载或作他用,敬请联系该书权益人张栋伟。

 

《网络营销教程—SEO 》 软晨学习网

一、什么是搜索引擎爬虫程序

网络爬虫(又被称为网页蜘蛛,网络机器人,更经常的称为网页追逐者),是一种按照一定的规则,自动的抓取万维网信息的程序或者脚本。另外一些不常使用的名字还有蚂蚁,自动索引,模拟程序或者蠕虫。

这些处理被称为网络抓取或者蜘蛛爬行。很多站点,尤其是搜索引擎,都使用爬虫提供最新的数据,它主要用于提供它访问过页面的一个副本,然后,搜索引擎就可以对得到的页面进行索引,以提供快速的访问。蜘蛛也可以在web上用来自动执行一些任务,例如检查链接,确认html代码;也可以用来抓取网页上某种特定类型信息,例如抓取电子邮件地址(通常用于垃圾邮件)。

一个网络蜘蛛就是一种机器人,或者软件代理。大体上,它从一组要访问的URL链接开始,可以称这些URL为种子。爬虫访问这些链接,它辨认出这些页面的所有超链接,然后添加到这个URL列表,可以称作检索前沿。这些URL按照一定的策略反复访问。

二、爬虫程序的种类以及分辨

搜索引擎派出他们的爬虫程序去访问、索引网站内容,但是由于搜索引擎派爬虫程序来访会在一定程度上影响网站性能。在你的服务器日志文件中,可见每次访问的路径和相应的 IP 地址,如果是爬虫程序来访, 则user-agent 会显示 Googlebot 或MSNBot 等搜索引擎爬虫程序名称,每个搜索引擎都有自己的user-agent。

三、国内主要的爬虫程序

百度 baidu.com—-Baiduspider

http://www.baidu.com/search/spider.htm

谷歌 google.com—-Googlebot

http://www.google.com/bot.html

雅虎 yahoo.com—-Yahoo

http://misc.yahoo.com.cn/help.html

有道 yodao.com—-YodaoBot

http://www.yodao.com/help/webmaster/spider/

搜搜 soso.com—-Sosospider/Sosoimagespider

http://help.soso.com/webspider.htm

http://help.soso.com/soso-image-spider.htm

搜狗 sogou.com—-sogou

http://www.sogou.com/docs/help/webmasters.htm

微软 msn.com—-msnbot

http://search.msn.com/msnbot.htm