当前位置: 首页 > 图文教程 > 网站运营 > 网站优化 > 基础教程 搜索引擎优化基础之爬虫程序篇

网站优化
驳“AJAX 的七宗罪”
AJAX的七宗罪
网站设计必须知道的65条原则
网页设计中文字颜色的搭配技巧
学习Web 2.0的方向盘
制作主页的“五十”大秘诀
WEB设计经验
创建优秀网页的6个好习惯
初次体验.NET Ajax无刷新技术
RSS利于发布什么样的内容
ASP开发10条经验总结
架构企业Blog之7大贴士
博客、网志和用户空间
走出路径的困惑
竭尽全力为设计师服务
百度的38个我预示互联网2.0的崛起
从网页到网络平台
以Flash为核心
QA老师辛苦建站为哪般
百度排名NO.1是怎样SEO成功的

网站优化 中的 基础教程 搜索引擎优化基础之爬虫程序篇


出处:互联网   整理: 软晨网(RuanChen.com)   发布: 2009-10-17   浏览: 98 ::
收藏到网摘: n/a

《网络营销教程—SEO 》,软晨学习网()独家在线发布。

如有转载或作他用,敬请联系该书权益人张栋伟。

 

《网络营销教程—SEO 》 软晨学习网

一、什么是搜索引擎爬虫程序

网络爬虫(又被称为网页蜘蛛,网络机器人,更经常的称为网页追逐者),是一种按照一定的规则,自动的抓取万维网信息的程序或者脚本。另外一些不常使用的名字还有蚂蚁,自动索引,模拟程序或者蠕虫。

这些处理被称为网络抓取或者蜘蛛爬行。很多站点,尤其是搜索引擎,都使用爬虫提供最新的数据,它主要用于提供它访问过页面的一个副本,然后,搜索引擎就可以对得到的页面进行索引,以提供快速的访问。蜘蛛也可以在web上用来自动执行一些任务,例如检查链接,确认html代码;也可以用来抓取网页上某种特定类型信息,例如抓取电子邮件地址(通常用于垃圾邮件)。

一个网络蜘蛛就是一种机器人,或者软件代理。大体上,它从一组要访问的URL链接开始,可以称这些URL为种子。爬虫访问这些链接,它辨认出这些页面的所有超链接,然后添加到这个URL列表,可以称作检索前沿。这些URL按照一定的策略反复访问。

二、爬虫程序的种类以及分辨

搜索引擎派出他们的爬虫程序去访问、索引网站内容,但是由于搜索引擎派爬虫程序来访会在一定程度上影响网站性能。在你的服务器日志文件中,可见每次访问的路径和相应的 IP 地址,如果是爬虫程序来访, 则user-agent 会显示 Googlebot 或MSNBot 等搜索引擎爬虫程序名称,每个搜索引擎都有自己的user-agent。

三、国内主要的爬虫程序

百度 baidu.com—-Baiduspider

http://www.baidu.com/search/spider.htm

谷歌 google.com—-Googlebot

http://www.google.com/bot.html

雅虎 yahoo.com—-Yahoo

http://misc.yahoo.com.cn/help.html

有道 yodao.com—-YodaoBot

http://www.yodao.com/help/webmaster/spider/

搜搜 soso.com—-Sosospider/Sosoimagespider

http://help.soso.com/webspider.htm

http://help.soso.com/soso-image-spider.htm

搜狗 sogou.com—-sogou

http://www.sogou.com/docs/help/webmasters.htm

微软 msn.com—-msnbot

http://search.msn.com/msnbot.htm