当前位置: 首页 > 图文教程 > 网站运营 > 网站优化 > 基础教程 搜索引擎优化基础之爬虫程序篇

网站优化
SEO 搜索引擎收录页面流程原理和方式
SEO 分析某关键词的竞争强度的方法
新手站长找外部链接和简单网站推广方法
SEO实例经验分享 搜索引擎分词和长尾
DEDECMS 网站优化4则细节
Google 处理采集数据的一些分析
SEO不容易 开始给SEO吹冷风
Tags 标签优化细节问题
选择关键词的心得和思路
site 域名首页是在第一四种原因
网站找好链接的6种方法
三天优化到百度第一等类似信息纯属骗人
SEO实验 不要过于相信搜索引擎内部人的话
让排名在百度更稳定
百度 反垃圾网站的若干问答
搜索引擎重复网页发现技术分析
站内链接对蜘蛛收录的负面影响以及对策
免费网站推广诀窍 多干体力活儿
SEO 准确的进行关键词的选取
SEO 更新网站内容时注意的链接策略

网站优化 中的 基础教程 搜索引擎优化基础之爬虫程序篇


出处:互联网   整理: 软晨网(RuanChen.com)   发布: 2009-10-17   浏览: 51 ::
收藏到网摘: n/a

《网络营销教程—SEO 》,软晨学习网()独家在线发布。

如有转载或作他用,敬请联系该书权益人张栋伟。

 

《网络营销教程—SEO 》 软晨学习网

一、什么是搜索引擎爬虫程序

网络爬虫(又被称为网页蜘蛛,网络机器人,更经常的称为网页追逐者),是一种按照一定的规则,自动的抓取万维网信息的程序或者脚本。另外一些不常使用的名字还有蚂蚁,自动索引,模拟程序或者蠕虫。

这些处理被称为网络抓取或者蜘蛛爬行。很多站点,尤其是搜索引擎,都使用爬虫提供最新的数据,它主要用于提供它访问过页面的一个副本,然后,搜索引擎就可以对得到的页面进行索引,以提供快速的访问。蜘蛛也可以在web上用来自动执行一些任务,例如检查链接,确认html代码;也可以用来抓取网页上某种特定类型信息,例如抓取电子邮件地址(通常用于垃圾邮件)。

一个网络蜘蛛就是一种机器人,或者软件代理。大体上,它从一组要访问的URL链接开始,可以称这些URL为种子。爬虫访问这些链接,它辨认出这些页面的所有超链接,然后添加到这个URL列表,可以称作检索前沿。这些URL按照一定的策略反复访问。

二、爬虫程序的种类以及分辨

搜索引擎派出他们的爬虫程序去访问、索引网站内容,但是由于搜索引擎派爬虫程序来访会在一定程度上影响网站性能。在你的服务器日志文件中,可见每次访问的路径和相应的 IP 地址,如果是爬虫程序来访, 则user-agent 会显示 Googlebot 或MSNBot 等搜索引擎爬虫程序名称,每个搜索引擎都有自己的user-agent。

三、国内主要的爬虫程序

百度 baidu.com—-Baiduspider

http://www.baidu.com/search/spider.htm

谷歌 google.com—-Googlebot

http://www.google.com/bot.html

雅虎 yahoo.com—-Yahoo

http://misc.yahoo.com.cn/help.html

有道 yodao.com—-YodaoBot

http://www.yodao.com/help/webmaster/spider/

搜搜 soso.com—-Sosospider/Sosoimagespider

http://help.soso.com/webspider.htm

http://help.soso.com/soso-image-spider.htm

搜狗 sogou.com—-sogou

http://www.sogou.com/docs/help/webmasters.htm

微软 msn.com—-msnbot

http://search.msn.com/msnbot.htm