当前位置: 首页 > 图文教程 > 网站运营 > 网站优化 > 有道关于robots.txt的解释

网站优化
SEO试验:谷歌喜欢专业网站,百度喜欢娱乐网站
优化网站:让网站访问速度更快的方法
SEO教程:搜索引擎确定重复内容的原理
淘宝网店宝贝信息排名优化的技巧
SEO教程:Baiduspider常见问题解答
网站优化教程:网站链接的时间长短问题
SEO教程:搜索引擎收录网站的一些秘密
SEO专家:回答关于搜索引擎优化指标的4个问题
webjx推荐五款基于火狐(FireFox)的SEO插件
SEO经验总结:做SEO积累的8个实用经验
SEO教程:增加网站反向链接提高PR值的要点
SEO技巧:做好网站交叉链接的注意事项
揭秘24小时SEO优化关键词上百度首页第一
网站更新的24小时首页快照的5点方法
SEO教程:Http请求状态码和SEO的关系
SEO技巧:找到优质外部链接的13个方法
title,keywords,description标签
Google将发生最重大的改版 谷歌新主页截图泄露
谷歌公司连自己的网站的SEO都搞不清楚
Google本身产品的内部SEO报告文档

网站优化 中的 有道关于robots.txt的解释


出处:互联网   整理: 软晨网(RuanChen.com)   发布: 2009-09-26   浏览: 38 ::
收藏到网摘: n/a

怎么写robots.txt文件?
robots.txt是个很简单的文本文件,您只要标明“谁不能访问哪些链接”即可。
在文件的第一行写:
User-Agent: YodaoBot
这就告诉了爬虫下面的描述是针对名叫YodaoBot的爬虫。您还可以写:
User-Agent: *
这就意味着向所有的爬虫开放。需要注意的是一个robots.txt文件里只能有一个"User-Agent: *"。

接下来是不希望被访问的链接前缀。例如:
Disallow: /private
这就告诉爬虫不要抓取以"/private"开头的所有链接。包括/private.html,/private/some.html,/private/some/haha.html。如果您写成:
Disallow: /
则表明整个站点都不希望被访问。您也可以分多行来指定不希望被抓取的链接前缀,例如:
Disallow: /tmp
Disallow: /disallow
那么所有以"/tmp"和"/disallow"开头的链接都不会被访问了。

最后形成的robots.txt文件如下:
User-Agent: YodaoBot
Disallow: /tmp
Disallow: /private

请注意,如果您的robots.txt文件里有中文等非英语字符,请确定该文件是由UTF-8编码编写。