用robots.txt限制搜索引擎抓取

WordPress站点默认在浏览器中输入:http://你的域名/robots.txt,会显示如下内容:
User-agent:*
Disallow:/wp-admin/
Disallow:/wp-includes/
这是由WordPress自动生成的,意思是告诉搜索引擎不要抓取后台程序文件。
但这是远远不够的,比较完整的WordPress站点robots.txt文件内容如下:
User-agent:*
Disallow:/wp-admin/
Disallow:/wp-content/
Disallow:/wp-includes/
Disallow:/*/comment-page-*
Disallow:/*?replytocom=*
Disallow:/category/*/page/
Disallow:/tag/*/page/
Disallow:/*/trackback
Disallow:/feed
Disallow:/*/feed
Disallow:/comments/feed
Disallow:/?s=*
Disallow:/*/?s=*\
Disallow:/attachment/
使用方法:新建一个名称为robots.txt文本文件,将上面的内容放进去,然后上传到网站根目录即可。

 

分别解释一下各项的作用:

1、Disallow: /wp-admin/、Disallow: /wp-content/和Disallow: /wp-includes/
用于告诉搜索引擎不要抓取后台程序文件页面。
2、Disallow: /*/comment-page-*和Disallow: /*?replytocom=*
禁止搜索引擎抓取评论分页等相关链接。
3、Disallow: /category/*/page/和Disallow: /tag/*/page/
禁止搜索引擎抓取收录分类和标签的分页。
4、Disallow: /*/trackback
禁止搜索引擎抓取收录trackback等垃圾信息
5、Disallow: /feed、Disallow: /*/feed和Disallow: /comments/feed
禁止搜索引擎抓取收录feed链接,feed只用于订阅本站,与搜索引擎无关。
6、Disallow: /?s=*和Disallow: /*/?s=*\
禁止搜索引擎抓取站内搜索结果
7、Disallow: /attachment/
禁止搜索引擎抓取附件页面,比如毫无意义的图片附件页面。

建站技巧

cPanel禁止目录浏览的方法 目录禁止索引

2015-4-9 13:41:51

建站技巧

11个常用PHP程序CMS在Nginx环境伪静态脚本应用规则整理

2015-4-15 5:17:48

个人中心
今日签到
有新私信 私信列表
搜索