在你的主页中为Web robot设计路标_网络服务器

在你的主页中为Web robot设计路标

发表于：2007-05-25来源：作者：点击数：标签：

Internet越来越酷，WWW的知名度如日中天。在Internet上发布公司信息、进行电子商务已经从时髦演化成时尚。作为一个WebMaster，你可能对HTML、 Java script、Java、ActiveX了如指掌，但你是否知道什么是Webrobot？你是否知道Webrobot和你所设计的主页有什么关

　　Internet越来越酷，WWW的知名度如日中天。在Internet上发布公司信息、进行电子商务已经从时髦演化成时尚。作为一个Web Master，你可能对HTML、Javascript、Java、 ActiveX了如指掌，但你是否知道什么是Web robot？你是否知道Web robot和你所设计的主页有什么关系？

　　Internet上的流浪汉--- Web robot

　　有时你会莫名其妙地发现你的主页的内容在一个搜索引擎中被索引，即使你从未与他们有过任何联系。其实这正是Web robot的功劳。Web robot其实是一些程序，它可以穿越大量Internet网址的超文本结构，递归地检索网络站点所有的内容。这些程序有时被叫 “蜘蛛（Spider）” ， “网上流浪汉（Web Wanderer）”，“网络蠕虫（web worms）”或Web crawler。一些Internet网上知名的搜索引擎站点（Search Engines）都有专门的Web robot程序来完成信息的采集，例如Lycos，Webcrawler，Altavista等，以及中文搜索引擎站点例如北极星，网易，GOYOYO等。

　　Web robot就象一个不速之客，不管你是否在意，它都会忠于自己主人的职责，任劳任怨、不知疲倦地奔波于万维网的空间，当然也会光临你的主页，检索主页内容并生成它所需要的记录格式。或许有的主页内容你乐于世人皆知，但有的内容你却不愿被洞察、索引。难道你就只能任其“横行”于自己主页空间，能否指挥和控制Web robot的行踪呢？答案当然是肯定的。只要你阅读了本篇的下文，就可以象一个交通警察一样，布置下一个个路标，告诉Web robot应该怎么去检索你的主页，哪些可以检索，哪些不可以访问。

　　其实Web robot能听懂你的话

　　不要以为Web robot是毫无组织，毫无管束地乱跑。很多Web robot软件给网络站点的管理员或网页内容制作者提供了两种方法来限制Web robot的行踪：

　　1、Robots Exclusion Protocol 协议

　　网络站点的管理员可以在站点上建立一个专门格式的文件，来指出站点上的哪一部分可以被robot访问, 这个文件放在站点的根目录下，即http://.../robots.txt.

　　2、Robots META tag

　　一个网页作者可以使用专门的HTML META tag ，来指出某一个网页是否可以被索引、分析或链接。

　　这些方法适合于大多数的Web robot，至于是否在软件中实施了这些方法，还依赖于 robot的开发者，并非可以保证对任何robot都灵验。如果你迫切需要保护自己内容，则应考虑采用诸如增加密码等其他保护方法。

　　使用Robots Exclusion Protocol协议

　　当robot访问一个 Web 站点时，比如http://www.sti.net.cn/，它先去检查文件http://www.sti.net.cn/robots.txt。如果这个文件存在，它便会按照这样的记录格式去分析：

　　User-agent: *
　　Disallow: /cgi-bin/
　　Disallow: /tmp/
　　Disallow: /~joe/

　　以确定它是否应该检索站点的文件。这些记录是专门给Web robot看的，一般的浏览者大概永远不会看到这个文件，所以千万不要异想天开地在里面加入形似<img src=*> 类的HTML语句或是“How do you do? where are you from?”之类假情假意的问候语。

　　在一个站点上只能有一个 "/robots.txt" 文件，而且文件名的每个字母要求全部是小写。在robot的记录格式中每一个单独的"Disallow"行表示你不希望robot访问的URL，每个URL必须单独占一行，不能出现 "Disallow: /cgi-bin/ /tmp/"这样的病句。同时在一个记录中不能出现空行，这是因为空行是多个记录分割的标志。

　　User-agent行指出的是robot或其他代理的名称。在User-agent行，'*' 表示一个特殊的含义---所有的robot。

　　下面是几个robot.txt的例子：

　　在整个服务器上拒绝所有的robots：
　　User-agent: *
　　Disallow: /

　　允许所有的robots访问整个站点：
　　User-agent: *
　　Disallow:
　　或者产生一个空的 "/robots.txt" 文件。

　　服务器的部分内容允许所有的robot访问
　　User-agent: *
　　Disallow: /cgi-bin/
　　Disallow: /tmp/
　　Disallow: /private/

　　拒绝某一个专门的robot：
　　User-agent: BadBot
　　Disallow: /

　　只允许某一个robot光顾：
　　User-agent: WebCrawler
　　Disallow:
　　User-agent: *
　　Disallow: /
　　

　　最后我们给出 http://www.w3.org/站点上的robots.txt：
　　# For use by search.w3.org
　　User-agent: W3Crobot/1
　　Disallow:
　　User-agent: *
　　Disallow: /Member/ # This is restricted to W3C Members only
　　Disallow: /member/ # This is restricted to W3C Members only
　　Disallow: /team/ # This is restricted to W3C Team only
　　Disallow: /TandS/Member # This is restricted to W3C Members only
　　Disallow: /TandS/Team # This is restricted to W3C Team only
　　Disallow: /Project
　　Disallow: /Systems
　　Disallow: /Web
　　Disallow: /Team
　　

　　使用Robots META tag方式

　　Robots META tag 允许HTML网页作者指出某一页是否可以被索引，或是否可以用来查找更多的链接文件。目前只有部分robot实施了这一功能。

　　Robots META tag的格式为：
　　<META NAME="ROBOTS" CONTENT="NOINDEX, NOFOLLOW">
　　象其他的META tag一样，它应该放在HTML文件的HEAD区：
　　<html>
　　<head>
　　<meta name="robots" content="noindex,nofollow">
　　<meta name="description" content="This page ....">
　　<title>...</title>
　　</head>
　　<body>
　　...

　　Robots META tag指令使用逗号隔开，可以使用的指令包括 [NO]INDEX 和[NO]FOLLOW。INDEX 指令指出一个索引性robot是否可以对本页进行索引；FOLLOW 指令指出robot是否可以跟踪本页的链接。缺省的情况是INDEX和FOLLOW。例如：
　　<meta name="robots" content="index,follow">
　　<meta name="robots" content="noindex,follow">
　　<meta name="robots" content="index,nofollow">
　　<meta name="robots" content="noindex,nofollow">

　　一个好的Web 站点管理员应该将robot的管理考虑在内，使robot为自己的主页服务，同时又不损害自己网页的安全

郝君回复于：2003-08-19 02:27:01

血

Konye 回复于：2003-12-07 15:17:40

您能教我怎么用DARWIN701上网吗?我刚安装了这个系统.好像不能上网呀.

原文转自：http://www.ltesting.net

相关文章

解密阿里云之飞天平台内核

解析Google集群资源管理系统Omega

kvm 虚拟机的详细说明

好的系统管理员应该是个瞎子

查看IIS中应用程序池相对应的网站

Apache设置web 缓存

周排行

月排行

下载

全网最详细的接口测试实战

先测试再开发？TDD测试驱动

自动化测试架构

软件测试架构师的知识能力

大数据平台测试方法

用不同的测试模型来构建测

当软件测试遇上ChatGPT：软件

全网最详细的接口测试实战

先测试再开发？TDD测试驱动

自动化测试架构

软件测试架构师的知识能力

大数据平台测试方法

用不同的测试模型来构建测

当软件测试遇上ChatGPT：软件

MBT基于模型的测试介绍资料

iso29119相关介绍性资料

HP QTP 10 中文版官方中文补丁

HP QTP 10 英文版下载地址

HP ALM 11 官方中文版下载地址

Quality Center 9.0中文版下载地

HttpWatch Basic Edition Version 7.

WIN2003+ORACLE11G+QC11(ALM11) 安装

WIN2003+SQL2005(SP3)+QC11(ALM11) 安

软件测试沙龙 More>>

新浪微博 More>>

热门标签

功能测试

性能测试

安全测试

本地化测试

游戏测试

web测试

单元测试

敏捷测试

测试用例

测试模版

测试管理

测试工具

《测试团队的招聘与管理

《我们应该如何构建我们

软件测试 > 测试开发技术 > 软件测试环境搭建 > 网络服务器 >

在你的主页中为Web robot设计路标