我想屏蔽我以前网站的那一些旧时光的链接,robot.txt如何改写?

我想屏蔽我以前网站的一些旧的链接,robot.txt如何改写?_百度知道网站目录robotx.txt如何设置只允许搜索引擎蜘蛛访问_百度知道只需一步,快速开始
查看: 1095|回复: 20
在线时间 小时
签到天数: 145 天连续签到: 1 天[LV.7]总监
马上注册,结交更多好友,享用更多功能,让你轻松玩转社区。
才可以下载或查看,没有帐号?
/.....5123.html
我经常在IIS日志中看到这种类似的页面 可是我网站根本没有这链接 也不知道这页面怎么出现的
请问这种页面怎么屏蔽啊 这是在我网站根目录下的 下一级还有很多页面呢 怎么做到只屏蔽这种页面 其他那些可以被正常收录
a. 回帖是一种美德,也是对楼主发帖的尊重和支持;
&&&&如果通过本帖信息与他人联系,请说明来自推一把论坛!推一把微信公众号:tui18com
b. 请不要发表违反中华人民共和国法律的内容。本站所有帖子属会员个人意见,与本站立场无关.
&&&&帖子内容版权归属作者所有,如是转贴版权归属原作者所有,其他单位或个人在使用或转载帖子&&&&内容时须征得帖子作者的同意或注明内容原出处。
, , , , , , , , , , , , , , , , , , , , , ,
在线时间 小时
签到天数: 136 天连续签到: 1 天[LV.7]总监
听技术说是别人用机器刷的 也不知道谁吃饱了没事刷这种页面给我
在线时间 小时
签到天数: 50 天连续签到: 0 天[LV.5]主管
User-agent: *
Disallow: /.....5123.html
在线时间 小时
签到天数: 136 天连续签到: 1 天[LV.7]总监
类似的页面 不是这一个 还有很多 这个数字是随机的
阅读权限200
在线时间 小时
签到天数: 171 天连续签到: 1 天[LV.7]总监
你IIS服务器上面没的页面&&不关你的事情!!你屏蔽干嘛!!???你怎么屏蔽??
在线时间 小时
签到天数: 145 天连续签到: 1 天[LV.7]总监
可是他爬来爬去的 老是404肯定对网站有影响的吧
阅读权限200
在线时间 小时
签到天数: 253 天连续签到: 1 天[LV.8]总经理
这个可能是刷的哦
在线时间 小时
签到天数: 50 天连续签到: 0 天[LV.5]主管
User-agent: *
Disallow: /^[0-9]*$.html
这个是所有根目录下形式如:/.....5123.html 的页面
阅读权限70
在线时间 小时
签到天数: 23 天连续签到: 0 天[LV.4]组长
3楼的办法可以,在robots.txt里面加上那个屏蔽的代码。
在线时间 小时
该用户从未签到
提示: 作者被禁止或删除 内容自动屏蔽
推一把微信公众号:tui18com||京公网安备
论坛事务(9:30-17:00):
|广告合作(9:30-17:00):
承载数据运行(|)我的站点是一个b2b网站,有很多企业产品照片,网站上线一个月,每天日志上都有大量304,几乎全是图片,可以一次性把图片目录屏蔽了吗?
还有就是有说可以通过设置缓存解决?如何设置,谢谢!
  一、什么是robots.txt  笔者引用百度站长工具中后段话来解释。搜索引擎使用spider程序自动访问互联网上的网页并获取网页信息。spider在访问一个网站时,会首先会检查该网站的根域下是否有一个叫做 robots.txt的纯文本文件,这个文件用于指定spider在您网站上的抓取范围。您可以在您的网站中创建一个robots.txt,在文件中声明 该网站中不想被搜索引擎收录的部分或者指定搜索引擎只收录特定的部分。 二、robots.txt文件对网站有什么好处  1、快速增加网站权重和访问量;  2、禁止某些文件被搜索引擎索引,可以节省服务器带宽和网站访问速度;  3、为搜索引擎提供一个简洁明了的索引环境  三、哪些网站的目录需要使用robots.txt文件禁止抓取  1)、图片目录  图片是构成网站的主要组成元素。随着现在建站越来越方便,大量CMS的出现,真正做到了会打字就会建网站,而正是因为如此方便,网上出现了大量的同质化模板网站,被反复使用,这样的网站搜索引擎是肯定不喜欢的,就算是你的网站被收录了,那你的效果也是很差的。如果你非要用这种网站的话,建议你应该在robots.txt文件中进行屏蔽,通常的网站图片目录是:imags 或者  2)、网站模板目录  如上面 图片目录 中所说,CMS的强大和灵活,也导致了很多同质化的网站模板的出现和滥用,高度的重复性模板在搜索引擎中形成了一种冗余,且模板文件常常与生成文件高度相似,同样易造成雷同内容的出现。对搜索引擎很不友好,严重的直接被搜索引擎打入冷宫,不得翻身,很多CMS有拥有独立的模板存放目录,因此,应该进行模板目录的屏蔽。通常模板目录的文件目录是:templets  3)、CSS、JS目录的屏蔽  CSS目录文件在搜索引擎的抓取中没有用处,也无法提供有价值的信息。所以强烈建议站长朋友们在Robots.txt文件中将其进行屏蔽,以提高搜索引擎的索引质量。为搜索引擎提供一个简洁明了的索引环境更易提升网站友好性。CSS样式的目录通常情况下是:CSS 或者 style  JS文件在搜索引擎中无法进行识别,这里只是建议,可以对其进行屏蔽,这样做也有一个好处:为搜索引擎提供一个简洁明了的索引环境;  4)、屏蔽双页面的内容  这里拿DEDECMS来举例吧。大家都知道DEDECMS可以使用静态和动态URL进行同一篇内容的访问,如果你生成全站静态了,那你必须屏蔽动态地址的URL链接。这里有两个好处:1、搜索引擎对静态的URL比动态的URL更友好、更容易收录;2、防止静态、动态URL能访问同一篇文章而被搜索引擎判为重复内容。这样做对搜索引擎友好性来说是有益无害的。  5)、模板缓存目录  很多CMS程序都有缓存目录,这种缓存目录的好处我想不用说大家也清楚了吧,可以非常有效的提升网站的访问速度,减少网站带宽,对用户体验也是很好的。不过,这样的缓存目录也有一定的缺点,那就是会让搜索引擎进行重复的抓取,一个网站中内容重复也是大祭,对网站百害而无一利。很多使用CMS建站的朋友都没有注意到,必须要引起重视。  6)被删除的目录  死链过多,对搜索引擎优化来说,是致命的。不能不引起站长的高度重视,。在网站的发展过程中,目录的删除和调整是不可避免的,如果你的网站当前目录不存在了,那必须对此目录进行robots屏蔽,并返回正确的404错误页面(注意:在IIS中,有的朋友在设置404错误的时候,设置存在问题,在自定义错误页面一项中,404错误的正确设置应该是选择:默认值 或者 文件,而不应该是:URL,以防止搜索引擎返回200的状态码。至于怎么设置,网上教程很多,大家要吧搜索一下)  这里有一个争议性的问题,关于网站后台管理目录是否需要进行屏蔽,其实这个可有可无。在能保证网站安全的情况下,如果你的网站运营规模较小,就算网站管理目录出现在robots.txt文件中,也没有多大问题,这个我也见过很多网站这样设置的;但如果你的网站运营规模较大,竞争夺手过多,强烈建议千万别出现任何你网站后台管理目录的信息,以防被别有用心的人利用,损害你的利益;其实搜索引擎越来越智能,对于网站的管理目录还是能很好的识别,并放弃索引的。另外,大家在做网站后台的时候,也可以在页面元标签中添加:进行搜索引擎的屏蔽抓取。  最后,需要说明一点,很多站长朋友喜欢把站点地图地址放在robots.txt文件中,当然这里并不是去屏蔽搜索引擎,而是让搜索引擎在第一次索引网站的时候便能通过站点地图快速的抓取网站内容。这里需要注意一下:1、站点地图的制作一定要规范;2、网站一定要有高质量的内容;
已有帐号?
无法登录?
社交帐号登录robot.txt的使用技巧_百度知道

我要回帖

更多关于 那一些旧时光 的文章

 

随机推荐