# ============================================ # 网站 - Robots.txt 协议 # 目标:精准拦截异常爬虫,保护服务器资源 # ============================================ # ----- 第一部分:对【所有爬虫】的通用规则 ----- User-agent: * Crawl-delay: 5 # 全局抓取延迟设为5秒,显著降低请求频率 Allow: /css/ Allow: /js/ Allow: /images/ Allow: /static/ # 【重要】恢复允许,因为你的网站使用/static/api/js/等分享功能 Disallow: /bin/ # 禁止访问bin目录 Disallow: /man/ # 禁止访问man目录 Disallow: /App/ # 禁止访问App目录(注意大小写,根据你的实际目录名) Disallow: /pdf/ # 禁止访问pdf目录(包括PDF查看器页面) Disallow: /ueditor/ # 核心防护:屏蔽易受攻击的上传目录 Disallow: /*?* # 禁止所有带参数的动态URL,防爬虫陷阱 Disallow: /*.php$ Disallow: /*.do$ Disallow: /*.jsp$ Disallow: /sdk.51.la/ # 阻止对第三方统计脚本源的异常请求 # ----- 第二部分:对【已验证的正常搜索引擎】给予优待 ----- # 允许Google、Bing、百度、搜狗、360快速抓取重要内容 User-agent: Googlebot User-agent: Bingbot User-agent: Baiduspider User-agent: Sogou web spider User-agent: 360Spider # 【新增】360搜索爬虫 Crawl-delay: 2 # 对友好爬虫,给予更短的延迟 Disallow: /ueditor/ Disallow: /bin/ Disallow: /man/ Disallow: /App/ Disallow: /pdf/ # ----- 第三部分:对【已知的资源消耗型/问题爬虫】实施严格封锁 ----- # 1. 屏蔽查重/内容检测爬虫(从日志看,Turnitin对/inside/目录的遍历是主要负载源) User-agent: Turnitin User-agent: Copyscape # 新增:Copyscape查重爬虫 User-agent: plagiarismcheck # 新增:PlagiarismCheck查重爬虫 User-agent: Grammarly # 新增:Grammarly语法检查爬虫 User-agent: Screaming Frog SEO Spider # 新增:SEO蜘蛛(消耗极大) Disallow: / # 2. 屏蔽SemrushBot等SEO工具爬虫(它们并发高,且对你业务价值低) User-agent: SemrushBot User-agent: SemrushBot-BA User-agent: SemrushBot-SI User-agent: SemrushBot-SWA User-agent: DotBot User-agent: MJ12bot Crawl-delay: 10 Disallow: / # 3. 屏蔽其他已确认的异常或低价值爬虫 User-agent: ia_archiver # Alexa爬虫,已无必要 User-agent: YandexBot # 新增:俄罗斯Yandex搜索(对中国企业站价值低) User-agent: AhrefsBot # 新增 User-agent: Amazonbot # 新增 User-agent: PetalBot # 新增 User-agent: BLEXBot # 新增 User-agent: DataForSeoBot # 新增 Disallow: /