robot txt:企业并购后两套网站内容如何选择去留

📍 WDQWDWQD987AAAAA:216.73.217.7
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /d6336d364292.html
📄

robot txt:企业并购后两套网站内容如何选择去留

结论先给:如果并购后只保留一个主域名,优先留下“能独立承担搜索需求、且与合并后业务定位一致”的那套内容,另一套做选择性迁移或下线;如果两个品牌仍面向不同客户群、且各自有持续经营价值,则保留双站点,但必须用不同的 robot txt 划清抓取边界,避免两套内容互相消耗。判断依据不是哪套页面更多,而是哪套内容在合并后仍能回答目标客户的问题。

先判断“去留”的对象是域名、栏目还是单篇内容

很多团队把问题简化成“A 站留还是 B 站留”,结果在域名层面做决定,却在栏目层面留下大量重复。更稳的做法是分三层看:域名层决定是否继续对外提供独立入口;栏目层决定哪些主题值得保留;页面层决定哪些具体内容需要迁移、改写或直接下线。

一个实际动作是:把两套网站的内容按主题列成对照表,而不是按 URL 数量列。对照表里标出三件事——该主题在合并后是否仍属于核心业务、是否已有另一套内容覆盖、是否有外部链接或用户习惯依赖。这个动作的结果会直接影响下一步:如果某个主题只有一套内容覆盖,它通常应保留;如果两套都覆盖,才进入取舍。

两种常见做法成立的条件与代价

做法一:单站保留,另一套内容择优迁移

适用条件:合并后对外只用一个品牌或一个主域名;两套内容主题重叠度高;团队没有足够人力长期维护两套站点。代价是迁移期间会出现旧 URL 失效、部分页面短期不可访问,且需要逐条处理重定向与内容合并,不能只靠 robot txt 解决。

这里的 robot txt 作用是配合迁移节奏,而不是替代迁移决策。例如,在确认某批旧页面不再对外提供服务后,可以用 Disallow 阻止其继续被抓取,但前提是这些页面已经完成重定向或明确下线。如果页面还要参与搜索,就不应简单屏蔽。

做法二:双站保留,用抓取规则区分定位

适用条件:两个品牌仍各自面对不同客户群;两套内容有明确差异,不是同一批文章的换皮;公司愿意为两套站点分别投入内容维护。代价是管理成本翻倍,且一旦两边内容趋同,搜索端会面临重复内容判断,用户也会困惑该信任哪一个入口。

双站保留时,robot txt 的差异要服务于定位差异。比如一套站只保留面向老客户的售后与文档内容,另一套站承担新客获取内容,那么可以在前者的 robot txt 中对不再维护的营销栏目设定更严格的抓取边界,把抓取预算留给仍有效的文档页。这个动作的结果是:搜索端更容易理解两套站各自负责什么,下一步的内容排期也能按站点分开。

一个会让上述结论失效的反例

如果并购后两个品牌其实面向同一批客户、提供同类服务,只是历史遗留了两套网站,那么“双站保留”通常不成立。此时即使两套内容在措辞上有差异,搜索端和用户仍会把它们视为同一类供给,重复问题不会因为 robot txt 写了不同规则而消失。

反过来说,如果单站保留后,被下线的那套内容里有大量只此一份的深度资料,且这些资料仍能回答客户问题,那么“直接下线”也不成立。正确顺序是先识别不可替代内容,再决定迁移还是保留,而不是先决定关掉哪个域名。

可操作的判断顺序与下一步

  1. 先确认合并后的业务定位:是一个品牌服务一类客户,还是两个品牌继续服务不同客户。
  2. 按主题而非 URL 数量对照两套内容,标出重叠主题、独有主题和已失效主题。
  3. 对独有且仍有效的主题,优先迁移或保留;对重叠主题,选择质量更高、维护更可持续的一套。
  4. 对确定不再提供服务的页面,先完成重定向或下线,再调整 robot txt 的抓取边界。
  5. 调整后观察抓取与索引变化,但不要把某次抓取量下降直接当成处理正确的证据,它也可能是迁移节奏或内链调整带来的结果。

假设一个场景:A 站有 200 篇产品说明,B 站有 180 篇同类说明,其中 120 篇主题重叠。此时不应按“哪个站文章多”决定去留,而应先看这 120 篇重叠主题中哪套说明更完整、更新更及时,再把另一套中独有的 60 篇迁移过去。迁移完成后,再对已下线的旧地址设置重定向,并在 robot txt 中停止对已确认下线目录的抓取。这个顺序能避免先屏蔽、后迁移造成的真空期。下一步动作是复查迁移后的页面是否可访问、是否仍回答原来的客户问题,再决定是否需要补充新内容。

图1 图2

nginx