GEO Insights

AI 能搜到你,却记不住你
245 次爬虫实测揭开"实时引用"与"品牌沉淀"的差距

基于新网传媒官网服务器 23 天、245 条真实 AI 爬虫访问记录的一手观测

新网传媒 · GEO观察 2026年8月31日 阅读约 9 分钟

因为你买的是租期,不是产权。高频发稿买到的"被 AI 提及",属于 RAG 实时检索层的短期可见性——它按最新日期轮换,断更即失效。而真正让 AI"记住"你的是另一套机制:多家彼此独立的来源,对同一个事实分别给出印证。这两个池子由两套完全不同的爬虫维护,互不打通。

做 GEO 执行时很容易撞上一个尴尬现象:稿子一直在发,AI 联网回答时也确实能带上品牌和引用来源,但这种提及永远是短的。今天引用你,明天就被更新的内容挤掉;发稿量月月达标,品牌在 AI 世界里的存在感却几乎没长进。

行业里通常把这解释成"内容不够好"或"发得不够多"。我们把自己服务器上的 AI 爬虫日志完整拆开看了一遍,发现真正的答案在数据里:维护"实时引用"和维护"品牌沉淀"的,根本不是同一个爬虫,也不是同一套逻辑。

一、先把两套机制摆到台面上:两个池子,两套爬虫

2026 年 8 月 9 日至 8 月 31 日,我们在 xinwang-geo.cn 服务器上完整记录 AI 爬虫行为,共捕获 417 条访问记录。剔除伪装扫描器后,245 条来自真实 AI 爬虫,分属三套体系。它们的行为差异之大,超出预期:

爬虫访问次数抓取内容单次会话最深对应哪一层
GPTBot106 次sitemap + 全站内页 + CSS/JS18 个路径沉淀层
OAI-SearchBot44 次仅 robots.txt1 个路径实时层
Bytespider95 次(87 个 IP)robots.txt + sitemap 为主5 个路径入口层

先看最刺眼的一行:OAI-SearchBot 来了 44 次,一次内容页都没抓过

二、实时层长什么样:OAI-SearchBot 的 44 次来访

1. 44 次来访,0 次内容抓取

OAI-SearchBot 是 ChatGPT 联网搜索时使用的爬虫,OpenAI 在官方爬虫文档里明确了它的用途:仅用于搜索索引,不用于模型训练。在它造访我们站点的 44 次里,请求路径 100% 是 /robots.txt,没有一次是文章页、服务页或首页。

更关键的是会话深度:40 次独立会话,每一次只抓 1 个路径。来了、看一眼权限文件、走人,从不深入。

2. 它只确认一件事:我能不能抓你

这个行为模式说明,联网搜索的实时抓取并不在你服务器上现场完成内容采集——它先确认"这个站点允许不允许我抓",真正的内容获取走的是平台自己的搜索索引体系。你在 ChatGPT 联网回答里被引用,取决于第三方索引里有没有你、排第几,而不是这个爬虫有没有读过你的页面。

这正是"租期"这个比喻的物理含义:租约条款不写在你的服务器上,你甚至看不到它。索引怎么排序、权重怎么算、什么时候轮换,全在别人手里。

3. 这也解释了为什么"断更即失效"

实时检索是一个动态窗口,模型只取近期高相关的网页作参考素材。旧稿持续被更新的内容挤下去,一旦停发,品牌从实时结果里消失的速度比多数人预期得快——这不是玄学,是这个窗口的设计逻辑:它要的是"当下",不是"长期"。

一句话概括实时层:它解决的是"当下能搜到"。你为它付出的每一分投入,都是维持性支出——支出停止,可见性立刻开始衰减。

三、沉淀层长什么样:GPTBot 的 106 次,是在给你建档

与 OAI-SearchBot 形成鲜明对照的是 GPTBot。OpenAI 在官方文档中说明,GPTBot 采集的数据用于模型改进与训练,属于沉淀层采集。它的行为完全是另一套:

1. 它不是"抓",是"建档"

106 次访问的分布:sitemap.xml 22 次、首页 22 次(//index.html 合计)、CSS 与 JS 各 6 次、站点清单文件 5 次、favicon 5 次,其余分散在 FAQ、服务页、关于页、联系页、两个业务落地页和 GEO 观察板块。它把整个站的结构都搬了一遍。

2. 单次会话最深 18 个路径,连 CSS 和 JS 都抓

8 月 29 日 8 点那一次会话,GPTBot 一口气抓了 18 个不同路径——包括 style.css、main.js 以及 chatbot 相关的脚本。抓 CSS 和 JS 意味着它在渲染页面,而不只是读取 HTML 文本。这是在核实页面真实呈现的内容,属于典型的建档行为。

相比 OAI-SearchBot 恒定 1 个路径的会话深度,两者不在一个量级上。

3. 新内容被发现的速度:6 秒

8 月 31 日我们上线 GEO 观察板块,日志显示:

时间请求路径响应
18:08:58/insights/200
18:09:01/insights/geo-content-asset-lifecycle.html200
18:09:04/insights/index.html200

从 sitemap 发现到两个新页面抓取完成,6 秒。沉淀层爬虫对新内容的响应极其敏锐——前提是你在 sitemap 里声明了它。这也是我们反复强调结构化数据与站点地图的原因:那是给沉淀层爬虫的导航图。

四、第三类爬虫:Bytespider 的 87 个 IP 只读目录

字节跳动的 Bytespider(豆包系)呈现第三种形态:95 次访问来自 87 个不同 IP,极度分散;请求集中在 robots.txt(52.6%)和 sitemap.xml(25.3%),另有 7 次抓取站长验证文件、7 次抓取 www 版站点地图副本,抓到内容页的仅 4 次首页。

它做的是权限确认与目录读取,内容采集明显走其他通道。对国内 GEO 来说这意味着:豆包侧的可见性同样高度依赖索引层,而不是站点被抓取的频次。

五、必须说的一个坑:你日志里 41% 的"AI 爬虫"是假的

这次统计里最值得单独讲的一件事:417 条记录中有 172 条(41.2%)来自 2 个 IP,它们轮换伪装成 GPTBot、OAI-SearchBot、PerplexityBot 三种身份,专门扫描 /.env/.aws/credentials/id_rsa/@fs/.../backup.sql 这类敏感文件。

最直接的后果是:PerplexityBot 从未真正访问过我们的站点。此前按 UA 名称统计出的 60 次 Perplexity 访问,全部来自这两个扫描器,请求路径全是敏感文件,没有一条是正常内容页。如果不做清洗,你会得出"Perplexity 来过又消失了"这种完全错误的结论。

识别维度真实 AI 爬虫伪装扫描器
UA 前缀完整浏览器 UA(Macintosh Chrome 131 / AppleWebKit / Android 5.0)Mozilla/5.0 (compatible; X/1.0; +url) 短格式
请求路径robots.txt、sitemap、正常页面、CSS/JS/.env、/@fs/、/.aws/、/id_rsa、/backup.sql
HTTP 状态以 200 为主绝大多数 404
IP 归属平台官方段(如 OpenAI 的 74.7.x)云主机段(本次为 34.81.x、34.6.x)
会话节奏成批、有规律,按天回访几秒内数十条,扫完即走
这件事本身就是 GEO 的一个隐喻:我们整篇文章在讲"单一来源不足为凭,需要多源交叉印证",而用来证明这件事的数据,自己也需要先做交叉验证才能用。任何只看 UA 名称就下结论的统计,都可能建立在 41% 的噪音上。

六、三个可查指标:判断你的 GEO 现在停在哪一层

"实时层"和"沉淀层"听起来抽象,但落到服务器日志上完全可以量化。以下三个指标,任何有服务器日志访问权限的团队都能自己查:

指标怎么查健康信号危险信号
沉淀层抓取路径数 统计 GPTBot 抓过多少个不同路径 覆盖全部核心页面,且包含 CSS/JS 只抓首页,内页从不被抓取
内页抓取占比 内页请求数 ÷ 总请求数 内页占比高,说明站点被当作内容源 占比接近 0,说明只有首页被认可
断更后衰减曲线 停发 2–4 周,对比爬虫来访频次与 AI 提及率 来访频次小幅下降后企稳 提及率快速归零

两个补充判断:

联网测试——在 AI 开启联网状态下提问行业问题,看品牌是否出现,考察的是实时检索层。断更测试——停止发稿 2 到 4 周后重复同样的问题,看品牌是否仍被提及,考察的是实体沉淀层。两个都通过,说明双池结构健康;只有联网测试通过,说明投入全部压在实时层,这就是"天天发稿却只是短暂提及"的直接诊断结果。

七、从"刷实时"转向"建沉淀":可执行的四步调整

1

把预算拆成两个池子

实时更新池用少量媒体承载最新动态(新品、项目、活动),只保障 RAG 当下的检索可用性,不必追求海量。沉淀信源池用于持续拓展新的独立权威媒体、垂直站点与第三方平台——每新增一家可索引的不同媒体,价值远高于在老媒体上多发 10 篇同质化通稿。目标指标从"稿件篇数"换成"独立信源基数"。

2

内容结构不能全是时效性新闻

时效性稿件适合 RAG 抓取,但很快沦为"历史新闻"、权重持续衰减。必须搭配非强时效的事实类内容:品牌定位、核心案例、技术能力、行业分析。这类内容生命周期长,长期留在索引库里,构成模型认知品牌的基础素材。"XX 公司今日发布 XX"式短效新闻,不应是内容库的主体。

3

让一个事实被多家分别报道

同一个事实(比如一个项目落地),尽量让多家不同媒体各自报道解读,而不是一家媒体反复改写同一事件。大模型评估实体可信度时看的不是"某家媒体发了多少篇日期不同的稿件",而是"多少家彼此独立的媒体分别佐证了同一件事"。多源佐证是向沉淀层输入实体证据的唯一路径。

4

配比建议:30% 维持,70% 建资产

30% 精力用于每日或每周的实时新闻更新,维持 RAG 检索池活跃;70% 精力用于拓展新独立信源、产出长周期事实内容,搭建品牌的全网事实沉淀底座。核心逻辑是:实时层是维持性支出,沉淀层是资产性投入——支出停止即归零,资产却能长期复利。

八、关于数据口径的一次更正

我们在此更正 8 月 31 日发布的《GEO 内容资产会不会随大模型迭代失效》一文中的统计口径。该文初版按 User-Agent 名称直接统计,未做扫描器清洗,导致三处数据失真:

  1. 原文"407 条有效访问记录",其中 172 条来自 2 个伪装扫描器 IP,真实 AI 爬虫访问为 245 条
  2. 原文"PerplexityBot 到访 60 次后消失",实为扫描器伪装,PerplexityBot 在观测期内从未真实访问
  3. 原文"OAI-SearchBot 从 1.3 升级到 1.4",其中 1.3 为扫描器伪造 UA、1.4 为真实爬虫,两者并非同一爬虫的版本迭代

该文已按清洗后口径同步修订。做 GEO 的人最容易犯的错,就是拿未经交叉验证的数据去论证"交叉验证很重要"——这次我们自己也踩了一次,记录在案。

九、常见问题

实时引用信源和品牌沉淀信源到底有什么区别?

实时引用信源是 AI 开启联网检索时临时抓取的近期网页,解决"当下能搜到",按最新日期轮换、断更即失效;品牌沉淀信源是多家独立来源对同一事实的长期交叉印证,解决"被模型记住",写入模型基础认知后即使短期停发仍可能被提及。前者是维持性支出,后者是资产性投入。

为什么天天发稿,AI 还是记不住品牌?

因为稿件数量不等于独立信源基数。如果在少数几家媒体循环发布同质化通稿,独立信源池几乎不动,模型关闭联网后仍无法识别你为可信实体。判断标准很简单:开联网问能出现、关联网问就消失,说明投入全压在实时层。

怎么判断自己现在停在哪一层?

两个测试:联网测试(AI 开联网提问行业问题,品牌是否出现)与断更测试(停发 2 到 4 周后重复提问,是否仍被提及)。都通过说明双池健康,只有联网测试通过说明全在实时层。有服务器权限的还可以查 GPTBot 抓取路径数与内页抓取占比。

AI 爬虫日志里的访问数据可信吗?

不能只看 User-Agent 名称。新网传媒实测发现,日志里 41% 标称 AI 爬虫的请求来自 2 个伪装扫描器 IP,轮换伪造 GPTBot、OAI-SearchBot、PerplexityBot 身份扫敏感文件。必须结合 UA 完整格式、请求路径、HTTP 状态码与 IP 归属做交叉清洗后才能用。

实时更新和沉淀建设,预算怎么分配?

建议 30% 与 70%:三成用于每日或每周的实时新闻更新维持检索池活跃,七成用于拓展新独立信源与产出长周期事实内容。同时补充百科、行业白皮书、第三方机构引用等异构载体——它们生命周期远高于普通新闻,不依赖每日刷新。

新发布的内容,AI 多久能发现?

新网传媒 8 月 31 日上线 GEO 观察板块的实测:GPTBot 在 18:08:58 抓取 sitemap 后,18:09:01 和 18:09:04 分别抓完两个新页面,全程 6 秒。前提是页面已在 sitemap.xml 中声明且 robots.txt 未禁止抓取。

想知道你的品牌现在停在哪一层?

我们可以基于你的站点做一次双池结构诊断:检测品牌在豆包、通义千问、元宝、DeepSeek、ChatGPT 中的引用现状,统计独立信源基数的真实规模,并给出实时层与沉淀层的投入配比建议。