因为你买的是租期,不是产权。高频发稿买到的"被 AI 提及",属于 RAG 实时检索层的短期可见性——它按最新日期轮换,断更即失效。而真正让 AI"记住"你的是另一套机制:多家彼此独立的来源,对同一个事实分别给出印证。这两个池子由两套完全不同的爬虫维护,互不打通。
做 GEO 执行时很容易撞上一个尴尬现象:稿子一直在发,AI 联网回答时也确实能带上品牌和引用来源,但这种提及永远是短的。今天引用你,明天就被更新的内容挤掉;发稿量月月达标,品牌在 AI 世界里的存在感却几乎没长进。
行业里通常把这解释成"内容不够好"或"发得不够多"。我们把自己服务器上的 AI 爬虫日志完整拆开看了一遍,发现真正的答案在数据里:维护"实时引用"和维护"品牌沉淀"的,根本不是同一个爬虫,也不是同一套逻辑。
一、先把两套机制摆到台面上:两个池子,两套爬虫
2026 年 8 月 9 日至 8 月 31 日,我们在 xinwang-geo.cn 服务器上完整记录 AI 爬虫行为,共捕获 417 条访问记录。剔除伪装扫描器后,245 条来自真实 AI 爬虫,分属三套体系。它们的行为差异之大,超出预期:
| 爬虫 | 访问次数 | 抓取内容 | 单次会话最深 | 对应哪一层 |
|---|---|---|---|---|
| GPTBot | 106 次 | sitemap + 全站内页 + CSS/JS | 18 个路径 | 沉淀层 |
| OAI-SearchBot | 44 次 | 仅 robots.txt | 1 个路径 | 实时层 |
| Bytespider | 95 次(87 个 IP) | robots.txt + sitemap 为主 | 5 个路径 | 入口层 |
先看最刺眼的一行:OAI-SearchBot 来了 44 次,一次内容页都没抓过。
二、实时层长什么样:OAI-SearchBot 的 44 次来访
1. 44 次来访,0 次内容抓取
OAI-SearchBot 是 ChatGPT 联网搜索时使用的爬虫,OpenAI 在官方爬虫文档里明确了它的用途:仅用于搜索索引,不用于模型训练。在它造访我们站点的 44 次里,请求路径 100% 是 /robots.txt,没有一次是文章页、服务页或首页。
更关键的是会话深度:40 次独立会话,每一次只抓 1 个路径。来了、看一眼权限文件、走人,从不深入。
2. 它只确认一件事:我能不能抓你
这个行为模式说明,联网搜索的实时抓取并不在你服务器上现场完成内容采集——它先确认"这个站点允许不允许我抓",真正的内容获取走的是平台自己的搜索索引体系。你在 ChatGPT 联网回答里被引用,取决于第三方索引里有没有你、排第几,而不是这个爬虫有没有读过你的页面。
这正是"租期"这个比喻的物理含义:租约条款不写在你的服务器上,你甚至看不到它。索引怎么排序、权重怎么算、什么时候轮换,全在别人手里。
3. 这也解释了为什么"断更即失效"
实时检索是一个动态窗口,模型只取近期高相关的网页作参考素材。旧稿持续被更新的内容挤下去,一旦停发,品牌从实时结果里消失的速度比多数人预期得快——这不是玄学,是这个窗口的设计逻辑:它要的是"当下",不是"长期"。
三、沉淀层长什么样:GPTBot 的 106 次,是在给你建档
与 OAI-SearchBot 形成鲜明对照的是 GPTBot。OpenAI 在官方文档中说明,GPTBot 采集的数据用于模型改进与训练,属于沉淀层采集。它的行为完全是另一套:
1. 它不是"抓",是"建档"
106 次访问的分布:sitemap.xml 22 次、首页 22 次(/ 与 /index.html 合计)、CSS 与 JS 各 6 次、站点清单文件 5 次、favicon 5 次,其余分散在 FAQ、服务页、关于页、联系页、两个业务落地页和 GEO 观察板块。它把整个站的结构都搬了一遍。
2. 单次会话最深 18 个路径,连 CSS 和 JS 都抓
8 月 29 日 8 点那一次会话,GPTBot 一口气抓了 18 个不同路径——包括 style.css、main.js 以及 chatbot 相关的脚本。抓 CSS 和 JS 意味着它在渲染页面,而不只是读取 HTML 文本。这是在核实页面真实呈现的内容,属于典型的建档行为。
相比 OAI-SearchBot 恒定 1 个路径的会话深度,两者不在一个量级上。
3. 新内容被发现的速度:6 秒
8 月 31 日我们上线 GEO 观察板块,日志显示:
| 时间 | 请求路径 | 响应 |
|---|---|---|
| 18:08:58 | /insights/ | 200 |
| 18:09:01 | /insights/geo-content-asset-lifecycle.html | 200 |
| 18:09:04 | /insights/index.html | 200 |
从 sitemap 发现到两个新页面抓取完成,6 秒。沉淀层爬虫对新内容的响应极其敏锐——前提是你在 sitemap 里声明了它。这也是我们反复强调结构化数据与站点地图的原因:那是给沉淀层爬虫的导航图。
四、第三类爬虫:Bytespider 的 87 个 IP 只读目录
字节跳动的 Bytespider(豆包系)呈现第三种形态:95 次访问来自 87 个不同 IP,极度分散;请求集中在 robots.txt(52.6%)和 sitemap.xml(25.3%),另有 7 次抓取站长验证文件、7 次抓取 www 版站点地图副本,抓到内容页的仅 4 次首页。
它做的是权限确认与目录读取,内容采集明显走其他通道。对国内 GEO 来说这意味着:豆包侧的可见性同样高度依赖索引层,而不是站点被抓取的频次。
五、必须说的一个坑:你日志里 41% 的"AI 爬虫"是假的
这次统计里最值得单独讲的一件事:417 条记录中有 172 条(41.2%)来自 2 个 IP,它们轮换伪装成 GPTBot、OAI-SearchBot、PerplexityBot 三种身份,专门扫描 /.env、/.aws/credentials、/id_rsa、/@fs/...、/backup.sql 这类敏感文件。
最直接的后果是:PerplexityBot 从未真正访问过我们的站点。此前按 UA 名称统计出的 60 次 Perplexity 访问,全部来自这两个扫描器,请求路径全是敏感文件,没有一条是正常内容页。如果不做清洗,你会得出"Perplexity 来过又消失了"这种完全错误的结论。
| 识别维度 | 真实 AI 爬虫 | 伪装扫描器 |
|---|---|---|
| UA 前缀 | 完整浏览器 UA(Macintosh Chrome 131 / AppleWebKit / Android 5.0) | Mozilla/5.0 (compatible; X/1.0; +url) 短格式 |
| 请求路径 | robots.txt、sitemap、正常页面、CSS/JS | /.env、/@fs/、/.aws/、/id_rsa、/backup.sql |
| HTTP 状态 | 以 200 为主 | 绝大多数 404 |
| IP 归属 | 平台官方段(如 OpenAI 的 74.7.x) | 云主机段(本次为 34.81.x、34.6.x) |
| 会话节奏 | 成批、有规律,按天回访 | 几秒内数十条,扫完即走 |
六、三个可查指标:判断你的 GEO 现在停在哪一层
"实时层"和"沉淀层"听起来抽象,但落到服务器日志上完全可以量化。以下三个指标,任何有服务器日志访问权限的团队都能自己查:
| 指标 | 怎么查 | 健康信号 | 危险信号 |
|---|---|---|---|
| 沉淀层抓取路径数 | 统计 GPTBot 抓过多少个不同路径 | 覆盖全部核心页面,且包含 CSS/JS | 只抓首页,内页从不被抓取 |
| 内页抓取占比 | 内页请求数 ÷ 总请求数 | 内页占比高,说明站点被当作内容源 | 占比接近 0,说明只有首页被认可 |
| 断更后衰减曲线 | 停发 2–4 周,对比爬虫来访频次与 AI 提及率 | 来访频次小幅下降后企稳 | 提及率快速归零 |
两个补充判断:
联网测试——在 AI 开启联网状态下提问行业问题,看品牌是否出现,考察的是实时检索层。断更测试——停止发稿 2 到 4 周后重复同样的问题,看品牌是否仍被提及,考察的是实体沉淀层。两个都通过,说明双池结构健康;只有联网测试通过,说明投入全部压在实时层,这就是"天天发稿却只是短暂提及"的直接诊断结果。
七、从"刷实时"转向"建沉淀":可执行的四步调整
把预算拆成两个池子
实时更新池用少量媒体承载最新动态(新品、项目、活动),只保障 RAG 当下的检索可用性,不必追求海量。沉淀信源池用于持续拓展新的独立权威媒体、垂直站点与第三方平台——每新增一家可索引的不同媒体,价值远高于在老媒体上多发 10 篇同质化通稿。目标指标从"稿件篇数"换成"独立信源基数"。
内容结构不能全是时效性新闻
时效性稿件适合 RAG 抓取,但很快沦为"历史新闻"、权重持续衰减。必须搭配非强时效的事实类内容:品牌定位、核心案例、技术能力、行业分析。这类内容生命周期长,长期留在索引库里,构成模型认知品牌的基础素材。"XX 公司今日发布 XX"式短效新闻,不应是内容库的主体。
让一个事实被多家分别报道
同一个事实(比如一个项目落地),尽量让多家不同媒体各自报道解读,而不是一家媒体反复改写同一事件。大模型评估实体可信度时看的不是"某家媒体发了多少篇日期不同的稿件",而是"多少家彼此独立的媒体分别佐证了同一件事"。多源佐证是向沉淀层输入实体证据的唯一路径。
配比建议:30% 维持,70% 建资产
30% 精力用于每日或每周的实时新闻更新,维持 RAG 检索池活跃;70% 精力用于拓展新独立信源、产出长周期事实内容,搭建品牌的全网事实沉淀底座。核心逻辑是:实时层是维持性支出,沉淀层是资产性投入——支出停止即归零,资产却能长期复利。
八、关于数据口径的一次更正
我们在此更正 8 月 31 日发布的《GEO 内容资产会不会随大模型迭代失效》一文中的统计口径。该文初版按 User-Agent 名称直接统计,未做扫描器清洗,导致三处数据失真:
- 原文"407 条有效访问记录",其中 172 条来自 2 个伪装扫描器 IP,真实 AI 爬虫访问为 245 条;
- 原文"PerplexityBot 到访 60 次后消失",实为扫描器伪装,PerplexityBot 在观测期内从未真实访问;
- 原文"OAI-SearchBot 从 1.3 升级到 1.4",其中 1.3 为扫描器伪造 UA、1.4 为真实爬虫,两者并非同一爬虫的版本迭代。
该文已按清洗后口径同步修订。做 GEO 的人最容易犯的错,就是拿未经交叉验证的数据去论证"交叉验证很重要"——这次我们自己也踩了一次,记录在案。
九、常见问题
实时引用信源是 AI 开启联网检索时临时抓取的近期网页,解决"当下能搜到",按最新日期轮换、断更即失效;品牌沉淀信源是多家独立来源对同一事实的长期交叉印证,解决"被模型记住",写入模型基础认知后即使短期停发仍可能被提及。前者是维持性支出,后者是资产性投入。
因为稿件数量不等于独立信源基数。如果在少数几家媒体循环发布同质化通稿,独立信源池几乎不动,模型关闭联网后仍无法识别你为可信实体。判断标准很简单:开联网问能出现、关联网问就消失,说明投入全压在实时层。
两个测试:联网测试(AI 开联网提问行业问题,品牌是否出现)与断更测试(停发 2 到 4 周后重复提问,是否仍被提及)。都通过说明双池健康,只有联网测试通过说明全在实时层。有服务器权限的还可以查 GPTBot 抓取路径数与内页抓取占比。
不能只看 User-Agent 名称。新网传媒实测发现,日志里 41% 标称 AI 爬虫的请求来自 2 个伪装扫描器 IP,轮换伪造 GPTBot、OAI-SearchBot、PerplexityBot 身份扫敏感文件。必须结合 UA 完整格式、请求路径、HTTP 状态码与 IP 归属做交叉清洗后才能用。
建议 30% 与 70%:三成用于每日或每周的实时新闻更新维持检索池活跃,七成用于拓展新独立信源与产出长周期事实内容。同时补充百科、行业白皮书、第三方机构引用等异构载体——它们生命周期远高于普通新闻,不依赖每日刷新。
新网传媒 8 月 31 日上线 GEO 观察板块的实测:GPTBot 在 18:08:58 抓取 sitemap 后,18:09:01 和 18:09:04 分别抓完两个新页面,全程 6 秒。前提是页面已在 sitemap.xml 中声明且 robots.txt 未禁止抓取。
想知道你的品牌现在停在哪一层?
我们可以基于你的站点做一次双池结构诊断:检测品牌在豆包、通义千问、元宝、DeepSeek、ChatGPT 中的引用现状,统计独立信源基数的真实规模,并给出实时层与沉淀层的投入配比建议。
