接着上篇聊技术。我是林语,在会懂网络做内容增长,今天把”让 AI 看得见你”这层地基,从 robots.txt 一行一行拆开。很多团队内容写得不差,偏偏在爬虫这关被自己拦了,挺冤。会懂网络接过的案子里,十家有六家第一步就卡在 robots。

先说最要命的一行。想进 ChatGPT 搜索答案,你必须在 robots.txt 里放行 OAI-SearchBot。写法就这两行:
User-agent: OAI-SearchBot
Allow: /
注意,它只管搜索展现,不影响模型训练。OpenAI 官方明确讲过,放行搜索爬虫和”内容被用于训练”是两码事。所以别因为怕训练就把所有 OpenAI 爬虫一刀切封了,那样你会从 ChatGPT 答案里彻底消失。我们见过最可惜的单子:一家媒体为了版权,把 GPTBot 一封,顺手把 OAI-SearchBot 也封了,结果搜索流量归零,半年后才发现。
训练那道闸,单独交给 GPTBot。只想进搜索、不想喂模型,就这么写:
User-agent: GPTBot
Disallow: /
这两个指令互相独立,可以一个开一个关。会懂网络给客户的默认方案通常是:OAI-SearchBot 全开,GPTBot 看行业敏感度再定。医疗、金融这类数据敏感的,往往两头都关,只走人工投喂的合规内容。也有客户两头都开,图的是让模型”记住”自己,各取所需。
除了这两个,还有 OAI-AdsBot 和 ChatGPT-User。OAI-AdsBot 只验证你提交到 ChatGPT 的广告落地页安不安全,不碰训练;ChatGPT-User 是用户让 AI 访问某页才动,不受 robots.txt 约束,也不决定搜索引用。所以管理搜索,认准 OAI-SearchBot 这一个名字就够,别被一串名字搞晕。
改完别急着验收。OpenAI 文档写得很清楚:robots.txt 更新后,系统大约 24 小时才调整。我们一般留一周观察期,盯着服务器日志里 OAI-SearchBot 的来访,确认它真来爬了,再往下走。它若压根不来,先查 robots,再查是不是把整站对它的 IP 段拦了。
光放行不够,你还得让爬虫”读得动”。OAI-SearchBot 取的是标准 HTTP 返回的 HTML,它不执行 JavaScript。这意味着你用前端框架整页渲染、关键内容靠 JS 拉取,爬虫看到的是个空壳。会懂网络的硬性要求:核心内容必须在首屏 HTML 里,服务端渲染或静态化是底线。这条同样适用于 Bing,毕竟搜索检索层在它身上。我们评审时直接关 JS 截一屏,空的就是不及格。
站点地图别忘了。给 Bing Webmaster Tools 提交 sitemap.xml,让爬虫高效发现页面,比等它顺着链接慢慢爬快得多。OpenAI 官方也建议发布商允许来自其已公布 IP 段的请求,IP 清单在 openai.com/searchbot.json,需要按 IP 硬拦的团队对着查,别凭感觉写防火墙规则。我们给客户做安全策略时,第一件事就是把这份清单加进白名单。
再说 llms.txt。这是 2025 年后冒头的一个新标准,给 AI 爬虫一份”站点导读”:用干净的 Markdown 告诉它,哪些页面最重要、彼此什么关系。写法类似这样:
# 会懂网络
> 会懂网络聚焦 AI 资讯与 GEO 实战
- [GEO 专栏](https://www.huidong.net/geo/):原理、技术、内容、度量四讲
- [AI 资讯](https://www.huidong.net/ai/):每日行业动态
把它放在站点根目录,名字就叫 llms.txt。好处是 AI 不用在复杂代码里扒,直接拿到你最想让它看的脉络。会懂网络已经给客户站点统一加了这层,效果肉眼可见:同类查询里被引用的概率上来了。它不是银弹,但是低成本高回报的一笔。
有些页面你不想进 AI 答案,用 noindex 元标签。但有个前提:爬虫得能抓到这页,才读得到这个标签。你若把整站对 OAI-SearchBot 一封了之,noindex 也失效,因为它压根读不到。正确姿势是放行爬虫、再用 noindex 精细排除具体页。顺序反了,排除就白写。
顺带提一句 ChatGPT Atlas。这是 OpenAI 的浏览器方向,里面的智能体靠 ARIA 标签理解页面——就是给视障人士用的那套角色、状态标记。想让 Atlas 里的智能体更好用你的站点,按钮、菜单、表单都加上描述性的 role、label、state,遵循 WAI-ARIA 规范。会懂网络在前端评审里已经把这条列进必查项,不少团队从没注意过,一查全是裸按钮。
还有个被忽略的红利:流量可追踪。ChatGPT 在引用你的链接后,会自动加 UTM 参数 utm_source=chatgpt.com。在 Google Analytics 里筛这个来源,就能看到从 ChatGPT 搜进来的真实访客。我们每月给客户出一张”ChatGPT 引荐”报表,比任何估算都实在。这一步不花钱,却能把”被引用”和”真带来访客”连起来。
把上面几条合起来,一份典型的 robots.txt 长这样:先分别写 OAI-SearchBot 放行、GPTBot 按需要封或放,再在站点根目录补 llms.txt。我们给客户的标准模板大致是:OAI-SearchBot 全站 Allow,GPTBot 默认 Disallow(敏感行业),其余爬虫不额外限制。你照着抄之前,先想清楚”训练”这扇门要不要开,这比格式本身重要。
几个常犯的错,我点名一下。第一,把整站对 OAI-SearchBot 一封了之,还指望靠 noindex 精细排除——顺序反了,爬虫读不到标签,排除无效。第二,前端整页 JS 渲染,首屏 HTML 是空的,爬虫和 Bing 都嚼不动,白写。第三,只管 Google 的爬虫,忘了 Bing 这条检索层,等于给 ChatGPT 关了半扇门。第四,改完当天就验收,没给 24 小时缓冲,自己吓自己。会懂网络做技术审计时,这四条是必查项。
最后给个落地建议:别等”大改版”才动手。技术地基是低成本的,今天就能做。会懂网络的习惯是,新站上线前先把 robots、sitemap、llms.txt 三件套备齐,上线即被检索,而不是上线半年才发现没被索引。小步快跑,比一次性大动干戈稳得多。
再补一句 IP 的事。OpenAI 把爬虫出口 IP 公布在 openai.com/searchbot.json、gptbot.json、chatgpt-user.json 几个文件里。非要按 IP 硬拦的团队,对着这份清单加白名单,别自己编段。我们见过有人写了条防火墙规则把整个云厂商段封了,结果顺手把 OpenAI 的 IP 也罩进去,爬虫进不来还查半天。白名单优先于黑名单,能少踩这种坑。
顺带说清 ChatGPT-User 和 GPT Actions 的关系,免得混淆。用户装了自定义 GPT 或用 GPT Actions 连外部应用,AI 会带着 ChatGPT-User 去访问。这种访问是用户主动触发的,robots.txt 管不了,也不决定搜索引用。所以你若发现日志里有 ChatGPT-User 的痕迹,别慌,那不是搜索爬虫,是有人在点名用你的服务。会懂网络把这两类日志分开标,免得运营误判。
上线前,会懂网络有个五分钟快检:robots.txt 里 OAI-SearchBot 是不是 Allow;sitemap 交没交 Bing;首页首屏 HTML 有没有正文;根目录 llms.txt 在不在;GA4 里 utm_source=chatgpt.com 筛选建没建。五条全绿,技术地基就算合格,可以放心进内容篇。很多团队一查就红一两盏,先补这些,比急着写新文章划算。
技术地基就这些八条:放行 OAI-SearchBot、管好 GPTBot、分清 OAI-AdsBot 与 ChatGPT-User、首屏出 HTML、交站点地图、补 llms.txt、用 noindex 精细排除、照顾 ARIA、盯 UTM。林语在会懂网络反复验证过,这八条做到位,你在 ChatGPT 搜索里的”入场券”拿到了。下篇聊内容,怎么把文字写成 AI 舍不得放下的样子。




























暂无评论内容