集成
边缘上的 llms.txt
一个你部署在自己站点前面的 Cloudflare Worker 模板。
它回答来要 llms.txt 的 AI 爬虫,对其他所有人则完全让路。你把它部署进自己的账号;它是模板,不是服务。
它做什么
已知 AI 爬虫请求 /llms.txt 时,返回你配置的内容(text/plain)。其余请求一律回源。
「原样」是字面意思:回源响应原封返回,不加头、不改写 HTML、不动缓存指令。人类访客看不出它装过。不配置它就什么都不做。
零外发请求
源码里唯一的网络调用就是透传回你自己的源站。它从不联系 TriRank,从不上报有爬虫来过,也从不回家报到。
这是一条你可以自己核的性质,不是一句要你相信的承诺:源码短到几分钟能读完,而我们仓库里的一道检查断言它整份源码不含任何绝对 URL,所以这条性质不会被不小心弄丢。
怎么装
- 复制模板目录,把你的 llms.txt 放进 wrangler.toml 顶部的 LLMS_TXT 变量。
- 把 route 设成你自己的 zone。
- 跑 wrangler deploy,然后验两次:一次扮爬虫,一次扮浏览器。
llms.txt 超过 Cloudflare 变量上限时改走 KV 的做法、两条验证命令、以及这个模板刻意不做的事,都在 integrations/cloudflare-worker/README.md 里。
哪些爬虫算数
模板自带一份生成的爬虫 User-Agent 名册。它来自我们自己的爬虫统计所依据的同一份名册——每个 token 都带着它是从哪个厂商页面读到的、哪一天读的,以及那些被刻意排除在外的爬虫的理由。
目前的状态
它还没有作为一键模板发布。Deploy to Cloudflare 按钮需要一个把 wrangler 配置放在根目录的公开仓库,而 cloudflare/templates 画廊走 PR 且有自己的命名与 CI 要求;两条都还没做(2026-09-07 读)。
而克隆目录再跑 wrangler deploy 这两样都不需要,README 走的就是这条路。