集成

边缘上的 llms.txt

一个你部署在自己站点前面的 Cloudflare Worker 模板。

它回答来要 llms.txt 的 AI 爬虫,对其他所有人则完全让路。你把它部署进自己的账号;它是模板,不是服务。

它做什么

已知 AI 爬虫请求 /llms.txt 时,返回你配置的内容(text/plain)。其余请求一律回源。

「原样」是字面意思:回源响应原封返回,不加头、不改写 HTML、不动缓存指令。人类访客看不出它装过。不配置它就什么都不做。

零外发请求

源码里唯一的网络调用就是透传回你自己的源站。它从不联系 TriRank,从不上报有爬虫来过,也从不回家报到。

这是一条你可以自己核的性质,不是一句要你相信的承诺:源码短到几分钟能读完,而我们仓库里的一道检查断言它整份源码不含任何绝对 URL,所以这条性质不会被不小心弄丢。

怎么装

  1. 复制模板目录,把你的 llms.txt 放进 wrangler.toml 顶部的 LLMS_TXT 变量。
  2. 把 route 设成你自己的 zone。
  3. 跑 wrangler deploy,然后验两次:一次扮爬虫,一次扮浏览器。

llms.txt 超过 Cloudflare 变量上限时改走 KV 的做法、两条验证命令、以及这个模板刻意不做的事,都在 integrations/cloudflare-worker/README.md 里。

哪些爬虫算数

模板自带一份生成的爬虫 User-Agent 名册。它来自我们自己的爬虫统计所依据的同一份名册——每个 token 都带着它是从哪个厂商页面读到的、哪一天读的,以及那些被刻意排除在外的爬虫的理由。

看看哪些 AI 爬虫真的来过

目前的状态

它还没有作为一键模板发布。Deploy to Cloudflare 按钮需要一个把 wrangler 配置放在根目录的公开仓库,而 cloudflare/templates 画廊走 PR 且有自己的命名与 CI 要求;两条都还没做(2026-09-07 读)。

而克隆目录再跑 wrangler deploy 这两样都不需要,README 走的就是这条路。