TriRank 数据

哪些 AI 爬虫真的会来访问网站——实测自 TriRank 自有服务器

每家厂商都公布了自己的爬虫,但真正会出现的要少得多。我们把访问自有站点的每个请求与 13 个已公布的 AI 爬虫 User-Agent 做匹配并计数——目前累计 8,672 次命中,来自 12 个不同的爬虫。

观测区间 2026-06-26 至 2026-08-05 · 共 41 天 · 8,672 次爬虫命中 · 仅我们自有的单一站点 trirankai.com

这个数据测了什么——以及没测什么:
  • 仅为我们自有站点的观测。所有命中都记录自 trirankai.com。这是单一网站的服务端观测,不是对全网的测量——我们不抓取任何他人站点,你站点上的爬虫构成也会与我们不同。
  • 统计的是 HTML 页面命中,不是全部请求。负责计数的边缘匹配器跳过 /api 路由、Next.js 内部路径以及所有带点的静态资源路径,因此爬虫同时抓取的图片、脚本与 API 调用都不计入这些数字。
  • 这是确定性的爬虫命中计数,不是「AI 带来的流量」。只有当请求的 User-Agent 含有厂商公布的爬虫标识时才记一次命中。一个人在 AI 助手里读到我们后再来访问,发送的是普通浏览器 User-Agent——这类访问在本页任何数字里都不会出现。
  • 单一爬虫占据了绝大部分。仅 Meta-ExternalAgent 一家就占全部命中的 79.2%,所以下方的占比列描述的只是抓取量,不代表哪个助手更可能引用你。 这一点很重要,因为 Meta-ExternalAgent 是 Meta 的内容与社交预览爬虫,并非问答引擎,它的抓取量几乎说明不了 AI 答案可见度。
8,672

整个观测窗口内在我们自有站点 trirankai.com 上记录到的 AI 爬虫命中次数

12

个爬虫在我们自有站点上至少出现过一次(追踪总数 13 个)

41

天连续观测,2026-06-26 至 2026-08-05

79.2%

的命中仅来自 Meta-ExternalAgent 一家

我们观测到的全部 AI 爬虫(按访问量)

命中数是 HTML 页面请求的原始计数。出现天数是更难粉饰的一列:它统计爬虫出现过的不同日期数,因此一个访问量小但持续来访的爬虫,在这一列的排名会与突发式抓取的爬虫明显不同。

爬虫命中占比出现天数首次至最近
Meta-ExternalAgent6,86979.2%222026-07-062026-07-31
GoogleOther4675.4%302026-06-262026-08-03
GPTBot4345%172026-06-282026-08-02
Amazonbot3604.2%262026-07-022026-08-05
PerplexityBot2763.2%292026-06-302026-08-04
OAI-SearchBot1091.3%152026-07-092026-08-04
ClaudeBot710.8%52026-07-092026-07-26
ChatGPT-User560.6%172026-07-022026-08-04
Perplexity-User170.2%62026-07-192026-08-02
Claude-User110.1%62026-06-272026-08-03
cohere-ai10%12026-07-192026-07-19
Bytespider10%12026-07-162026-07-16

占比保留一位小数,合计可能不恰好为 100%。我们追踪的 13 个爬虫中还有 1 个尚未出现,未列入表中——我们只能说它们没出现在我们的日志里,不能说它们不存在于网络上。

上表每一次命中都记录在我们自己的服务器上,所以这一页不报告关于你站点的任何事。它能交给你的是那份文件本身:robots.txt 生成器列出这里追踪的同样 13 个爬虫,按它们应当出现在 User-agent 行后的写法,另附只存在于 robots.txt、完全不发送 User-Agent、因而永远不可能出现在这类计数里的控制项。它在你的浏览器里运行,不上传任何内容。它不会让助手引用你:本页不主张被抓取与被引用之间存在任何关联。

月度趋势

即将推出

我们刻意暂不发布趋势曲线。41 天还不足一个完整自然月,用一个不完整的月份画趋势,等于把噪声当结论发布。等积累满至少两个完整月份后,本区块才会补上。

测量方法

我们的边缘中间件会检查每个 HTML 页面请求的 User-Agent。若其中含有 13 个逐字取自厂商文档的爬虫标识之一,就对该(爬虫,UTC 日期)计数器加一。访问者的任何信息都不会被存储——不存 IP、不存路径、不存会话,只记录匹配到哪个爬虫标识、发生在哪一天。

这些标识取自 OpenAI、Anthropic、Perplexity、Google、Amazon 与 Meta 公布的爬虫文档。Google-Extended 这类仅用于 robots.txt 的控制标识被刻意排除:它们根本不发送 User-Agent,统计它们等于凭空制造我们并不具备的覆盖度。

本页数字全部由脚本直接从上述计数器重新生成,绝不手工修改。没有记录的爬虫会被标为「尚未出现」而不是记作 0,因为我们的日志无法区分「它没来」和「它还没发现我们」这两件事。

常见问题

什么是 AI 爬虫?+

它是 AI 公司运行的机器人,用于抓取网页——或用于构建训练与搜索索引,或在回答问题时实时读取页面。每个爬虫都会用一个有文档记录的 User-Agent 标明身份:OpenAI 的 GPTBot、Anthropic 的 ClaudeBot、Perplexity 的 PerplexityBot 等等。正是这种自我标识,才使得统计它们成为可能。

你们具体是怎么测的?+

在服务端、在边缘、在我们自己的站点上测的。访问 trirankai.com 的每个 HTML 页面请求,其 User-Agent 都会与 13 个厂商公布的爬虫标识做匹配;命中则对应的「按爬虫、按天」计数器加一。在 2026-06-26 至 2026-08-05 期间,这产生了来自 12 个不同爬虫的 8,672 次命中。没有抽样也没有估算——这里的数字就是计数器本身。

爬虫来访是否意味着 AI 会引用我的站点?+

不是,而且这正是这类数据最常被误读的地方。被抓取是必要条件,但远不充分:它只说明有机器人取走了页面,不说明任何助手在回答问题时选用了这个页面作为来源。引用是另一套数据上的另一项测量——我们做 101 品牌引用基准,恰恰是因为抓取量回答不了这个问题。

为什么单个爬虫占了大部分流量?+

仅 Meta-ExternalAgent 一家就占我们命中的 79.2%。高访问量的爬虫通常在做大范围的内容与预览抓取,而不是在回答问题,因此某家占比高只说明它的抓取胃口大,不说明你在 AI 答案里有多可见。这也是我们把「出现天数」与原始命中并列的原因:两列给出的排名相当不同。

我能看到哪些 AI 爬虫访问了我自己的站点吗?+

在本页看不到——这些是我们的日志,单一站点的数字无法迁移到另一个站点。你可以免费检查的是从外部就能看见的那部分:你的页面是否对 AI 爬虫可达、robots.txt 是否屏蔽了它们,以及 AI 助手当前是否引用你。

AI 爬虫能抓到你的页面吗?

运行一次免费诊断,看看 AI 爬虫能否访问你的站点,以及助手今天是否引用你。