每家厂商都公布了自己的爬虫,但真正会出现的要少得多。我们把访问自有站点的每个请求与 13 个已公布的 AI 爬虫 User-Agent 做匹配并计数——目前累计 5,258 次命中,来自 12 个不同的爬虫。
观测区间 2026-06-26 至 2026-07-20 · 共 25 天 · 5,258 次爬虫命中 · 仅我们自有的单一站点 trirankai.com
整个观测窗口内在我们自有站点 trirankai.com 上记录到的 AI 爬虫命中次数
个爬虫在我们自有站点上至少出现过一次(追踪总数 13 个)
天连续观测,2026-06-26 至 2026-07-20
的命中仅来自 Meta-ExternalAgent 一家
命中数是 HTML 页面请求的原始计数。出现天数是更难粉饰的一列:它统计爬虫出现过的不同日期数,因此一个访问量小但持续来访的爬虫,在这一列的排名会与突发式抓取的爬虫明显不同。
| 爬虫 | 命中 | 占比 | 出现天数 | 首次至最近 |
|---|---|---|---|---|
| Meta-ExternalAgent | 4,083 | 77.7% | 11 | 2026-07-06 → 2026-07-20 |
| GoogleOther | 350 | 6.7% | 18 | 2026-06-26 → 2026-07-20 |
| Amazonbot | 330 | 6.3% | 16 | 2026-07-02 → 2026-07-19 |
| GPTBot | 310 | 5.9% | 11 | 2026-06-28 → 2026-07-19 |
| OAI-SearchBot | 65 | 1.2% | 3 | 2026-07-09 → 2026-07-19 |
| PerplexityBot | 49 | 0.9% | 15 | 2026-06-30 → 2026-07-20 |
| ChatGPT-User | 34 | 0.6% | 9 | 2026-07-02 → 2026-07-19 |
| ClaudeBot | 25 | 0.5% | 3 | 2026-07-09 → 2026-07-19 |
| Claude-User | 9 | 0.2% | 4 | 2026-06-27 → 2026-07-11 |
| Perplexity-User | 1 | 0% | 1 | 2026-07-19 → 2026-07-19 |
| cohere-ai | 1 | 0% | 1 | 2026-07-19 → 2026-07-19 |
| Bytespider | 1 | 0% | 1 | 2026-07-16 → 2026-07-16 |
占比保留一位小数,合计可能不恰好为 100%。我们追踪的 13 个爬虫中还有 1 个尚未出现,未列入表中——我们只能说它们没出现在我们的日志里,不能说它们不存在于网络上。
我们刻意暂不发布趋势曲线。25 天还不足一个完整自然月,用一个不完整的月份画趋势,等于把噪声当结论发布。等积累满至少两个完整月份后,本区块才会补上。
我们的边缘中间件会检查每个 HTML 页面请求的 User-Agent。若其中含有 13 个逐字取自厂商文档的爬虫标识之一,就对该(爬虫,UTC 日期)计数器加一。访问者的任何信息都不会被存储——不存 IP、不存路径、不存会话,只记录匹配到哪个爬虫标识、发生在哪一天。
这些标识取自 OpenAI、Anthropic、Perplexity、Google、Amazon 与 Meta 公布的爬虫文档。Google-Extended 这类仅用于 robots.txt 的控制标识被刻意排除:它们根本不发送 User-Agent,统计它们等于凭空制造我们并不具备的覆盖度。
本页数字全部由脚本直接从上述计数器重新生成,绝不手工修改。没有记录的爬虫会被标为「尚未出现」而不是记作 0,因为我们的日志无法区分「它没来」和「它还没发现我们」这两件事。
它是 AI 公司运行的机器人,用于抓取网页——或用于构建训练与搜索索引,或在回答问题时实时读取页面。每个爬虫都会用一个有文档记录的 User-Agent 标明身份:OpenAI 的 GPTBot、Anthropic 的 ClaudeBot、Perplexity 的 PerplexityBot 等等。正是这种自我标识,才使得统计它们成为可能。
在服务端、在边缘、在我们自己的站点上测的。访问 trirankai.com 的每个 HTML 页面请求,其 User-Agent 都会与 13 个厂商公布的爬虫标识做匹配;命中则对应的「按爬虫、按天」计数器加一。在 2026-06-26 至 2026-07-20 期间,这产生了来自 12 个不同爬虫的 5,258 次命中。没有抽样也没有估算——这里的数字就是计数器本身。
不是,而且这正是这类数据最常被误读的地方。被抓取是必要条件,但远不充分:它只说明有机器人取走了页面,不说明任何助手在回答问题时选用了这个页面作为来源。引用是另一套数据上的另一项测量——我们做 101 品牌引用基准,恰恰是因为抓取量回答不了这个问题。
仅 Meta-ExternalAgent 一家就占我们命中的 77.7%。高访问量的爬虫通常在做大范围的内容与预览抓取,而不是在回答问题,因此某家占比高只说明它的抓取胃口大,不说明你在 AI 答案里有多可见。这也是我们把「出现天数」与原始命中并列的原因:两列给出的排名相当不同。
在本页看不到——这些是我们的日志,单一站点的数字无法迁移到另一个站点。你可以免费检查的是从外部就能看见的那部分:你的页面是否对 AI 爬虫可达、robots.txt 是否屏蔽了它们,以及 AI 助手当前是否引用你。