TriRank 数据

哪些 AI 爬虫真的会来访问网站——实测自 TriRank 自有服务器

每家厂商都公布了自己的爬虫,但真正会出现的要少得多。我们把访问自有站点的每个请求与 21 个已公布的 AI 爬虫 User-Agent 做匹配并计数——目前累计 14,041 次命中,来自 14 个不同的爬虫。

观测区间 2026-06-26 至 2026-09-07 · 共 74 天 · 14,041 次爬虫命中 · 仅我们自有的单一站点 trirankai.com

这个数据测了什么——以及没测什么:
  • 仅为我们自有站点的观测。所有命中都记录自 trirankai.com。这是单一网站的服务端观测,不是对全网的测量——我们不抓取任何他人站点,你站点上的爬虫构成也会与我们不同。
  • 统计的是 HTML 页面命中,不是全部请求。负责计数的边缘匹配器跳过 /api 路由、Next.js 内部路径以及所有带点的静态资源路径,因此爬虫同时抓取的图片、脚本与 API 调用都不计入这些数字。
  • 这是确定性的爬虫命中计数,不是「AI 带来的流量」。只有当请求的 User-Agent 含有厂商公布的爬虫标识时才记一次命中。一个人在 AI 助手里读到我们后再来访问,发送的是普通浏览器 User-Agent——这类访问在本页任何数字里都不会出现。
  • 单一爬虫占据了绝大部分。仅 Meta-ExternalAgent 一家就占全部命中的 58.5%,所以下方的占比列描述的只是抓取量,不代表哪个助手更可能引用你。 这一点很重要,因为 Meta-ExternalAgent 是 Meta 的内容与社交预览爬虫,并非问答引擎,它的抓取量几乎说明不了 AI 答案可见度。
14,041

整个观测窗口内在我们自有站点 trirankai.com 上记录到的 AI 爬虫命中次数

14

个爬虫在我们自有站点上至少出现过一次(追踪总数 21 个)

74

天连续观测,2026-06-26 至 2026-09-07

58.5%

的命中仅来自 Meta-ExternalAgent 一家

我们观测到的全部 AI 爬虫(按访问量)

命中数是 HTML 页面请求的原始计数。出现天数是更难粉饰的一列:它统计爬虫出现过的不同日期数,因此一个访问量小但持续来访的爬虫,在这一列的排名会与突发式抓取的爬虫明显不同。

自计数器启用以来,在边缘对每一次 HTML 请求计数。这些数字没有页面维度、也永远不会有——产生它们的那个计数器记的是爬虫和日期,而一次已经发生过的请求补不上路径。

爬虫命中占比出现天数首次至最近
Meta-ExternalAgent8,21658.5%382026-07-062026-09-04
Amazonbot2,18815.6%592026-07-022026-09-07
GoogleOther8736.2%552026-06-262026-09-07
GPTBot8716.2%272026-06-282026-09-05
PerplexityBot6104.3%562026-06-302026-09-07
ClaudeBot5914.2%152026-07-092026-09-04
OAI-SearchBot3622.6%392026-07-092026-09-07
ChatGPT-User2661.9%442026-07-022026-09-07
Claude-User270.2%142026-06-272026-09-05
Perplexity-User250.2%92026-07-192026-09-04
Bytespider70%52026-07-162026-09-04
Claude-SearchBot30%12026-09-042026-09-04
DuckAssistBot10%12026-09-072026-09-07
cohere-ai10%12026-07-192026-07-19

占比保留一位小数,合计可能不恰好为 100%。我们追踪的 21 个爬虫中还有 7 个尚未出现,未列入表中——我们只能说它们没出现在我们的日志里,不能说它们不存在于网络上。

上表每一次命中都记录在我们自己的服务器上,所以这一页不报告关于你站点的任何事。它能交给你的是那份文件本身:robots.txt 生成器列出这里追踪的同样 21 个爬虫,按它们应当出现在 User-agent 行后的写法,另附只存在于 robots.txt、完全不发送 User-Agent、因而永远不可能出现在这类计数里的控制项。它在你的浏览器里运行,不上传任何内容。它不会让助手引用你:本页不主张被抓取与被引用之间存在任何关联。

它们请求了哪些页面

从页面维度上线那天起记录,所以这个窗口比上面那个晚开始,两边的总数本来就不该对得上。

2026-09-062026-09-07

爬虫被请求的路径命中
Amazonbot/(other)15
GoogleOther/(other)15
ChatGPT-User/11
PerplexityBot/(other)10
Amazonbot/solutions4
GoogleOther/tools/ai-cited-reddit-threads4
GoogleOther/tools/alternatives-visibility-check4
GoogleOther/tools/claude-visibility-checker4
GoogleOther/tools/perplexity-visibility-checker4
OAI-SearchBot/(other)4
GoogleOther/tools/gemini-visibility-checker3
Amazonbot/blog/the-true-cost-of-manual-seo2
Amazonbot/changelog2
Amazonbot/contact2
Amazonbot/data/ai-citation-sources2
Amazonbot/data/dr-leaderboard2
Amazonbot/solutions/ai-visibility-healthcare-ai-tools2
Amazonbot/solutions/get-cited-by-ai-ecommerce2
GoogleOther/2
GoogleOther/blog/category2
GoogleOther/tools/brand-name-ai-check2
GoogleOther/tools/chatgpt-visibility-checker2
Amazonbot/1
Amazonbot/about1
Amazonbot/ai-models1
Amazonbot/blog1
Amazonbot/blog/ai-search-rank-tracking1
Amazonbot/blog/ai-seo-tools-for-small-business1
Amazonbot/blog/category1
Amazonbot/blog/how-to-rank-on-google1
Amazonbot/blog/how-to-track-brand-mentions-in-ai-search1
Amazonbot/blog/outrank-alternatives1
Amazonbot/blog/page1
Amazonbot/blog/perplexity-vs-chatgpt-for-search1
Amazonbot/blog/prompt-tracking-for-seo1
Amazonbot/blog/self-hosting-seo-stack-cost1
Amazonbot/blog/trirank-mcp-server-ai-search-visibility1
Amazonbot/compare/otterly-vs-trirank1
Amazonbot/compare/peec-vs-trirank1
Amazonbot/glossary/brand-mentions-in-ai1
Amazonbot/glossary/canonicalization1
Amazonbot/glossary/content-pruning1
Amazonbot/glossary/entity-seo1
Amazonbot/glossary/featured-snippet1
Amazonbot/glossary/keyword-density1
Amazonbot/glossary/llms-txt1
Amazonbot/glossary/query-fan-out1
Amazonbot/glossary/question-keywords1
Amazonbot/glossary/schema-markup1
Amazonbot/glossary/search-intent1
Amazonbot/glossary/seo-vs-geo1
Amazonbot/glossary/share-of-voice1
Amazonbot/glossary/sitemap-xml1
Amazonbot/glossary/thin-content1
Amazonbot/pricing1
Amazonbot/privacy1
Amazonbot/solutions/ai-visibility-hr-tools1
Amazonbot/solutions/track-ai-visibility-saas-founder1
Amazonbot/terms1
Amazonbot/tools/keywords-generator1

路径是「被请求的」,包含并不存在的页面。计数器在路由之前运行、看不到响应,所以一个探测我们从未发布过的 URL 的爬虫,与一个读真实页面的爬虫记下来一模一样。

显示请求数最高的 60 组。

月度趋势

即将推出

我们刻意暂不发布趋势曲线。74 天还不足一个完整自然月,用一个不完整的月份画趋势,等于把噪声当结论发布。等积累满至少两个完整月份后,本区块才会补上。

测量方法

我们的边缘中间件会检查每个 HTML 页面请求的 User-Agent。若其中含有 21 个逐字取自厂商文档的爬虫标识之一,就对该(爬虫,UTC 日期)计数器加一。访问者的任何信息都不会被存储——不存 IP、不存路径、不存会话,只记录匹配到哪个爬虫标识、发生在哪一天。

这些标识取自 OpenAI、Anthropic、Perplexity、Google、Amazon 与 Meta 公布的爬虫文档。Google-Extended 这类仅用于 robots.txt 的控制标识被刻意排除:它们根本不发送 User-Agent,统计它们等于凭空制造我们并不具备的覆盖度。

本页数字全部由脚本直接从上述计数器重新生成,绝不手工修改。没有记录的爬虫会被标为「尚未出现」而不是记作 0,因为我们的日志无法区分「它没来」和「它还没发现我们」这两件事。

常见问题

什么是 AI 爬虫?+

它是 AI 公司运行的机器人,用于抓取网页——或用于构建训练与搜索索引,或在回答问题时实时读取页面。每个爬虫都会用一个有文档记录的 User-Agent 标明身份:OpenAI 的 GPTBot、Anthropic 的 ClaudeBot、Perplexity 的 PerplexityBot 等等。正是这种自我标识,才使得统计它们成为可能。

你们具体是怎么测的?+

在服务端、在边缘、在我们自己的站点上测的。访问 trirankai.com 的每个 HTML 页面请求,其 User-Agent 都会与 21 个厂商公布的爬虫标识做匹配;命中则对应的「按爬虫、按天」计数器加一。在 2026-06-26 至 2026-09-07 期间,这产生了来自 14 个不同爬虫的 14,041 次命中。没有抽样也没有估算——这里的数字就是计数器本身。

爬虫来访是否意味着 AI 会引用我的站点?+

不是,而且这正是这类数据最常被误读的地方。被抓取是必要条件,但远不充分:它只说明有机器人取走了页面,不说明任何助手在回答问题时选用了这个页面作为来源。引用是另一套数据上的另一项测量——我们做 101 品牌引用基准,恰恰是因为抓取量回答不了这个问题。

为什么单个爬虫占了大部分流量?+

仅 Meta-ExternalAgent 一家就占我们命中的 58.5%。高访问量的爬虫通常在做大范围的内容与预览抓取,而不是在回答问题,因此某家占比高只说明它的抓取胃口大,不说明你在 AI 答案里有多可见。这也是我们把「出现天数」与原始命中并列的原因:两列给出的排名相当不同。

我能看到哪些 AI 爬虫访问了我自己的站点吗?+

在本页看不到——这些是我们的日志,单一站点的数字无法迁移到另一个站点。你可以免费检查的是从外部就能看见的那部分:你的页面是否对 AI 爬虫可达、robots.txt 是否屏蔽了它们,以及 AI 助手当前是否引用你。

AI 爬虫能抓到你的页面吗?

运行一次免费诊断,看看 AI 爬虫能否访问你的站点,以及助手今天是否引用你。