哪些 AI 爬虫真的会来访问网站——实测自 TriRank 自有服务器
每家厂商都公布了自己的爬虫,但真正会出现的要少得多。我们把访问自有站点的每个请求与 21 个已公布的 AI 爬虫 User-Agent 做匹配并计数——目前累计 14,041 次命中,来自 14 个不同的爬虫。
观测区间 2026-06-26 至 2026-09-07 · 共 74 天 · 14,041 次爬虫命中 · 仅我们自有的单一站点 trirankai.com
- 仅为我们自有站点的观测。所有命中都记录自 trirankai.com。这是单一网站的服务端观测,不是对全网的测量——我们不抓取任何他人站点,你站点上的爬虫构成也会与我们不同。
- 统计的是 HTML 页面命中,不是全部请求。负责计数的边缘匹配器跳过 /api 路由、Next.js 内部路径以及所有带点的静态资源路径,因此爬虫同时抓取的图片、脚本与 API 调用都不计入这些数字。
- 这是确定性的爬虫命中计数,不是「AI 带来的流量」。只有当请求的 User-Agent 含有厂商公布的爬虫标识时才记一次命中。一个人在 AI 助手里读到我们后再来访问,发送的是普通浏览器 User-Agent——这类访问在本页任何数字里都不会出现。
- 单一爬虫占据了绝大部分。仅 Meta-ExternalAgent 一家就占全部命中的 58.5%,所以下方的占比列描述的只是抓取量,不代表哪个助手更可能引用你。 这一点很重要,因为 Meta-ExternalAgent 是 Meta 的内容与社交预览爬虫,并非问答引擎,它的抓取量几乎说明不了 AI 答案可见度。
整个观测窗口内在我们自有站点 trirankai.com 上记录到的 AI 爬虫命中次数
个爬虫在我们自有站点上至少出现过一次(追踪总数 21 个)
天连续观测,2026-06-26 至 2026-09-07
的命中仅来自 Meta-ExternalAgent 一家
我们观测到的全部 AI 爬虫(按访问量)
命中数是 HTML 页面请求的原始计数。出现天数是更难粉饰的一列:它统计爬虫出现过的不同日期数,因此一个访问量小但持续来访的爬虫,在这一列的排名会与突发式抓取的爬虫明显不同。
自计数器启用以来,在边缘对每一次 HTML 请求计数。这些数字没有页面维度、也永远不会有——产生它们的那个计数器记的是爬虫和日期,而一次已经发生过的请求补不上路径。
| 爬虫 | 命中 | 占比 | 出现天数 | 首次至最近 |
|---|---|---|---|---|
| Meta-ExternalAgent | 8,216 | 58.5% | 38 | 2026-07-06 → 2026-09-04 |
| Amazonbot | 2,188 | 15.6% | 59 | 2026-07-02 → 2026-09-07 |
| GoogleOther | 873 | 6.2% | 55 | 2026-06-26 → 2026-09-07 |
| GPTBot | 871 | 6.2% | 27 | 2026-06-28 → 2026-09-05 |
| PerplexityBot | 610 | 4.3% | 56 | 2026-06-30 → 2026-09-07 |
| ClaudeBot | 591 | 4.2% | 15 | 2026-07-09 → 2026-09-04 |
| OAI-SearchBot | 362 | 2.6% | 39 | 2026-07-09 → 2026-09-07 |
| ChatGPT-User | 266 | 1.9% | 44 | 2026-07-02 → 2026-09-07 |
| Claude-User | 27 | 0.2% | 14 | 2026-06-27 → 2026-09-05 |
| Perplexity-User | 25 | 0.2% | 9 | 2026-07-19 → 2026-09-04 |
| Bytespider | 7 | 0% | 5 | 2026-07-16 → 2026-09-04 |
| Claude-SearchBot | 3 | 0% | 1 | 2026-09-04 → 2026-09-04 |
| DuckAssistBot | 1 | 0% | 1 | 2026-09-07 → 2026-09-07 |
| cohere-ai | 1 | 0% | 1 | 2026-07-19 → 2026-07-19 |
占比保留一位小数,合计可能不恰好为 100%。我们追踪的 21 个爬虫中还有 7 个尚未出现,未列入表中——我们只能说它们没出现在我们的日志里,不能说它们不存在于网络上。
上表每一次命中都记录在我们自己的服务器上,所以这一页不报告关于你站点的任何事。它能交给你的是那份文件本身:robots.txt 生成器列出这里追踪的同样 21 个爬虫,按它们应当出现在 User-agent 行后的写法,另附只存在于 robots.txt、完全不发送 User-Agent、因而永远不可能出现在这类计数里的控制项。它在你的浏览器里运行,不上传任何内容。它不会让助手引用你:本页不主张被抓取与被引用之间存在任何关联。
它们请求了哪些页面
从页面维度上线那天起记录,所以这个窗口比上面那个晚开始,两边的总数本来就不该对得上。
2026-09-06 → 2026-09-07
| 爬虫 | 被请求的路径 | 命中 |
|---|---|---|
| Amazonbot | /(other) | 15 |
| GoogleOther | /(other) | 15 |
| ChatGPT-User | / | 11 |
| PerplexityBot | /(other) | 10 |
| Amazonbot | /solutions | 4 |
| GoogleOther | /tools/ai-cited-reddit-threads | 4 |
| GoogleOther | /tools/alternatives-visibility-check | 4 |
| GoogleOther | /tools/claude-visibility-checker | 4 |
| GoogleOther | /tools/perplexity-visibility-checker | 4 |
| OAI-SearchBot | /(other) | 4 |
| GoogleOther | /tools/gemini-visibility-checker | 3 |
| Amazonbot | /blog/the-true-cost-of-manual-seo | 2 |
| Amazonbot | /changelog | 2 |
| Amazonbot | /contact | 2 |
| Amazonbot | /data/ai-citation-sources | 2 |
| Amazonbot | /data/dr-leaderboard | 2 |
| Amazonbot | /solutions/ai-visibility-healthcare-ai-tools | 2 |
| Amazonbot | /solutions/get-cited-by-ai-ecommerce | 2 |
| GoogleOther | / | 2 |
| GoogleOther | /blog/category | 2 |
| GoogleOther | /tools/brand-name-ai-check | 2 |
| GoogleOther | /tools/chatgpt-visibility-checker | 2 |
| Amazonbot | / | 1 |
| Amazonbot | /about | 1 |
| Amazonbot | /ai-models | 1 |
| Amazonbot | /blog | 1 |
| Amazonbot | /blog/ai-search-rank-tracking | 1 |
| Amazonbot | /blog/ai-seo-tools-for-small-business | 1 |
| Amazonbot | /blog/category | 1 |
| Amazonbot | /blog/how-to-rank-on-google | 1 |
| Amazonbot | /blog/how-to-track-brand-mentions-in-ai-search | 1 |
| Amazonbot | /blog/outrank-alternatives | 1 |
| Amazonbot | /blog/page | 1 |
| Amazonbot | /blog/perplexity-vs-chatgpt-for-search | 1 |
| Amazonbot | /blog/prompt-tracking-for-seo | 1 |
| Amazonbot | /blog/self-hosting-seo-stack-cost | 1 |
| Amazonbot | /blog/trirank-mcp-server-ai-search-visibility | 1 |
| Amazonbot | /compare/otterly-vs-trirank | 1 |
| Amazonbot | /compare/peec-vs-trirank | 1 |
| Amazonbot | /glossary/brand-mentions-in-ai | 1 |
| Amazonbot | /glossary/canonicalization | 1 |
| Amazonbot | /glossary/content-pruning | 1 |
| Amazonbot | /glossary/entity-seo | 1 |
| Amazonbot | /glossary/featured-snippet | 1 |
| Amazonbot | /glossary/keyword-density | 1 |
| Amazonbot | /glossary/llms-txt | 1 |
| Amazonbot | /glossary/query-fan-out | 1 |
| Amazonbot | /glossary/question-keywords | 1 |
| Amazonbot | /glossary/schema-markup | 1 |
| Amazonbot | /glossary/search-intent | 1 |
| Amazonbot | /glossary/seo-vs-geo | 1 |
| Amazonbot | /glossary/share-of-voice | 1 |
| Amazonbot | /glossary/sitemap-xml | 1 |
| Amazonbot | /glossary/thin-content | 1 |
| Amazonbot | /pricing | 1 |
| Amazonbot | /privacy | 1 |
| Amazonbot | /solutions/ai-visibility-hr-tools | 1 |
| Amazonbot | /solutions/track-ai-visibility-saas-founder | 1 |
| Amazonbot | /terms | 1 |
| Amazonbot | /tools/keywords-generator | 1 |
路径是「被请求的」,包含并不存在的页面。计数器在路由之前运行、看不到响应,所以一个探测我们从未发布过的 URL 的爬虫,与一个读真实页面的爬虫记下来一模一样。
显示请求数最高的 60 组。
月度趋势
即将推出我们刻意暂不发布趋势曲线。74 天还不足一个完整自然月,用一个不完整的月份画趋势,等于把噪声当结论发布。等积累满至少两个完整月份后,本区块才会补上。
测量方法
我们的边缘中间件会检查每个 HTML 页面请求的 User-Agent。若其中含有 21 个逐字取自厂商文档的爬虫标识之一,就对该(爬虫,UTC 日期)计数器加一。访问者的任何信息都不会被存储——不存 IP、不存路径、不存会话,只记录匹配到哪个爬虫标识、发生在哪一天。
这些标识取自 OpenAI、Anthropic、Perplexity、Google、Amazon 与 Meta 公布的爬虫文档。Google-Extended 这类仅用于 robots.txt 的控制标识被刻意排除:它们根本不发送 User-Agent,统计它们等于凭空制造我们并不具备的覆盖度。
本页数字全部由脚本直接从上述计数器重新生成,绝不手工修改。没有记录的爬虫会被标为「尚未出现」而不是记作 0,因为我们的日志无法区分「它没来」和「它还没发现我们」这两件事。
常见问题
什么是 AI 爬虫?+
它是 AI 公司运行的机器人,用于抓取网页——或用于构建训练与搜索索引,或在回答问题时实时读取页面。每个爬虫都会用一个有文档记录的 User-Agent 标明身份:OpenAI 的 GPTBot、Anthropic 的 ClaudeBot、Perplexity 的 PerplexityBot 等等。正是这种自我标识,才使得统计它们成为可能。
你们具体是怎么测的?+
在服务端、在边缘、在我们自己的站点上测的。访问 trirankai.com 的每个 HTML 页面请求,其 User-Agent 都会与 21 个厂商公布的爬虫标识做匹配;命中则对应的「按爬虫、按天」计数器加一。在 2026-06-26 至 2026-09-07 期间,这产生了来自 14 个不同爬虫的 14,041 次命中。没有抽样也没有估算——这里的数字就是计数器本身。
爬虫来访是否意味着 AI 会引用我的站点?+
不是,而且这正是这类数据最常被误读的地方。被抓取是必要条件,但远不充分:它只说明有机器人取走了页面,不说明任何助手在回答问题时选用了这个页面作为来源。引用是另一套数据上的另一项测量——我们做 101 品牌引用基准,恰恰是因为抓取量回答不了这个问题。
为什么单个爬虫占了大部分流量?+
仅 Meta-ExternalAgent 一家就占我们命中的 58.5%。高访问量的爬虫通常在做大范围的内容与预览抓取,而不是在回答问题,因此某家占比高只说明它的抓取胃口大,不说明你在 AI 答案里有多可见。这也是我们把「出现天数」与原始命中并列的原因:两列给出的排名相当不同。
我能看到哪些 AI 爬虫访问了我自己的站点吗?+
在本页看不到——这些是我们的日志,单一站点的数字无法迁移到另一个站点。你可以免费检查的是从外部就能看见的那部分:你的页面是否对 AI 爬虫可达、robots.txt 是否屏蔽了它们,以及 AI 助手当前是否引用你。