智能体网络与工业产品数据

发布于 2026-08-0911 分钟阅读agentic web · crawlers · Cloudflare · Web Bot Auth

简而言之

智能体网络正在如何改变工业制造商必须发布的内容?

网络正在分裂为一个为浏览器优化的人类界面,和一个为智能体优化的机器界面,而两者正被以不同的规则治理。自动化流量已经超过人类流量——Imperva 测得 2025 年全网 53% 的流量来自自动化程序——基础设施厂商如今开始对它计量收费:自 2026 年 9 月 15 日起,对于新建站点与免费套餐站点,Cloudflare 会在带有广告的页面上默认拦截 AI 训练类与智能体类爬虫,而按次抓取付费与基于加密签名的智能体身份,正在成为一刀切封锁之外的替代方案。对制造商而言,现实的后果是:可被抓取不再等于可被触达,而率先做到数据准确且可被触达的企业,会成为默认答案。

如今的网络有两类受众,而只有一类长着眼睛

三十年来,在网络上发布内容,意味着面向一个握着鼠标的人发布。由此衍生的一切——版面布局、JavaScript 框架、Cookie 提示条、分析统计、广告位——都默认另一端坐着一个人。

Nothing in the top row changes. The layer reads from what already exists and publishes it in the shapes agents actually request.

这一前提如今为假的时候,已经多于为真的时候。Imperva 的《2026 年恶意机器人报告》发现,2025 年自动化流量占到全部网络流量的 53%,高于此前的 51%,人类流量则降至 47%,并且仍在继续下滑。Cloudflare 在公布其 2026 年爬虫政策时给出了同样的判断:互联网上的大多数流量并非来自人类。

真正值得注意的后果不是这个比例,而是这两类受众如今被分开治理了——不同的访问规则、不同的定价、不同的身份要求。网络正在一分为二,裂成一个面向人的界面和一个面向机器的界面,而工业制造商花在后者上的时间,至今为零。

这笔经济账是怎么算崩的?

搜索之所以行得通,是因为它是一笔交易。爬虫取走你的页面,还给你访问者。发布者接受这笔买卖,是因为汇率对他们有利。

AI 检索把这个汇率打崩了。2025 年,Cloudflare 开始在 Radar 上发布抓取引荐比——每送回一次引荐所抓取的页面数——而这些数字与搜索时代“每送回一位访问者只抓取一两个页面、甚至更少”的常态相去甚远。在 2025 年 6 月下旬的一次采样中,Anthropic 的爬虫大约每引荐一次就抓取 70,900 个页面。Cloudflare 还在 2026 年报告称,超过一半的 AI 抓取流量,都花在了重复抓取内容并未发生变化的页面上。

与此同时,这笔交易中属于人的那一侧也在自行萎缩。SparkToro 测得,2026 年初美国有 68% 的 Google 搜索以零点击告终,每 1,000 次搜索大约只有 276 次点击流向开放网络,低于 2024 年的 374 次。

于是发布者面对的局面是:被抽取的越来越多,得到的补偿越来越少,然后他们做出了完全可以预料的反应。

但请务必看清:这套逻辑只适用于那些以内容本身为产品的生意。制造商的数据手册并不靠页面浏览量变现。它是为你按毛利出售的实物商品所准备的营销材料。如果某个助手把你的整个产品目录读了 70,000 遍,然后送来一位工程师,把你的零件选进一个 50 万件规模的项目,那你就赢了。把发布者关于抓取引荐比的抱怨不加辨别地搬进工业场景,得出的将是完全错误的政策。

这些收费闸门究竟在做什么

机制它是什么状态对制造商的意义
按用途分类Cloudflare 把 AI 流量拆分为搜索、智能体与训练三类,每一类都可单独控制已上线;新的默认规则自 2026 年 9 月 15 日起生效高——你应当按类别自行决定政策,而不是被动继承别人给的
广告页面默认拦截在带有广告的页面上默认拦截训练类与智能体类爬虫;用途混合的爬虫在这些页面上被完全拦截自 2026 年 9 月 15 日起,适用于新客户、新建站点与现有免费套餐站点间接——你的产品目录多半不带广告,但讨论你零件的行业媒体带
按次抓取付费返回带报价的 HTTP 402 响应,配合 crawler-max-price、crawler-exact-price 与 crawler-charged 三个请求头,在边缘完成结算私有测试阶段目前较低;但它标示了计量收费的走向
Web Bot Auth / 签名智能体通过 HTTP Message Signatures 与 Signature-Agent 请求头实现加密的智能体身份,取代 user-agent 字符串Cloudflare 已于 2025 年 8 月上线;正在 IETF 推进标准化高——这是向已知智能体提供其有权获取之数据的前提条件

最后一行才是商业上真正要紧的一行,也恰恰是整个工业供应领域里没有人在讨论的一行。

工业供应商真正赖以成交的一切——合同价格、锁定库存、针对特定客户的交期、认可的替代料清单——都是你无法公开发布的数据。这意味着今天的智能体拿到的是公开标价和一句笼统的库存说明,换句话说,它们拿到的是错的。可验证的智能体身份,能把“这个我们不能公开”变成“我们可以把它公开给这一个智能体,它代表的是这一位客户,并且全程留痕”。这不是一个拦截爬虫的故事,而是一个渠道赋能的故事,只不过它恰好跑在同一套管道上。

llms.txt 给出的教训

llms.txt 值得多说几句,因为它完美地展示了这个市场是如何把力气用错地方的。

这个提案本身是合理的:用一个纯文本文件告诉 AI 系统,你的优质内容在哪里。它被广泛采用,被每一份营销通讯反复报道。随后 Ahrefs 分析了 137,210 个域名,发现已发布的 llms.txt 文件中,有 97% 在 2026 年 5 月收到的请求数为零。真正发生的那些抓取里,大多数来自 SEO 审计工具而非 AI 系统;该研究也没有找到任何证据,表明它能提升在 ChatGPT、Perplexity 或 AI Overviews 中的被引用率。

与此同时,同一份数据集显示,AI 机器人占到全部请求的 19.5%,其中智能体基础设施是占比最大的 AI 类别,达 10.5%。机器确实来了,从不缺席。它们只是去抓取你真正的页面——而许多制造商的这些页面采用客户端渲染,因此返回的是一片空白。

这个教训适用的范围远不止一个文件。一项约定被广泛采用,不等于它被真正使用。可靠的检验标准,不是某个标准在舆论场上有多大声势,而是真实的客户端会不会去抓取它。目前能通过这一检验的只有两样东西:服务端渲染的 HTML,以及 Model Context Protocol 端点——截至 2026 年 3 月,MCP 的 SDK 月下载量已达约 9,700 万次,并已于 2025 年 12 月移交 Linux 基金会旗下的 Agentic AI Foundation 进行中立治理,AWS、Anthropic、Block、Bloomberg、Cloudflare、Google、Microsoft 与 OpenAI 均为白金会员。

监管的水流也朝着同一个方向

还有第二股力量正在把工业数据推向机器可读的形态,而它与 AI 毫无关系。

2026 年 7 月 16 日通过的《欧盟委员会实施条例 (EU) 2026/1778》,为依据《可持续产品生态设计条例》设立的数字产品护照登记系统确定了运行安排——包括架构、身份核验、注册、注册凭证、日志记录与留存。数日之后,欧盟委员会正式上线了该登记系统。建筑产品则依据修订后的《建筑产品条例》走另一条轨道,时间表也更长。

剥去合规语言的外衣,这项要求实质上就是:结构化、机器可读的产品数据,带有经过核验的身份与来源信息,并可由第三方检索获取。这几乎就是对一个面向智能体就绪的产品目录的描述。任何把数字产品护照(DPP)合规与 AI 可读性当作两个互不相干、各占一份预算的项目来做的制造商,都是在把同一份资产建两遍。

制造商实际上应该做什么

  1. 01测一测机器看到的是什么。用一个普通的非浏览器客户端去抓取你自己的目录页面。2026 年 8 月,Partsgraph 审计了全球 984 个分销商与制造商域名,其中 38% 未能向标准的非浏览器客户端返回任何可读的目录页面,AI 可见性得分的中位数是 100 分中的 50 分。客户端渲染是最常见的元凶,而它在任何常规的分析视图里都是隐形的。
  2. 02写一份明确的爬虫政策,并把它公布出来。按类别决定你允许什么:搜索索引、为生成回答而检索、智能体访问、训练。在同一次审计中,984 个域名里只有 19% 发布了点名主要机器人的明确 AI 爬虫政策——也就是说,五家里有四家在沿用 CDN 厂商替它们选定的默认设置;而随着边缘侧的默认规则不断收紧,沉默将被解读为“否”。
  3. 03在 2026 年 9 月 15 日之前检查你的 CDN 默认设置。如果你用的是免费套餐,或者正在上线新的站点资产,默认规则会在你毫无察觉的情况下改变。这是一件十分钟就能做完、却没有人排进日程的事。
  4. 04不要不加区分地封锁。照搬发布者的封锁姿态,等于是在为一笔你根本赚不到的收入做优化,同时放弃了一条你确实需要的分发渠道。
  5. 05稳定的数据静态提供,易变的数据实时提供。参数、合规状态与生命周期状态可以服务端渲染并结构化输出。库存、交期与合同价格,无论刷新频率多高都不可能被正确抓取,它们应当放在一个可查询的端点之后。
  6. 06为身份做准备,而不只是为访问做准备。签名智能体将让按权限区分的响应成为可能。那些已经把价格与库存数据规范化的供应商,能够立刻用上这一能力;没有做过的,则要把这段窗口期花在清洗数据上。
  7. 07监测准确性,而不只是可见性。一个言之凿凿却是错的交期,比压根查不到交期造成的商业损害更大,而这两者都不会出现在任何排名报告里。

为什么在这件事上抢先比通常更重要

早行动有一个具体的理由,而它不是那套常见的跑马圈地说辞。

助手会趋同。当一个模型找到某个来源,它能正确而低成本地回答一整类问题——解析起来毫无歧义,型号识别前后一致,页面之间也不自相矛盾——那么这个来源就会成为这一整类问题上阻力最小的那条路径。它会被检索得更多、被引用得更多,并在下一轮训练以及构建于其上的检索索引中被进一步强化。

这不是那种日后加大预算就能买回来的排名,因为其背后的机制不是竞价,而是默认。而工业领域的默认格外顽固,因为它们会被固化进那些长期留存的文档里:合格供应商名录、标准规范、物料清单模板。一个在 2026 年成为默认答案的零件,到 2031 年仍然躺在那份模板里。

对于那些想等局面明朗再说的人,随之而来的推论并不好受。抢先的代价,是做一个数据项目。落后的代价,却不是把同一个数据项目往后挪着做——而是要在一个已经成为默认答案的竞争对手面前,再去做这个数据项目。

[/audit](/audit) 上的免费评分工具会准确显示,机器今天从你的产品目录里读到了什么,以及缺口在哪里。

常见问题

2026 年 9 月 15 日会有什么变化?

Cloudflare 将不再把 AI 爬虫流量当作一个整体来对待,而是把它划分为搜索、智能体与训练三类。自该日起,在展示广告的页面上,训练类与智能体类爬虫将被默认拦截;那些不肯按请求声明自身用途、用途混合的爬虫,在这些页面上会被完全拦截。这些默认规则适用于新客户、现有客户新建的站点,以及所有现存的免费套餐站点;付费客户可以事先在安全设置中覆盖它们。

这会影响制造商的产品目录吗?

通常不会直接影响,因为这些默认规则以页面是否带有广告为触发条件,而多数制造商的产品目录并不投放广告。但它在两个间接层面上很重要。其一,那些讨论你零件的行业刊物、分销商内容与技术论坛往往靠广告养活,因此第三方对你产品的报道,可能会变得更难被助手获取。其二,它确立了一个先例:爬虫访问是一种按用途计量的许可——而这套模式会扩散开来。

什么是抓取引荐比,它为什么重要?

它指的是一家 AI 公司每送回一位访问者,需要抓取多少个页面。2025 年,Cloudflare 开始在 Radar 上发布这些比值,其中 Anthropic 的爬虫在 2025 年 6 月下旬的一次采样中,约为每引荐一次抓取 70,900 个页面,而传统搜索的常态是每送回一位访问者只抓取一两个页面、甚至更少。正是这个比值让发布者开始封锁。但对制造商而言,情况恰好是反过来的:你并不是靠流量来卖广告,因此高抓取引荐比对你不是成本——它是你没有付钱的分发。

我应该发布一个 llms.txt 文件吗?

它几乎不花什么成本,也几乎不起什么作用。Ahrefs 分析了 137,210 个域名,发现已发布的 llms.txt 文件中,有 97% 在 2026 年 5 月收到的请求数为零;真正发生的抓取里,大多数来自 SEO 工具而非 AI 系统,被引用率也没有任何可测量的提升。如果它是免费的,那就发一份;但绝不要让它替代服务端渲染的页面、结构化数据、数据源或查询端点。

什么是 Web Bot Auth,制造商为什么要关心它?

它是一种让自动化客户端以密码学方式证明自身身份的机制:基于 HTTP Message Signatures、为每个智能体配一把 Ed25519 密钥,再加上一个 Signature-Agent 请求头,而不再依赖极易伪造的 user-agent 字符串。Cloudflare 于 2025 年 8 月上线了签名智能体,首批接入的包括 ChatGPT agent 与 Block 的 Goose,这项工作目前正在 IETF 推进。它之所以重要,是因为它是“向不同智能体提供不同数据”的前提条件——而这正是合同价格与针对特定客户的库存信息,将来得以安全送达智能体的方式。

对工业供应商来说,封锁 AI 爬虫是个合理的默认做法吗?

几乎从来都不是。只有当你的内容本身就是产品、流量本身就是收入时——出版、媒体、研究——封锁才说得通。而对制造商或分销商而言,产品目录是实物商品的营销材料,在助手的回答中缺席,代价是丢掉一次选型。正确的姿态是有选择的:开放产品目录,公布明确的爬虫政策,并对那些真正具有商业敏感性的内容(例如合同价格)实行计量或身份验证。

欧盟监管与这件事是怎么互相作用的?

它出于不同的动机,却把事情推向同一个方向。2026 年 7 月 16 日的《欧盟委员会实施条例 (EU) 2026/1778》,为依据 ESPR 设立的欧盟数字产品护照登记系统确定了运行规则,欧盟委员会在数日后正式上线了该系统。建筑产品则依据修订后的《建筑产品条例》单独处理,时间表更靠后。其合规要求是:结构化、机器可读、带有经过核验的身份与来源信息的产品数据——这与智能体网络所需要的,基本上是同一份资产。那些为布鲁塞尔建一遍、又为助手再建一遍的制造商,是在浪费预算。

资料来源

  1. 01TechCrunch, Cloudflare's new policy pushes AI companies to pay for publishers' content (1 July 2026)
  2. 02Help Net Security, Cloudflare changes AI crawler access rules (2 July 2026)
  3. 03Cloudflare, Introducing pay per crawl
  4. 04Cloudflare, The crawl before the fall of referrals: crawl-to-refer ratios on Radar
  5. 05Cloudflare, The age of agents: cryptographically recognizing agent traffic (28 August 2025)
  6. 06IETF, HTTP Message Signatures for automated traffic architecture (Web Bot Auth)
  7. 07Ahrefs, We analysed 137,000 sites: 97% of llms.txt files never get read (May 2026)
  8. 08Imperva / Thales, 2026 Bad Bot Report: Bots in the Agentic Age
  9. 09SparkToro, In 2026, Less than One Third of Google Searches Still Send a Click
  10. 10Model Context Protocol, MCP joins the Agentic AI Foundation (9 December 2025)
  11. 11EUR-Lex, Commission Implementing Regulation (EU) 2026/1778 on the digital product passport registry (16 July 2026)
在您自己的产品目录上跑一遍

看清 AI 助手今天究竟能读取您产品的哪些信息、又有哪些读不到——爬虫抓取策略、目录覆盖率、数据手册可访问性,逐项评分,并与全球 984 家分销商和制造商对标。

为我的产品目录评分

相关现场笔记