智能体网络与工业产品数据
简而言之
智能体网络正在如何改变工业制造商必须发布的内容?
网络正在分裂为一个为浏览器优化的人类界面,和一个为智能体优化的机器界面,而两者正被以不同的规则治理。自动化流量已经超过人类流量——Imperva 测得 2025 年全网 53% 的流量来自自动化程序——基础设施厂商如今开始对它计量收费:自 2026 年 9 月 15 日起,对于新建站点与免费套餐站点,Cloudflare 会在带有广告的页面上默认拦截 AI 训练类与智能体类爬虫,而按次抓取付费与基于加密签名的智能体身份,正在成为一刀切封锁之外的替代方案。对制造商而言,现实的后果是:可被抓取不再等于可被触达,而率先做到数据准确且可被触达的企业,会成为默认答案。
如今的网络有两类受众,而只有一类长着眼睛
三十年来,在网络上发布内容,意味着面向一个握着鼠标的人发布。由此衍生的一切——版面布局、JavaScript 框架、Cookie 提示条、分析统计、广告位——都默认另一端坐着一个人。
这一前提如今为假的时候,已经多于为真的时候。Imperva 的《2026 年恶意机器人报告》发现,2025 年自动化流量占到全部网络流量的 53%,高于此前的 51%,人类流量则降至 47%,并且仍在继续下滑。Cloudflare 在公布其 2026 年爬虫政策时给出了同样的判断:互联网上的大多数流量并非来自人类。
真正值得注意的后果不是这个比例,而是这两类受众如今被分开治理了——不同的访问规则、不同的定价、不同的身份要求。网络正在一分为二,裂成一个面向人的界面和一个面向机器的界面,而工业制造商花在后者上的时间,至今为零。
这笔经济账是怎么算崩的?
搜索之所以行得通,是因为它是一笔交易。爬虫取走你的页面,还给你访问者。发布者接受这笔买卖,是因为汇率对他们有利。
AI 检索把这个汇率打崩了。2025 年,Cloudflare 开始在 Radar 上发布抓取引荐比——每送回一次引荐所抓取的页面数——而这些数字与搜索时代“每送回一位访问者只抓取一两个页面、甚至更少”的常态相去甚远。在 2025 年 6 月下旬的一次采样中,Anthropic 的爬虫大约每引荐一次就抓取 70,900 个页面。Cloudflare 还在 2026 年报告称,超过一半的 AI 抓取流量,都花在了重复抓取内容并未发生变化的页面上。
与此同时,这笔交易中属于人的那一侧也在自行萎缩。SparkToro 测得,2026 年初美国有 68% 的 Google 搜索以零点击告终,每 1,000 次搜索大约只有 276 次点击流向开放网络,低于 2024 年的 374 次。
于是发布者面对的局面是:被抽取的越来越多,得到的补偿越来越少,然后他们做出了完全可以预料的反应。
但请务必看清:这套逻辑只适用于那些以内容本身为产品的生意。制造商的数据手册并不靠页面浏览量变现。它是为你按毛利出售的实物商品所准备的营销材料。如果某个助手把你的整个产品目录读了 70,000 遍,然后送来一位工程师,把你的零件选进一个 50 万件规模的项目,那你就赢了。把发布者关于抓取引荐比的抱怨不加辨别地搬进工业场景,得出的将是完全错误的政策。
这些收费闸门究竟在做什么
| 机制 | 它是什么 | 状态 | 对制造商的意义 |
|---|---|---|---|
| 按用途分类 | Cloudflare 把 AI 流量拆分为搜索、智能体与训练三类,每一类都可单独控制 | 已上线;新的默认规则自 2026 年 9 月 15 日起生效 | 高——你应当按类别自行决定政策,而不是被动继承别人给的 |
| 广告页面默认拦截 | 在带有广告的页面上默认拦截训练类与智能体类爬虫;用途混合的爬虫在这些页面上被完全拦截 | 自 2026 年 9 月 15 日起,适用于新客户、新建站点与现有免费套餐站点 | 间接——你的产品目录多半不带广告,但讨论你零件的行业媒体带 |
| 按次抓取付费 | 返回带报价的 HTTP 402 响应,配合 crawler-max-price、crawler-exact-price 与 crawler-charged 三个请求头,在边缘完成结算 | 私有测试阶段 | 目前较低;但它标示了计量收费的走向 |
| Web Bot Auth / 签名智能体 | 通过 HTTP Message Signatures 与 Signature-Agent 请求头实现加密的智能体身份,取代 user-agent 字符串 | Cloudflare 已于 2025 年 8 月上线;正在 IETF 推进标准化 | 高——这是向已知智能体提供其有权获取之数据的前提条件 |
最后一行才是商业上真正要紧的一行,也恰恰是整个工业供应领域里没有人在讨论的一行。
工业供应商真正赖以成交的一切——合同价格、锁定库存、针对特定客户的交期、认可的替代料清单——都是你无法公开发布的数据。这意味着今天的智能体拿到的是公开标价和一句笼统的库存说明,换句话说,它们拿到的是错的。可验证的智能体身份,能把“这个我们不能公开”变成“我们可以把它公开给这一个智能体,它代表的是这一位客户,并且全程留痕”。这不是一个拦截爬虫的故事,而是一个渠道赋能的故事,只不过它恰好跑在同一套管道上。
llms.txt 给出的教训
llms.txt 值得多说几句,因为它完美地展示了这个市场是如何把力气用错地方的。
这个提案本身是合理的:用一个纯文本文件告诉 AI 系统,你的优质内容在哪里。它被广泛采用,被每一份营销通讯反复报道。随后 Ahrefs 分析了 137,210 个域名,发现已发布的 llms.txt 文件中,有 97% 在 2026 年 5 月收到的请求数为零。真正发生的那些抓取里,大多数来自 SEO 审计工具而非 AI 系统;该研究也没有找到任何证据,表明它能提升在 ChatGPT、Perplexity 或 AI Overviews 中的被引用率。
与此同时,同一份数据集显示,AI 机器人占到全部请求的 19.5%,其中智能体基础设施是占比最大的 AI 类别,达 10.5%。机器确实来了,从不缺席。它们只是去抓取你真正的页面——而许多制造商的这些页面采用客户端渲染,因此返回的是一片空白。
这个教训适用的范围远不止一个文件。一项约定被广泛采用,不等于它被真正使用。可靠的检验标准,不是某个标准在舆论场上有多大声势,而是真实的客户端会不会去抓取它。目前能通过这一检验的只有两样东西:服务端渲染的 HTML,以及 Model Context Protocol 端点——截至 2026 年 3 月,MCP 的 SDK 月下载量已达约 9,700 万次,并已于 2025 年 12 月移交 Linux 基金会旗下的 Agentic AI Foundation 进行中立治理,AWS、Anthropic、Block、Bloomberg、Cloudflare、Google、Microsoft 与 OpenAI 均为白金会员。
监管的水流也朝着同一个方向
还有第二股力量正在把工业数据推向机器可读的形态,而它与 AI 毫无关系。
2026 年 7 月 16 日通过的《欧盟委员会实施条例 (EU) 2026/1778》,为依据《可持续产品生态设计条例》设立的数字产品护照登记系统确定了运行安排——包括架构、身份核验、注册、注册凭证、日志记录与留存。数日之后,欧盟委员会正式上线了该登记系统。建筑产品则依据修订后的《建筑产品条例》走另一条轨道,时间表也更长。
剥去合规语言的外衣,这项要求实质上就是:结构化、机器可读的产品数据,带有经过核验的身份与来源信息,并可由第三方检索获取。这几乎就是对一个面向智能体就绪的产品目录的描述。任何把数字产品护照(DPP)合规与 AI 可读性当作两个互不相干、各占一份预算的项目来做的制造商,都是在把同一份资产建两遍。
制造商实际上应该做什么
- 01测一测机器看到的是什么。用一个普通的非浏览器客户端去抓取你自己的目录页面。2026 年 8 月,Partsgraph 审计了全球 984 个分销商与制造商域名,其中 38% 未能向标准的非浏览器客户端返回任何可读的目录页面,AI 可见性得分的中位数是 100 分中的 50 分。客户端渲染是最常见的元凶,而它在任何常规的分析视图里都是隐形的。
- 02写一份明确的爬虫政策,并把它公布出来。按类别决定你允许什么:搜索索引、为生成回答而检索、智能体访问、训练。在同一次审计中,984 个域名里只有 19% 发布了点名主要机器人的明确 AI 爬虫政策——也就是说,五家里有四家在沿用 CDN 厂商替它们选定的默认设置;而随着边缘侧的默认规则不断收紧,沉默将被解读为“否”。
- 03在 2026 年 9 月 15 日之前检查你的 CDN 默认设置。如果你用的是免费套餐,或者正在上线新的站点资产,默认规则会在你毫无察觉的情况下改变。这是一件十分钟就能做完、却没有人排进日程的事。
- 04不要不加区分地封锁。照搬发布者的封锁姿态,等于是在为一笔你根本赚不到的收入做优化,同时放弃了一条你确实需要的分发渠道。
- 05稳定的数据静态提供,易变的数据实时提供。参数、合规状态与生命周期状态可以服务端渲染并结构化输出。库存、交期与合同价格,无论刷新频率多高都不可能被正确抓取,它们应当放在一个可查询的端点之后。
- 06为身份做准备,而不只是为访问做准备。签名智能体将让按权限区分的响应成为可能。那些已经把价格与库存数据规范化的供应商,能够立刻用上这一能力;没有做过的,则要把这段窗口期花在清洗数据上。
- 07监测准确性,而不只是可见性。一个言之凿凿却是错的交期,比压根查不到交期造成的商业损害更大,而这两者都不会出现在任何排名报告里。
为什么在这件事上抢先比通常更重要
早行动有一个具体的理由,而它不是那套常见的跑马圈地说辞。
助手会趋同。当一个模型找到某个来源,它能正确而低成本地回答一整类问题——解析起来毫无歧义,型号识别前后一致,页面之间也不自相矛盾——那么这个来源就会成为这一整类问题上阻力最小的那条路径。它会被检索得更多、被引用得更多,并在下一轮训练以及构建于其上的检索索引中被进一步强化。
这不是那种日后加大预算就能买回来的排名,因为其背后的机制不是竞价,而是默认。而工业领域的默认格外顽固,因为它们会被固化进那些长期留存的文档里:合格供应商名录、标准规范、物料清单模板。一个在 2026 年成为默认答案的零件,到 2031 年仍然躺在那份模板里。
对于那些想等局面明朗再说的人,随之而来的推论并不好受。抢先的代价,是做一个数据项目。落后的代价,却不是把同一个数据项目往后挪着做——而是要在一个已经成为默认答案的竞争对手面前,再去做这个数据项目。
[/audit](/audit) 上的免费评分工具会准确显示,机器今天从你的产品目录里读到了什么,以及缺口在哪里。
常见问题
2026 年 9 月 15 日会有什么变化?
Cloudflare 将不再把 AI 爬虫流量当作一个整体来对待,而是把它划分为搜索、智能体与训练三类。自该日起,在展示广告的页面上,训练类与智能体类爬虫将被默认拦截;那些不肯按请求声明自身用途、用途混合的爬虫,在这些页面上会被完全拦截。这些默认规则适用于新客户、现有客户新建的站点,以及所有现存的免费套餐站点;付费客户可以事先在安全设置中覆盖它们。
这会影响制造商的产品目录吗?
通常不会直接影响,因为这些默认规则以页面是否带有广告为触发条件,而多数制造商的产品目录并不投放广告。但它在两个间接层面上很重要。其一,那些讨论你零件的行业刊物、分销商内容与技术论坛往往靠广告养活,因此第三方对你产品的报道,可能会变得更难被助手获取。其二,它确立了一个先例:爬虫访问是一种按用途计量的许可——而这套模式会扩散开来。
什么是抓取引荐比,它为什么重要?
它指的是一家 AI 公司每送回一位访问者,需要抓取多少个页面。2025 年,Cloudflare 开始在 Radar 上发布这些比值,其中 Anthropic 的爬虫在 2025 年 6 月下旬的一次采样中,约为每引荐一次抓取 70,900 个页面,而传统搜索的常态是每送回一位访问者只抓取一两个页面、甚至更少。正是这个比值让发布者开始封锁。但对制造商而言,情况恰好是反过来的:你并不是靠流量来卖广告,因此高抓取引荐比对你不是成本——它是你没有付钱的分发。
我应该发布一个 llms.txt 文件吗?
它几乎不花什么成本,也几乎不起什么作用。Ahrefs 分析了 137,210 个域名,发现已发布的 llms.txt 文件中,有 97% 在 2026 年 5 月收到的请求数为零;真正发生的抓取里,大多数来自 SEO 工具而非 AI 系统,被引用率也没有任何可测量的提升。如果它是免费的,那就发一份;但绝不要让它替代服务端渲染的页面、结构化数据、数据源或查询端点。
什么是 Web Bot Auth,制造商为什么要关心它?
它是一种让自动化客户端以密码学方式证明自身身份的机制:基于 HTTP Message Signatures、为每个智能体配一把 Ed25519 密钥,再加上一个 Signature-Agent 请求头,而不再依赖极易伪造的 user-agent 字符串。Cloudflare 于 2025 年 8 月上线了签名智能体,首批接入的包括 ChatGPT agent 与 Block 的 Goose,这项工作目前正在 IETF 推进。它之所以重要,是因为它是“向不同智能体提供不同数据”的前提条件——而这正是合同价格与针对特定客户的库存信息,将来得以安全送达智能体的方式。
对工业供应商来说,封锁 AI 爬虫是个合理的默认做法吗?
几乎从来都不是。只有当你的内容本身就是产品、流量本身就是收入时——出版、媒体、研究——封锁才说得通。而对制造商或分销商而言,产品目录是实物商品的营销材料,在助手的回答中缺席,代价是丢掉一次选型。正确的姿态是有选择的:开放产品目录,公布明确的爬虫政策,并对那些真正具有商业敏感性的内容(例如合同价格)实行计量或身份验证。
欧盟监管与这件事是怎么互相作用的?
它出于不同的动机,却把事情推向同一个方向。2026 年 7 月 16 日的《欧盟委员会实施条例 (EU) 2026/1778》,为依据 ESPR 设立的欧盟数字产品护照登记系统确定了运行规则,欧盟委员会在数日后正式上线了该系统。建筑产品则依据修订后的《建筑产品条例》单独处理,时间表更靠后。其合规要求是:结构化、机器可读、带有经过核验的身份与来源信息的产品数据——这与智能体网络所需要的,基本上是同一份资产。那些为布鲁塞尔建一遍、又为助手再建一遍的制造商,是在浪费预算。
资料来源
- 01TechCrunch, Cloudflare's new policy pushes AI companies to pay for publishers' content (1 July 2026)
- 02Help Net Security, Cloudflare changes AI crawler access rules (2 July 2026)
- 03Cloudflare, Introducing pay per crawl
- 04Cloudflare, The crawl before the fall of referrals: crawl-to-refer ratios on Radar
- 05Cloudflare, The age of agents: cryptographically recognizing agent traffic (28 August 2025)
- 06IETF, HTTP Message Signatures for automated traffic architecture (Web Bot Auth)
- 07Ahrefs, We analysed 137,000 sites: 97% of llms.txt files never get read (May 2026)
- 08Imperva / Thales, 2026 Bad Bot Report: Bots in the Agentic Age
- 09SparkToro, In 2026, Less than One Third of Google Searches Still Send a Click
- 10Model Context Protocol, MCP joins the Agentic AI Foundation (9 December 2025)
- 11EUR-Lex, Commission Implementing Regulation (EU) 2026/1778 on the digital product passport registry (16 July 2026)
看清 AI 助手今天究竟能读取您产品的哪些信息、又有哪些读不到——爬虫抓取策略、目录覆盖率、数据手册可访问性,逐项评分,并与全球 984 家分销商和制造商对标。
为我的产品目录评分相关现场笔记
工业品供应中的智能体商务:2026 年的现实
智能体商务在 2026 年究竟哪些部分真的跑得通,哪些只是被过度宣传;以及 OpenAI 撤回 Instant Checkout 这件事,为什么证明了真正的瓶颈是产品数据的准确性,而不是智能体的自主性。本文用可核查的数据…
市场AI 选型如何改变了 B2B 采购
工程师与采购人员如今在打开供应商网站之前,先去问 AI 助手。当短名单在供应商还不知情时就已由机器组装完成,这一变化对选型指定、设计注册与分销商的需求创造究竟意味着什么?本文用可核查的实测数据,梳理制造商与分销商手里还剩…
市场2026 年工程师如何用 AI 做元器件选型
AI 辅助元器件选型如今已近乎普及,但工程师仍会把每一项关键参数拿去对照数据手册核验。本文结合 2026 年的行业调研与 PCB-QA 基准测试说明,真正拖低准确率的往往不是模型,而是被困在 PDF 里的参数格式,并列出…