什么是智能体就绪的产品目录?
简而言之
什么是智能体就绪的产品目录?
智能体就绪的产品目录,是指机器无需人操作浏览器,就能找到、读取、查询并正确引用的产品目录。落到实处,它意味着四个彼此独立的接触面:由服务端完整渲染、携带结构化数据、让不执行 JavaScript 的爬虫也能解析的页面;同一批记录的纯文本视图;推送给那些只接受推送数据的助手的产品数据流;以及智能体可以直接调用的托管 MCP 端点。这四者不可互相替代——每一个面对的助手都不一样——而且如果底层没有一份唯一的、经过核验的产品记录,它们全都无从谈起。
“智能体就绪”到底意味着什么?
当一台机器无需人操作浏览器,就能找到、读取、查询一份产品目录并正确引用其中的内容时,这份目录才算得上智能体就绪。
这比“我们有一个不错的网站”要严苛得多,而且它失败的原因,在任何一份页面速度报告里都不会露面。一份目录可以排名很好、转化很好、界面无可挑剔,却仍然向 AI 助手真正使用的那个客户端返回一份空文档。这里的差距是结构性的,不是表面功夫的问题。
- 01 · Crawler policyDoes robots.txt name AI crawlers? Silence is not neutral — as edges default to blocking unverified agents, an unstated policy resolves to no.
- 02 · ReachabilityDoes a non-browser client get through your WAF, or meet a challenge interstitial?
- 03 · ReadabilityAre specs in the HTML, or injected by JavaScript the crawler will never run?
- 04 · CoverageHow much of the catalogue is actually reachable — sitemaps, regional hosts, gzipped indexes, datasheet PDFs?
- 05 · Agent surfacesCan an agent query you directly: llms.txt, markdown views, product feeds, an MCP endpoint?
而且这件事每过一个季度就更要紧一分。Forrester 在 2026 年 1 月发布的采购方旅程调研中报告:94% 的企业采购者如今会在采购过程中使用 AI;把生成式 AI 或对话式搜索列为最有价值信息来源的采购者,人数是其他任何来源的两倍——排在供应商网站、产品专家和销售代表之前。助手在复述你产品规格时说出的那些数字,正越来越多地成为你的买家所相信的数字。
眼下多数相关文章的混乱之处在于,把“智能体就绪”当成了一件事。它其实是四件事,对应四类不同的消费方。
哪些助手在消费哪一个接触面?
| 接触面 | 它是什么 | 今天由谁消费 | 它做不到什么 |
|---|---|---|---|
| 服务端渲染的结构化数据 | 由服务器直接返回完整的 HTML,并带有与可见文本一致的 schema.org JSON-LD | 检索与搜索类爬虫:OAI-SearchBot、Claude-SearchBot、PerplexityBot,以及为 AI Overviews 和 AI Mode 抓取的 Googlebot | 返回实时库存、执行合同价,或回答参数化查询 |
| Markdown / 纯文本视图 | 同一批记录的低噪声文本呈现,有时挂在 .md 结尾的 URL 上,有时藏在内容协商之后 | 没有任何面向消费者的助手公布过内容协商约定;它的价值主要在于充当便于提取的源文本,以及 MCP 的返回载荷 | 仅凭它自己让你被索引;它不是排名机制 |
| 推送式产品数据流 | 由你按固定周期投送给助手的结构化目录文件 | ChatGPT 的购物入口和 Perplexity 的商家索引,两者都要求你主动推送——都不会为此来抓取你的网站 | 承载工程深度;零售数据流的结构默认存在 GTIN、目录价和一个可直接下单的 SKU |
| MCP 端点 | 一台托管的服务器,对外暴露带类型定义的工具,供智能体经 HTTP 调用 | Claude(全部套餐)、ChatGPT 开发者模式与应用、Gemini Enterprise、Copilot、IDE 智能体,以及你客户自己的智能体 | 触达匿名长尾;必须由用户本人或其管理员主动接入 |
1. 带结构化数据的服务端渲染页面
这是唯一一个能触达“什么都没配置过”的助手用户的接触面。
关于它,最要紧的一条技术事实是:AI 爬虫不会执行你的 JavaScript。Vercel 的爬虫分析——单月 5.69 亿次 GPTBot 抓取和 3.70 亿次 Claude 抓取——发现这些爬虫虽然确实会下载 JavaScript 文件(分别占请求量的 11.50% 和 23.84%),却从不执行它们,并得出结论:“目前没有任何一个主流 AI 爬虫会渲染 JavaScript”,点名了 OpenAI、Anthropic、Meta、字节跳动和 Perplexity。贯穿 2026 年的独立复测得出了同样的判断。如果你的参数表、库存指示或文档清单是在客户端注入的,那么对这些客户端而言,它们根本不存在。Googlebot 会渲染 JavaScript,至今仍是那个例外——而这恰恰就是为什么那些只在 Google 里检查自己可见性的团队,会错误地断定一切正常。
至于其余部分,Google 自己的指引直白得令人耳目一新:想出现在 AI Overviews 或 AI Mode 中,“页面必须已被索引,并且有资格带摘要出现在 Google 搜索结果里”,除此之外没有额外的技术要求、没有 AI 专用的 schema,也没有什么特殊文件。结构化数据依然值得做,因为它能消除歧义——让机器分得清哪个数字是额定电流、哪个是峰值——但它是一件消歧工具,不是什么魔法开关。
最后,爬虫这一层还有一个大多数目录都忽略掉的策略维度。OpenAI 公开记录了三个彼此独立的抓取代理:用于基础模型训练的 GPTBot、负责让站点出现在 ChatGPT 搜索里的 OAI-SearchBot,以及响应用户即时抓取请求的 ChatGPT-User。Anthropic 按同样的模式公布了 ClaudeBot、Claude-User 和 Claude-SearchBot。它们在 robots.txt 里是各自独立的条目。一条冲着训练去的一刀切禁止规则,同时也会关掉那个本可以引用你的检索爬虫。
2. Markdown 与纯文本视图
这是 2026 年被吹得最过头的一个接触面,所以有必要把话说准。
没有任何一款主流消费级助手公布过这样的内容协商约定:“发 Accept: text/markdown 给我,我会优先采用它”。llms.txt 这套约定在技术上是自洽的,在开发者文档类站点中也确有采用,但 Google 明确表示,你并不需要 AI 文本文件才能出现在它的 AI 功能里;而贯穿 2026 年的采用度研究也发现,OpenAI、Google 和 Anthropic 的爬虫并没有以任何有意义的量级去请求这个文件。
真正成立的那部分要窄得多,但仍然值得做。从一个导航繁重、脚本繁重的页面里抽出来的文本,噪声远高于直接以正文形式提供的文本,所以纯净视图在提取环节的存活率更高。而同一份纯净呈现,恰恰就是你的 MCP 工具应当作为载荷返回的东西。把 Markdown 视图当作规范记录的一件复用产物来做,而不是当作增长手段,你就不会失望。
3. 推送式产品数据流
有一条事实会重排大多数团队的路线图:ChatGPT 的购物入口,是靠商家推送的数据喂出来的,不是靠抓取。按已公布的数据流规范,商家通过加密的 HTTPS,把 TSV、CSV、XML 或 JSON 投送到一个双方约定并列入白名单的端点,系统最快可每 15 分钟接收一次更新。Perplexity 的商家计划在形态上如出一辙——产品数据以指定格式的 CSV 或 XML 文件提供,由商家负责投送。再多的页面内优化,也替代不了先去报名加入。
对工业品目录来说,一句必须说清的保留意见是:这些结构是照着零售业的形状设计的。它们默认存在 GTIN、目录价和一个可直接下单的变体。一家有 4 万个料号、价格按客户逐一签约、且有一半产品线根本没有 GTIN 的分销商,会发现两者并不契合。当你面向可识别的终端买家、按公开价格销售时,数据流的价值很高;而当你走报价流程时,它基本无关紧要。
4. 一个 MCP 端点
MCP 是保真度最高的那个接触面,同时在今天也是受众最窄的一个。这里有必要说得精确,因为不同助手之间的触达面差异极大:
- Claude 在 Free、Pro、Max、Team 和 Enterprise 各档套餐上都支持自定义远程 MCP 连接器,免费用户限用一个连接器。服务器必须能从 Anthropic 的 IP 段经公网访问到。
- ChatGPT 通过开发者模式接入自定义 MCP 服务器;具备写入能力的自定义连接器仅限 Business、Enterprise 和 Edu 使用,个人版 Plus 与 Pro 用户只能用只读的。支撑 ChatGPT 内应用的 Apps SDK 本身就构建在 MCP 之上,提交上架需经过目录审核。
- Gemini 通过 Gemini Enterprise 提供自定义 MCP 服务器连接:由管理员把你的 Streamable HTTP 服务器注册为其租户内的一个数据存储。这不是一项面向消费者的功能。
所以,真正能被触达的人群是:会自己配置连接器的工程师,以及其 IT 部门会去注册你服务器的企业采购方。对一家元器件或建筑产品制造商而言,这恰好精准描述了规格制定者和采购团队——但他们不是匿名长尾。谁要是告诉你,光靠一个 MCP 端点就能让你“在 AI 里可见”,那他一定是在推销什么。
为什么一个空的 MCP 服务器毫无价值?
因为一次工具调用就是一次关于正确性的承诺,而经由工具给出的错误答案,比根本不给答案更糟。
当助手读取你的网页时,它会留有余地:模型知道自己是在概括一份文档。而当它调用 get_part 并收到 {"rated_current_a": 32} 时,它不会留余地。它会把这个数字直接说出来。如果你的 PIM 里,壳架等级对应的是 32 A、具体型号对应的是 25 A,而工具解析到了错的那一个,那么你并没有提升自己的 AI 可见性——你只是把一个规格错误工业化量产了,还给它挂上了自己品牌的权威背书。
这也正是为什么,今天真正可信的零件类 MCP 服务器,都建立在一层经过核验的数据之上,而不是一层协议贴皮。Microchip 于 2025 年 11 月上线的免费公开 MCP 服务器,通过 Streamable HTTP 对外提供经过核验的产品规格、数据手册、库存、价格和交期——那份发布公告强调的重点是数据本身经过核验、保持最新,而不是传输方式。Shopify 的 Storefront MCP 服务器(地址为 https://{shop}.myshopify.com/api/mcp)之所以能跑通,是因为一家 Shopify 店铺本就已经拥有一份带类型字段的权威产品记录。
把一个 MCP 端点架在三份互相打架的电子表格、一个丢了单位的 PIM 和一个装满 PDF 的文件夹前面,只会让你更快地犯错。正确的工作顺序是:先规范记录,再核验,最后才是协议。
智能体就绪成熟度模型
| 级别 | 名称 | 这一级上成立的事实 | 典型失效 |
|---|---|---|---|
| 0 | 不可见 | 客户端渲染的目录;规格只活在 PDF 里;没有结构化数据 | 非浏览器客户端收到的是一具空壳 |
| 1 | 可抓取 | 服务端渲染的产品页;与可见文本一致的 schema.org 标记;robots.txt 里有一份明确且经过斟酌的 AI 爬虫策略 | 一刀切的训练封禁,把检索爬虫也一起噤了声 |
| 2 | 可提取 | 每个零件一份规范记录;参数按共享字典(ETIM、ECLASS、UNSPSC)定型;文档被建模为记录而非链接;标识符稳定不变 | 属性是有的,但网站、PIM 和数据手册三者对不上 |
| 3 | 可调用 | 基于 Streamable HTTP 的托管 MCP 端点,提供参数化检索、型号查询、替代料、合规文件和 CAD;在有对应入口的地方推送数据流 | 工具上线时不带时效与来源信息,于是没人能审计一个答案 |
| 4 | 受授权的智能体通道 | 按客户区分、经 OAuth 门控的库存与合同价;持续的准确性监测;智能体访问分析;一份公开的“智能体可访问什么”策略 | 没有——只要监测是真的做起来了;这就是目标状态 |
大多数组织自以为在第 2 级,一查才发现自己在第 0 级或第 1 级。真正能区分级别的问题不是“我们有没有结构化数据?”,而是“当两个系统对同一个属性各执一词时,哪一个是对的,机器能不能分辨出来?”
怎么弄清自己在哪一级?
五项检查,按顺序做,每一项都只需要几分钟:
- 01用一个纯粹的非浏览器客户端抓取一个产品页,然后读原始响应。如果规格参数不在 HTML 里,那么无论这个页面在浏览器中看起来如何,你都在第 0 级。
- 02把你的 `robots.txt` 当成一份策略文件来读。 逐条列出你放行和禁止的每一个 AI 用户代理,并确认每一行都对应着一个关于“训练还是检索”的真实决策。
- 03校验一段 JSON-LD,并把其中每一个取值都和可见页面逐一比对。对不上比缺失更糟。
- 04挑十个零件,向三款助手各提一个你闭着眼都知道正确答案的事实性问题。 把答错的记下来。这个错误率,就是你真实的基线。
- 05试着只用机器能够触及的数据,回答一个参数化问题——找出满足三项约束条件的全部零件。如果人必须打开一份 PDF 才行,那智能体也一样得打开——而它不会去打开。
我们在 984 家企业身上看到了什么?
2026 年 8 月,我们在全球范围内审计了 984 个分销商与制造商域名,覆盖北美、欧洲和亚洲。汇总出来的图景一致得让人不太舒服:
- AI 可见性得分的中位数,在 100 分制下约为 50 分。
- 38% 的站点对标准的非浏览器客户端根本不返回任何可读的目录页。
- 只有 19% 公布了任何形式的明确 AI 爬虫策略;而在这些站点中,封禁了某个主流爬虫的数量,是主动邀请其抓取的两倍多。
- 没有任何一家对外声明自己提供 MCP 端点。
分布比中位数更值得看。前 10% 与中位区间之间的差距,不在预算,也不在人手;而在于这家组织究竟只有一份规范的产品记录,还是有好几份互相竞争的版本。其余的一切,都是由这一点决定的。
应该先建什么?
- 01为每个零件归一出唯一的规范记录,带上有类型的属性、单位、数据来源和最后核验时间戳。下面的每一项,都只是这份记录的一次投影。
- 02让目录在服务端渲染,使完整的规格参数出现在首个 HTML 响应里。
- 03加上与页面一致的结构化数据,然后动手校验,而不是信任生成器。
- 04逐个代理写出一份经过斟酌的 AI 爬虫策略,并把每个决策的理由记录下来。
- 05在存在与你商业模式相匹配的入口处推送数据流——不匹配的地方,就坦然跳过。
- 06搭起一个 MCP 端点,对外提供参数化检索、型号查询、替代料、合规文件和 CAD,并对一切客户专属的内容加上 OAuth。
- 07持续监测准确性,因为这里的失效模式不是沉默,而是自信满满的错误。
Partsgraph 以叠加层的方式来实现这一切:我们接入你现有的产品目录——数据手册、参数、CAD 和合规文件——把它归并成一张经过核验的 Parts Graph,并在不改动你网站的前提下,把它同时供给这四个接触面。
如果你想在做路线图之前先拿到基线,把你的域名放进我们的免费评分工具跑一遍:/audit。它会告诉你,今天一个非浏览器客户端从你的目录里实际拿到了什么,以及这四个接触面里你缺了哪几个。
常见问题
智能体就绪的目录,是不是换了个名字的 SEO?
不是,尽管两者确有重叠。传统 SEO 是为一个消费方(搜索索引)优化一个接触面(可被抓取的 HTML 页面)。而智能体就绪横跨四个接触面,消费方各不相同,其中两个(推送式数据流和 MCP)根本不涉及抓取:数据是你主动投送过去的。重叠确实存在于抓取这一层——按 Google 自己的指引,AI Overviews 和 AI Mode 依赖的是与普通搜索同一套索引、同一套技术要求。
我需要 llms.txt 吗?
几乎可以肯定,它不该被排进优先事项。Google 明确表示:你不需要创建新的机器可读文件或 AI 文本文件,也能出现在它的 AI 功能中;2026 年的独立采用度分析也发现,主流 AI 爬虫并没有以任何有意义的量级去请求 llms.txt。发布一份的成本很低,但在路线图上,它绝不该挤掉服务端渲染页面、产品数据流或 MCP 端点的位置。
制造商应该优先建设哪一个接触面?
服务端渲染的结构化产品页——因为它是唯一能触达助手用户匿名长尾的接触面,也因为它会倒逼你去建立那份被其他所有接触面复用的规范产品记录。这份记录一旦存在,数据流和 MCP 都很便宜;而在它存在之前,两者几乎不可能做成。
AI 助手能读懂 PDF 数据手册吗?
有时候能,但读得很糟,而且不可预测。抓到 PDF 的爬虫可能会从中提取文本,但表格、脚注中的条件说明和多栏参数表会严重劣化,抽出来的数值往往不带单位、公差和测试条件。PDF 是你数据的一种呈现,不是你的数据本身。正确的做法是:把参数以结构化记录的形式保存,PDF 只作为若干种表现形式中的一种。
MCP 端点会取代我的网站吗?
不会。MCP 是与网站并行部署的,不是用来替代网站的。它触达的是一群更窄但意向更强的受众:会自己配置连接器的工程师,以及其 IT 管理员会注册你服务器的企业采购方。公开网页依然承载着助手流量中匿名的大多数,所以这两条通道服务的是同一个漏斗的两半。
我怎么知道 AI 助手有没有正确读取我的产品目录?
去测,别去假设。用一个纯粹的非浏览器客户端抓取你自己的产品页,看看回来的是什么;就那些你知道正确答案的零件,向几款助手提事实性问题;并给任何 MCP 端点或数据流加上埋点,这样你才能看清哪些零件正在被查询、哪些查询失败了。准确性监测比调用量更重要——一条说得斩钉截铁却是错的规格,造成的商业损害远大于一条缺失的规格。
第 4 级比第 3 级多给了我什么?
授权与可观测性。在第 3 级,智能体可以查询你的公开目录。到了第 4 级,经过认证的智能体可以看到某个特定客户的合同价和实时库存;你能看到哪个智能体查询了什么;你还能衡量它们拿到的答案是否正确。这就把一个“SEO 周边”的项目,变成了一条自带权限模型和度量指标的渠道。
资料来源
- 01Vercel, The rise of the AI crawler (crawl volumes and JavaScript rendering analysis)
- 02SearchOptimo, Do AI crawlers render JavaScript? GPTBot, ClaudeBot and Perplexity in 2026
- 03Google Search Central, AI Features and Your Website
- 04Google Search Central, Guide to optimizing for generative AI features
- 05OpenAI, Overview of OpenAI crawlers (GPTBot, OAI-SearchBot, ChatGPT-User)
- 06Anthropic, Does Anthropic crawl data from the web, and how can site owners block the crawler?
- 07Agentic Commerce Protocol, Product Feed Specification
- 08OpenAI Developers, Product feeds (Agentic Commerce)
- 09Perplexity, Merchant Program Terms of Service
- 10Anthropic, Get started with custom connectors using remote MCP
- 11OpenAI Help Center, Developer mode and MCP apps in ChatGPT
- 12Google Cloud, Set up your custom MCP server data store (Gemini Enterprise)
- 13Model Context Protocol, MCP joins the Agentic AI Foundation (9 December 2025)
- 14Shopify, Storefront MCP server documentation
- 15Microchip Technology, Microchip unveils Model Context Protocol (MCP) Server (6 November 2025)
- 16Forrester, B2B Buyers Make Zero-Click Buying Number One (22 January 2026, Buyers' Journey Survey)
- 17Presenc AI, State of llms.txt 2026 (adoption and crawler request data)
看清 AI 助手今天究竟能读取您产品的哪些信息、又有哪些读不到——爬虫抓取策略、目录覆盖率、数据手册可访问性,逐项评分,并与全球 984 家分销商和制造商对标。
为我的产品目录评分相关现场笔记
AI 爬虫不会执行 JavaScript
GPTBot、ClaudeBot 与 PerplexityBot 只解析服务器返回的原始 HTML,从不执行脚本,Google 是唯一的例外。客户端渲染的参数化目录,在 AI 助手眼中只是一具空壳。本文讲清如何用一条 c…
解决方案面向 AI 爬虫的 robots.txt:2026 完全指南
本文盘点 2026 年真正重要的每一个 AI 用户代理:训练爬虫、检索索引器与用户触发抓取器分别由谁运营、哪些遵守 robots.txt,并提供可直接复制粘贴的三套配置方案、Content Signals 写法、WAF …
合规把数字产品护照要求映射到 ETIM 字段
数字产品护照强制要求产品数据必须机器可读,却刻意不点名任何一部字典。本文把 DPP 的每一项要求逐条映射到 ETIM 的类别、特征与允许值结构上,给出一份合规形态的 ETIM xChange 记录范例并逐行拆解,同时点明…