术语表

机器可读目录的词汇

只要产品数据需要由人以外的东西来读取,就会出现的 17 个术语。先给定义,再说明如果您有目录要卖,每一个为什么重要。

检索获取

面向智能体的产品数据

#

AI 智能体无需浏览器、无需人工、无需猜测即可获取、解析并引用的产品数据 — 位于稳定地址可达,存在于所返回的响应之中而非事后拼装,是带类型的而非用散文描述的,并且可以归属到来源。

为什么重要取不到您数据的助手不会退回去看您的宣传册;它会退回到第三方对您零件的描述,或退到那个数据它读得懂的竞争对手。

另见结构化数据服务端渲染Model Context Protocol

AI 爬虫

#

代表某个 AI 系统抓取网页的自动化客户端,或是为了构建训练语料,或是为了实时回答用户的问题。每家运营方都会公布自己的用户代理名称,而这两种用途往往由同一运营方的不同代理分别承担。

为什么重要封禁还是放行并不是一个决定。一个站点完全可以合理地拒绝训练抓取,同时对正在回答买家问题的那个智能体保持完全可读 — 而这种区分要按用户代理逐个表达。

另见robots.txt服务端渲染

服务端渲染

亦称 SSR · client-side rendering · CSR#

服务端渲染意味着页面内容就在服务器返回的 HTML 里。客户端渲染意味着服务器只返回一个外壳,内容随后由浏览器中的 JavaScript 拼装出来。

为什么重要已公开的 AI 爬虫流量分析发现,主要助手的爬虫会抓取 JavaScript 文件,却不执行它们。对这些爬虫来说,客户端渲染的目录就是一张空白页 — 无论它在人眼中看起来多么完整。

另见AI 爬虫面向智能体的产品数据

生成式引擎优化

亦称 GEO · AEO · answer engine optimisation#

让内容能够被 AI 助手获取并引用的做法,而不只是能在链接列表里获得排名。它强调可达、可解析、无歧义、可归属,因为所追求的结果是出现在答案中的一次引用,而不是一次点击。

为什么重要对目录来说,这项工作大体上不是编辑工作。它是可达性、渲染方式、结构和标识符 — 也正是让产品数据在其他任何场景都好用的那些东西。

另见面向智能体的产品数据服务端渲染

黄金题集

#

一组固定的问题及其已知的正确答案,用于衡量系统在发生变更之后是否仍然答对。每次运行都对照同一套预期答案打分,因此回退表现为一个数字,而不是一则轶事。

为什么重要没有它,「助手把我们的零件说对了」只是一种印象。有了它,它就是一次测量,并且在它不再成立的当天您就会知道 — 而不是在下个季度。

另见面向智能体的产品数据

智能体接口

Model Context Protocol

亦称 MCP#

一个开放协议,通过既定接口把工具和数据暴露给 AI 助手,使助手可以直接调用某项能力,而不必抓取网页再去推断自己找到了什么。服务端声明它提供的工具,客户端发现并调用它们。

为什么重要对目录而言,这是助手「读一份您产品的呈现」与「向您的系统提问」之间的差别 — 参数化检索、零件查询、替代料、合规 — 并拿回一个带类型的答案。

另见面向智能体的产品数据参数化检索

llms.txt

#

提议放在站点根目录的纯文本文件,为语言模型提供一份简短、经过筛选的索引,说明站点包含什么、实质性内容在哪里。它是建议而非控制:它告诉模型什么值得读,而不是什么可以读。

为什么重要这是目录能够发布的成本最低的信号,而且采用率仍然足够低,因此发布它是差异化因素,而不是及格线。

另见robots.txt面向智能体的产品数据

robots.txt

亦称 Robots Exclusion Protocol#

位于站点根目录的文件,告诉自动化客户端可以请求哪些路径。2022 年由 IETF 标准化为 RFC 9309,它是一份守规矩的爬虫会尊重的许可声明 — 既不是访问控制,也不具备强制力。

为什么重要多数工业站点是在 AI 爬虫出现之前写下这个文件的,因此它们对这些爬虫的政策,不过是若干年前一条通配规则碰巧隐含的结果。这是一次误打误撞的决定。

另见llms.txtAI 爬虫

目录数据

结构化数据

亦称 schema.org · JSON-LD#

嵌入页面的机器可读标记,用共享词汇表述这个页面讲的是什么 — 对产品而言通常是 schema.org 的 Product 类型,把标识符、价格、可获得性和规格作为具名字段承载,而不是写成句子。

为什么重要它省去了推断这一步。没有它,机器必须自己判断页面上的某个数字是价格;有了它,页面自己就说清楚了。

另见GTIN制造商料号面向智能体的产品数据

制造商料号

亦称 MPN#

制造商分配给某个零件的标识符。与全球贸易标识符不同,它只在该制造商范围内唯一,而且实际书写并不统一 — 有无分隔符、后缀、包装代码以及地区变体。

为什么重要大多数交叉参照失败其实是料号规范化失败。同一个零件若以四种写法出现,助手会把它当成四个零件,或者无法把它与客户询问的那个对上。

另见实体归并GTIN

GTIN

#

在 GS1 体系下管理的全球唯一贸易项目标识符,涵盖零售条码中编码的号码。与制造商料号不同,它在所有制造商之间都是唯一的。

为什么重要它是跨系统匹配产品最有力的键,这也是 AI 购物界面和电商平台首先索要它的原因。

另见制造商料号结构化数据

实体归并

亦称 canonicalisation#

判定多条记录描述的是同一个现实事物,并把它们合并为一个规范实体,同时把各种变体记录在其名下。在零件语境中,这涵盖料号、变体、包装选项,以及被多家分销商分别登记的同一零件。

为什么重要这是目录与图谱之间的分界。替代料、交叉参照,以及「还有什么能装得上」这类问题,全都取决于这一步做得对不对。

另见制造商料号参数化检索

标准

ETIM

#

面向技术产品的开放式国际分类模型。它定义产品类别,并为每个类别定义描述性特征,以及这些特征可取的单位与取值列表 — 从而让技术规格从自由文本表格变成可以跨制造商比较的东西。

为什么重要在欧洲很多地方,它已经是电气、暖通空调与建材供应的共同语言。映射到它的目录,是助手、批发商和监管机构都能以同样方式读懂的目录。

另见ECLASSBMEcat参数化检索

ECLASS

#

一套跨行业的数据标准,用于对产品和服务进行分类与描述,在采购和工业自动化领域广泛使用。与 ETIM 一样,它同时提供分类层级和标准化的属性定义。

为什么重要ETIM 在电气与建材领域占优,ECLASS 则在工业自动化和流程工业中更常见。许多制造商两者都需要。

另见ETIMBMEcat

BMEcat

#

在供应商与买方之间交换电子产品目录时广泛使用的 XML 格式,其载荷通常携带按 ETIM 或 ECLASS 分类的数据。

为什么重要目录数据在贸易伙伴之间本来就是这样流转的。能产出干净 BMEcat 的目录,通常已经具备智能体接口所需的底层结构。

另见ETIMECLASS

数字产品护照

亦称 DPP#

关于产品特性 — 材料、合规、可维修性、来源 — 的结构化、机器可读记录,可通过产品上或随附的数据载体访问。它由欧盟《可持续产品生态设计条例》引入,具体义务通过授权法案按产品组分别规定。

为什么重要对越来越多销往欧盟的商品而言,它把机器可读的产品数据从营销优势变成法律要求。这项工作与把目录变得可供智能体读取的工作大量重叠。

另见ETIM结构化数据

亲自验证

评分工具会对照本页所定义的大部分内容 — 爬虫政策、渲染方式、结构化数据、llms.txt、智能体接口 — 检查一个真实目录并给出评分。

为我的目录评分