为什么 AI 读不了你的数据手册

发布于 2026-08-099 分钟阅读datasheets · PDF · AI crawlers · product data

简而言之

为什么 AI 助手读不了我的产品数据手册?

有四件事会让数据手册在 AI 面前失效:PDF 在爬虫取回之前就被机器人拦截或登录页挡住;文件是没有文本层的纯图像扫描件,抽取出来是零个字符;文档被困在 JavaScript 阅读器里,没有可直接访问的文件 URL;或者它放在一台独立的文档主机上,而那台主机的 robots.txt 说不行。这四条中的任何一条,都足以让这颗料的权威规格无法触及——而规格真正的所在正是数据手册,网页上从来只有一份摘要。

简短的答案

数据手册会通过四种方式在 AI 面前消失,而这四种都平淡无奇。文件在被取回之前就遭到拦截,可能是一条机器人规则、一个登录页,或一层插屏页。文件是没有文本层的扫描图像,抽取工具取出零个字符。文档只能通过 JavaScript 阅读器打开,没有直接的 URL。又或者 PDF 放在一台独立的文档主机上——docs.、media.、一套 DAM、一个 CDN——不管你的主站多么开放,那台主机自己的 robots.txt 或 WAF 都说不行。

None of these are exotic, all four are common, and any one of them is sufficient on its own. The datasheet is the specification of record — when AI can read the product page but not the source, it answers engineering questions from the summary.

这些都不是什么稀奇状况。四种都很常见,而且任何一种单独出现就已足够。它的后果值得直说:

数据手册才是正式的规格文件,产品页只是它的摘要。当 AI 能读到摘要、却读不到原始文件时,它就会照着摘要回答工程问题——然后答错。

在这件事上,数据手册为何比网页更重要

一个产品页大概承载八到二十个属性:封装、主要额定值、生命周期标识、价格、库存。而一份数据手册承载的是数以百计的信息:绝对最大额定值、全温度范围内的电气特性、时序图、引脚说明、热阻数据、推荐焊盘图形、湿敏等级、订购型号解码表。工程师真正会向助手提出的问题——这颗料能不能跑在 5.5 V、85 度下的静态电流是多少、引脚是否与我要替换的那颗料兼容——几乎全都只在数据手册里有答案,别处都没有。

这件事如今比过去更要紧,因为问题正被抛给助手,而不是敲进你网站的搜索框。Forrester 在 2026 年 1 月发现,94% 的企业采购者如今会在采购过程中使用 AI。而技术含量最深的那些页面,恰恰表现最差:Adobe 在 2026 年 4 月对零售机器可读性的分析中,产品详情页只得到 66%,是所有页面类型中最低的,低于首页的 75% 和 FAQ 页的 80%。

当底层数据无法触及时,失败并不表现为沉默,而是表现为自信的错误。2026 年 3 月,OpenAI 在只有约 30 家商户上线的情况下收缩了 ChatGPT 的 Instant Checkout,产品数据不准确正是核心原因:OpenAI 一直在抓取零售网站来获取商品信息,而库存、配送和价格数据经常是错的。这与写错一个最大额定值是同一种故障模式,只是赌注小一些。

数据手册变得不可读的五条路径

故障爬虫看到的东西如何识别
机器人拦截返回 403、429,或一个 HTML 挑战页,而不是 PDF响应的 content-type 是 text/html,而不是 application/pdf
纯图像扫描件一个格式正常、却不含任何可抽取文字的 PDF文本抽取返回 0 个字符;没有嵌入字体
只能在阅读器中打开的文档一页 JavaScript,没有文件 URLPDF 从 blob 或需要认证的数据流中加载
独立主机的策略产品页干净地返回 200,文档却被拦下文档主机有自己的 robots.txt 和 WAF
临时或带门槛的 URL会过期的签名链接,或一道表单门槛链接在你的浏览器里能打开,从 curl 发起却返回 403

第五条最是自作自受。短时效的签名 URL、“注册后下载”的门槛、一次性令牌,全都是看不见的墙:爬虫没有会话、没有 Cookie,也不会去填表单。而且由于 AI 爬虫不执行 JavaScript,任何由脚本写入 DOM 的下载链接,从线路的另一端看去根本就不存在。

我该如何检查自己的数据手册是否可读?

三条命令就能定案。请对你自己的文档执行它们。

  1. 01检查抓取。 面对一个普通的、非浏览器客户端,这个 URL 会返回 PDF 吗?
curl -sSIL "https://example.com/datasheets/part-12345.pdf" | grep -iE "^HTTP|content-type|content-length"

你要看到的是最终返回 200,且 content-type: application/pdf。如果是 content-type: text/html,说明递给你的是一个伪装成下载的挑战页或登录页。

  1. 01把它下载下来,确认它真的是 PDF。
curl -sSL -o ds.pdf "https://example.com/datasheets/part-12345.pdf" -w "status=%{http_code} type=%{content_type} bytes=%{size_download}"
head -c 5 ds.pdf

前五个字节必须是 %PDF-。如果是 <!DOC,那你下载到的是一个错误页。

  1. 01测试文本层。 这一条谁都没跑过。
pdftotext -q ds.pdf - | tr -d '[:space:]' | wc -c
pdffonts ds.pdf

怎么判断一个 PDF 有没有文本层?

两个数字,而它们之间的差距不会看错。我们对一份真实的、在产的厂商数据手册——Texas Instruments 的 LM358,一个 4.15 MB 的 PDF——以及同一份文档的栅格化副本,分别跑了这两项测试;后者正是一份扫描版老数据手册在机器眼中的样子。

测试真实数据手册纯图像扫描件
pdftotext 抽取出的字符数95,8950
pdffonts 列出的嵌入字体行数1140
人眼看上去是否一致是是
AI 助手能否使用能不能

整套诊断就是这些。可抽取字符为零、嵌入字体为零,就意味着文件里没有文字——只有一张文字的图片。 这份文档对人显示得完美无瑕,对模型却字面意义上毫无贡献。一颗仍在量产的元器件,如果配的是 1990 年代扫描出来的数据手册,那么在互联网上的每一个 AI 系统看来,它都是一张白纸。

还有两点细节值得知道。字符数不为零、却低得可疑——比如四十页的文档只有几百个字符——通常意味着正文是扫描图像、只有页眉是文字,这同样无法使用。另外,在 pdffonts 的输出中,uni 这一列很重要:没有 ToUnicode 映射的子集化字体,即使字符在技术上确实存在,抽取出来也可能是乱码。不要只相信字符数,抽查一下抽取文本的前 200 个字符。

要把整个文档库扫一遍,就把它写成循环:

while read -r url; do
  code=$(curl -sSL -o /tmp/d.pdf -w "%{http_code}" --max-time 30 "$url")
  chars=$(pdftotext -q /tmp/d.pdf - 2>/dev/null | tr -d '[:space:]' | wc -c)
  echo "$code $chars $url"
done < datasheet-urls.txt

把输出按字符数升序排列。排在这份清单最上面的每一条,都是你产品数据里的一个窟窿。

独立主机这个陷阱

这一条几乎无一例外地击中大型组织,因为它恰恰是把事情做规范之后的结果。文档被搬到 DAM、文档子域名或 CDN 上,而它们各自都是独立的源,各有各的配置——往往还各有各的负责人。

按照 RFC 9309,robots.txt 的作用范围仅限于单个源:协议、主机和端口。https://www.example.com/robots.txt 对 https://docs.example.com/ 毫无约束力,对 https://cdn.example-media.net/ 也一样。如果你的主站欢迎 AI 爬虫,而你的文档主机是从一份默认模板拉起来的、带着一条一刀切的 Disallow: /,或者被一套见到非人类流量就发起挑战的机器人管理器挡在后面,那么在你的营销站敞开大门的同时,你的整个技术文档库都是黑的。

把每一个对外提供文档的源都检查一遍:

for h in www.example.com docs.example.com cdn.example-media.net; do
  echo "--- $h"
  curl -sS --max-time 15 "https://$h/robots.txt" | head -30
done

做对了是什么样子

一份发布正确的数据手册平平无奇,而这正是重点。Texas Instruments 把 LM358 的数据手册放在 /lit/ds/ 下一个稳定、可以猜到的 URL 上;它的 robots.txt 对这条路径不设任何限制;面对一个自称 GPTBot 的非浏览器客户端,该文件返回 200 和 content-type: application/pdf;PDF 本身带有完整的文本层,字体已嵌入并映射到 Unicode。没有登录,没有阅读器,没有签名 URL,没有插屏页。世界上任何一条抽取流水线都能读懂它。

元器件行业的走向,是要把这件事变得更容易。Microchip 在 2025 年 11 月发布了一台免费、免认证的 MCP 服务器,开放其产品数据——规格、数据手册、库存、价格与交期;ECIA 旗下的 TrustedParts 则在 2026 年 6 月推出了库存 AI 智能体服务,把授权分销商的可用库存开放给 Copilot、ChatGPT 和 Claude。两者体现的是同一个认知:一份要让机器费劲去争取的文档,就是一份注定落败的文档。

该怎么修?

按投入产出比排序:

  1. 01放开文档路径。 在 WAF 和 robots.txt 两处,都要放行 AI 爬虫访问 /datasheets/*、/lit/*、/documents/* 及同类路径。这是两个彼此独立的开关,必须都打开。
  2. 02去掉公开技术文档上的下载门槛。 如果一份数据手册已经在你的公开站点上,那它本来就是公开的。一张注册表单只会挡住那些本来会推荐你的机器。
  3. 03把每一个纯图像 PDF 做 OCR,带着文本层重新发布。 按料号带来的营收排优先级,而不是按文档年份。现代 OCR 处理干净的 300 dpi 扫描件,在正文上已接近无损;参数表请人工核对。
  4. 04给每一份文档一个稳定、直接、可链接的 URL。 不要 blob,不要阅读器,不要会过期的令牌,不要 ?token= 这样的查询串。
  5. 05为每一份数据手册发布一个 HTML 或 markdown 的孪生版本。 规格表要做成真正的表格。这是最有效的一项改动,因为它消除了一切对 PDF 版面启发式解析的依赖,还给了你一个可以持续监控准确性的页面。
  6. 06在服务端渲染的 HTML 里,把文档从产品页交叉链接过去,这样爬虫只要能到达页面,无需执行任何东西就能到达文档。
  7. 07把抽取出的参数以结构化数据的形式暴露出来——页面上的 JSON-LD,理想情况下再加一个可查询的接口——让智能体可以直接按参数筛选,而不必每次都重新解析一份 PDF。

Partsgraph 在 2026 年 8 月审计了全球 984 个分销商与制造商域名,覆盖北美、欧洲和亚洲。AI 可见性得分的中位数是 100 分中的 50 分,样本中 70% 被评为 D 或 F。文档层始终是整个评分中最薄弱的一环:38% 的域名无法向一个标准的非浏览器客户端提供哪怕一个可读的目录页,而文档访问失败的频率比页面访问还要高。

令人不安的是,这一切在你的分析数据里根本看不到。被拦下的爬虫不会提工单,一次糟糕的 OCR 不会抛异常,而一个读不懂你数据手册的模型,也不会告诉买家它读不懂你的数据手册。它只会转而推荐一家竞争对手——那家的 PDF 打开了。

你可以用免费的 Partsgraph AI 可见性评分工具,按上述这些测试检查你自己的文档库:[/audit](/audit)。

常见问题

AI 爬虫到底能不能读 PDF?

它们能把 PDF 取回来,而且 PDF 文本抽取本来就是数据摄取流水线的标准环节。它们做不到的,是凭空造出文件里没有的文字。抽取读的是文本层;如果这个 PDF 是一份没有文本层的扫描图像,抽取的结果就是空的,这份文档也就毫无贡献。

我怎么判断一个 PDF 有没有文本层?

对这个文件运行 pdftotext,数一数它返回了多少个字符,再运行 pdffonts,数一数输出了多少行。一份健康的数据手册会返回数以万计的字符,以及一长串嵌入字体。而一份纯图像扫描件返回的是零个字符、零个字体。

我的数据手册放在一个独立的文档子域名上。这有影响吗?

有。按照 RFC 9309,robots.txt 的作用范围仅限于单个源,也就是协议、主机和端口。www.example.com 上一份宽松的 robots.txt,对 docs.example.com 或你的 CDN 主机名不授予任何权限。每一个对外提供文档的源都需要自己的策略,而且每一个都各自受你的 WAF 规则约束。

我应该把数据手册的内容以 HTML 形式放到网页上吗?

应该,而且这通常是回报最高的一项改动。为每一份数据手册做一个 HTML 或 markdown 的孪生版本——规格表、绝对最大额定值、引脚说明、订购信息——解析起来毫不费力,可缓存也可被引用,而且它彻底消除了对 PDF 抽取工具能否处理好你的版面这件事的依赖。

在我的文档主机上拦截机器人,能保护我的知识产权吗?

它主要保护的是让你不被推荐。数据手册早已被各类聚合平台镜像了一遍,因此拦截爬虫很少能把这些内容从训练语料里拿掉;它只是意味着模型看到的版本,是第三方那份过期的副本,而不是你当前的修订版。如果你要的是掌控力,那就把权威文档提供出去,然后持续监控其准确性。

多栏版面和表格能不能在抽取中保住结构?

保不完整。数据手册常见的双栏版面在被线性抽取时经常会交错串行,而带合并单元格的参数表会丢掉行结构。带标签、阅读顺序正确的 PDF 会有相当大的帮助,但把同样的表格再做一份 HTML 或 markdown 镜像,才能把歧义彻底消除。

我应该测试多少份数据手册?

先测流量最高的 20 份,然后用脚本把整个文档库扫一遍。以我们的经验,失败往往按文档年代和创作工具聚集成堆,所以一份只覆盖近期料号的样本,看起来会比文档库的真实状况健康得多。

资料来源

  1. 01Adobe Digital Insights, AI traffic and retail machine-readability, April 2026
  2. 02eCommerceNews, Adobe machine-readability scores by page type, April 2026
  3. 03CNBC, OpenAI revamps shopping in ChatGPT after Instant Checkout, March 2026
  4. 04Forrester, The State Of Business Buying, 2026 (January 2026)
  5. 05Vercel and MERJ, The rise of the AI crawler, December 2024
  6. 06RFC 9309, Robots Exclusion Protocol
  7. 07Microchip Technology, MCP Server press release, November 2025
  8. 08ECIA, TrustedParts.com launches Inventory AI Agent Service, June 2026
  9. 09Texas Instruments, LM358 datasheet (used as a worked example)
在您自己的产品目录上跑一遍

看清 AI 助手今天究竟能读取您产品的哪些信息、又有哪些读不到——爬虫抓取策略、目录覆盖率、数据手册可访问性,逐项评分,并与全球 984 家分销商和制造商对标。

为我的产品目录评分

相关现场笔记