# Por qué la IA no puede leer tus fichas técnicas

> Muros antibots, escaneos sin texto, visores y hosts de documentos aparte ocultan tus fichas técnicas a la IA. Pruébalas en tres comandos y arréglalas.

**Language:** es  
**Published:** 2026-08-09  
**Category:** Technical · **Tags:** datasheets, PDF, AI crawlers, product data, technical documentation, OCR  
**Canonical:** https://partsgraph.ai/es/blog/why-ai-cannot-read-your-datasheets

## En resumen

**¿Por qué los asistentes de IA no pueden leer las fichas técnicas de mis productos?**

Hay cuatro cosas que estropean una ficha técnica para la IA: el PDF está bloqueado por un muro antibots o por un inicio de sesión antes de que un rastreador pueda descargarlo; el archivo es un escaneo solo de imagen, sin capa de texto, de modo que la extracción devuelve cero caracteres; el documento está atrapado en un visor JavaScript, sin URL directa al archivo; o reside en un host de documentación aparte cuyo robots.txt dice que no. Basta con cualquiera de estos casos para que la especificación definitiva de tu componente resulte inalcanzable, y la especificación vive de verdad en la ficha técnica: la página web nunca lleva más que un resumen.

---

## La respuesta breve

Una ficha técnica se vuelve invisible para la IA por una de estas cuatro vías, y todas son de lo más prosaico. El archivo se bloquea antes siquiera de descargarse, por una regla antibots, un inicio de sesión o una página intersticial. El archivo es una imagen escaneada sin capa de texto, de modo que el extractor obtiene cero caracteres. Al documento solo se llega a través de un visor JavaScript, sin URL directa. O el PDF reside en un host de documentación aparte —`docs.`, `media.`, un DAM, una CDN— cuyo propio robots.txt o WAF dice que no, por muy permisivo que sea tu sitio principal.

> **Figure.** The four ways a datasheet becomes invisible to AI: blocked before fetch, scanned with no text layer, viewer-only with no direct URL, or on a separate host that refuses.

Nada de esto es exótico. Los cuatro casos son habituales, y basta con uno solo. Conviene enunciar la consecuencia sin rodeos:

> La ficha técnica es la especificación de referencia. La página de producto es un resumen de ella. Cuando la IA puede leer el resumen pero no la fuente, responde a las preguntas de ingeniería a partir del resumen, y se equivoca.

## Por qué aquí las fichas técnicas importan más que las páginas web

Una página de producto recoge quizá entre ocho y veinte atributos: encapsulado, valor nominal principal, un indicador de ciclo de vida, precio y stock. Una ficha técnica recoge cientos: valores máximos absolutos, características eléctricas en todo el rango de temperatura, diagramas de tiempos, descripción de patillas, valores de resistencia térmica, huellas recomendadas, nivel de sensibilidad a la humedad y descodificadores del número de referencia para pedido. Casi todas las preguntas que un ingeniero le hace de verdad a un asistente —*¿puedo alimentarlo a 5,5 V?*, *¿cuál es la corriente en reposo a 85 grados?*, *¿es compatible el patillaje con el componente al que sustituyo?*— se responden en la ficha técnica y en ningún otro sitio.

Eso pesa más que antes, porque las preguntas se le plantean a un asistente en lugar de escribirse en tu buscador interno. Forrester constató en enero de 2026 que **el 94 % de los compradores profesionales ya usa IA durante su proceso de compra**. Y las páginas con más profundidad técnica son justo las que peor rinden: el análisis de Adobe de abril de 2026 sobre legibilidad automática en el comercio minorista puntuó las páginas de detalle de producto con un **66 %, la nota más baja de cualquier tipo de página**, por debajo de las páginas de inicio (75 %) y de las de preguntas frecuentes (80 %).

Cuando los datos de origen no son accesibles, el fallo no es el silencio: es el error rotundo. OpenAI desmanteló Instant Checkout en ChatGPT en marzo de 2026 con unos 30 comercios activos, y la inexactitud de los datos de producto fue una de las razones de fondo: OpenAI venía extrayendo la información de producto de las webs de los minoristas, y los datos de inventario, envío y precio fallaban con frecuencia. Es el mismo modo de fallo que un valor máximo equivocado, solo que con menos en juego.

## Las cinco formas en que una ficha técnica se vuelve ilegible

| Fallo | Lo que ve un rastreador | Cómo detectarlo |
|---|---|---|
| Muro antibots | Un 403, un 429 o una página HTML de desafío en lugar de un PDF | El `content-type` de la respuesta es `text/html`, no `application/pdf` |
| Escaneo solo de imagen | Un PDF válido que no contiene texto extraíble | La extracción de texto devuelve 0 caracteres; ninguna fuente incrustada |
| Documento accesible solo por visor | Una página de JavaScript sin URL de archivo | El PDF se carga desde un blob o desde un flujo autenticado |
| Política de un host aparte | Un 200 limpio en la página de producto y un bloqueo en el documento | El host de documentos tiene su propio robots.txt y su propio WAF |
| URL efímera o con barrera | Un enlace firmado que caduca, o un formulario de por medio | El enlace funciona en tu navegador y devuelve 403 desde `curl` |

La quinta es la más autoinfligida. Las URL firmadas de vida corta, las barreras de «regístrate para descargar» y los tokens de un solo uso son todos muros invisibles: un rastreador no tiene sesión, ni cookies, ni rellena formularios. Y como los rastreadores de IA no ejecutan JavaScript, cualquier enlace de descarga que un script escriba en el DOM sencillamente no existe desde su lado del cable.

## ¿Cómo compruebo si mis fichas técnicas son legibles?

Tres comandos lo resuelven. Ejecútalos contra tus propios documentos.

1. **Comprueba la descarga.** ¿Devuelve la URL un PDF a un cliente sencillo que no sea un navegador?

```
curl -sSIL "https://example.com/datasheets/part-12345.pdf" | grep -iE "^HTTP|content-type|content-length"
```

Quieres un `200` final y `content-type: application/pdf`. Un `content-type: text/html` significa que te han entregado un desafío o una página de inicio de sesión disfrazada de descarga.

2. **Descárgalo y confirma que de verdad es un PDF.**

```
curl -sSL -o ds.pdf "https://example.com/datasheets/part-12345.pdf" -w "status=%{http_code} type=%{content_type} bytes=%{size_download}"
head -c 5 ds.pdf
```

Los cinco primeros bytes deben ser `%PDF-`. Si son `<!DOC`, lo que has descargado es una página de error.

3. **Prueba la capa de texto.** Este es el que no ejecuta nadie.

```
pdftotext -q ds.pdf - | tr -d '[:space:]' | wc -c
pdffonts ds.pdf
```

## ¿Cómo sé si un PDF tiene capa de texto?

Dos números, y la distancia entre ellos es inconfundible. Ejecutamos ambas pruebas contra una ficha técnica de fabricante real y vigente —el LM358 de Texas Instruments, un PDF de 4,15 MB— y contra una copia rasterizada del mismo documento, que es exactamente el aspecto que tiene para una máquina una ficha técnica antigua escaneada.

| Prueba | Ficha técnica real | Escaneo solo de imagen |
|---|---|---|
| Caracteres extraídos con `pdftotext` | 95.895 | 0 |
| Filas de fuentes incrustadas en `pdffonts` | 114 | 0 |
| Visualmente idéntica para una persona | Sí | Sí |
| Utilizable por un asistente de IA | Sí | No |

Ese es todo el diagnóstico. **Cero caracteres extraíbles y cero fuentes incrustadas significa que en el archivo no hay texto: solo una imagen de texto.** El documento se ve perfectamente para una persona y no aporta literalmente nada a un modelo. Una ficha técnica escaneada de los años noventa, de un componente que sigue en producción, es, para todos los sistemas de IA de internet, una página en blanco.

Dos matices que conviene conocer. Un recuento de caracteres bajo pero distinto de cero —pongamos unos cientos de caracteres en un documento de cuarenta páginas— suele indicar un cuerpo escaneado con una cabecera de texto, y resulta igual de inservible. Y en la salida de `pdffonts` importa la columna `uni`: las fuentes subconjuntadas sin mapa ToUnicode pueden extraerse como caracteres ilegibles aunque técnicamente los caracteres estén presentes. Revisa a mano los primeros 200 caracteres del texto extraído en lugar de fiarte solo del recuento.

Para barrer una biblioteca entera, hazlo en bucle:

```
while read -r url; do
  code=$(curl -sSL -o /tmp/d.pdf -w "%{http_code}" --max-time 30 "$url")
  chars=$(pdftotext -q /tmp/d.pdf - 2>/dev/null | tr -d '[:space:]' | wc -c)
  echo "$code $chars $url"
done < datasheet-urls.txt
```

Ordena la salida por número de caracteres de menor a mayor. Todo lo que quede en la parte alta de esa lista es un agujero en tus datos de producto.

## La trampa del host aparte

Esta pilla a casi todas las organizaciones grandes, y precisamente por hacer las cosas bien. Los documentos se trasladan a un DAM, a un subdominio de documentación o a una CDN, y cada uno de ellos es un origen distinto con su propia configuración, y a menudo con su propio responsable.

Según el RFC 9309, el ámbito de robots.txt es un único origen: esquema, host y puerto. `https://www.example.com/robots.txt` no gobierna nada en `https://docs.example.com/` ni nada en `https://cdn.example-media.net/`. Si tu sitio principal da la bienvenida a los rastreadores de IA y tu host de documentos se levantó a partir de una plantilla por defecto con un `Disallow: /` general, o está detrás de un gestor de bots configurado para desafiar a todo lo que no sea humano, entonces toda tu biblioteca técnica está a oscuras mientras tu web de marketing está abierta de par en par.

Comprueba todos los orígenes que sirven algún documento:

```
for h in www.example.com docs.example.com cdn.example-media.net; do
  echo "--- $h"
  curl -sS --max-time 15 "https://$h/robots.txt" | head -30
done
```

## Cómo es cuando está bien hecho

Una ficha técnica bien publicada no tiene nada de particular, y esa es justo la idea. Texas Instruments sirve la ficha técnica del LM358 en una URL estable y previsible bajo `/lit/ds/`; su robots.txt no impone ninguna restricción a esa ruta; el archivo devuelve `200` con `content-type: application/pdf` a un cliente que no es un navegador y que se identifica como GPTBot; y el PDF lleva una capa de texto completa, con fuentes incrustadas y mapeadas a Unicode. Sin inicio de sesión, sin visor, sin URL firmada, sin intersticial. Cualquier canal de extracción del mundo puede leerla.

La dirección que lleva el sector de componentes es la de ponerlo aún más fácil. Microchip publicó en noviembre de 2025 un servidor MCP gratuito y sin autenticación para sus datos de producto —especificaciones, fichas técnicas, inventario, precios y plazos de entrega— y TrustedParts, de ECIA, lanzó en junio de 2026 un servicio de agente de IA de inventario que expone la disponibilidad de los distribuidores autorizados a Copilot, ChatGPT y Claude. Ambos parten de la misma constatación: un documento por el que una máquina tiene que pelear es un documento que pierde.

## ¿Cómo se soluciona?

Por orden de rentabilidad respecto al esfuerzo:

1. **Desbloquea las rutas de documentos.** Permite el paso a los rastreadores de IA en `/datasheets/*`, `/lit/*`, `/documents/*` y equivalentes, tanto en el WAF como en robots.txt. Son dos interruptores distintos y hay que activar los dos.
2. **Quita las barreras de descarga de los documentos técnicos públicos.** Si una ficha técnica está en tu sitio público, ya es pública. Un formulario de registro solo detiene a las máquinas que te habrían recomendado.
3. **Pasa por OCR todos los PDF que sean solo imagen y vuelve a publicarlos con capa de texto.** Prioriza por facturación del componente, no por antigüedad del documento. El OCR moderno sobre un escaneo limpio a 300 dpi es casi sin pérdidas en el texto corrido; verifica a mano las tablas de parámetros.
4. **Da a cada documento una URL estable, directa y enlazable.** Sin blobs, sin visores, sin tokens que caducan, sin cadenas de consulta `?token=`.
5. **Publica un gemelo en HTML o markdown de cada ficha técnica.** Las tablas de especificaciones, como tablas reales. Es el cambio más eficaz de todos, porque elimina cualquier dependencia de las heurísticas de maquetación del PDF y te da una página cuya exactitud también puedes vigilar.
6. **Enlaza el documento desde la página de producto en HTML renderizado en el servidor**, para que un rastreador que llegue a la página pueda llegar al documento sin ejecutar nada.
7. **Expón los parámetros extraídos como datos estructurados** —JSON-LD en la página y, a ser posible, un endpoint consultable— para que un agente pueda filtrar por ellos en lugar de volver a analizar un PDF cada vez.

Partsgraph auditó 984 dominios de distribuidores y fabricantes de todo el mundo —Norteamérica, Europa y Asia— en agosto de 2026. La puntuación mediana de visibilidad ante la IA fue de 50 sobre 100, y el 70 % de la muestra obtuvo una D o una F. La capa documental fue de forma sistemática el componente más débil de la puntuación: el 38 % no fue capaz de servir ni una sola página de catálogo legible a un cliente estándar que no fuera un navegador, y el acceso a los documentos falló más a menudo que el acceso a las páginas.

Lo incómodo es que nada de esto aparece en tu analítica. Un rastreador bloqueado no abre una incidencia, un OCR defectuoso no lanza una excepción y un modelo que no puede leer tu ficha técnica no le dice al comprador que no ha podido leerla. Simplemente recomienda a un competidor cuyo PDF sí se abrió.

*Puedes someter tu propia biblioteca de documentos a estas pruebas con el evaluador gratuito de visibilidad ante la IA de Partsgraph en [/audit](/audit).*

## Preguntas frecuentes

### ¿Pueden siquiera los rastreadores de IA leer PDF?

Pueden descargarlos, y la extracción de texto de PDF es una pieza estándar de cualquier canal de ingesta. Lo que no pueden hacer es inventarse un texto que no está en el archivo. La extracción lee la capa de texto; si el PDF es una imagen escaneada sin capa de texto, la extracción no devuelve nada y el documento no aporta nada.

### ¿Cómo sé si un PDF tiene capa de texto?

Ejecuta pdftotext contra el archivo y cuenta los caracteres que devuelve; después ejecuta pdffonts y cuenta las filas. Una ficha técnica sana devuelve decenas de miles de caracteres y una lista larga de fuentes incrustadas. Un escaneo solo de imagen devuelve cero caracteres y cero fuentes.

### Mis fichas técnicas están en un subdominio de documentación aparte. ¿Eso importa?

Sí. Según el RFC 9309, el ámbito de robots.txt es un único origen: esquema, host y puerto. Un robots.txt permisivo en www.example.com no concede nada en docs.example.com ni en el nombre de host de tu CDN. Cada origen que sirva documentos necesita su propia política, y cada uno queda sujeto por separado a las reglas de tu WAF.

### ¿Debería publicar el contenido de la ficha técnica en la página web como HTML?

Sí, y suele ser la solución más rentable. Un gemelo en HTML o markdown de cada ficha técnica —tablas de especificaciones, valores máximos absolutos, descripción de patillas, información de pedido— resulta trivial de analizar, se puede cachear y citar, y elimina cualquier dependencia de lo bien que un extractor de PDF gestione tu maquetación.

### ¿Bloquear los bots en mi host de documentos protegerá mi propiedad intelectual?

Sobre todo te protege de que te recomienden. Las fichas técnicas ya están replicadas en los agregadores, así que bloquear al rastreador rara vez saca el contenido del corpus de entrenamiento; lo único que consigue es que la versión que ve el modelo sea la copia desactualizada de un tercero en lugar de tu revisión vigente. Si lo que buscas es control, sirve el documento autorizado y vigila su exactitud.

### ¿Sobreviven a la extracción las maquetaciones a varias columnas y las tablas?

De forma imperfecta. Las fichas técnicas a dos columnas suelen entremezclarse cuando se extraen de forma lineal, y las tablas de parámetros con celdas combinadas pierden su estructura de filas. Los PDF etiquetados con un orden de lectura correcto ayudan bastante, pero un espejo en HTML o markdown de esas mismas tablas elimina la ambigüedad por completo.

### ¿Cuántas fichas técnicas debería probar?

Prueba primero tus 20 principales por tráfico y luego barre toda la biblioteca con un script. Según nuestra experiencia, los fallos se agrupan por antigüedad y por herramienta de maquetación, así que una muestra que solo cubra componentes recientes parecerá mucho más sana de lo que en realidad está la biblioteca.

## Fuentes

1. [Adobe Digital Insights, AI traffic and retail machine-readability, April 2026](https://business.adobe.com/blog/ai-traffic-surge-retail-sites-not-machine-readable)
2. [eCommerceNews, Adobe machine-readability scores by page type, April 2026](https://e-commerce.news/story/adobe-says-ai-retail-traffic-surges-as-readability-lags)
3. [CNBC, OpenAI revamps shopping in ChatGPT after Instant Checkout, March 2026](https://www.cnbc.com/2026/03/24/openai-revamps-shopping-experience-in-chatgpt-after-instant-checkout.html)
4. [Forrester, The State Of Business Buying, 2026 (January 2026)](https://www.forrester.com/blogs/state-of-business-buying-2026/)
5. [Vercel and MERJ, The rise of the AI crawler, December 2024](https://vercel.com/blog/the-rise-of-the-ai-crawler)
6. [RFC 9309, Robots Exclusion Protocol](https://www.rfc-editor.org/rfc/rfc9309.html)
7. [Microchip Technology, MCP Server press release, November 2025](https://ir.microchip.com/news-events/press-releases/detail/1344/microchip-technology-unveils-model-context-protocol-mcp-server-to-power-ai-driven-product-data-access)
8. [ECIA, TrustedParts.com launches Inventory AI Agent Service, June 2026](https://www.ecianow.org/2026/06/11/trustedparts-com-launches-inventory-ai-agent-service/)
9. [Texas Instruments, LM358 datasheet (used as a worked example)](https://www.ti.com/lit/ds/symlink/lm358.pdf)

## Other languages

- English: https://partsgraph.ai/blog/why-ai-cannot-read-your-datasheets/md
- Deutsch: https://partsgraph.ai/de/blog/why-ai-cannot-read-your-datasheets/md
- Français: https://partsgraph.ai/fr/blog/why-ai-cannot-read-your-datasheets/md
- Italiano: https://partsgraph.ai/it/blog/why-ai-cannot-read-your-datasheets/md
- Nederlands: https://partsgraph.ai/nl/blog/why-ai-cannot-read-your-datasheets/md
- Polski: https://partsgraph.ai/pl/blog/why-ai-cannot-read-your-datasheets/md
- Português: https://partsgraph.ai/pt/blog/why-ai-cannot-read-your-datasheets/md
- Svenska: https://partsgraph.ai/sv/blog/why-ai-cannot-read-your-datasheets/md
- Türkçe: https://partsgraph.ai/tr/blog/why-ai-cannot-read-your-datasheets/md
- 日本語: https://partsgraph.ai/ja/blog/why-ai-cannot-read-your-datasheets/md
- 한국어: https://partsgraph.ai/ko/blog/why-ai-cannot-read-your-datasheets/md
- 简体中文: https://partsgraph.ai/zh/blog/why-ai-cannot-read-your-datasheets/md

---

Partsgraph — the agent-ready parts data layer. Free AI-visibility grader: https://partsgraph.ai/es/audit
