La web agéntica y los datos de producto industriales
En resumen
¿Cómo está cambiando la web agéntica lo que los fabricantes industriales deben publicar?
La web se está separando en una superficie humana, optimizada para navegadores, y una superficie para máquinas, optimizada para agentes, y ambas se están gobernando de forma distinta. El tráfico automatizado ya supera al humano —Imperva midió que el 53 % del tráfico web fue automatizado en 2025— y los proveedores de infraestructura han empezado a tarificarlo: desde el 15 de septiembre de 2026, Cloudflare bloquea por defecto a los rastreadores de entrenamiento de IA y de agentes en las páginas con publicidad de los sitios nuevos y de los del plan gratuito, con el pago por rastreo y la identidad de agente firmada criptográficamente como alternativas emergentes al bloqueo indiscriminado. Para un fabricante, la consecuencia práctica es que ser rastreable ya no equivale a ser alcanzable, y las empresas que consigan ser precisas y alcanzables primero se convertirán en la respuesta por defecto.
Ahora la web tiene dos audiencias, y solo una de ellas tiene ojos
Durante treinta años, publicar en la web significaba publicar para una persona con un ratón en la mano. Todo lo que venía después —la maquetación, los frameworks de JavaScript, los avisos de cookies, la analítica, el inventario publicitario— daba por supuesto que al otro lado había un humano.
Esa premisa hoy es falsa más veces de las que es cierta. El Bad Bot Report 2026 de Imperva concluyó que el tráfico automatizado supuso el 53 % de todo el tráfico web en 2025, frente al 51 % anterior, con el tráfico humano reducido al 47 % y todavía a la baja. Cloudflare hizo la misma observación al anunciar su política de rastreadores de 2026: la mayor parte del tráfico de internet no es humano.
La consecuencia interesante no es la proporción. Es que ambas audiencias se gobiernan ya por separado: reglas de acceso distintas, precios distintos, requisitos de identidad distintos. La web se está bifurcando en una superficie humana y una superficie para máquinas, y los fabricantes industriales no le han dedicado ni un minuto a la segunda.
¿Por qué se rompió la ecuación económica?
La búsqueda funcionaba porque era un intercambio. Un rastreador se llevaba tu página y devolvía visitantes. Los editores aceptaban el trato porque el tipo de cambio les resultaba favorable.
La recuperación de información por IA rompió ese tipo de cambio. Cloudflare empezó a publicar en Radar, en 2025, las ratios de rastreos por referencia —páginas rastreadas por cada visita enviada— y las cifras no se parecían en nada a la norma de la búsqueda, de un par de rastreos o menos por visitante. En una muestra de finales de junio de 2025, el rastreador de Anthropic estaba en torno a 70.900 páginas rastreadas por cada referencia. Cloudflare informó además, en 2026, de que más de la mitad del tráfico de rastreo de IA se dedica a volver a descargar páginas que no han cambiado.
Mientras tanto, el lado humano del intercambio se adelgazaba por su cuenta. SparkToro midió que el 68 % de las búsquedas de Google en Estados Unidos terminaba sin ningún clic a principios de 2026, con unos 276 clics por cada 1.000 búsquedas llegando a la web abierta, frente a 374 en 2024.
Así que los editores se encontraron con una extracción creciente y una compensación decreciente, e hicieron lo previsible.
Pero conviene fijarse bien en que esta lógica es propia de los negocios cuyo contenido es el producto. La ficha técnica de un fabricante no se monetiza con páginas vistas. Es material de marketing de una cosa física que vendes con un margen. Si un asistente lee tu catálogo entero 70.000 veces y te envía a un solo ingeniero que especifica tu pieza en un programa de 500.000 unidades, has ganado. La queja de los editores sobre la ratio de rastreos por referencia, importada sin examen a un contexto industrial, produce exactamente la política equivocada.
Qué hacen en realidad los peajes
| Mecanismo | Qué es | Estado | Relevancia para un fabricante |
|---|---|---|---|
| Clasificación por finalidad | Cloudflare divide el tráfico de IA en búsqueda, agente y entrenamiento, cada categoría controlable por separado | En funcionamiento; nuevos valores por defecto desde el 15 de septiembre de 2026 | Alta: deberías decidir tu propia política por categoría en lugar de heredar una |
| Bloqueo por defecto en páginas con publicidad | Los rastreadores de entrenamiento y de agente quedan bloqueados por defecto en las páginas con publicidad; los de uso mixto, bloqueados por completo en ellas | Desde el 15 de septiembre de 2026, para clientes nuevos, sitios nuevos y sitios del plan gratuito ya existentes | Indirecta: es poco probable que tu catálogo lleve anuncios, pero la prensa sectorial que habla de tus piezas sí |
| Pago por rastreo | Respuestas HTTP 402 que indican un precio, con las cabeceras crawler-max-price, crawler-exact-price y crawler-charged, liquidadas en el edge | Beta privada | Baja hoy; una señal de hacia dónde va la tarificación |
| Web Bot Auth / agentes firmados | Identidad criptográfica del agente mediante HTTP Message Signatures y una cabecera Signature-Agent, en sustitución de las cadenas de user-agent | Lanzado por Cloudflare en agosto de 2025; avanzando en el IETF | Alta: es la condición previa para servir datos con derechos de acceso a un agente conocido |
La última fila es la que importa comercialmente, y es la que nadie en el suministro industrial está comentando.
Todo aquello con lo que un proveedor industrial gana de verdad la venta —precios contractuales, stock asignado, plazos de entrega específicos de cada cliente, listas de alternativas homologadas— son datos que no puedes publicar abiertamente. Hoy eso significa que los agentes reciben el precio de tarifa público y una cadena genérica de disponibilidad, es decir, que reciben algo incorrecto. La identidad de agente verificable es lo que convierte «eso no lo podemos exponer» en «eso sí se lo podemos exponer a este agente, que actúa para este cliente, y además dejarlo registrado». Esto no va de bloquear rastreadores. Va de habilitar un canal, y da la casualidad de que funciona sobre la misma fontanería.
La lección de llms.txt
Merece la pena detenerse en llms.txt, porque es la ilustración perfecta de cómo este mercado asigna mal el esfuerzo.
La propuesta era razonable: un archivo de texto plano que indica a los sistemas de IA dónde está tu buen contenido. Se adoptó de forma masiva. Se escribió sobre él en todas las newsletters de marketing. Después, Ahrefs analizó 137.210 dominios y descubrió que el 97 % de los archivos llms.txt publicados no recibió ni una sola petición en mayo de 2026. La mayoría de las descargas que sí se produjeron procedían de herramientas de auditoría SEO, no de sistemas de IA, y el estudio no halló prueba alguna de mejora en las citas en ChatGPT, Perplexity o las AI Overviews.
Mientras tanto, ese mismo conjunto de datos mostraba que los bots de IA suponían el 19,5 % de todas las peticiones, con la infraestructura agéntica como mayor categoría de IA, con un 10,5 %. Las máquinas estaban allí, sin ninguna duda. Simplemente estaban descargando tus páginas de verdad, esas que muchos fabricantes renderizan en el cliente y, por tanto, sirven vacías.
La lección va mucho más allá de un solo archivo. Que una convención se adopte no es lo mismo que se consuma. La prueba fiable no es si un estándar tiene impulso en el debate, sino si hay clientes reales que lo descargan. Hoy hay dos cosas que superan esa prueba: el HTML renderizado en el servidor y los endpoints de Model Context Protocol; MCP alcanzó unos 97 millones de descargas mensuales de sus SDK en marzo de 2026 y pasó a una gobernanza neutral bajo la Agentic AI Foundation de la Linux Foundation en diciembre de 2025, con AWS, Anthropic, Block, Bloomberg, Cloudflare, Google, Microsoft y OpenAI como miembros platino.
La corriente regulatoria va en la misma dirección
Hay una segunda fuerza que empuja los datos industriales hacia un formato legible por máquina, y no tiene nada que ver con la IA.
El Reglamento de Ejecución (UE) 2026/1778 de la Comisión, adoptado el 16 de julio de 2026, estableció las disposiciones de funcionamiento del registro del Pasaporte Digital de Producto creado por el Reglamento de Diseño Ecológico para Productos Sostenibles: estructura, verificación de la identidad, registro, prueba del registro, trazas y conservación. La Comisión puso en marcha el registro pocos días después. Los productos de construcción siguen una vía aparte, bajo el Reglamento de Productos de Construcción revisado y con un calendario más largo.
Quita el lenguaje de cumplimiento y el requisito es: datos de producto estructurados y legibles por máquina, con identidad y trazabilidad verificadas, recuperables por un tercero. Eso es casi exactamente la descripción de un catálogo preparado para agentes. Cualquier fabricante que trate el cumplimiento del DPP y la legibilidad para la IA como dos programas sin relación, con dos presupuestos, está construyendo el mismo activo dos veces.
Qué debería hacer realmente un fabricante
- 01Comprueba qué ve una máquina. Descarga tus propias páginas de catálogo con un cliente sencillo que no sea un navegador. Cuando Partsgraph auditó 984 dominios de distribuidores y fabricantes de todo el mundo en agosto de 2026, el 38 % no devolvía ninguna página de catálogo legible a un cliente estándar que no fuera un navegador, y la puntuación mediana de visibilidad ante la IA fue de 50 sobre 100. El renderizado en el cliente es el culpable habitual y resulta invisible en cualquier vista normal de analítica.
- 02Redacta una política explícita para rastreadores y publícala. Decide, categoría por categoría, qué permites: indexación para búsqueda, recuperación para respuestas, acceso de agentes, entrenamiento. En esa misma auditoría, solo el 19 % de los 984 dominios publicaba una política explícita para rastreadores de IA que nombrase a los bots principales, lo que significa que cuatro de cada cinco funcionan con el valor por defecto que elija su proveedor de CDN y que, a medida que los valores por defecto del edge se endurecen, el silencio se resuelve como un «no».
- 03Revisa los valores por defecto de tu CDN antes del 15 de septiembre de 2026. Si estás en un plan gratuito o vas a poner en marcha propiedades nuevas, los valores por defecto cambian bajo tus pies. Es una tarea de diez minutos que nadie tiene agendada.
- 04No bloquees de forma indiscriminada. Copiar la postura de bloqueo de un editor optimiza unos ingresos que tú no obtienes y renuncia a una distribución que sí necesitas.
- 05Sirve de forma estática los datos estables y en vivo los volátiles. Los parámetros técnicos, el estado de cumplimiento y el ciclo de vida se pueden renderizar en el servidor y estructurar. El stock, el plazo de entrega y el precio contractual no se pueden rastrear correctamente a ninguna frecuencia de actualización y su sitio está detrás de un endpoint consultable.
- 06Prepárate para la identidad, no solo para el acceso. Los agentes firmados harán posibles las respuestas que tienen en cuenta los derechos de acceso. Los proveedores que ya hayan normalizado sus datos de precios y disponibilidad podrán aprovecharlo; los que no, se pasarán esa ventana de oportunidad limpiando datos.
- 07Vigila la exactitud, no solo la visibilidad. Un plazo de entrega equivocado y dado con aplomo hace más daño comercial que uno ausente, y ninguno de los dos aparece en un informe de posiciones.
Por qué llegar primero importa aquí más de lo habitual
Hay un motivo concreto para moverse pronto, y no es el argumento habitual de ocupar terreno.
Los asistentes convergen. Cuando un modelo encuentra una fuente que responde a toda una clase de preguntas de forma correcta y barata —una que se analiza sin ambigüedad, resuelve las referencias de pieza de manera coherente y no se contradice de una página a otra—, esa fuente se convierte en el camino de menor resistencia para toda la clase. Se recupera más, se cita más y se refuerza en la siguiente ronda de entrenamiento y en los índices de recuperación construidos sobre ella.
Eso no es una posición que puedas recomprar más adelante con un presupuesto mayor, porque el mecanismo no es una subasta. Es una opción por defecto. Y en la industria las opciones por defecto son especialmente persistentes, porque se cuelan en documentos que perduran: una lista de proveedores homologados, una especificación estándar, una plantilla de lista de materiales. Una pieza que se convierte en la respuesta por defecto en 2026 sigue estando en la plantilla en 2031.
El corolario resulta incómodo para quien esté esperando a que el panorama se aclare. El coste de llegar pronto es un proyecto de datos. El coste de llegar tarde no es ese mismo proyecto de datos hecho más tarde: es un proyecto de datos hecho más tarde contra un competidor que ya es la respuesta por defecto.
El evaluador gratuito en [/audit](/audit) muestra exactamente qué lee hoy una máquina de tu catálogo y dónde están las lagunas.
Preguntas frecuentes
¿Qué cambia el 15 de septiembre de 2026?
Cloudflare empieza a clasificar el tráfico de rastreadores de IA en tres categorías —búsqueda, agente y entrenamiento— en lugar de tratarlo como una sola clase. A partir de esa fecha, los rastreadores de entrenamiento y de agente quedan bloqueados por defecto en las páginas que muestran publicidad, y los rastreadores de uso mixto que no declaran su finalidad en cada petición quedan bloqueados por completo en esas páginas. Los valores por defecto se aplican a los clientes nuevos, a los sitios nuevos creados por clientes existentes y a todos los sitios del plan gratuito ya existentes; los clientes de pago pueden anularlos previamente en los ajustes de seguridad.
¿Afecta esto al catálogo de producto de un fabricante?
Normalmente no de forma directa, porque los valores por defecto se activan en las páginas con publicidad y la mayoría de los catálogos de fabricante no llevan anuncios. Importa por dos motivos indirectos. Primero, las publicaciones sectoriales, los contenidos de los distribuidores y los foros técnicos donde se habla de tus piezas suelen financiarse con publicidad, de modo que la cobertura de tus productos por parte de terceros puede volverse menos accesible para los asistentes. Segundo, sienta el precedente de que el acceso de los rastreadores es un permiso tarificado y específico por finalidad, y ese modelo se extenderá.
¿Qué es la ratio de rastreos por referencia y por qué importa?
Es el número de páginas que una empresa de IA rastrea por cada visitante que devuelve. Cloudflare empezó a publicar estas ratios en Radar en 2025: el rastreador de Anthropic se situaba en torno a 70.900 páginas rastreadas por cada referencia en una muestra de finales de junio de 2025, frente a la norma de la búsqueda tradicional, de un par de rastreos o menos por visitante enviado. Esa ratio explica por qué los editores empezaron a bloquear. Para un fabricante, la inversión del planteamiento es importante: tú no vendes publicidad contra el tráfico, así que una ratio alta de rastreos por referencia no es un coste, es distribución que no estás pagando.
¿Debería publicar un archivo llms.txt?
Cuesta casi nada y sirve de casi nada. Ahrefs analizó 137.210 dominios y comprobó que el 97 % de los archivos llms.txt publicados no recibió ni una sola petición en mayo de 2026; la mayoría de las descargas que sí se produjeron procedían de herramientas de SEO, no de sistemas de IA, y no hubo ninguna mejora medible en las citas. Publícalo si te sale gratis, pero nunca dejes que sustituya a las páginas renderizadas en el servidor, los datos estructurados, los feeds o un endpoint.
¿Qué es Web Bot Auth y por qué debería importarle a un fabricante?
Es una forma de que un cliente automatizado demuestre criptográficamente su identidad mediante HTTP Message Signatures, una clave Ed25519 por agente y una cabecera Signature-Agent, en lugar de depender de una cadena de user-agent fácil de falsificar. Cloudflare lanzó los agentes firmados en agosto de 2025, con un grupo inicial que incluía el agente de ChatGPT y Goose, de Block, y el trabajo avanza ahora en el IETF. Importa porque es la condición previa para servir datos distintos a agentes distintos, que es como los precios contractuales y la disponibilidad específica de cada cliente acabarán llegando a los agentes de forma segura.
¿Es bloquear a los rastreadores de IA una opción por defecto sensata para un proveedor industrial?
Casi nunca. Bloquear tiene sentido cuando tu contenido es el producto y el tráfico es el ingreso: edición, medios, investigación. Para un fabricante o un distribuidor, el catálogo es material de marketing de un producto físico, y estar ausente de la respuesta de un asistente cuesta una especificación. La postura correcta es selectiva: abre el catálogo, publica una política explícita para rastreadores y tarifica o autentica aquello que sea de verdad sensible desde el punto de vista comercial, como los precios contractuales.
¿Cómo interactúa con esto la regulación de la UE?
Empuja en la misma dirección, aunque por otro motivo. El Reglamento de Ejecución (UE) 2026/1778 de la Comisión, de 16 de julio de 2026, fijó las normas de funcionamiento del registro del Pasaporte Digital de Producto de la UE previsto en el ESPR, que la Comisión puso en marcha pocos días después. Los productos de construcción se tratan por separado, bajo el Reglamento de Productos de Construcción revisado y con un calendario posterior. El requisito de cumplimiento son datos de producto estructurados y legibles por máquina, con identidad y trazabilidad verificadas, que es esencialmente el mismo activo que exige la web agéntica. Los fabricantes que lo construyan dos veces, una para Bruselas y otra para los asistentes, están malgastando el presupuesto.
Fuentes
- 01TechCrunch, Cloudflare's new policy pushes AI companies to pay for publishers' content (1 July 2026)
- 02Help Net Security, Cloudflare changes AI crawler access rules (2 July 2026)
- 03Cloudflare, Introducing pay per crawl
- 04Cloudflare, The crawl before the fall of referrals: crawl-to-refer ratios on Radar
- 05Cloudflare, The age of agents: cryptographically recognizing agent traffic (28 August 2025)
- 06IETF, HTTP Message Signatures for automated traffic architecture (Web Bot Auth)
- 07Ahrefs, We analysed 137,000 sites: 97% of llms.txt files never get read (May 2026)
- 08Imperva / Thales, 2026 Bad Bot Report: Bots in the Agentic Age
- 09SparkToro, In 2026, Less than One Third of Google Searches Still Send a Click
- 10Model Context Protocol, MCP joins the Agentic AI Foundation (9 December 2025)
- 11EUR-Lex, Commission Implementing Regulation (EU) 2026/1778 on the digital product passport registry (16 July 2026)
Comprueba exactamente qué información de tus productos pueden leer hoy los asistentes de IA y cuál no —política de rastreo, cobertura del catálogo, acceso a las fichas técnicas—, con puntuación y comparativa frente a 984 distribuidores y fabricantes de todo el mundo.
Evaluar mi catálogoNotas de campo relacionadas
Comercio agéntico en el suministro industrial: la realidad de 2026
Qué funciona de verdad hoy en el comercio agéntico frente al ruido: la retirada de Instant Checkout demostró q…
MercadoCómo la especificación por IA transformó la compra B2B
Ingenieros y compradores consultan a un asistente antes de entrar en la web de un proveedor. Qué implica para …
MercadoCómo seleccionan componentes los ingenieros con IA en 2026
La selección de componentes con IA ya es casi universal, pero el ingeniero sigue verificando en la ficha técni…