¿Qué es un catálogo de producto preparado para agentes?
En resumen
¿Qué es un catálogo de producto preparado para agentes?
Un catálogo de producto preparado para agentes es aquel que una máquina puede encontrar, leer, consultar y citar correctamente sin que una persona maneje un navegador. En la práctica supone cuatro superficies distintas: páginas renderizadas en el servidor con datos estructurados que los rastreadores sin JavaScript pueden analizar, vistas de texto limpio de esos mismos registros, feeds de producto enviados a los asistentes que solo aceptan datos entregados por el comercio, y un endpoint MCP alojado al que los agentes pueden llamar directamente. Las cuatro no son intercambiables —cada una la consume un conjunto distinto de asistentes— y ninguna funciona sin un único registro de producto canónico y verificado por debajo.
¿Qué significa realmente «preparado para agentes»?
Un catálogo de producto está preparado para agentes cuando una máquina puede encontrarlo, leerlo, consultarlo y citarlo correctamente sin que una persona maneje un navegador.
Es una prueba más exigente que «tenemos una buena web», y se suspende por motivos que jamás aparecen en un informe de velocidad de página. Un catálogo puede posicionar bien, convertir bien y tener un aspecto impecable y, aun así, devolver un documento vacío al cliente que realmente utiliza un asistente de IA. La brecha es estructural, no cosmética.
- 01 · Crawler policyDoes robots.txt name AI crawlers? Silence is not neutral — as edges default to blocking unverified agents, an unstated policy resolves to no.
- 02 · ReachabilityDoes a non-browser client get through your WAF, or meet a challenge interstitial?
- 03 · ReadabilityAre specs in the HTML, or injected by JavaScript the crawler will never run?
- 04 · CoverageHow much of the catalogue is actually reachable — sitemaps, regional hosts, gzipped indexes, datasheet PDFs?
- 05 · Agent surfacesCan an agent query you directly: llms.txt, markdown views, product feeds, an MCP endpoint?
Y cada trimestre importa más. Al publicar su Buyers' Journey Survey en enero de 2026, Forrester señaló que el 94 % de los compradores profesionales ya usa IA en su proceso de compra, y que el doble de compradores citó la IA generativa o la búsqueda conversacional como fuente de información más relevante que cualquier otra: por delante de las webs de los proveedores, los expertos de producto y los comerciales. Las especificaciones que un asistente recita sobre su producto son, cada vez más, las especificaciones que su comprador da por buenas.
La confusión en casi todo lo que se escribe sobre este asunto está en tratar «preparado para agentes» como una sola cosa. Son cuatro cosas, con cuatro consumidores distintos.
¿Qué asistentes consumen realmente cada superficie?
| Superficie | Qué es | Quién la consume hoy | Qué no puede hacer |
|---|---|---|---|
| Datos estructurados renderizados en el servidor | HTML entregado completo por el servidor, con JSON-LD de schema.org que coincide con el texto visible | Rastreadores de recuperación y de búsqueda: OAI-SearchBot, Claude-SearchBot, PerplexityBot y Googlebot para AI Overviews y AI Mode | Devolver stock en tiempo real, aplicar precios de contrato o responder a una consulta paramétrica |
| Vistas en Markdown o texto limpio | Representaciones de texto con poco ruido de esos mismos registros, a veces en URL .md o tras una negociación de contenido | Ningún asistente de consumo documenta un contrato de negociación de contenido; sirve sobre todo como texto fuente fácil de extraer y como carga útil de MCP | Conseguir por sí sola que le indexen; no es un mecanismo de posicionamiento |
| Feeds de producto enviados | Archivos de catálogo estructurados que usted entrega al asistente de forma periódica | La superficie de compra de ChatGPT y el índice de comercios de Perplexity, que exigen que sea usted quien envíe los datos: ninguno rastrea su sitio para esto | Transportar profundidad de ingeniería; los esquemas de feed de retail dan por supuesto un GTIN, un precio de tarifa y un SKU comprable |
| Endpoint MCP | Un servidor alojado que expone herramientas tipadas que un agente invoca por HTTP | Claude (todos los planes), el modo desarrollador y las apps de ChatGPT, Gemini Enterprise, Copilot, agentes de IDE y los propios agentes de sus clientes | Llegar a la cola larga anónima; el usuario o su administrador tiene que conectarlo |
1. Páginas renderizadas en el servidor con datos estructurados
Es la única superficie que alcanza a un usuario de asistente que no ha configurado nada.
El dato técnico más importante al respecto: los rastreadores de IA no ejecutan su JavaScript. El análisis de rastreadores de Vercel —569 millones de peticiones de GPTBot y 370 millones de peticiones de Claude en un solo mes— constató que, si bien estos rastreadores sí descargan archivos JavaScript (el 11,50 % y el 23,84 % de las peticiones, respectivamente), no los ejecutan, y concluyó que «ninguno de los principales rastreadores de IA renderiza JavaScript actualmente», citando a OpenAI, Anthropic, Meta, ByteDance y Perplexity. Las pruebas independientes repetidas a lo largo de 2026 han llegado al mismo veredicto. Si su tabla paramétrica, su indicador de stock o su lista de documentos se inyecta en el cliente, no existe para estos clientes. Googlebot sí renderiza JavaScript y sigue siendo la excepción, que es exactamente el motivo por el que los equipos que comprueban su visibilidad en Google concluyen, erróneamente, que todo va bien.
La propia documentación de Google es refrescantemente tajante sobre el resto: para aparecer en AI Overviews o en AI Mode «una página debe estar indexada y ser apta para mostrarse en Google Search con un fragmento», y no hay requisitos técnicos adicionales, ni schema específico para IA, ni archivos especiales. Los datos estructurados siguen mereciendo su lugar, porque eliminan la ambigüedad sobre qué cifra es la corriente nominal y cuál es la de pico, pero son una herramienta de desambiguación, no un disparador mágico.
Por último, la capa de rastreo tiene una dimensión de política que la mayoría de los catálogos ignora. OpenAI documenta tres agentes distintos: GPTBot para el entrenamiento de modelos fundacionales, OAI-SearchBot para mostrar sitios en la búsqueda de ChatGPT y ChatGPT-User para las peticiones iniciadas por el usuario. Anthropic documenta ClaudeBot, Claude-User y Claude-SearchBot con el mismo patrón. Son entradas independientes de robots.txt. Un bloqueo genérico dirigido al entrenamiento apaga también el rastreador de recuperación que podría haberle citado.
2. Vistas en Markdown y texto limpio
Es la superficie sobre la que más se ha exagerado en 2026, así que conviene ser preciso.
Ningún asistente de consumo relevante publica un contrato de negociación de contenido que diga «envíeme Accept: text/markdown y lo preferiré». La convención llms.txt es técnicamente coherente y tiene una adopción real entre los sitios de documentación para desarrolladores, pero Google afirma sin rodeos que no hacen falta archivos de texto para IA para aparecer en sus funciones de IA, y la investigación sobre adopción a lo largo de 2026 constató que los rastreadores de OpenAI, Google y Anthropic no solicitan el archivo en volúmenes significativos.
Lo que sí es cierto es más limitado y aun así merece la pena. El texto extraído de una página cargada de navegación y de scripts es más ruidoso que el texto servido como prosa, de modo que las vistas limpias sobreviven mejor a la extracción. Y esa misma representación limpia es justo lo que sus herramientas MCP deberían devolver como carga útil. Construya las vistas en Markdown como un subproducto reutilizable del registro canónico y no como una táctica de crecimiento, y no se llevará una decepción.
3. Feeds de producto enviados
He aquí el dato que reordena la mayoría de las hojas de ruta: la superficie de compra de ChatGPT se alimenta de datos que envían los comercios, no del rastreo. Según la especificación de feed publicada, los comercios entregan TSV, CSV, XML o JSON a un endpoint acordado y en lista de permitidos sobre HTTPS cifrado, y el sistema admite actualizaciones cada 15 minutos. El programa de comercios de Perplexity funciona igual en su forma: datos de producto suministrados como archivos CSV o XML en un formato especificado y entregados por el comercio. Ninguna cantidad de optimización en la página sustituye al alta en el programa.
La advertencia honesta para los catálogos industriales es que estos esquemas están pensados para el retail. Dan por supuesto un GTIN, un precio de tarifa y una variante comprable. Un distribuidor con 40.000 referencias, precios de contrato específicos por cliente y sin GTIN en la mitad de la gama comprobará que el encaje es malo. Los feeds aportan mucho valor cuando se vende a un precio publicado a un comprador final identificable, y son en gran medida irrelevantes cuando se trabaja por oferta.
4. Un endpoint MCP
MCP es la superficie de mayor fidelidad y, hoy, la de audiencia más estrecha. Aquí la precisión importa, porque el alcance varía mucho según el asistente:
- Claude admite conectores MCP remotos personalizados en los planes Free, Pro, Max, Team y Enterprise, con los usuarios gratuitos limitados a un único conector. El servidor debe ser accesible por la internet pública desde los rangos de IP de Anthropic.
- ChatGPT expone servidores MCP personalizados a través del modo desarrollador; los conectores personalizados con capacidad de escritura se limitan a Business, Enterprise y Edu, mientras que los usuarios individuales de Plus y Pro solo disponen de conectores de solo lectura. El Apps SDK, que sustenta las apps dentro de ChatGPT, está construido sobre MCP y los envíos pasan por una revisión de directorio.
- Gemini ofrece conexiones a servidores MCP personalizados a través de Gemini Enterprise, donde un administrador registra su servidor Streamable HTTP como almacén de datos dentro de su tenant. No es una función de consumo.
Así pues, la población alcanzable son los ingenieros que configuran un conector y los compradores corporativos cuyo departamento de TI registra su servidor. Para un fabricante de componentes o de producto para construcción, esa es una descripción notablemente buena del prescriptor y del equipo de compras, pero no es la cola larga anónima: quien le diga que un endpoint MCP por sí solo le hace «visible para la IA» le está vendiendo algo.
¿Por qué un servidor MCP vacío no vale nada?
Porque una llamada a una herramienta es una promesa de exactitud, y una respuesta equivocada entregada a través de una herramienta es peor que ninguna respuesta.
Cuando un asistente lee su página web, matiza: el modelo sabe que está resumiendo un documento. Cuando llama a get_part y recibe {"rated_current_a": 32}, no matiza. Afirma la cifra. Si su PIM guarda 32 A para el tamaño de carcasa y 25 A para la variante concreta, y la herramienta resolvió la equivocada, no ha mejorado su visibilidad ante la IA: ha industrializado un error de especificación y le ha adherido la autoridad de su marca.
Por eso los servidores MCP de piezas solventes que se están lanzando hoy se apoyan en una capa de datos verificada y no en un barniz de protocolo. El servidor MCP público y gratuito de Microchip, lanzado en noviembre de 2025, expone especificaciones de producto verificadas, fichas técnicas, inventario, precios y plazos de entrega sobre Streamable HTTP; el énfasis del anuncio está en que los datos sean verificados y estén actualizados, no en el transporte. El servidor Storefront MCP de Shopify, accesible en https://{shop}.myshopify.com/api/mcp, funciona porque una tienda de Shopify ya tiene un único registro de producto autorizado con campos tipados.
Un endpoint MCP colocado delante de tres hojas de cálculo que se contradicen, de un PIM que perdió sus unidades y de una carpeta de archivos PDF es una forma más rápida de equivocarse. El orden de trabajo es: registro canónico, verificación y después protocolo.
El modelo de madurez de la preparación para agentes
| Nivel | Nombre | Qué es cierto en este nivel | Fallo típico |
|---|---|---|---|
| 0 | Invisible | Catálogo renderizado en el cliente; las especificaciones solo viven dentro de archivos PDF; sin datos estructurados | Un cliente que no es un navegador recibe un armazón vacío |
| 1 | Rastreable | Páginas de producto renderizadas en el servidor; marcado de schema.org que coincide con el texto visible; una política explícita y deliberada para rastreadores de IA en robots.txt | El bloqueo genérico del entrenamiento silencia también a los rastreadores de recuperación |
| 2 | Extraíble | Un único registro canónico por pieza; paramétricos tipados contra un diccionario común (ETIM, ECLASS, UNSPSC); documentos modelados como registros, no como enlaces; identificadores estables | Los atributos existen, pero no coinciden entre la web, el PIM y la ficha técnica |
| 3 | Invocable | Endpoint MCP alojado sobre Streamable HTTP con búsqueda paramétrica, consulta de piezas, alternativas, documentos de conformidad y CAD; feeds enviados allí donde existe la superficie | Las herramientas se publican sin frescura ni trazabilidad, así que nadie puede auditar una respuesta |
| 4 | Canal de agentes autorizado | Stock y precios de contrato por cliente protegidos con OAuth; monitorización continua de la exactitud; analítica de agentes; una política publicada sobre a qué pueden acceder los agentes | Ninguno, si la monitorización es real: este es el estado objetivo |
La mayoría de las organizaciones descubre que está en el nivel 0 o en el 1 mientras cree estar en el 2. La pregunta que marca la diferencia no es «¿tenemos datos estructurados?», sino «si dos sistemas discrepan sobre este atributo, cuál tiene razón, y puede saberlo una máquina?».
¿Cómo averiguar en qué nivel está?
Cinco comprobaciones, en orden, y cada una lleva minutos:
- 01Descargue una página de producto con un cliente sencillo que no sea un navegador y lea la respuesta en bruto. Si las especificaciones no están en el HTML, está en el nivel 0 por muy bien que se vea la página en un navegador.
- 02Lea su `robots.txt` como un documento de política. Enumere todos los agentes de usuario de IA que permite y que bloquea, y confirme que cada línea refleja una decisión real sobre entrenamiento frente a recuperación.
- 03Valide un bloque JSON-LD y contraste cada valor con la página visible. Las discrepancias son peores que las omisiones.
- 04Elija diez piezas y haga a tres asistentes una pregunta objetiva cuya respuesta correcta conozca de memoria. Anote las respuestas erróneas. Esa tasa de error es su punto de partida real.
- 05Intente responder a una pregunta paramétrica con sus propios datos —todas las piezas que cumplen tres restricciones— utilizando solo aquello a lo que puede llegar una máquina. Si una persona tiene que abrir un PDF, un agente también tendría que hacerlo, y no lo hará.
¿Qué encontramos en 984 empresas?
En agosto de 2026 auditamos 984 dominios de distribuidores y fabricantes de todo el mundo, en Norteamérica, Europa y Asia. El panorama agregado fue lo bastante consistente como para resultar incómodo:
- La puntuación mediana de visibilidad ante la IA rondaba los 50 sobre 100.
- El 38 % no sirvió ninguna página de catálogo legible a un cliente estándar que no fuera un navegador.
- Solo el 19 % publicaba una política explícita para rastreadores de IA de algún tipo y, entre ellos, más del doble bloqueaba a un rastreador importante que los que lo invitaban.
- Ninguno anunciaba un endpoint MCP.
La distribución importa más que la mediana. La diferencia entre el decil superior y la zona media no era el presupuesto ni la plantilla; era si la organización tenía un único registro de producto canónico o varios en competencia. Todo lo demás se derivaba de ahí.
¿Qué construir primero?
- 01Establezca un único registro canónico por pieza, con atributos tipados, unidades, trazabilidad y una marca de tiempo de última verificación. Todo lo que sigue es una proyección de esto.
- 02Renderice el catálogo en el servidor para que la especificación completa esté presente en la respuesta HTML inicial.
- 03Añada datos estructurados que coincidan con la página y verifíquelos en lugar de confiar en el generador.
- 04Redacte una política deliberada para rastreadores de IA, agente por agente, y documente por qué se tomó cada decisión.
- 05Envíe feeds allí donde exista una superficie compatible con su modelo comercial y prescinda de ellos, con honestidad, donde no la haya.
- 06Levante un endpoint MCP que exponga búsqueda paramétrica, consulta de piezas, alternativas, documentos de conformidad y CAD, con OAuth para todo lo específico de cada cliente.
- 07Monitorice la exactitud de forma continua, porque el modo de fallo no es el silencio, sino el error rotundo.
Partsgraph construye todo esto como una capa superpuesta: ingerimos el catálogo que ya tiene —fichas técnicas, paramétricos, CAD y documentos de conformidad—, lo resolvemos en un único Parts Graph verificado y lo servimos en las cuatro superficies sin tocar su web.
Si quiere el punto de partida antes que la hoja de ruta, pase su dominio por nuestro grader gratuito en /audit. Informa de qué recibe hoy realmente de su catálogo un cliente que no es un navegador, y de cuál de las cuatro superficies le falta.
Preguntas frecuentes
¿Un catálogo preparado para agentes no es más que SEO con otro nombre?
No, aunque hay solapamiento. El SEO clásico optimiza una sola superficie —una página HTML rastreable— para un solo consumidor, un índice de búsqueda. La preparación para agentes abarca cuatro superficies con consumidores distintos, dos de las cuales (los feeds enviados y MCP) no se rastrean en absoluto: usted les entrega los datos de forma activa. El solapamiento es real en la capa de rastreo, donde la propia documentación de Google indica que AI Overviews y AI Mode se apoyan en el mismo índice y en los mismos requisitos técnicos que la búsqueda ordinaria.
¿Necesito llms.txt?
Casi con toda seguridad no como prioridad. Google afirma con claridad que no hace falta crear nuevos archivos legibles por máquina ni archivos de texto para IA para aparecer en sus funciones de IA, y el análisis independiente de adopción de 2026 constató que los principales rastreadores de IA no solicitan llms.txt en volúmenes significativos. Publicar uno cuesta poco, pero nunca debería desplazar en su hoja de ruta a las páginas renderizadas en el servidor, a un feed o a un endpoint MCP.
¿Qué superficie debería construir primero un fabricante?
Páginas de producto estructuradas y renderizadas en el servidor, porque es la única superficie que llega a la cola larga anónima de usuarios de asistentes y porque le obliga a construir el registro de producto canónico que todas las demás superficies reutilizan. Los feeds y MCP salen baratos una vez que existe ese registro, y son casi imposibles antes de que exista.
¿Pueden los asistentes de IA leer una ficha técnica en PDF?
A veces, mal y de forma impredecible. Un rastreador que llegue a un PDF puede extraer texto de él, pero las tablas, las condiciones a pie de página y los paramétricos a varias columnas se degradan mucho, y los valores resultantes llegan sin unidades, tolerancias ni condiciones de ensayo asociadas. Un PDF es una representación de sus datos, no sus datos. La solución es mantener los paramétricos como registros estructurados y conservar el PDF como una representación más entre varias.
¿Un endpoint MCP sustituye a mi sitio web?
No. MCP se despliega junto al sitio web, no en su lugar. Llega a una audiencia más estrecha pero de mayor intención: ingenieros que configuran un conector y compradores corporativos cuyo administrador de TI registra su servidor. La web pública sigue concentrando la mayoría anónima del tráfico de asistentes, así que los dos canales atienden a mitades distintas del mismo embudo.
¿Cómo sé si los asistentes de IA están leyendo bien mi catálogo?
Compruébelo en lugar de suponerlo. Descargue sus propias páginas de producto con un cliente sencillo que no sea un navegador y vea qué devuelve; haga a varios asistentes preguntas objetivas sobre piezas cuyas respuestas correctas conoce; e instrumente cualquier endpoint MCP o feed para poder ver qué piezas se solicitan y qué consultas fallan. La monitorización de la exactitud importa más que la del volumen: una especificación equivocada dicha con aplomo hace más daño comercial que una ausente.
¿Qué me aporta el nivel 4 que no me dé el nivel 3?
Autorización y observabilidad. En el nivel 3 un agente puede consultar su catálogo público. En el nivel 4 un agente autenticado puede ver los precios de contrato y el stock en tiempo real de un cliente concreto, usted puede ver qué agentes consultaron qué y puede medir si las respuestas que recibieron eran correctas. Eso convierte un proyecto contiguo al SEO en un canal con modelo de permisos y métricas.
Fuentes
- 01Vercel, The rise of the AI crawler (crawl volumes and JavaScript rendering analysis)
- 02SearchOptimo, Do AI crawlers render JavaScript? GPTBot, ClaudeBot and Perplexity in 2026
- 03Google Search Central, AI Features and Your Website
- 04Google Search Central, Guide to optimizing for generative AI features
- 05OpenAI, Overview of OpenAI crawlers (GPTBot, OAI-SearchBot, ChatGPT-User)
- 06Anthropic, Does Anthropic crawl data from the web, and how can site owners block the crawler?
- 07Agentic Commerce Protocol, Product Feed Specification
- 08OpenAI Developers, Product feeds (Agentic Commerce)
- 09Perplexity, Merchant Program Terms of Service
- 10Anthropic, Get started with custom connectors using remote MCP
- 11OpenAI Help Center, Developer mode and MCP apps in ChatGPT
- 12Google Cloud, Set up your custom MCP server data store (Gemini Enterprise)
- 13Model Context Protocol, MCP joins the Agentic AI Foundation (9 December 2025)
- 14Shopify, Storefront MCP server documentation
- 15Microchip Technology, Microchip unveils Model Context Protocol (MCP) Server (6 November 2025)
- 16Forrester, B2B Buyers Make Zero-Click Buying Number One (22 January 2026, Buyers' Journey Survey)
- 17Presenc AI, State of llms.txt 2026 (adoption and crawler request data)
Comprueba exactamente qué información de tus productos pueden leer hoy los asistentes de IA y cuál no —política de rastreo, cobertura del catálogo, acceso a las fichas técnicas—, con puntuación y comparativa frente a 984 distribuidores y fabricantes de todo el mundo.
Evaluar mi catálogoNotas de campo relacionadas
Los rastreadores de IA no ejecutan JavaScript
GPTBot, ClaudeBot y PerplexityBot leen el HTML en bruto y nunca ejecutan scripts. Cómo comprobar si tu catálog…
Soluciónrobots.txt para rastreadores de IA: la guía de 2026
Los user-agents de IA que importan en 2026, quién los opera, cuáles respetan robots.txt, configuraciones lista…
MercadoComercio agéntico en el suministro industrial: la realidad de 2026
Qué funciona de verdad hoy en el comercio agéntico frente al ruido: la retirada de Instant Checkout demostró q…