# robots.txt para rastreadores de IA: la guía de 2026

> Los user-agents de IA que importan en 2026, quién los opera, cuáles respetan robots.txt, configuraciones listas para copiar, WAF y verificación en logs.

**Language:** es  
**Published:** 2026-08-09  
**Category:** Solution · **Tags:** robots.txt, AI crawlers, GPTBot, ClaudeBot, bot management, WAF, Content Signals  
**Canonical:** https://partsgraph.ai/es/blog/robots-txt-for-ai-crawlers-guide

## En resumen

**¿Cómo debo configurar robots.txt para los rastreadores de IA en 2026?**

Trata a los clientes de IA como tres clases, no como una: rastreadores de entrenamiento (GPTBot, ClaudeBot, CCBot, Google-Extended), indexadores de búsqueda (OAI-SearchBot, Claude-SearchBot, PerplexityBot) y recuperadores activados por el usuario (ChatGPT-User, Perplexity-User, Gemini-Deep-Research). Los dos primeros recopilan contenido para entrenar modelos y para los índices de recuperación que citan los motores de respuesta, y ambos respetan robots.txt. El tercero se activa cuando una persona real hace una pregunta real, y la mayoría de los operadores documentan que robots.txt puede no aplicarse en ese caso. Bloquear la clase de entrenamiento es una decisión de licencia; bloquear los recuperadores activados por el usuario es negarse a atender a un cliente en directo.

---

## La respuesta breve

Deja de pensar en los «bots de IA» como si fueran una sola cosa. Hay tres clases con economías completamente distintas, y una única línea `Disallow` aplicada a todas ellas es casi siempre un mal negocio.

> **Figure.** The three classes of AI user-agent — training crawlers, search indexers and user-triggered fetchers — and why one blanket rule is the wrong trade.

> Un rastreador de entrenamiento pide aprender de tu catálogo. Un indexador de búsqueda pide poder citarlo. Un recuperador activado por el usuario es un cliente que, ahora mismo, está preguntando por tu producto. Bloquear al primero es una decisión de licencia. Bloquear al tercero es colgarle el teléfono.

Forrester constató que **el 94 % de los compradores profesionales usó IA durante su proceso de compra más reciente**. Una parte significativa de las peticiones que llegan a tu origen con un user-agent de IA no son scraping: son alguien con una lista de materiales abierta, en plena decisión. Tu robots.txt debería distinguir entre unas y otras, y la mayoría no lo hace.

## Todos los user-agents de IA que importan en 2026

| Token | Operador | Clase | ¿Respeta robots.txt? | Verificar la IP de origen en |
|---|---|---|---|---|
| `GPTBot` | OpenAI | Entrenamiento | Sí | [gptbot.json](https://openai.com/gptbot.json) |
| `OAI-SearchBot` | OpenAI | Índice de búsqueda | Sí | [searchbot.json](https://openai.com/searchbot.json) |
| `ChatGPT-User` | OpenAI | Activado por el usuario | «puede no aplicarse» | [chatgpt-user.json](https://openai.com/chatgpt-user.json) |
| `ClaudeBot` | Anthropic | Entrenamiento | Sí | [bots.json](https://claude.com/crawling/bots.json) |
| `Claude-SearchBot` | Anthropic | Índice de búsqueda | Sí | [bots.json](https://claude.com/crawling/bots.json) |
| `Claude-User` | Anthropic | Activado por el usuario | Sí | [bots.json](https://claude.com/crawling/bots.json) |
| `PerplexityBot` | Perplexity | Índice de búsqueda | Sí | [perplexitybot.json](https://www.perplexity.com/perplexitybot.json) |
| `Perplexity-User` | Perplexity | Activado por el usuario | «generalmente las ignora» | [perplexity-user.json](https://www.perplexity.com/perplexity-user.json) |
| `Google-Extended` | Google | Token de permiso de entrenamiento | Sí, como token | No es un recuperador |
| `Gemini-Deep-Research` | Google | Agente de investigación activado por el usuario | Generalmente las ignora | [Rangos de los recuperadores de Google](https://developers.google.com/static/search/apis/ipranges/user-triggered-fetchers-google.json) |
| `Applebot-Extended` | Apple | Token de permiso de entrenamiento | Sí, como token | No es un recuperador |
| `Amazonbot` | Amazon | Entrenamiento y mejora de producto | Sí | [Lista de IP de Amazon](https://developer.amazon.com/amazonbot/ip-addresses/) |
| `Bytespider` | ByteDance | Entrenamiento | En disputa | Ninguna publicada |
| `CCBot` | Common Crawl | Archivo masivo que alimenta muchos modelos | Sí | DNS inverso |
| `Meta-ExternalAgent` | Meta | Entrenamiento e indexación | Sí | Documentación de Meta |

Hay cinco puntos de esa tabla que se malinterpretan o se pasan por alto de forma sistemática, y conviene enunciarlos de forma explícita.

**`Google-Extended` y `Applebot-Extended` no son rastreadores.** Ninguno de los dos descarga nada. Son tokens de permiso: Google-Extended controla si el contenido que ya ha rastreado Googlebot puede usarse para entrenar Gemini y para fundamentar sus respuestas, y la documentación de Apple es explícita al señalar que Applebot-Extended «no rastrea páginas web» y «solo se usa para determinar cómo utilizar los datos rastreados por el user agent Applebot». Aplicar Disallow a Applebot-Extended no te saca de los resultados de Siri, Spotlight o Safari.

**Anthropic es la excepción en las peticiones activadas por el usuario.** OpenAI afirma que, en el caso de ChatGPT-User, «como estas acciones las inicia un usuario, las reglas de robots.txt pueden no aplicarse». Perplexity dice que Perplexity-User «generalmente ignora las reglas de robots.txt». La documentación de Google señala, sobre sus recuperadores activados por el usuario, que «como la petición la ha solicitado un usuario, estos recuperadores generalmente ignoran las reglas de robots.txt». Amazon dice que Amzn-User «puede no seguir todas las directivas de robots.txt». Anthropic, en cambio, documenta que sus bots respetan robots.txt y designa Claude-User como el token que los propietarios de sitios pueden usar para controlar las peticiones iniciadas por usuarios. Si aplicas Disallow a todo el conjunto, Claude será el único que se detenga de verdad, que es justo lo contrario de lo que casi todo el mundo pretende.

**Amazon y Meta operan cada uno una flota dividida.** Además de Amazonbot, Amazon documenta `Amzn-SearchBot` (experiencias de búsqueda, incluidas Alexa y Rufus) y `Amzn-User` (acciones de usuario en directo), y afirma que ninguno de los dos rastrea para entrenar IA generativa. Meta opera `Meta-ExternalAgent` para entrenamiento e indexación y `Meta-ExternalFetcher` para las peticiones solicitadas por usuarios, este último capaz de saltarse robots.txt.

**Bytespider es un problema de política, no de robots.txt.** ByteDance afirma que respeta robots.txt; los operadores de sitios informan de forma generalizada de lo contrario. Si quieres detenerlo, deténlo en el edge y no confíes en el archivo.

**Una nota sobre `Gemini-Deep-Research`:** la documentación de rastreadores publicada por Google todavía no incluye este token entre sus rastreadores comunes ni entre sus recuperadores activados por el usuario, pero está en uso activo y los grandes distribuidores ya lo tratan por su nombre: el robots.txt de Digi-Key permite explícitamente tanto `Google-Extended` como `Gemini-Deep-Research`, junto con GPTBot, ChatGPT-User, OAI-SearchBot, PerplexityBot, Perplexity-User, ClaudeBot, Claude-User y Claude-SearchBot. Inclúyelo: un token no reconocido en robots.txt es inofensivo.

## ¿Qué cuesta realmente bloquear cada clase?

| Si bloqueas | Pierdes | Ganas |
|---|---|---|
| Rastreadores de entrenamiento | Presencia en los pesos de los modelos futuros; ser la respuesta por defecto sin conexión | Una posición de licencia y, marginalmente, algo menos de ancho de banda |
| Indexadores de búsqueda | Ser citado en las respuestas de ChatGPT, Claude y Perplexity | Nada relevante para un catálogo público |
| Recuperadores activados por el usuario | La capacidad de responder a la pregunta de un comprador en directo | Nada |

Para un fabricante o distribuidor cuyo catálogo ya es público y ya está replicado en los agregadores, bloquear la clase de entrenamiento es sobre todo simbólico: los datos llegan igualmente a los modelos, a través de las fichas de los distribuidores y de Common Crawl. Lo que cambia es de quién es la versión de tus datos que retiene el modelo. Bloquear las otras dos clases no aporta ninguna ventaja en un catálogo público.

## robots.txt listo para copiar y pegar

### Receta A: máxima visibilidad ante los agentes

El valor por defecto adecuado para un fabricante o distribuidor con un catálogo público y cuyo interés comercial es que lo encuentren y lo citen con precisión.

```
# --- Answer engines and user-triggered fetchers ---
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Gemini-Deep-Research
User-agent: Amzn-SearchBot
Disallow: /account/
Disallow: /cart/
Disallow: /checkout/
Allow: /

# --- Training crawlers and permission tokens ---
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: CCBot
User-agent: Meta-ExternalAgent
User-agent: Amazonbot
User-agent: Google-Extended
User-agent: Applebot-Extended
Disallow: /account/
Disallow: /cart/
Disallow: /checkout/
Allow: /

# --- Everything else ---
User-agent: *
Disallow: /account/
Disallow: /cart/
Disallow: /checkout/

Sitemap: https://www.example.com/sitemap.xml
Sitemap: https://www.example.com/sitemap-products.xml
```

### Receta B: permitir la recuperación, rechazar el entrenamiento

Para organizaciones que han decidido deliberadamente no contribuir al entrenamiento de modelos, pero que siguen queriendo que las encuentren y las citen. Ten presente lo que cuesta: aplicar Disallow a Google-Extended retira tu contenido tanto de la fundamentación de las respuestas de Gemini como de su entrenamiento.

```
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Gemini-Deep-Research
Allow: /

User-agent: GPTBot
User-agent: ClaudeBot
User-agent: CCBot
User-agent: Bytespider
User-agent: Meta-ExternalAgent
User-agent: Amazonbot
User-agent: Google-Extended
User-agent: Applebot-Extended
Disallow: /

User-agent: *
Disallow: /account/
```

### Receta C: catálogo abierto, todo lo demás cerrado

Útil cuando el catálogo y la biblioteca documental son los activos que quieres exponer y el resto del sitio es ruido.

```
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: ClaudeBot
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Gemini-Deep-Research
Disallow: /
Allow: /products/
Allow: /catalog/
Allow: /datasheets/
Allow: /documents/
Allow: /sitemap-products.xml
```

Según la RFC 9309 gana la regla de ruta coincidente más larga, de modo que las líneas `Allow` prevalecen sobre el `Disallow: /` general para esos prefijos. Verifica el resultado en lugar de darlo por hecho: el comportamiento de los analizadores en los casos límite sigue variando.

## Expresar un «no» que se sostenga: Content Signals

robots.txt controla el *acceso*. No dice nada sobre el *uso* una vez servidos los bytes. La Content Signals Policy de Cloudflare, lanzada el 24 de septiembre de 2025, añade al mismo archivo una preferencia de uso legible por máquina, con tres señales: `search` (construir un índice de búsqueda y ofrecer resultados de búsqueda), `ai-input` (introducir el contenido en uno o varios modelos de IA) y `ai-train` (entrenar o afinar modelos de IA).

```
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /account/
```

Cloudflare aplicó `search=yes, ai-train=no` a más de 3,8 millones de dominios que habían activado su robots.txt gestionado, y dejó `ai-input` deliberadamente sin definir en lugar de suponerlo. Es una preferencia declarada, no un mecanismo de aplicación, pero es una declaración de intenciones clara, fechada y legible por máquina, y eso merece la pena.

## Por qué el silencio se está convirtiendo en un «no»

Durante veinte años, la ausencia de una regla en robots.txt significaba «sí». Ese valor por defecto se está retirando en la capa de infraestructura, y a los fabricantes que nunca han tocado el archivo los está excluyendo su propia CDN.

- **1 de julio de 2025** — Cloudflare, que se sitúa por delante de aproximadamente una quinta parte de la web, se convirtió en el primer gran proveedor de infraestructura en bloquear los rastreadores de IA por defecto, y pregunta de entrada a cada dominio recién incorporado si desea permitirlos.
- **24 de septiembre de 2025** — se publicó la Content Signals Policy, con `ai-train=no` aplicado por defecto a 3,8 millones de dominios gestionados.
- **1 de julio de 2026** — Cloudflare anunció que, a partir del **15 de septiembre de 2026**, en los dominios nuevos, en los sitios nuevos de clientes existentes y en todos los clientes actuales del plan gratuito, las categorías de rastreadores Training y Agent quedan bloqueadas por defecto en las páginas que muestran anuncios. Search sigue permitida. Los rastreadores polivalentes que mezclan Search con Training heredan la regla más restrictiva.

Lee esto último con precisión, porque se cita mal muy a menudo. Su alcance son las páginas monetizadas con publicidad, que no es lo que son la mayoría de los catálogos de fabricante. El cambio que ya te afecta es el de 2025: si tu sitio se dio de alta hace poco en una CDN moderna, o está en un plan gratuito, puede que ya estés rechazando rastreadores de IA sin que nadie lo haya decidido. Compruébalo antes de darlo por sentado.

## robots.txt es una petición. Tu WAF es lo que se aplica.

Aquí es donde fallan la mayoría de las configuraciones bienintencionadas. robots.txt es un protocolo voluntario que leen los clientes que lo cumplen. Tu gestor de bots es una barrera dura que clasifica por **IP de origen verificada**, y los conjuntos de reglas por defecto lanzan desafíos o bloquean de forma rutinaria todo lo que no parece un navegador. Un rastreador que lee `Allow: /` y acto seguido recibe un desafío de JavaScript ha sido bloqueado, diga lo que diga el archivo.

Todos los operadores importantes publican sus rangos para que puedas añadirlos correctamente a tu lista de permitidos:

| Operador | Rangos publicados |
|---|---|
| OpenAI | [gptbot.json](https://openai.com/gptbot.json), [searchbot.json](https://openai.com/searchbot.json), [chatgpt-user.json](https://openai.com/chatgpt-user.json) |
| Anthropic | [claude.com/crawling/bots.json](https://claude.com/crawling/bots.json) |
| Perplexity | [perplexitybot.json](https://www.perplexity.com/perplexitybot.json), [perplexity-user.json](https://www.perplexity.com/perplexity-user.json) |
| Google | [googlebot.json](https://developers.google.com/static/search/apis/ipranges/googlebot.json), [special-crawlers.json](https://developers.google.com/static/search/apis/ipranges/special-crawlers.json), [user-triggered-fetchers-google.json](https://developers.google.com/static/search/apis/ipranges/user-triggered-fetchers-google.json) |
| Amazon | [developer.amazon.com/amazonbot](https://developer.amazon.com/amazonbot) |

Para comprobar si una dirección concreta de tus logs es realmente de OpenAI:

```
python3 - <<'EOF'
import ipaddress, json, urllib.request
probe = ipaddress.ip_address("132.196.86.5")
data = json.load(urllib.request.urlopen("https://openai.com/gptbot.json"))
nets = [ipaddress.ip_network(p.get("ipv4Prefix") or p.get("ipv6Prefix"))
        for p in data["prefixes"]]
print(any(probe in n for n in nets if n.version == probe.version))
EOF
```

Tres reglas en el edge cubren casi todo:

1. **Añade los rangos verificados a la lista de permitidos antes de que se dispare tu regla de puntuación de bots**, limitándolo solo a las rutas del catálogo público y de los documentos.
2. **Exime a esas rutas de los desafíos de JavaScript y de los límites de tasa.** Un cliente que no es un navegador no puede resolver un desafío, y un rastreador que indexa 40.000 SKU hará saltar un límite de tasa calibrado para humanos.
3. **No incluyas nada en la lista de permitidos según la cadena del user-agent.** Es una cabecera de texto libre. Filtra por IP y, opcionalmente, después por user-agent.

Recuerda que cada origen se configura por separado. Tu sitio de producto, tu subdominio de documentación y el nombre de host de tu CDN necesitan cada uno su propio robots.txt y su propia política de WAF.

## ¿Cómo verifico en mis logs que ha funcionado?

Una configuración que no has verificado en los logs es una hipótesis. Deja pasar unos días antes de juzgar el resultado: los operadores cachean robots.txt, y la documentación de Meta advierte de que los cambios pueden tardar hasta 24 horas en surtir efecto, mientras que Amazon indica que sus rastreadores pueden usar una copia cacheada en los últimos 30 días. Después:

```
grep -aiE "GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-User|Claude-SearchBot|PerplexityBot|Perplexity-User|Gemini-Deep-Research|Applebot|Amazonbot|Bytespider|CCBot|Meta-External" access.log | wc -l
```

Después desglósalo por agente y por código de estado, que es la cifra que importa:

```
awk '/GPTBot/ {print $9}' access.log | sort | uniq -c | sort -rn
```

Lo que buscas:

1. **Volumen distinto de cero por agente.** Cero peticiones de cualquier agente de IA a lo largo de 72 horas en un catálogo público significa que estás bloqueado aguas arriba, no simplemente que no llamas la atención.
2. **Una distribución de estados dominada por códigos 2xx.** Un muro de 403 significa que el WAF se está imponiendo a robots.txt. Un muro de 404 significa que tu sitemap o tus enlaces internos apuntan a URL que ya no existen.
3. **Que aparezcan rutas de documentos, no solo de productos.** Si `/datasheets/` no aparece nunca, tu biblioteca técnica es invisible.
4. **Tamaños de respuesta con sentido.** Códigos 200 repetidos de 4–15 KB en las URL de producto suelen significar que los rastreadores están recibiendo una carcasa vacía renderizada en el cliente: técnicamente permitida, prácticamente inútil.
5. **Que los agentes activados por el usuario aparezcan siquiera.** El tráfico de ChatGPT-User, Claude-User y Perplexity-User es lo más parecido que tienes a una señal en tiempo real del interés de un comprador. Merece la pena reportarlo por separado.

## Errores habituales

- Bloquear por accidente los recuperadores activados por el usuario, dentro de una regla general dirigida a los rastreadores de entrenamiento.
- Configurar bien robots.txt y dejar el WAF sin tocar. Son dos interruptores y hay que accionar los dos.
- Olvidar el subdominio de documentación, el DAM y la CDN, cada uno de los cuales es un origen distinto según la RFC 9309.
- Bloquear el acceso de los rastreadores a los recursos CSS y JavaScript. A los rastreadores de solo texto les da igual, pero Googlebot y Applebot renderizan, y privarlos de recursos degrada lo que ven.
- Dar por hecho que un agregador reproduce tus datos con exactitud. Reproduce lo que capturó, en el momento en que lo capturó.
- Tratar `llms.txt` como un sustituto. Ningún operador importante se ha comprometido a leerlo, y los logs muestran por lo general que nunca se solicita.

Partsgraph auditó 984 dominios de distribuidores y fabricantes de todo el mundo —Norteamérica, Europa y Asia— en agosto de 2026. Solo el 19 % publicaba una política explícita de rastreadores de IA de algún tipo y, entre los que sí lo hacían, más del doble bloqueaba a un rastreador de IA importante frente a los que lo invitaban. Ninguno anunciaba un endpoint MCP. Puntuación mediana de visibilidad ante la IA: 50 sobre 100. La brecha todavía no es competitiva, y precisamente por eso un robots.txt bien construido sigue siendo una de las horas de trabajo más rentables al alcance de un equipo de datos de producto.

*Comprueba a qué pueden llegar realmente los rastreadores de IA en tu dominio con el evaluador gratuito de Partsgraph en [/audit](/audit).*

## Preguntas frecuentes

### ¿Cuál es la diferencia entre GPTBot y ChatGPT-User?

GPTBot es un rastreador masivo que recopila datos de entrenamiento para los modelos fundacionales de OpenAI, y obedece robots.txt. ChatGPT-User descarga una única página porque alguien le ha hecho a ChatGPT una pregunta que la necesita. La documentación de OpenAI indica que, al tratarse de acciones iniciadas por un usuario, las reglas de robots.txt pueden no aplicarse. Bloquear GPTBot es una decisión de licencia; bloquear ChatGPT-User es rehusar responder a la pregunta de un cliente en directo.

### ¿Es Google-Extended un rastreador?

No. Google-Extended es un token de control de robots.txt, no un cliente que descargue páginas. Los bytes siguen llegando a través de Googlebot. Aplicar Disallow a Google-Extended le indica a Google que no use el contenido para entrenar los modelos Gemini ni para fundamentar sus respuestas, sin tocar la indexación normal en búsqueda. Applebot-Extended funciona igual en el caso de Apple.

### ¿Bloquear los rastreadores de entrenamiento de IA mantendrá mi catálogo fuera de los modelos de IA?

En gran medida no, y te costará visibilidad. Los datos de componentes están replicados en distribuidores, agregadores y Common Crawl, así que el contenido suele llegar igualmente a los modelos, solo que como la copia desactualizada de un tercero en lugar de tu versión actual y autorizada. Pierdes la capacidad de ser la fuente citada sin ganar a cambio ningún control real.

### ¿El robots.txt de mi dominio principal cubre el subdominio de documentación?

No. Según la RFC 9309, robots.txt tiene alcance de un solo origen: esquema, host y puerto. El nombre de host de tu CDN, tu DAM y tu subdominio de documentación necesitan cada uno su propio archivo. Este es, con diferencia, el motivo más habitual de que un sitio que parece abierto en robots.txt siga sin servir nada a un rastreador.

### ¿Por qué mi robots.txt dice Allow y aun así se bloquea a los rastreadores?

Porque robots.txt es una petición y el WAF es lo que realmente se aplica. Los gestores de bots clasifican por IP de origen verificada, no por la cadena del user-agent, y muchas reglas por defecto lanzan un desafío a cualquier cliente que no sea un navegador. Tienes que añadir los rangos verificados de los rastreadores a la lista de permitidos en el edge, además de permitirlos en robots.txt.

### ¿Debería usar llms.txt en su lugar?

En su lugar, no. A fecha de 2026, ningún operador de IA relevante se ha comprometido a leer llms.txt, y el equipo de Search Relations de Google se ha negado a respaldarlo. Los logs del servidor muestran, por lo general, que los rastreadores de IA nunca solicitan el archivo. Publícalo si quieres, pero lo que de verdad cambia el comportamiento es robots.txt, tener páginas reales enlazadas y la lista de permitidos para bots verificados.

### ¿Cómo confirmo que una petición vino realmente de GPTBot y no de un suplantador?

Comprueba la IP de origen contra la lista de prefijos que OpenAI publica en openai.com/gptbot.json. Todos los operadores importantes publican un archivo JSON equivalente, y Google admite la verificación por DNS inverso. No te fíes nunca solo de la cadena del user-agent: es trivial falsificarla, y una parte considerable del tráfico que dice ser un rastreador de IA no lo es.

## Fuentes

1. [OpenAI, Overview of OpenAI crawlers](https://developers.openai.com/api/docs/bots)
2. [Anthropic, Does Anthropic crawl data from the web?](https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler)
3. [Perplexity, PerplexityBot and Perplexity-User documentation](https://docs.perplexity.ai/guides/bots)
4. [Google Search Central, Google crawlers and user agents](https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers)
5. [Google Search Central, user-triggered fetchers](https://developers.google.com/search/docs/crawling-indexing/google-user-triggered-fetchers)
6. [Apple Support, About Applebot](https://support.apple.com/en-us/119829)
7. [Amazon, About Amazonbot](https://developer.amazon.com/amazonbot)
8. [Meta for Developers, Meta web crawlers](https://developers.facebook.com/documentation/sharing/webmasters/web-crawlers)
9. [Cloudflare, Content Independence Day: new AI traffic options, July 2026](https://blog.cloudflare.com/content-independence-day-ai-options/)
10. [Cloudflare, Content Signals Policy, September 2025](https://blog.cloudflare.com/content-signals-policy/)
11. [Cloudflare press release, blocking AI crawlers by default, July 2025](https://www.cloudflare.com/press/press-releases/2025/cloudflare-just-changed-how-ai-crawlers-scrape-the-internet-at-large/)
12. [RFC 9309, Robots Exclusion Protocol](https://www.rfc-editor.org/rfc/rfc9309.html)
13. [Forrester, The State Of Business Buying, 2026 (January 2026)](https://www.forrester.com/blogs/state-of-business-buying-2026/)

## Other languages

- English: https://partsgraph.ai/blog/robots-txt-for-ai-crawlers-guide/md
- Deutsch: https://partsgraph.ai/de/blog/robots-txt-for-ai-crawlers-guide/md
- Français: https://partsgraph.ai/fr/blog/robots-txt-for-ai-crawlers-guide/md
- Italiano: https://partsgraph.ai/it/blog/robots-txt-for-ai-crawlers-guide/md
- Nederlands: https://partsgraph.ai/nl/blog/robots-txt-for-ai-crawlers-guide/md
- Polski: https://partsgraph.ai/pl/blog/robots-txt-for-ai-crawlers-guide/md
- Português: https://partsgraph.ai/pt/blog/robots-txt-for-ai-crawlers-guide/md
- Svenska: https://partsgraph.ai/sv/blog/robots-txt-for-ai-crawlers-guide/md
- Türkçe: https://partsgraph.ai/tr/blog/robots-txt-for-ai-crawlers-guide/md
- 日本語: https://partsgraph.ai/ja/blog/robots-txt-for-ai-crawlers-guide/md
- 한국어: https://partsgraph.ai/ko/blog/robots-txt-for-ai-crawlers-guide/md
- 简体中文: https://partsgraph.ai/zh/blog/robots-txt-for-ai-crawlers-guide/md

---

Partsgraph — the agent-ready parts data layer. Free AI-visibility grader: https://partsgraph.ai/es/audit
