# 에이전틱 웹과 산업 제품 데이터

> 웹이 사람을 위한 표면과 기계를 위한 표면으로 갈라지고 있다. 크롤 대비 리퍼럴이라는 새로운 경제학, Cloudflare가 세운 통행료 게이트, 암호학적으로 서명된 에이전트 신원, 그리고 산업 제조사가 지금 당장 무엇을 해야 하는지까지 실무 관점에서 정리했다.

**Language:** ko  
**Published:** 2026-08-09  
**Category:** Market · **Tags:** agentic web, crawlers, Cloudflare, Web Bot Auth, llms.txt, product data  
**Canonical:** https://partsgraph.ai/ko/blog/the-agentic-web-and-industrial-data

## 핵심 요약

**에이전틱 웹은 산업 제조사가 공개해야 할 것을 어떻게 바꾸고 있는가?**

웹은 브라우저에 최적화된 사람의 표면과 에이전트에 최적화된 기계의 표면으로 갈라지고 있으며, 이 둘은 서로 다른 규칙 아래 관리되기 시작했다. 자동화된 트래픽은 이미 사람의 트래픽을 넘어섰고(Imperva는 2025년 웹 트래픽의 53%를 자동화된 것으로 측정했다), 인프라 사업자들은 여기에 계량기를 달고 있다. 2026년 9월 15일부터 Cloudflare는 신규 사이트와 무료 플랜 사이트에 대해 광고가 실린 페이지에서 AI 학습용·에이전트용 크롤러를 기본 차단하며, 전면 차단의 대안으로는 페이 퍼 크롤과 암호학적으로 서명된 에이전트 신원이 떠오르고 있다. 제조사 입장에서 실질적인 결과는, 크롤될 수 있다는 것이 더 이상 도달될 수 있다는 것과 같지 않다는 점이다. 그리고 먼저 정확해지고 먼저 도달 가능해진 기업이 기본 답변이 된다.

---

## 웹에는 이제 두 종류의 독자가 있고, 눈을 가진 쪽은 하나뿐이다

30년 동안 웹에 무언가를 공개한다는 것은 마우스를 쥔 사람을 위해 공개한다는 뜻이었다. 그 아래에 딸린 모든 것 — 레이아웃, JavaScript 프레임워크, 쿠키 배너, 애널리틱스, 광고 지면 — 은 반대편에 사람이 있다고 전제했다.

> **Figure.** How a canonical parts graph sits between existing systems and agent-facing surfaces.

그 전제는 이제 맞을 때보다 틀릴 때가 더 많다. Imperva의 2026년 Bad Bot Report는 2025년 전체 웹 트래픽 가운데 자동화된 트래픽이 51%에서 올라 53%를 차지했고, 사람의 트래픽은 47%까지 내려와 여전히 줄고 있다고 밝혔다. Cloudflare도 2026년 크롤러 정책을 발표하면서 같은 관찰을 내놓았다. 인터넷 트래픽의 다수는 사람이 아니라는 것이다.

흥미로운 대목은 이 비율 자체가 아니다. 두 독자가 이제 *서로 다르게 관리되고 있다*는 점이다. 접근 규칙이 다르고, 가격이 다르고, 신원 요건이 다르다. 웹은 사람의 표면과 기계의 표면으로 갈라지고 있는데, 산업 제조사들이 두 번째 표면을 두고 고민한 시간은 전혀 없다.

## 왜 경제학이 무너졌는가

검색이 작동한 이유는 그것이 거래였기 때문이다. 크롤러가 페이지를 가져가고 방문자를 돌려주었다. 퍼블리셔가 그 거래를 받아들인 것은 환율이 유리했기 때문이다.

AI 검색은 그 환율을 깨뜨렸다. Cloudflare는 2025년부터 리퍼럴 1건당 크롤한 페이지 수, 즉 크롤 대비 리퍼럴 비율을 Radar에 공개하기 시작했고, 그 수치는 방문자 한 명당 크롤 두어 번 이하라는 검색의 통상 수준과는 비교조차 되지 않았다. 2025년 6월 말의 한 표본에서 Anthropic의 크롤러는 리퍼럴 1건당 약 70,900페이지를 크롤하고 있었다. Cloudflare는 2026년에 AI 크롤 트래픽의 절반 이상이 바뀌지도 않은 페이지를 다시 가져오는 데 쓰이고 있다고도 보고했다.

한편 거래의 사람 쪽 절반은 그와 별개로 얇아졌다. SparkToro는 2026년 초 미국 Google 검색의 68%가 클릭 없이 끝났고, 검색 1,000건당 열린 웹에 도달한 클릭은 약 276건으로 2024년의 374건에서 줄었다고 측정했다.

그래서 퍼블리셔들은 추출은 늘고 대가는 줄어드는 상황에 놓였고, 예상 가능한 행동을 했다.

**다만 이 논리는 콘텐츠 자체가 상품인 사업에만 해당한다는 점을 분명히 해 두어야 한다.** 제조사의 데이터시트는 페이지뷰로 수익을 내지 않는다. 마진을 붙여 파는 물리적 제품을 위한 마케팅 자료다. 어시스턴트가 자사 카탈로그를 7만 번 읽고, 그 결과로 엔지니어 한 명이 자사 부품을 50만 대 규모 프로그램에 지정했다면, 그것은 이긴 것이다. 퍼블리셔의 크롤 대비 리퍼럴 불만을 검증 없이 산업의 문맥에 그대로 들여오면, 정확히 반대되는 정책이 나온다.

## 통행료 게이트가 실제로 하는 일

| 메커니즘 | 무엇인가 | 상태 | 제조사에게 갖는 의미 |
| --- | --- | --- | --- |
| 목적별 분류 | Cloudflare가 AI 트래픽을 검색·에이전트·학습으로 나누고 각각을 따로 제어할 수 있게 한다 | 가동 중. 새 기본값은 2026년 9월 15일부터 | 높음 — 물려받은 기본값을 따르지 말고 카테고리별로 자사 정책을 직접 정해야 한다 |
| 광고 페이지 기본 차단 | 광고가 실린 페이지에서 학습용·에이전트용 크롤러를 기본 차단하고, 혼합 용도 크롤러는 그곳에서 전면 차단한다 | 2026년 9월 15일부터. 신규 고객, 신규 사이트, 기존 무료 플랜 사이트가 대상 | 간접적 — 자사 카탈로그에 광고가 실릴 일은 없겠지만, 자사 부품을 다루는 업계 매체에는 실린다 |
| 페이 퍼 크롤 | 가격을 제시하는 HTTP 402 응답. `crawler-max-price`, `crawler-exact-price`, `crawler-charged` 헤더를 사용하며 결제는 엣지에서 끝난다 | 프라이빗 베타 | 지금은 낮음 — 다만 계량 과금이 어디로 향하는지 보여주는 신호 |
| Web Bot Auth / 서명된 에이전트 | HTTP Message Signatures와 `Signature-Agent` 헤더를 통한 암호학적 에이전트 신원. 사용자 에이전트 문자열을 대체한다 | Cloudflare가 2025년 8월 출시. IETF에서 표준화 진행 중 | **높음** — 신원이 확인된 에이전트에게 권한에 맞는 데이터를 내주기 위한 전제 조건 |

상업적으로 의미가 있는 것은 마지막 행이며, 산업 자재 공급 업계에서 아무도 이야기하지 않는 것도 그 행이다.

산업 공급업체가 실제로 승부를 거는 것들 — 계약 단가, 확보해 둔 재고, 고객별 리드타임, 승인 대체품 목록 — 은 공개할 수 없는 데이터다. 그래서 지금 에이전트가 받아 가는 것은 공개 정가와 두루뭉술한 재고 문구, 다시 말해 틀린 정보다. 검증 가능한 에이전트 신원은 "그건 내줄 수 없다"를 "*이* 고객을 대리하는 *이* 에이전트에게는 내줄 수 있고, 기록도 남는다"로 바꿔 놓는다. 이것은 크롤러 차단에 관한 이야기가 아니다. 마침 같은 배관 위에서 돌아갈 뿐인, 채널 개방에 관한 이야기다.

## llms.txt가 남긴 교훈

llms.txt는 잠시 짚고 넘어갈 가치가 있다. 이 시장이 노력을 어떻게 잘못 배분하는지 보여주는 완벽한 사례이기 때문이다.

제안 자체는 합리적이었다. 좋은 콘텐츠가 어디에 있는지 AI 시스템에 알려주는 일반 텍스트 파일. 널리 채택됐다. 모든 마케팅 뉴스레터가 다뤘다. 그리고 Ahrefs가 137,210개 도메인을 분석한 결과, **공개된 llms.txt 파일의 97%가 2026년 5월에 요청을 단 한 건도 받지 못했다**. 실제로 발생한 가져오기의 대부분은 AI 시스템이 아니라 SEO 감사 도구에서 나왔고, ChatGPT와 Perplexity, AI Overviews 어디에서도 인용이 늘었다는 증거는 나오지 않았다.

한편 같은 데이터셋에서 AI 봇은 전체 요청의 19.5%를 차지했고, 그중 가장 큰 AI 카테고리는 10.5%를 기록한 에이전틱 인프라였다. 기계는 분명히 거기에 있었다. 다만 그들이 가져가고 있던 것은 실제 페이지 쪽이었다. 많은 제조사가 클라이언트 측에서 렌더링해 결국 빈 껍데기로 내보내고 있는 바로 그 페이지다.

교훈은 파일 하나를 넘어 일반화된다. **어떤 규약이 채택되는 것과 그 규약이 실제로 소비되는 것은 다른 일이다.** 믿을 만한 판별 기준은 그 표준이 담론에서 힘을 얻고 있는지가 아니라, 실제 클라이언트가 그것을 가져가는지다. 현재 그 기준을 통과하는 것은 두 가지다. 서버에서 렌더링한 HTML, 그리고 Model Context Protocol 엔드포인트다. MCP는 2026년 3월까지 월 약 9,700만 건의 SDK 다운로드에 이르렀고, 2025년 12월에는 Linux Foundation 산하 Agentic AI Foundation으로 옮겨 중립적인 거버넌스를 갖췄다. 플래티넘 멤버로는 AWS, Anthropic, Block, Bloomberg, Cloudflare, Google, Microsoft, OpenAI가 이름을 올렸다.

## 규제의 물살도 같은 방향으로 흐른다

산업 데이터를 기계 판독 가능한 형태로 밀어붙이는 두 번째 힘이 있는데, 이쪽은 AI와 아무 관련이 없다.

2026년 7월 16일 채택된 집행위원회 이행규정 (EU) 2026/1778은 지속가능한 제품을 위한 에코디자인 규정에 따라 설립된 디지털 제품 여권 레지스트리의 운영 방식 — 구조, 신원 검증, 등록, 등록 증명, 로깅과 보존 — 을 규정했다. 집행위원회는 며칠 뒤 이 레지스트리를 개시했다. 건설 제품은 개정 건설제품규정에 따라 더 긴 일정으로 별도 트랙에서 진행된다.

규제 언어를 걷어내면 요구 사항은 이렇다. 검증된 신원과 출처를 갖추고 제3자가 가져갈 수 있는, 구조화된 기계 판독 가능 제품 데이터. 이는 에이전트 대응 카탈로그에 대한 설명과 거의 같다. DPP 규제 대응과 AI 가독성을 서로 무관한 두 개의 프로그램으로 보고 예산을 따로 잡는 제조사는, 같은 자산을 두 번 만들고 있는 것이다.

## 제조사가 실제로 해야 할 일

1. **기계가 무엇을 보는지 시험하라.** 브라우저가 아닌 평범한 클라이언트로 자사 카탈로그 페이지를 직접 가져와 보라. Partsgraph가 2026년 8월 전 세계 유통사·제조사 도메인 984곳을 감사했을 때, 38%는 표준 비브라우저 클라이언트에게 읽을 수 있는 카탈로그 페이지를 전혀 돌려주지 않았고, AI 가시성 점수의 중앙값은 100점 만점에 50점이었다. 대개는 클라이언트 측 렌더링이 원인이며, 이는 일반적인 애널리틱스 화면에서는 전혀 드러나지 않는다.
2. **크롤러 정책을 명시적으로 작성해 공개하라.** 검색 색인, 답변 생성을 위한 검색, 에이전트 접근, 학습 — 카테고리별로 무엇을 허용할지 정하라. 같은 감사에서 984개 도메인 가운데 주요 봇을 이름으로 지목한 AI 크롤러 정책을 공개한 곳은 19%에 불과했다. 다섯 곳 중 네 곳은 CDN 사업자가 정해 주는 기본값에 그대로 맡기고 있다는 뜻이며, 엣지의 기본값이 조여질수록 침묵은 "아니오"로 해석된다.
3. **2026년 9월 15일 전에 CDN 기본값을 확인하라.** 무료 플랜을 쓰고 있거나 새 사이트를 띄우는 중이라면, 기본값은 발밑에서 알아서 바뀐다. 10분이면 끝나는 일인데 아무도 일정에 넣어 두지 않았다.
4. **무차별적으로 차단하지 마라.** 퍼블리셔의 차단 태세를 그대로 베끼는 것은, 벌지도 않는 매출에 맞춰 최적화하면서 정작 필요한 유통을 내다 버리는 일이다.
5. **변하지 않는 데이터는 정적으로, 변하는 데이터는 실시간으로 내보내라.** 파라메트릭 사양과 규제 적합 상태, 수명 주기는 서버에서 렌더링하고 구조화할 수 있다. 재고와 리드타임, 계약 단가는 갱신 주기를 아무리 높여도 제대로 크롤될 수 없으며, 질의 가능한 엔드포인트 뒤에 두어야 한다.
6. **접근이 아니라 신원에 대비하라.** 서명된 에이전트는 권한을 반영한 응답을 가능하게 만든다. 가격과 재고 데이터를 이미 정규화해 둔 공급사는 그것을 활용할 수 있고, 그러지 못한 곳은 그 기회의 창을 데이터 정리에 쓰게 된다.
7. **가시성이 아니라 정확성을 모니터링하라.** 자신 있게 제시된 틀린 리드타임은 리드타임이 아예 없는 것보다 더 큰 상업적 손해를 낳는다. 그리고 그 둘 중 어느 것도 순위 보고서에는 나타나지 않는다.

## 여기서는 먼저 움직이는 것이 평소보다 더 중요하다

일찍 움직여야 할 구체적인 이유가 있는데, 그것은 흔한 선점 경쟁 논리가 아니다.

어시스턴트는 수렴한다. 어떤 부류의 질문에 정확하고 값싸게 답해 주는 출처를 모델이 찾아내면 — 모호함 없이 파싱되고, 부품 번호가 일관되게 해석되며, 페이지끼리 서로 모순되지 않는 출처라면 — 그 출처는 그 부류 전체에 대한 최소 저항 경로가 된다. 더 많이 검색되고, 더 많이 인용되며, 다음 학습 주기와 그 위에 쌓이는 검색 인덱스 안에서 강화된다.

이것은 나중에 더 큰 예산으로 되사 올 수 있는 순위가 아니다. 작동 원리가 경매가 아니기 때문이다. 그것은 기본값이다. 그리고 산업 분야의 기본값은 유난히 끈질기다. 승인 벤더 목록, 표준 사양서, 자재명세서 템플릿처럼 오래 남는 문서를 거쳐 굳어지기 때문이다. 2026년에 기본 답변이 된 부품은 2031년에도 여전히 그 템플릿 안에 있다.

그 귀결은 상황이 정리되기를 기다리는 쪽에게는 불편하다. 일찍 움직이는 비용은 데이터 프로젝트 하나다. 늦는 비용은 같은 프로젝트를 나중에 하는 것이 아니다. 이미 기본 답변이 되어 버린 경쟁사를 상대로, 나중에 그 프로젝트를 하는 일이다.

*[/audit](/audit)의 무료 그레이더는 지금 기계가 자사 카탈로그에서 무엇을 읽어 가는지, 그리고 어디에 구멍이 있는지를 그대로 보여준다.*

## 자주 묻는 질문

### 2026년 9월 15일에 무엇이 바뀌는가?

Cloudflare는 AI 크롤러 트래픽을 하나의 부류로 묶어 다루는 대신 검색(Search), 에이전트(Agent), 학습(Training)으로 분류하기 시작한다. 이 날짜부터 광고를 표시하는 페이지에서는 학습용과 에이전트용 크롤러가 기본 차단되며, 요청마다 목적을 밝히지 않는 혼합 용도 크롤러는 해당 페이지에서 전면 차단된다. 이 기본값은 신규 고객, 기존 고객이 새로 만든 사이트, 그리고 기존 무료 플랜 사이트 전체에 적용된다. 유료 고객은 그 전에 보안 설정에서 기본값을 직접 바꿀 수 있다.

### 이 변화가 제조사의 제품 카탈로그에도 영향을 주는가?

대개 직접적인 영향은 없다. 기본값이 광고가 실린 페이지를 기준으로 작동하는데, 대부분의 제조사 카탈로그에는 광고가 없기 때문이다. 다만 두 가지 간접적인 이유에서 중요하다. 첫째, 자사 부품이 논의되는 업계 전문지와 유통사 콘텐츠, 기술 포럼은 광고로 운영되는 경우가 많아, 자사 제품을 다룬 제3자 콘텐츠가 어시스턴트에게 덜 노출될 수 있다. 둘째, 크롤러 접근이 목적별로 계량되는 권한이라는 선례가 세워진다. 그리고 그 모델은 확산될 것이다.

### 크롤 대비 리퍼럴 비율이란 무엇이며, 왜 중요한가?

AI 기업이 방문자 한 명을 돌려보내는 동안 크롤해 가는 페이지 수를 뜻한다. Cloudflare는 2025년부터 Radar에 이 비율을 공개하기 시작했는데, 2025년 6월 말의 한 표본에서 Anthropic의 크롤러는 리퍼럴 1건당 약 70,900페이지를 크롤한 것으로 나타났다. 기존 검색에서는 방문자 한 명당 크롤 두어 번 이하가 통상적이었다. 퍼블리셔들이 차단에 나선 이유가 바로 이 비율이다. 제조사에게는 이 구도가 뒤집힌다는 점이 중요하다. 트래픽에 광고를 붙여 파는 사업이 아니기 때문에, 높은 크롤 대비 리퍼럴 비율은 비용이 아니다. 돈을 내지 않고 얻는 유통망이다.

### llms.txt 파일을 공개해야 하는가?

비용도 거의 들지 않고, 효과도 거의 없다. Ahrefs가 137,210개 도메인을 분석한 결과, 공개된 llms.txt 파일의 97%가 2026년 5월 한 달 동안 요청을 단 한 건도 받지 못했다. 실제로 발생한 가져오기의 대부분도 AI 시스템이 아니라 SEO 도구에서 나왔고, 인용이 늘었다는 측정 가능한 증거도 없었다. 공짜라면 하나 올려 두어도 좋다. 다만 서버에서 렌더링한 페이지와 구조화 데이터, 피드, 엔드포인트를 대신하게 두어서는 결코 안 된다.

### Web Bot Auth란 무엇이며, 제조사가 왜 신경 써야 하는가?

쉽게 위조되는 사용자 에이전트 문자열에 의존하는 대신, 자동화된 클라이언트가 HTTP Message Signatures와 에이전트별 Ed25519 키, 그리고 Signature-Agent 헤더를 사용해 자신의 신원을 암호학적으로 증명하는 방식이다. Cloudflare는 2025년 8월 서명된 에이전트를 출시했고, 초기 참여 대상에는 ChatGPT agent와 Block의 Goose가 포함됐다. 현재 이 작업은 IETF에서 표준화가 진행되고 있다. 이것이 중요한 이유는, 에이전트마다 서로 다른 데이터를 제공하기 위한 전제 조건이기 때문이다. 계약 단가와 고객별 재고가 언젠가 에이전트에게 안전하게 전달되는 경로도 바로 여기다.

### 산업 공급업체에게 AI 크롤러 차단은 합리적인 기본값인가?

거의 언제나 아니다. 차단이 타당한 경우는 콘텐츠 자체가 상품이고 트래픽이 곧 매출인 사업, 즉 출판과 미디어, 리서치다. 제조사나 유통사에게 카탈로그는 물리적인 제품을 팔기 위한 마케팅 자료이며, 어시스턴트의 답변에서 빠진다는 것은 사양 채택 한 건을 잃는다는 뜻이다. 올바른 태도는 선별적인 개방이다. 카탈로그는 열고, 크롤러 정책은 명시적으로 공개하며, 계약 단가처럼 실제로 상업적으로 민감한 항목만 계량하거나 인증 뒤에 두는 것이다.

### EU 규제는 이 흐름과 어떻게 맞물리는가?

동기는 다르지만 같은 방향으로 밀어붙인다. 2026년 7월 16일 자 집행위원회 이행규정 (EU) 2026/1778은 ESPR에 따른 EU 디지털 제품 여권 레지스트리의 운영 규칙을 정했고, 집행위원회는 며칠 뒤 이 레지스트리를 개시했다. 건설 제품은 개정 건설제품규정에 따라 별도의 일정으로 다뤄진다. 규제가 요구하는 것은 검증된 신원과 출처를 갖춘 구조화된 기계 판독 가능 제품 데이터이며, 이는 에이전틱 웹이 요구하는 자산과 사실상 같다. 브뤼셀용으로 한 번, 어시스턴트용으로 또 한 번, 같은 것을 두 번 만드는 제조사는 예산을 낭비하고 있는 것이다.

## 출처

1. [TechCrunch, Cloudflare's new policy pushes AI companies to pay for publishers' content (1 July 2026)](https://techcrunch.com/2026/07/01/cloudflares-new-policy-pushes-ai-companies-to-pay-for-publishers-content/)
2. [Help Net Security, Cloudflare changes AI crawler access rules (2 July 2026)](https://www.helpnetsecurity.com/2026/07/02/cloudflare-ai-crawler-controls/)
3. [Cloudflare, Introducing pay per crawl](https://blog.cloudflare.com/introducing-pay-per-crawl/)
4. [Cloudflare, The crawl before the fall of referrals: crawl-to-refer ratios on Radar](https://blog.cloudflare.com/ai-search-crawl-refer-ratio-on-radar/)
5. [Cloudflare, The age of agents: cryptographically recognizing agent traffic (28 August 2025)](https://blog.cloudflare.com/signed-agents/)
6. [IETF, HTTP Message Signatures for automated traffic architecture (Web Bot Auth)](https://datatracker.ietf.org/doc/html/draft-meunier-web-bot-auth-architecture)
7. [Ahrefs, We analysed 137,000 sites: 97% of llms.txt files never get read (May 2026)](https://ahrefs.com/blog/llmstxt-study/)
8. [Imperva / Thales, 2026 Bad Bot Report: Bots in the Agentic Age](https://www.imperva.com/blog/bad-bot-report-2026-bots-agentic-age/)
9. [SparkToro, In 2026, Less than One Third of Google Searches Still Send a Click](https://sparktoro.com/blog/in-2026-less-than-one-third-of-google-searches-still-send-a-click/)
10. [Model Context Protocol, MCP joins the Agentic AI Foundation (9 December 2025)](https://blog.modelcontextprotocol.io/posts/2025-12-09-mcp-joins-agentic-ai-foundation/)
11. [EUR-Lex, Commission Implementing Regulation (EU) 2026/1778 on the digital product passport registry (16 July 2026)](https://eur-lex.europa.eu/legal-content/EN/TXT/?uri=OJ%3AL_202601778)

## Other languages

- English: https://partsgraph.ai/blog/the-agentic-web-and-industrial-data/md
- Deutsch: https://partsgraph.ai/de/blog/the-agentic-web-and-industrial-data/md
- Français: https://partsgraph.ai/fr/blog/the-agentic-web-and-industrial-data/md
- Español: https://partsgraph.ai/es/blog/the-agentic-web-and-industrial-data/md
- Italiano: https://partsgraph.ai/it/blog/the-agentic-web-and-industrial-data/md
- Nederlands: https://partsgraph.ai/nl/blog/the-agentic-web-and-industrial-data/md
- Polski: https://partsgraph.ai/pl/blog/the-agentic-web-and-industrial-data/md
- Português: https://partsgraph.ai/pt/blog/the-agentic-web-and-industrial-data/md
- Svenska: https://partsgraph.ai/sv/blog/the-agentic-web-and-industrial-data/md
- Türkçe: https://partsgraph.ai/tr/blog/the-agentic-web-and-industrial-data/md
- 日本語: https://partsgraph.ai/ja/blog/the-agentic-web-and-industrial-data/md
- 简体中文: https://partsgraph.ai/zh/blog/the-agentic-web-and-industrial-data/md

---

Partsgraph — the agent-ready parts data layer. Free AI-visibility grader: https://partsgraph.ai/ko/audit
