AIクローラーの制御は、各社が公式に公表するUser-Agentトークンをrobots.txtへ用途別(学習・検索・ユーザー操作)に記述して行い、学習用のGPTBotやClaudeBotを拒否しつつ、検索引用用のOAI-SearchBotやClaude-SearchBotを許可する、という切り分けが基本です。
ただし、robots.txtは強制力のない意思表示であり、設定してもAI検索での引用や表示、流入を保証するものではありません。本記事は各社公式ドキュメントで確認できた範囲のみを記載します。
主要AIクローラーのUser-Agent一覧
| User-Agent | 運営元 | 主な用途 | robots.txt準拠の公表 |
|---|---|---|---|
| GPTBot | OpenAI | 生成AI基盤モデルの学習 | 準拠を公表 |
| OAI-SearchBot | OpenAI | ChatGPT検索での表示・リンク | 準拠を公表 |
| ChatGPT-User | OpenAI | ユーザー操作起点のアクセス | 適用されない場合があると公表 |
| ClaudeBot | Anthropic | モデルの学習・開発 | 準拠を公表 |
| Claude-User | Anthropic | ユーザー起点のWebアクセス | 準拠を公表 |
| Claude-SearchBot | Anthropic | 検索結果の品質向上 | 準拠を公表 |
| PerplexityBot | Perplexity | 検索結果での表示・リンク(基盤モデル学習には不使用と公表) | 準拠を公表 |
| Perplexity-User | Perplexity | ユーザー操作起点のアクセス | 原則適用されないと公表 |
| Google-Extended | Geminiの学習・グラウンディング利用の制御(独自UAなしの制御用トークン) | 準拠を公表 | |
| GoogleOther | 各製品チームによる汎用クロール | 準拠を公表 | |
| CCBot | Common Crawl | 公開クロールデータの収集・提供 | 準拠を公表 |
| Amazonbot | Amazon | サービス改善(AIモデル学習に利用される場合あり) | 準拠を公表 |
| meta-externalagent | Meta | AIモデルの学習・製品のインデックス作成 | 準拠を公表 |
| meta-externalfetcher | Meta | ユーザー要求起点の取得 | 適用されない場合があると公表 |
Amazonbotの用途・準拠状況はAmazonの公式ページ(developer.amazon.com/amazonbot)で確認できます。Bytespider等、運営元の公式ドキュメントを確認できなかったUser-Agentは本表に掲載していません。
「学習は拒否、検索引用は許可」の設定例
# 生成AIの学習用クローラーを拒否
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: meta-externalagent
Disallow: /
# 検索・引用用クローラーは許可
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
注意点は2つあります。第一に、Google-Extendedは独自のUser-Agent文字列を持たず、既存のGoogleのUAでクロールした内容の利用可否を制御するトークンです。アクセスログには現れません。第二に、OpenAIはOAI-SearchBotを拒否したサイトはChatGPT検索の回答に表示されなくなると明記しており、検索用トークンの拒否は引用機会の放棄を意味します。
拒否と引用機会のトレードオフ
学習用と検索用のトークンが分かれているため、「モデルの学習には使わせないが、検索経由の引用・リンクは受け入れる」という方針は設定として表現できます。一方で、次のトレードオフを理解しておく必要があります。
- 学習を拒否すると、将来のモデルが自社の情報を内部知識として持たない可能性があり、検索を伴わないAI回答での説明に影響しうる
- CCBotの拒否は、Common Crawlの公開データセットを利用する多数の研究・開発主体への意思表示となり、影響範囲を個別に予測しにくい
- 許可・拒否のどちらを選んでも、AI回答での引用や表示が約束されるわけではない
どの経路を許可するかは、コンテンツの性質(無料公開の集客記事か、有料・会員向け資産か)ごとに分けて判断するのが実務的です。
robots.txtのできないこと・限界
- 強制力がない:robots.txtは慣行に基づく意思表示であり、準拠は各運営元の自主的な運用に依存する
- 未知のBotに効かない:公表されていないUAや新規のBotは、トークンを書きようがない
- なりすましを防げない:UA文字列は自己申告のため、第三者がGPTBot等を名乗るアクセスは排除できない
- 遡及しない:過去に取得済みのデータやアーカイブが削除されるとは限らない
- ユーザー操作型に適用されない場合がある:ChatGPT-User、Perplexity-User、meta-externalfetcherは適用外となる場合があると各社が公表している
確実な遮断が必要な場合は、WAF、認証、レート制限などサーバー側の制御を併用します。
アクセスログでの確認方法(概要)
robots.txtの設定が実際にどう働いているかは、自社のアクセスログで確認できます。手順の概要は次の通りです。
- アクセスログからGPTBot、ClaudeBot等のUA文字列を含む行を抽出する
- 期間別・パス別・ステータスコード別に件数を集計し、来訪頻度と対象コンテンツを把握する
- robots.txt変更日を記録し、変更前後で各Botのアクセスが変化したかを比較する
- UAは自己申告のため、運営元が確認手段を公開している場合はIP等で照合する
実務チェックリスト
- 現状のアクセスログで、AI系UAの来訪有無・頻度・対象パスを確認した
- 学習・検索・ユーザー操作の3用途に分けて、許可・拒否の方針を決めた
- robots.txtへ用途別のUser-agentグループを記述し、文法を検証した
- 検索用トークンを拒否した場合の引用機会への影響を関係者へ共有した
- 変更日を記録し、変更前後のログで各Botの挙動変化を確認した
- 準拠しないBotへの対応(WAF・レート制限等)をサーバー側で別途検討した
- 各社の公式ドキュメントを定期的に再確認する体制を決めた(UAと用途は追加・変更される)
なお、Googleは自社のAI機能への表示にあたり、新しい機械可読ファイルやAI用テキストファイルを作成する必要はないと公表しています(developers.google.com/search/docs/appearance/ai-features)。llms.txtのような試みは、AIによる利用や引用を約束するものではなく、現時点では効果が確立していない実験的な補助手段として扱うのが妥当です。
株式会社Trillion Bank(トリリオンバンク)は、限定商用検証・導入相談受付中のHackⅡで、選定した質問に対するAI回答本文と引用URLの保存・比較を支援しています。robots.txt変更の前後で同一質問を再測定すれば、引用状況の変化を証跡付きで確認できます。ただし、測定はAI検索での引用や流入を保証するものではありません。
よくある質問
robots.txtでAIの学習だけを拒否し、検索引用は許可できますか?
できます。学習用途のGPTBot、ClaudeBot、Google-Extended、meta-externalagentなどをDisallowにし、検索用途のOAI-SearchBot、Claude-SearchBot、PerplexityBotを許可すれば、用途別の意思表示になります。
robots.txtで拒否すればAIには一切使われませんか?
いいえ。robots.txtは技術的な強制力のない意思表示で、準拠を公表していないBotやUser-Agentのなりすましには効きません。過去に取得済みのデータが削除されるとも限りません。
ChatGPT-UserやPerplexity-Userも拒否できますか?
両社とも、ユーザー操作起点のアクセスにはrobots.txtが適用されない場合があると公表しています。確実に止めたい場合はWAFやレート制限などサーバー側の制御を検討します。
どのAIクローラーが来ているかを確認する方法はありますか?
WebサーバーのアクセスログをGPTBotやClaudeBotなどのUser-Agent文字列で集計し、来訪頻度と対象URLを確認します。UAは自己申告のため、なりすましの可能性も考慮します。
参考文献・一次情報
- OpenAI — Overview of OpenAI Crawlers(確認日:2026-09-06)
- Anthropic Help Center — Does Anthropic crawl data from the web, and how can site owners block the crawler?(確認日:2026-09-06)
- Perplexity Docs — Perplexity Crawlers(確認日:2026-09-06)
- Google Search Central — Google's common crawlers(確認日:2026-09-06)
- Common Crawl — CCBot(確認日:2026-09-06)
- Meta for Developers — Meta Web Crawlers(確認日:2026-09-06)
- Amazon — Amazonbot(確認日:2026-09-06)
本記事は公開時点の一次情報と当社の分析に基づきます。用語や各サービスの仕様は変わる可能性があります。誤りを確認した場合は、お問い合わせ窓口からお知らせください。
この記事のテーマを、自社・競合で確認する
HackⅡは、選定した質問についてAI回答、引用URL、自社・競合の言及と測定条件を保存し、改善判断を支援します。
AI回答への掲載、順位、問い合わせ、売上を保証するサービスではありません。