主要AI BOTのUA・IP帯域・robots.txt対応状況を比較
生成AIの学習・検索・ユーザー起動アクセスを担うクローラー(BOT)は、企業ごとにUser-Agent(UA)文字列やIP帯域の公開範囲、robots.txtでの拒否方法、問い合わせ窓口の有無が大きく異なる。 以下では、米国・フランス・中国・日本の主要企業/サービスについて、公式資料をもとに確認できた項目を整理した。 「○」は公式資料で確認できた項目、「×」は公式に非公開と明記されている項目、「△」は部分的に確認できた項目、「確認できず」は今回の調査範囲では公式情報が見当たらなかった項目を示す。
| 国・地域 | 企業 / AI | UA公式公開 | IP帯域公式公開 | 用途別にBotを分けて公開 | 非公開理由の説明 | robots.txt拒否方法 | 問い合わせ窓口 | 備考 |
|---|---|---|---|---|---|---|---|---|
| 🇺🇸 米国 | OpenAI(GPTBot・OAI-SearchBot・ChatGPT-User) | ○ | ○ | ○(学習/検索/ユーザー起動の3種) | — | ○ | ○(各Bot専用ページに記載) | robots.txt更新の反映まで約24時間かかる旨も明記 |
| 🇺🇸 米国 | Google / Gemini関連 | ○※ | ○ | ○(Googlebot/Google-Extended/GoogleOtherで役割分離) | — | ○ | ○(Search Central) | Google-Extendedは独立したUAを持たない「制御トークン」。検索順位には影響しないと明言 |
| 🇺🇸 米国 | Anthropic / ClaudeBot・Claude-User・Claude-SearchBot | ○ | ○(2026年8月以降) | ○(学習/検索/ユーザー起動の3種) | △(過去はクラウド事業者の共有IPを理由に非公開としていたが、現在は統合IPリストを公開) | ○ | ○(claudebot@anthropic.com、ドメイン確認の運用ルールまで明記) | claude.com/crawling/bots.jsonで3ボット共通・20個のIPv4プレフィックスを公開(ボット別の内訳はなし) |
| 🇫🇷 フランス | Mistral AI(MistralAI-Index / MistralAI-User / MistralAI-Training) | ○ | △(Index/Userは公開、Trainingは確認できず) | ○(検索/ユーザー起動/学習の3種) | — | ○ | ○(docs.mistral.ai/robots) | Indexは検索、Userはユーザー起動、Trainingは学習用途として公式に役割を分けて公開 |
| 🇨🇳 中国 | DeepSeek | 確認できず | 確認できず | 確認できず | 確認できず | 確認できず | 確認できず | 公式なクローラー文書自体が見当たらず、第三者観測のUA文字列はあるが未確認。読者側で検証する手段がない状態 |
| 🇨🇳 中国 | ByteDance / Bytespider | △(第三者観測UAはあるが公式文書なし) | 確認できず | 確認できず | 確認できず | △(設定自体は可能) | 確認できず | 拒否設定を入れても構わずクロールしてくるとの報告が複数のサイト運営者から上がっている(公式にrobots.txt遵守を明言しているわけでもない) |
| 🇯🇵 日本 | NTT / tsuzumi | 確認できず | 確認できず | 確認できず | 確認できず | 確認できず | 確認できず | tsuzumi自体は国産LLMとして提供中だが、専用クローラーの運用を公表しているか今回確認できず |
| 🇯🇵 日本 | Rakuten AI | 確認できず | 確認できず | 確認できず | 確認できず | 確認できず | 確認できず | エージェント型AIは提供中だが、専用Webクローラー情報は今回確認できず |
※Googleの「UA公式公開」はGooglebot本体を指す。Google-Extendedは独立したHTTP User-Agentではなく、Googlebotが取得したデータの利用可否を制御するrobots.txt用トークンである点に留意。
主要AI BOT 34種類で見る「robots.txtで拒否できるか」「IPを追えるか」
上の一覧は代表的な数社にとどまるため、より広い範囲でAI BOTの実態を把握するために、 学習用・検索用・ユーザー起動用の主要BOT/サービス34種類 (OpenAI・Anthropic・Google・Microsoft・Apple・Amazon・Meta・Common Crawl・Perplexity・Mistral (MistralAI-Trainingを含む)・ByteDance・xAI等、および今回情報が確認できなかったDeepSeek・NTT・楽天AIを含む) を対象に、読者が実務で最も気にする2つの問いで分類した。
- robots.txtで拒否できるか? =2026年8月時点の公式資料を基準に、robots.txtの遵守が明言されているものを「可能」、 ユーザー起動等により適用対象外とされているものを「不可能」とした。 第三者による挙動観測は補助資料として参照した。
- IP帯域を公式に公開しているか =ベンダー自身がJSON等の形でIPレンジを公開し、 ファイアウォール等での照合を可能にしているか
robots.txtで拒否できるか?(n=34)
IP帯域を公式に公開しているか(n=34)
2つの円グラフを重ねると、興味深い違いが見えてくる。「robots.txtで拒否できる」BOTは50%、「IP帯域を公式公開している」BOTも50%だが、両者は必ずしも同じBOTではない。robots.txtによる制御可否と、IP帯域によるアクセス元確認のしやすさは別の指標として見る必要がある。 一方で「拒否できない」に分類された14件のうち、Googleの主要な検索周辺フェッチャー群(Google-Agentや関連サービス)とOpenAIのChatGPT-Userは、いずれも「ユーザーが直接リクエストしたアクセスだから」という理由でrobots.txtの適用対象外と公式に説明している。つまり拒否できない理由は「隠れて無視している」ケースだけでなく、「そもそも制御の対象外と設計されている」ケースも含まれる。
分類の基準
「拒否できるか」は、2026年8月時点の公式資料でrobots.txt遵守が明言されているものを「可能」、ユーザー起動等によりrobots.txtの適用対象外と明言されているものを「不可能」とした。公式資料だけで判断できない項目については、第三者による挙動観測も補助的に参照した。 Googleの各種ユーザー起動系フェッチャー(Google-Agent含む9種)は、Google自身が「ユーザーが起動した取得のためrobots.txtは適用されない場合がある」と公式に明言していることを根拠に「不可能」とした。 PerplexityBotは現在の公式資料でrobots.txt遵守が明記されているため「可能」、Perplexity-Userはユーザー起動型でrobots.txtの適用対象外のため「不可能」とした。Cloudflareによる2025年8月の回避報告は過去の第三者観測として参考資料に併記した。 分類は2026年8月時点の公開情報に基づく目安であり、各社の方針は変更され得る。判断が分かれうる項目は下表で個別に確認できる。
分類の内訳を見る(34件)
| Bot / サービス | 運営 | robots.txtで拒否できるか | IP帯域公開 |
|---|---|---|---|
| GPTBot | OpenAI | 可能 | している |
| OAI-SearchBot | OpenAI | 可能 | している |
| ChatGPT-User | OpenAI | 不可能 | している |
| ClaudeBot | Anthropic | 可能 | している |
| Claude-SearchBot | Anthropic | 可能 | している |
| Claude-User | Anthropic | 可能 | している |
| Amazonbot | Amazon | 可能 | している |
| Meta-ExternalAgent | Meta | 可能 | していない |
| CCBot | Common Crawl | 可能 | している |
| Applebot | Apple | 可能 | している |
| Google-CloudVertexBot | 可能 | している | |
| Bingbot | Microsoft | 可能 | している |
| DuckAssistBot | DuckDuckGo | 可能 | している |
| Google-Agent | 不可能 | している | |
| Gemini Notebook | 不可能 | 確認できず | |
| Google-Read-Aloud | 不可能 | 確認できず | |
| FeedFetcher-Google | 不可能 | 確認できず | |
| Google-CWS | 不可能 | 確認できず | |
| GoogleMessages | 不可能 | 確認できず | |
| Google-Pinpoint | 不可能 | 確認できず | |
| GoogleProducer | 不可能 | 確認できず | |
| Google-Site-Verification | 不可能 | 確認できず | |
| PerplexityBot | Perplexity | 可能 | している |
| Perplexity-User | Perplexity | 不可能 | している |
| MistralAI-Index | Mistral AI | 可能 | している |
| MistralAI-User | Mistral AI | 可能 | している |
| MistralAI-Training | Mistral AI | 可能 | 確認できず |
| Bytespider | ByteDance | 不可能 | していない |
| Grokクローラー | xAI | 不可能 | していない |
| Copilot Actions | Microsoft | 不可能 | していない |
| FirecrawlAgent | Firecrawl | 可能 | していない |
| DeepSeek | DeepSeek | 確認できず | 確認できず |
| tsuzumi | NTT | 確認できず | 確認できず |
| Rakuten AI | 楽天 | 確認できず | 確認できず |
主な確認資料
本レポートは、各社が公開しているクローラー・User-Agent・IP帯域・robots.txtに関する 公式資料を中心に、2026年8月19日時点で確認した内容を整理しています。 第三者による挙動観測を判定材料とした項目については、その資料も併記しています。
-
OpenAI
Publishers and Developers - FAQ
GPTBot、OAI-SearchBot、robots.txtによる制御等を確認。 -
OpenAI 公開IP
GPTBot IP ranges / OAI-SearchBot IP ranges / ChatGPT-User IP ranges -
Google
Google クローラー(ユーザー エージェント)の概要
Google クローラーとフェッチャーからのリクエストを確認する
Google ユーザートリガーフェッチャー -
Anthropic
ClaudeBot・Claude-SearchBot・Claude-Userとrobots.txt
Anthropic 公開Bot IPリスト -
Mistral AI
Mistral crawlers
MistralAI-Index、MistralAI-User、MistralAI-Trainingの UA・用途・robots.txt対応等を確認。 -
Perplexity
Perplexity Crawlers
Perplexityはrobots.txtにどのように対応していますか? -
Perplexityに関する第三者観測
Cloudflareによる2025年8月の観測報告 -
Apple
Applebotについて -
Amazon
About AmazonBot -
Microsoft / Bing
Which Crawlers Does Bing Use?
Verify Bingbot -
Common Crawl
CCBot
※「確認できず」は、2026年8月19日時点でWebPitaが確認した公式公開資料の範囲において、 該当する情報を確認できなかったことを示します。情報が存在しないことを断定するものではありません。 各社の仕様・公開情報は変更される可能性があります。
AIアクセス解析ツールで何が見えるのか?
WebPita AI Console for ChatGPTWebPita Laboの掲載方針
WebPita Laboは、Webサーバーログ等から確認できた観測事実を中心に掲載し、推測・意見・断定的な解釈は可能な限り記載しません。