WebPita Labo

2026-08-19(次回更新予定:2026年11月頃/各社の方針変更を確認次第、随時反映)

AI BOTはrobots.txtで拒否できるか?
AI 34種類で見るWebアクセス制限の実態

主要AI BOTのUA・IP帯域・robots.txt対応状況を比較

生成AIの学習・検索・ユーザー起動アクセスを担うクローラー(BOT)は、企業ごとにUser-Agent(UA)文字列やIP帯域の公開範囲、robots.txtでの拒否方法、問い合わせ窓口の有無が大きく異なる。 以下では、米国・フランス・中国・日本の主要企業/サービスについて、公式資料をもとに確認できた項目を整理した。 「○」は公式資料で確認できた項目、「×」は公式に非公開と明記されている項目、「△」は部分的に確認できた項目、「確認できず」は今回の調査範囲では公式情報が見当たらなかった項目を示す。


国・地域 企業 / AI UA公式公開 IP帯域公式公開 用途別にBotを分けて公開 非公開理由の説明 robots.txt拒否方法 問い合わせ窓口 備考
🇺🇸 米国 OpenAI(GPTBot・OAI-SearchBot・ChatGPT-User) ○(学習/検索/ユーザー起動の3種) ○(各Bot専用ページに記載) robots.txt更新の反映まで約24時間かかる旨も明記
🇺🇸 米国 Google / Gemini関連 ○※ ○(Googlebot/Google-Extended/GoogleOtherで役割分離) ○(Search Central) Google-Extendedは独立したUAを持たない「制御トークン」。検索順位には影響しないと明言
🇺🇸 米国 Anthropic / ClaudeBot・Claude-User・Claude-SearchBot ○(2026年8月以降) ○(学習/検索/ユーザー起動の3種) △(過去はクラウド事業者の共有IPを理由に非公開としていたが、現在は統合IPリストを公開) ○(claudebot@anthropic.com、ドメイン確認の運用ルールまで明記) claude.com/crawling/bots.jsonで3ボット共通・20個のIPv4プレフィックスを公開(ボット別の内訳はなし)
🇫🇷 フランス Mistral AI(MistralAI-Index / MistralAI-User / MistralAI-Training) △(Index/Userは公開、Trainingは確認できず) ○(検索/ユーザー起動/学習の3種) ○(docs.mistral.ai/robots) Indexは検索、Userはユーザー起動、Trainingは学習用途として公式に役割を分けて公開
🇨🇳 中国 DeepSeek 確認できず 確認できず 確認できず 確認できず 確認できず 確認できず 公式なクローラー文書自体が見当たらず、第三者観測のUA文字列はあるが未確認。読者側で検証する手段がない状態
🇨🇳 中国 ByteDance / Bytespider △(第三者観測UAはあるが公式文書なし) 確認できず 確認できず 確認できず △(設定自体は可能) 確認できず 拒否設定を入れても構わずクロールしてくるとの報告が複数のサイト運営者から上がっている(公式にrobots.txt遵守を明言しているわけでもない)
🇯🇵 日本 NTT / tsuzumi 確認できず 確認できず 確認できず 確認できず 確認できず 確認できず tsuzumi自体は国産LLMとして提供中だが、専用クローラーの運用を公表しているか今回確認できず
🇯🇵 日本 Rakuten AI 確認できず 確認できず 確認できず 確認できず 確認できず 確認できず エージェント型AIは提供中だが、専用Webクローラー情報は今回確認できず

※Googleの「UA公式公開」はGooglebot本体を指す。Google-Extendedは独立したHTTP User-Agentではなく、Googlebotが取得したデータの利用可否を制御するrobots.txt用トークンである点に留意。


主要AI BOT 34種類で見る「robots.txtで拒否できるか」「IPを追えるか」

上の一覧は代表的な数社にとどまるため、より広い範囲でAI BOTの実態を把握するために、 学習用・検索用・ユーザー起動用の主要BOT/サービス34種類 (OpenAI・Anthropic・Google・Microsoft・Apple・Amazon・Meta・Common Crawl・Perplexity・Mistral (MistralAI-Trainingを含む)・ByteDance・xAI等、および今回情報が確認できなかったDeepSeek・NTT・楽天AIを含む) を対象に、読者が実務で最も気にする2つの問いで分類した。

  • robots.txtで拒否できるか? =2026年8月時点の公式資料を基準に、robots.txtの遵守が明言されているものを「可能」、 ユーザー起動等により適用対象外とされているものを「不可能」とした。 第三者による挙動観測は補助資料として参照した。
  • IP帯域を公式に公開しているか =ベンダー自身がJSON等の形でIPレンジを公開し、 ファイアウォール等での照合を可能にしているか

robots.txtで拒否できるか?(n=34)

17件 14件 3件
可能(17件・50%)
不可能(14件・41%)
確認できず(3件・9%)

IP帯域を公式に公開しているか(n=34)

17件 5件 12件
している(17件・50%)
していない(5件・15%)
確認できず(12件・35%)

2つの円グラフを重ねると、興味深い違いが見えてくる。「robots.txtで拒否できる」BOTは50%、「IP帯域を公式公開している」BOTも50%だが、両者は必ずしも同じBOTではない。robots.txtによる制御可否と、IP帯域によるアクセス元確認のしやすさは別の指標として見る必要がある。 一方で「拒否できない」に分類された14件のうち、Googleの主要な検索周辺フェッチャー群(Google-Agentや関連サービス)とOpenAIのChatGPT-Userは、いずれも「ユーザーが直接リクエストしたアクセスだから」という理由でrobots.txtの適用対象外と公式に説明している。つまり拒否できない理由は「隠れて無視している」ケースだけでなく、「そもそも制御の対象外と設計されている」ケースも含まれる。


分類の基準

「拒否できるか」は、2026年8月時点の公式資料でrobots.txt遵守が明言されているものを「可能」、ユーザー起動等によりrobots.txtの適用対象外と明言されているものを「不可能」とした。公式資料だけで判断できない項目については、第三者による挙動観測も補助的に参照した。 Googleの各種ユーザー起動系フェッチャー(Google-Agent含む9種)は、Google自身が「ユーザーが起動した取得のためrobots.txtは適用されない場合がある」と公式に明言していることを根拠に「不可能」とした。 PerplexityBotは現在の公式資料でrobots.txt遵守が明記されているため「可能」、Perplexity-Userはユーザー起動型でrobots.txtの適用対象外のため「不可能」とした。Cloudflareによる2025年8月の回避報告は過去の第三者観測として参考資料に併記した。 分類は2026年8月時点の公開情報に基づく目安であり、各社の方針は変更され得る。判断が分かれうる項目は下表で個別に確認できる。


分類の内訳を見る(34件)
Bot / サービス 運営 robots.txtで拒否できるか IP帯域公開
GPTBotOpenAI可能している
OAI-SearchBotOpenAI可能している
ChatGPT-UserOpenAI不可能している
ClaudeBotAnthropic可能している
Claude-SearchBotAnthropic可能している
Claude-UserAnthropic可能している
AmazonbotAmazon可能している
Meta-ExternalAgentMeta可能していない
CCBotCommon Crawl可能している
ApplebotApple可能している
Google-CloudVertexBotGoogle可能している
BingbotMicrosoft可能している
DuckAssistBotDuckDuckGo可能している
Google-AgentGoogle不可能している
Gemini NotebookGoogle不可能確認できず
Google-Read-AloudGoogle不可能確認できず
FeedFetcher-GoogleGoogle不可能確認できず
Google-CWSGoogle不可能確認できず
GoogleMessagesGoogle不可能確認できず
Google-PinpointGoogle不可能確認できず
GoogleProducerGoogle不可能確認できず
Google-Site-VerificationGoogle不可能確認できず
PerplexityBotPerplexity可能している
Perplexity-UserPerplexity不可能している
MistralAI-IndexMistral AI可能している
MistralAI-UserMistral AI可能している
MistralAI-TrainingMistral AI可能確認できず
BytespiderByteDance不可能していない
GrokクローラーxAI不可能していない
Copilot ActionsMicrosoft不可能していない
FirecrawlAgentFirecrawl可能していない
DeepSeekDeepSeek確認できず確認できず
tsuzumiNTT確認できず確認できず
Rakuten AI楽天確認できず確認できず

主な確認資料

本レポートは、各社が公開しているクローラー・User-Agent・IP帯域・robots.txtに関する 公式資料を中心に、2026年8月19日時点で確認した内容を整理しています。 第三者による挙動観測を判定材料とした項目については、その資料も併記しています。

※「確認できず」は、2026年8月19日時点でWebPitaが確認した公式公開資料の範囲において、 該当する情報を確認できなかったことを示します。情報が存在しないことを断定するものではありません。 各社の仕様・公開情報は変更される可能性があります。

AIアクセス解析ツールで何が見えるのか?

WebPita AI Console for ChatGPT

WebPita Laboの掲載方針

WebPita Laboは、Webサーバーログ等から確認できた観測事実を中心に掲載し、推測・意見・断定的な解釈は可能な限り記載しません。