Common Crawlとは何ですか?
Common Crawlは、2008年から公開ウェブを収集し、そのデータを誰でも無料で使えるように公開している米国の非営利団体です。クローラー名はCCBotで、ほぼ毎月1回のクロールを行い、1回あたり数十億ページを保存しています。データはAWS上で公開されており、研究機関やAI企業が学習データを作る際の代表的な素材になっています。
Common Crawlは2008年からウェブを毎月アーカイブしている非営利団体で、多くのAI学習データの元になっています。URLを入力すると、どのクロールでページが保存されたか、保存されなかった理由(robots.txt・ファイアウォール・リダイレクト)まで日本語で確認できます。
ページURLまたはドメインを入力すると、過去12か月分のクロールを確認します。2008年以降の任意の期間(最大1年)も指定できます。無料登録すると、サイト全体やサブドメインを含めた確認も可能です。
Common Crawlの公式インデックスを直近のクロールから順に照会し、保存・リダイレクト・エラーの記録を集めます。
保存されなかった場合は、当時のrobots.txtやCCBotに返されたブロック画面を読み、理由と対処法を表示します。
Common Crawl(コモンクロール)は、2008年から公開ウェブを収集・保存し、そのデータを誰でも無料で使えるように公開している米国の非営利団体です。クローラー(ページを自動で巡回するプログラム)の名前は「CCBot」で、ほぼ毎月1回のクロールで数十億ページを保存しています。
保存されたデータは、研究者や企業がAI(大規模言語モデル)の学習データを作るときの代表的な出発点です。GPT-3の学習データの大部分がCommon Crawl由来だったことはよく知られており、現在も多くのデータセットがCommon Crawlをもとに作られています。
このツールは、Common Crawlが公開している公式インデックスを照会し、あなたのページがどのクロールで保存されたか、保存されなかった場合はその理由を日本語で表示します。
クロールごとに、CCBotがあなたのURLを訪れたときに何が起きたかが記録されています。結果は次のいずれかになります。
AI検索対策(LLMO)では、AIがあなたの情報を「知っている」状態をつくることが出発点です。
GPT・Claude・Geminiなど多くのLLMの学習データは、Common Crawlを出発点に構築されています。保存されていなければ、学習データに含まれる可能性は低くなります。
CloudflareのAIボットブロックやセキュリティプラグインが、気づかないうちにCCBotを拒否しているケースが多くあります。
CCBotはJavaScriptを実行しません。保存されたHTMLが空に近ければ、AIはあなたのページの内容を学べていません。
Common Crawlは、2008年から公開ウェブを収集し、そのデータを誰でも無料で使えるように公開している米国の非営利団体です。クローラー名はCCBotで、ほぼ毎月1回のクロールを行い、1回あたり数十億ページを保存しています。データはAWS上で公開されており、研究機関やAI企業が学習データを作る際の代表的な素材になっています。
主な理由は3つです。1つ目は、CCBotがまだページを見つけていないこと。CCBotはリンクやサイトマップをたどってページを発見するため、新しいサイトや被リンクの少ないページは数回のクロールを経てから現れることがよくあります。また、1回のクロールでウェブ全体を保存するわけではなく、同じサイトでも毎回すべてのページが保存されるとは限りません。2つ目は、robots.txtでCCBotをブロックしていること。3つ目は、CDN・ホスティング・セキュリティプラグインのボット対策がCCBotを拒否していることです。このツールでは2つ目と3つ目を自動で判定します。
どちらも、CCBotがURLに到達したもののページを保存しなかったことを意味します。リダイレクト(301・302など)の場合、保存されるのは転送先のページなので、転送先が正しいURLか、転送先が保存されているかを確認してください。エラーのうち403(アクセス拒否)や429(リクエスト過多)、503はファイアウォールやレート制限による拒否であることが多く、Cloudflareなら「AI Crawl Control」やBot Fight Modeの設定、WordPressならセキュリティプラグインの設定を見直してください。404は、その時点でページが存在しなかったことを示します。
CCBotはサーバーが最初に返したHTMLをそのまま保存し、JavaScriptを実行しません。ReactやVueなどでブラウザ側で本文を描画するページは、ほぼ空のHTMLとして保存され、そのデータから作られた学習データでも空のページとして扱われます。サーバーサイドレンダリング(SSR)や静的生成(SSG)を導入し、HTMLの時点で本文が含まれるようにすることをおすすめします。
必ずしもそうではありません。AI各社はCommon Crawlのデータから重複ページや低品質なページ、特定の言語以外のページなどを大幅に取り除いてから学習に使います。また、新しいクロールが公開済みのモデルに反映されるまでには数か月から1年以上かかります。さらに、ChatGPT検索やPerplexityのようにその場でウェブを検索するAIは、独自のクローラーで最新情報を取得します。Common Crawlへの保存は「AIがあなたを知っている」状態に影響する前提条件の一つであり、学習を保証するものではありません。
はい、一部を保存します。Common Crawlのサーバーへの負荷と待ち時間を減らすため、Common Crawlから取得した結果(公開データ)を当社サーバーに一時的にキャッシュしています。ログイン中にチェックした場合は、あとから見返せるよう結果をアカウントの履歴に保存します。また、サービス改善と不正利用防止のため、チェックしたURLと結果の概要を記録しています。あなたのサイト自体にアクセスしたり、サイトのデータを取得したりすることはありません。
近年はほぼ毎月1回のペースで新しいクロールが公開されています。初期(2008〜2012年ごろ)は数年分をまとめた大きなクロールが数回あっただけで、月単位で比較できるのは2013年以降です。このツールでは、標準で過去12か月分のクロールを確認します。
robots.txtに「User-agent: CCBot」と「Disallow: /」の組み合わせがあれば削除してください。「User-agent: *」で全体を禁止している場合も、CCBotはその対象になります。robots.txtに問題がなくても、CloudflareのAIボットブロックやBot Fight Mode、WordPressのセキュリティプラグイン、ホスティング会社のWAFがCCBotを拒否していることがあります。このツールの結果でブロックの原因が表示された場合は、その設定から確認してください。
はい。「期間を指定」を選ぶと、2008年以降に公開されたクロールの中から、最大1年間の期間を指定して確認できます。サイトのリニューアル前後でCCBotの扱いが変わったか、いつからブロックされるようになったかを調べるのに便利です。
LLMOでは、AIが自社の情報を正しく知っている状態をつくることが重要です。Common Crawlへの保存はその前提条件の一つです。umoren.aiでは、クロール状況の確認からAI検索での露出改善までを支援しています。