Umoren.ai
完全無料・AI学習データ確認

あなたのサイトはCommon Crawlに保存されていますか?

Common Crawlは2008年からウェブを毎月アーカイブしている非営利団体で、多くのAI学習データの元になっています。URLを入力すると、どのクロールでページが保存されたか、保存されなかった理由(robots.txt・ファイアウォール・リダイレクト)まで日本語で確認できます。

確認範囲確認範囲
期間期間

使い方

Step 01

URLを入力

ページURLまたはドメインを入力すると、過去12か月分のクロールを確認します。2008年以降の任意の期間(最大1年)も指定できます。無料登録すると、サイト全体やサブドメインを含めた確認も可能です。

Step 02

クロール記録を照合

Common Crawlの公式インデックスを直近のクロールから順に照会し、保存・リダイレクト・エラーの記録を集めます。

Step 03

原因まで確認

保存されなかった場合は、当時のrobots.txtやCCBotに返されたブロック画面を読み、理由と対処法を表示します。

Common Crawlとは?

Common Crawl(コモンクロール)は、2008年から公開ウェブを収集・保存し、そのデータを誰でも無料で使えるように公開している米国の非営利団体です。クローラー(ページを自動で巡回するプログラム)の名前は「CCBot」で、ほぼ毎月1回のクロールで数十億ページを保存しています。

保存されたデータは、研究者や企業がAI(大規模言語モデル)の学習データを作るときの代表的な出発点です。GPT-3の学習データの大部分がCommon Crawl由来だったことはよく知られており、現在も多くのデータセットがCommon Crawlをもとに作られています。

このツールは、Common Crawlが公開している公式インデックスを照会し、あなたのページがどのクロールで保存されたか、保存されなかった場合はその理由を日本語で表示します。

チェック結果の見方

クロールごとに、CCBotがあなたのURLを訪れたときに何が起きたかが記録されています。結果は次のいずれかになります。

200保存されています
CCBotがページを取得し、HTMLを保存しました。このページはCommon Crawlをもとにした学習データに含まれる可能性があります。「保存されたコピー」から、CCBotが実際に受け取った内容を確認できます。本文がほとんど無ければ、JavaScriptで描画している可能性があります。
301 →リダイレクト
CCBotがURLを訪れたところ、別のURLへ転送されました(301・302など)。保存されるのは転送先のページです。転送先が意図したURLか、転送先も保存されているかを確認しましょう。http→httpsやwwwの有無による転送はよくあり、問題ないことがほとんどです。
403 / 429エラー・ブロック
CCBotはURLに到達しましたが、エラーが返ってきたためページを保存しませんでした。403(アクセス拒否)や429(リクエスト過多)、503は、ファイアウォール・CDN・セキュリティプラグインがボットを止めていることが多いサインです。404は、その時点でページが存在しなかったことを意味します。
Disallow: /robots.txtでブロック
サイトのrobots.txtがCCBotのアクセスを禁止しているため、CCBotはページを取得しませんでした。意図的に学習を拒否しているなら問題ありません。AIに知ってもらいたい場合は、CCBot向けのDisallowを外してください。
—記録なし
確認したクロールに、このURLの記録が一件もありません。新しいサイトや被リンクの少ないページは、CCBotにまだ見つかっていないことがよくあります。サイトマップの公開や、他サイトからのリンク獲得で見つかりやすくなります。期間やサイト全体に広げて確認するのもおすすめです。

なぜCommon Crawlの確認が大切なのか

AI検索対策(LLMO)では、AIがあなたの情報を「知っている」状態をつくることが出発点です。

1

AI学習データの入口

GPT・Claude・Geminiなど多くのLLMの学習データは、Common Crawlを出発点に構築されています。保存されていなければ、学習データに含まれる可能性は低くなります。

2

意図しないブロックの発見

CloudflareのAIボットブロックやセキュリティプラグインが、気づかないうちにCCBotを拒否しているケースが多くあります。

3

JavaScript依存の検出

CCBotはJavaScriptを実行しません。保存されたHTMLが空に近ければ、AIはあなたのページの内容を学べていません。

よくある質問

Q

Common Crawlとは何ですか?

A

Common Crawlは、2008年から公開ウェブを収集し、そのデータを誰でも無料で使えるように公開している米国の非営利団体です。クローラー名はCCBotで、ほぼ毎月1回のクロールを行い、1回あたり数十億ページを保存しています。データはAWS上で公開されており、研究機関やAI企業が学習データを作る際の代表的な素材になっています。

Q

なぜ自分のページが保存されていないのですか?

A

主な理由は3つです。1つ目は、CCBotがまだページを見つけていないこと。CCBotはリンクやサイトマップをたどってページを発見するため、新しいサイトや被リンクの少ないページは数回のクロールを経てから現れることがよくあります。また、1回のクロールでウェブ全体を保存するわけではなく、同じサイトでも毎回すべてのページが保存されるとは限りません。2つ目は、robots.txtでCCBotをブロックしていること。3つ目は、CDN・ホスティング・セキュリティプラグインのボット対策がCCBotを拒否していることです。このツールでは2つ目と3つ目を自動で判定します。

Q

リダイレクトやエラーの結果は何を意味しますか?

A

どちらも、CCBotがURLに到達したもののページを保存しなかったことを意味します。リダイレクト(301・302など)の場合、保存されるのは転送先のページなので、転送先が正しいURLか、転送先が保存されているかを確認してください。エラーのうち403(アクセス拒否)や429(リクエスト過多)、503はファイアウォールやレート制限による拒否であることが多く、Cloudflareなら「AI Crawl Control」やBot Fight Modeの設定、WordPressならセキュリティプラグインの設定を見直してください。404は、その時点でページが存在しなかったことを示します。

Q

保存されたコピーがほぼ空なのはなぜですか?

A

CCBotはサーバーが最初に返したHTMLをそのまま保存し、JavaScriptを実行しません。ReactやVueなどでブラウザ側で本文を描画するページは、ほぼ空のHTMLとして保存され、そのデータから作られた学習データでも空のページとして扱われます。サーバーサイドレンダリング(SSR)や静的生成(SSG)を導入し、HTMLの時点で本文が含まれるようにすることをおすすめします。

Q

Common Crawlに保存されていれば、AIに学習されたことになりますか?

A

必ずしもそうではありません。AI各社はCommon Crawlのデータから重複ページや低品質なページ、特定の言語以外のページなどを大幅に取り除いてから学習に使います。また、新しいクロールが公開済みのモデルに反映されるまでには数か月から1年以上かかります。さらに、ChatGPT検索やPerplexityのようにその場でウェブを検索するAIは、独自のクローラーで最新情報を取得します。Common Crawlへの保存は「AIがあなたを知っている」状態に影響する前提条件の一つであり、学習を保証するものではありません。

Q

このツールは確認したURLを保存しますか?

A

はい、一部を保存します。Common Crawlのサーバーへの負荷と待ち時間を減らすため、Common Crawlから取得した結果(公開データ)を当社サーバーに一時的にキャッシュしています。ログイン中にチェックした場合は、あとから見返せるよう結果をアカウントの履歴に保存します。また、サービス改善と不正利用防止のため、チェックしたURLと結果の概要を記録しています。あなたのサイト自体にアクセスしたり、サイトのデータを取得したりすることはありません。

Q

Common Crawlはどのくらいの頻度でクロールしますか?

A

近年はほぼ毎月1回のペースで新しいクロールが公開されています。初期(2008〜2012年ごろ)は数年分をまとめた大きなクロールが数回あっただけで、月単位で比較できるのは2013年以降です。このツールでは、標準で過去12か月分のクロールを確認します。

Q

CCBotを許可するにはどうすればよいですか?

A

robots.txtに「User-agent: CCBot」と「Disallow: /」の組み合わせがあれば削除してください。「User-agent: *」で全体を禁止している場合も、CCBotはその対象になります。robots.txtに問題がなくても、CloudflareのAIボットブロックやBot Fight Mode、WordPressのセキュリティプラグイン、ホスティング会社のWAFがCCBotを拒否していることがあります。このツールの結果でブロックの原因が表示された場合は、その設定から確認してください。

Q

過去の期間を確認できますか?

A

はい。「期間を指定」を選ぶと、2008年以降に公開されたクロールの中から、最大1年間の期間を指定して確認できます。サイトのリニューアル前後でCCBotの扱いが変わったか、いつからブロックされるようになったかを調べるのに便利です。

Q

LLMO(AI検索対策)とどう関係しますか?

A

LLMOでは、AIが自社の情報を正しく知っている状態をつくることが重要です。Common Crawlへの保存はその前提条件の一つです。umoren.aiでは、クロール状況の確認からAI検索での露出改善までを支援しています。

【無料】Common Crawlチェッカー|AI学習データに自社サイトが含まれるか確認 | umoren.ai