クロール可能性
クロール可能性とは、検索エンジンのボットがサイト内のページにどれだけ簡単に到達し、そのコンテンツをクロールできるかを示すサイトの特性です。ページは、検索結果に表示される前に、発見可能でアクセス可能でなければなりません。
Crawlabilityとは、Googlebotのような検索エンジンのボットがどれだけ容易にサイト内のページへ到達し、クロールできるかを示すサイトの属性です。how readily search engine bots like Googlebot can reach and crawl its pages.
クロールcrawling(ボットがページを読み取る行為)やクローラー(ボットそのもの)とは異なり、crawlabilityはページがクロール可能であること、そしてその容易さを指します。
robots.txtによるブロック、壊れた内部リンク、オーファンページ、サーバーエラーはいずれもcrawlabilityを損ないます。
インデックス登録はクロールが行われて初めて開始できるため、crawlabilityはindexabilityの前提条件です。
Google Search ConsoleやAhrefs Site Auditのようなツールで診断し、そのうえでサイト構造、リンク、robots.txtを監査して改善します。 and Ahrefs Site Audit, then improve it by auditing site structure, links, and robots.txt.
概要
Crawlabilityとは、Googlebotを含む検索エンジンクローラーが、Webサイトのページやリソースに到達し、そのコンテンツをクロールできる度合いを指します。Ahrefsでは、「Googlebotのような検索エンジンクローラーが、Webサイトのページやリソースにアクセスできる能力」と定義しています。検索トラフィックの獲得を目指すあらゆるサイトにとって、crawlabilityは基本要件です。クロールできるページだけが、のちにインデックスされ、検索結果に表示される対象になります。
ここで重要なのは、2つを区別することです。クロールは、ボットが実際にページを訪れて読み取る行為であり、crawlerは、その作業を実行するボットです。一方、Crawlability は、サイトやページがどれだけうまくクロールできるかを示す特性および指標です。つまり、「このページの Crawlability が低い」と言う場合、それはボットがそのページに到達して発見するのが難しいことを意味します。
Crawlability と Indexability
Crawlability と indexability はしばしば同義で使われますが、検索エンジンがページを処理する異なる段階を表しています。Crawlability は、ボットがページにアクセスできるかどうかに関するものであり、indexability は、そのページが検索エンジンのインデックスに含められるかどうかに関するものです。Ahrefs によれば、Web ページは crawlable でも indexable でない場合があります。
項目 | Crawlability | Indexability |
|---|---|---|
意味 | ボットがページにアクセスし、クロールできる度合い | ページがインデックスに含まれる条件を満たしているかどうか |
処理段階 | 発見とアクセス(前段階) | インデックス登録(後段階) |
一般的な阻害要因 | robots.txt によるブロック、broken links、orphan pages、サーバーエラー | noindex タグ、誤った canonical、重複コンテンツ |
関係 | インデックス登録の前提条件 | クロール後に評価される |
重要なのは順序です。ページが一度もクロールされなければ、そもそもインデックス登録の候補になることはありません。逆に、クロールされたページであっても、noindex 指示、誤った canonical、または重複コンテンツの判定によってインデックスから除外されることがあります。検索結果に表示されるには、ページはこの2つの条件をどちらも満たす必要があります。
クロール可能性を損なう要因
ボットのアクセスと発見を妨げる最も一般的な要因は、以下のとおりです。
robots.txt によるブロック: robots.txt は、クローラーに対してサイト内のどの部分にアクセスでき、どの部分にアクセスできないかを示します。そこで許可されていない URL はクロールできません。
オーファンページ: サイトマップに含まれず、いかなる内部リンクとも接続されていないページは、クローラーに発見されません。
nofollow リンク: Googlebot は rel="nofollow" 属性を持つリンクをたどらないため、そのようなリンク経由でしか到達できないページは発見されません。
サーバーエラーとアクセス制限: 5xx サーバーエラー、応答の遅さ、ログインウォール、特定のユーザーエージェントや IP に対するブロックは、いずれもボットのページへのアクセス自体を妨げます。
診断と改善
クロール可能性の問題は、SEO 診断ツールで可視化されます。Google Search Consolereports crawl and index status along with detected errors, while tools like Ahrefs Site Audit and webmaster tools crawl the entire site and group problems by category. Ahrefs notes that such tools help you understand why a site is not being crawled and make targeted fixes to its structure and configuration.
改善の基本方針は次のとおりです。壊れたリンクを修正または削除し、内部リンクを一貫性のある論理的な階層で整理して、重要なコンテンツが数クリック以内で到達できるようにします。ページ速度が速いほど、ボットはより多くのページを効率的にクロールできます。Google は、新規または更新されたページを知らせるためにサイトマップを使用し、リンクがクロール可能であることを確認するよう推奨しています。大規模サイトでは、クロール予算の管理も検討する価値があります。
アクションチェックリスト
クロール対象の重要なページが robots.txt の Disallow によってブロックされていないことを確認します。
XML サイトマップを送信し、新規ページや変更ページが反映されるよう最新の状態に保ちます。
壊れた内部リンクを見つけて修正または削除します。
Connect 孤立ページを内部リンクでつなぎ、ボットが発見できるようにします。
重要なページへの経路が nofollow の背後に隠れていないことを確認します。
サーバーの応答コード(5xx)と応答時間を監視して、アクセス障害を排除します。
Regularly diagnose crawl errors with Google Search Consoleと Ahrefs Site Audit でクロールエラーを定期的に診断します。