robots.txt
robots.txtは、クローラーに対してサイト内のどのパスをクロールしてよいか伝えるルールファイルです。通常はドメイン直下に置きます。
30秒でわかる要点
robots.txtは、クローラーに対してサイト内のどのパスをクロールしてよいか伝えるルールファイルです。通常はドメイン直下に置きます。
User-agentごとにAllowやDisallowを記述し、サイトマップの場所も案内できます。
重要ページやCSS、JavaScriptを誤って遮断していないかテストします。
robots.txtはページを非公開にする仕組みでも、インデックス削除を確実に行う仕組みでもありません。機密情報には認証を使います。
本番のrobots.txtを取得し、対象ユーザーエージェントごとに代表URLの許可結果を検証します。
robots.txtの役割
robots.txtは、クローラーに対してサイト内のどのパスをクロールしてよいか伝えるルールファイルです。通常はドメイン直下に置きます。
主な検索表記:robots txt、robots.txt、robots.txt 書き方
robots.txtが関わる取得の流れ
User-agentごとにAllowやDisallowを記述し、サイトマップの場所も案内できます。標準はRFC 9309で定義されています。
サイト運営での確認方法
重要ページやCSS、JavaScriptを誤って遮断していないかテストします。検索ボットとAIボットは目的別にルールを分けます。
robots.txtで起きやすい誤解
robots.txtはページを非公開にする仕組みでも、インデックス削除を確実に行う仕組みでもありません。機密情報には認証を使います。
実務チェックリスト
重要ページやCSS、JavaScriptを誤って遮断していないかテストします。
検索ボットとAIボットは目的別にルールを分けます。
本番のrobots.txtを取得し、対象ユーザーエージェントごとに代表URLの許可結果を検証します。
参考資料
仕様や検索機能は変更されることがあります。実装時には、次の公式資料の最新版も確認してください。
robots.txt の概要とガイド(Google 検索セントラル)
Robots Exclusion Protocol(IETF RFC 9309)