【初心者向け】robots.txtとは?書き方・設定時の注意点や活用法を優しく解説!
「せっかく作ったページが検索エンジンに登録されない…」
「一般公開したくない管理画面が、なぜか検索結果に出てきてしまう…」
そんな悩みを解決し、検索エンジンのクローラーを適切にコントロールするために欠かせないのが「robots.txt(ロボッツテキスト)」です。
この記事では、robots.txtの基本から正しい書き方、設定時の注意点、具体的な活用例までをわかりやすく解説します!
そもそも「robots.txt」とは?
robots.txtとは、Googleなどの検索エンジンのクローラー(ロボット)に対して、「サイト内のどのページを巡回(クロール)してよいか、またはダメか」を伝えるためのテキストファイルです。
正しく設定することで、SEO効果を高めたり、サーバーへの不要な負荷を減らしたりすることができます。
robots.txtの主な3つの役割
特定のページへのアクセス制限
検索エンジンに「クロールしてほしくないページ(管理画面や開発中ページなど)」を伝えます。
クロール速度の調整
アクセス頻度を制御し、ウェブサーバーへの不要な負荷を軽減します。
サイトマップ(Sitemap)の位置を伝える
サイトマップのURLを示すことで、クローラーが効率よくサイト全体を巡回できるようにサポートします。
robots.txtは「クロールを拒否する(巡回させない)」ためのものであり、「インデックス(検索結果)から完全に消す(noindex)」ためのものではありません。 完全に検索結果から非表示にしたい場合は、noindex タグを使用しましょう。
robots.txtの書き方と基本ルール
robots.txtは非常にシンプルな構文で記述します。テキストエディタ(メモ帳など)で作成し、ファイル名を robots.txt にします。
基本的な記述ルール
基本となるのは以下の4つの「ディレクティブ(命令)」です。
| 項目 | 意味 |
| User-agent: | 対象にするクローラーの名前を指定します(例: Googlebot)。 |
| Disallow: | クロールを禁止するディレクトリやファイルのパスを指定します。 |
| Allow: | 禁止したディレクトリ内で、例外的にクロールを許可するパスを指定します。 |
| Sitemap: | サイトマップ(XML)の絶対URLを指定します。 |
具体的な記述例
実際に使われる具体的な書き方のテンプレートを見てみましょう。
各コードの解説
User-agent: Googlebot
「Googleのクローラーのみ」に指示を出しています(他のクローラーには適用されません)。
Disallow: /admin/
adminというフォルダ(ディレクトリ)以下のすべてのページを巡回拒否します。User-agent: *
アスタリスク(
*)は「すべての検索エンジン」を意味します。Sitemap: [https://example.com/sitemap.xml](https://example.com/sitemap.xml)
検索エンジンにXMLサイトマップの場所を知らせます(ここは必ず絶対パスで記述します)。
robots.txtを設定する際の注意点
正しく設定しないと、意図せずサイト全体が検索結果から消えてしまうリスクもあります。以下の点に注意しましょう。
大文字・小文字は厳密に区別される
URLやフォルダ名の大文字・小文字は正確に記述してください(例:
/Admin/と/admin/は別物として扱われます)。ワイルドカード(*)を活用する
アスタリスク(
*)を使うことで、特定の拡張子やパターンを一括指定できます。(例:
Disallow: /*.pdfと書けば、サイト内のすべてのPDFファイルをクロール拒否できます)優先順位のルール
robots.txt内のルールは、「より記述が長く、具体的なルール」が優先されます。
設置場所は必ず「ルートディレクトリ」
robots.txtは、必ずドメインの直下に設置する必要があります。
正しい例:
[https://example.com/robots.txt](https://example.com/robots.txt)間違いの例:
[https://example.com/wp/robots.txt](https://example.com/wp/robots.txt)
robots.txtの具体的な活用例
実際にどのような場面で使われるか、よくある3つのパターンをご紹介します。
1. 開発中のテストページを非表示にする
公開前のテストサイトや、作成中のページをクローラーに見つけられたくない場合、一時的にクロールをブロックします。
2. 管理画面や個人情報を含むページのブロック
WordPressのログイン画面(/wp-admin/ など)や、会員専用ページなど、一般ユーザーが検索エンジン経由で入る必要のないページを制限します。
3. 重複コンテンツ・低品質ページの対策
URLの末尾に付くパラメータ付きURLなど、中身が同じなのにURLが異なるページが大量にある場合、特定のパターンを Disallow して、クロールバジェット(巡回の上限)の浪費を防ぎます。
設定後は必ずテストツールで検証しよう!
robots.txtを書き終えたら、記述ミスがないか必ずテストしましょう。
Googleが提供する「Google Search Console(サーチコンソール)」の「robots.txt テスター」や「URL検査ツール」を使うことで、作成したファイルがエラーなく機能しているかを簡単に確認できます。
まとめ
robots.txtは、サイトのSEO評価を最適化し、検索エンジンを効率よく誘導するために欠かせないツールです。
最初は少し難しく感じるかもしれませんが、基本ルールを理解してシンプルに書けば決して難しくありません。まずは重要な管理画面のブロックや、サイトマップの指定から始めてみましょう!
さらに詳しい公式の仕様を知りたい方は、Googleの公式ドキュメントもあわせて確認してみてください。
👉
コメント
コメントを投稿