Robots.txt 設定完整指南:從入門到精通的 SEO 必學技巧
完整解析 robots.txt 的語法、設定方式與常見錯誤。學會正確設定 robots.txt,控制搜尋引擎爬蟲行為,提升網站 SEO 表現。附免費線上工具推薦。
什麼是 Robots.txt?
Robots.txt 是一個放置於網站根目錄的純文字檔案,用於告訴搜尋引擎爬蟲(如 Googlebot、Bingbot)哪些頁面可以抓取、哪些頁面不應該抓取。這個檔案遵循「機器人排除協定」(Robots Exclusion Protocol),是每個網站管理者都應該了解的基礎 SEO 設定。
簡單來說,robots.txt 就像你家門口的告示牌,告訴訪客哪些房間歡迎參觀,哪些房間是私人空間。正確設定它,能有效提升網站的 SEO 表現與爬蟲效率。
為什麼 Robots.txt 對 SEO 很重要?
許多網站管理者忽略了 robots.txt 的重要性,但它其實對 SEO 有著深遠的影響:
- 節省爬蟲預算(Crawl Budget):搜尋引擎分配給每個網站的爬蟲資源是有限的,封鎖不重要的頁面可以讓爬蟲專注抓取有價值的內容。
- 防止重複內容:阻止爬蟲存取重複頁面(如列印版本、篩選結果頁),避免 SEO 分數被稀釋。
- 保護私密資訊:防止管理後台、暫存頁面等被搜尋引擎收錄。
- 引導爬蟲行為:透過 Sitemap 指令,幫助搜尋引擎更快發現你的重要頁面。
Robots.txt 基本語法教學
robots.txt 的語法其實非常簡單,主要由幾個核心指令組成:
1. User-agent(使用者代理)
指定規則適用的爬蟲。使用星號(*)代表所有爬蟲:
User-agent: *
也可以針對特定爬蟲設定規則:
User-agent: Googlebot
2. Disallow(禁止抓取)
指定不允許爬蟲存取的路徑:
Disallow: /admin/Disallow: /private/
3. Allow(允許抓取)
在已禁止的目錄中,特別允許某些路徑被抓取:
Allow: /admin/public-page.html
4. Sitemap(網站地圖)
告訴搜尋引擎你的 Sitemap 位置:
Sitemap: https://example.com/sitemap.xml
常見的 Robots.txt 設定範例
允許所有爬蟲抓取所有頁面
User-agent: *
Disallow:
這是最開放的設定,適合大部分內容型網站。
封鎖所有爬蟲抓取整個網站
User-agent: *
Disallow: /
注意:此設定會讓你的網站完全從搜尋結果中消失,僅適用於開發中的網站。
封鎖特定目錄
User-agent: *
Disallow: /admin/
Disallow: /tmp/
Disallow: /cgi-bin/
Sitemap: https://example.com/sitemap.xml
這是最常見的設定模式,封鎖管理區域和暫存檔案,同時指定 Sitemap 位置。
常見的 Robots.txt 錯誤與注意事項
在設定 robots.txt 時,有幾個常見的錯誤需要避免:
- 檔案位置錯誤:robots.txt 必須放在網站根目錄,例如
https://example.com/robots.txt,放在子目錄無效。 - 大小寫敏感:路徑是區分大小寫的,
/Admin/和/admin/是不同的路徑。 - 誤以為能完全隱藏頁面:robots.txt 只是「建議」爬蟲不要抓取,並非強制。如果需要徹底阻止頁面被收錄,應使用
noindexmeta 標籤。 - 封鎖 CSS 和 JS 檔案:Google 建議不要封鎖 CSS 和 JavaScript 資源,因為這會影響 Googlebot 渲染頁面的能力。
- 忘記加上 Sitemap:在 robots.txt 中加入 Sitemap 位置是一個簡單但有效的 SEO 提升方式。
如何快速產生與驗證 Robots.txt?
手動撰寫 robots.txt 雖然不難,但容易出錯。建議使用線上工具來快速產生正確的 robots.txt 檔案。BearHelpers.com 提供了多種免費線上工具,可以幫助你處理各種網站管理任務。如果你正在處理文字編碼或格式轉換等相關工作,也能在上面找到實用的工具。
產生 robots.txt 後,建議使用 Google Search Console 中的「robots.txt 測試工具」來驗證你的設定是否正確,確認重要頁面沒有被意外封鎖。
進階技巧:善用 Crawl-delay
部分爬蟲支援 Crawl-delay 指令,用於控制爬蟲的抓取頻率:
User-agent: *
Crawl-delay: 10
這表示爬蟲每次抓取之間應等待 10 秒。這對伺服器資源有限的小型網站特別有用。不過要注意,Googlebot 並不支援此指令,Google 的抓取頻率需要在 Search Console 中設定。
總結
正確設定 robots.txt 是網站 SEO 基礎中的基礎。透過合理的設定,你可以有效引導搜尋引擎爬蟲、節省爬蟲預算、防止敏感頁面被收錄。記住以下要點:
- 將 robots.txt 放在網站根目錄
- 善用 Disallow 封鎖不重要的頁面
- 務必加入 Sitemap 位置
- 使用工具驗證設定是否正確
- 定期檢查並更新 robots.txt
花幾分鐘正確設定 robots.txt,就能為你的網站 SEO 帶來長期的正面影響。立即檢查你的網站,確保 robots.txt 設定正確吧!