Robots.txt 設定完整指南:從入門到實戰,掌握搜尋引擎爬蟲控制
完整解析 robots.txt 的語法規則、常見設定範例與最佳實踐。學會如何正確設定 robots.txt,有效控制搜尋引擎爬蟲的抓取行為,提升網站 SEO 表現,避免敏感頁面被索引。
什麼是 Robots.txt?
Robots.txt 是一個放置在網站根目錄下的純文字檔案,用來告訴搜尋引擎爬蟲(如 Googlebot、Bingbot)哪些頁面可以抓取、哪些頁面應該被忽略。它是「機器人排除協定」(Robots Exclusion Protocol)的核心組成部分,幾乎每個正式上線的網站都應該擁有這個檔案。
簡單來說,robots.txt 就像是你家門口的一塊告示牌,告訴訪客(搜尋引擎)哪些房間歡迎參觀,哪些房間是私人空間。雖然它不是強制性的安全機制(不遵守規範的爬蟲可能會忽略它),但主流搜尋引擎都會尊重這份檔案的指示。
為什麼 Robots.txt 對 SEO 很重要?
正確設定 robots.txt 對網站的 SEO 有著至關重要的影響,主要原因包括:
- 控制抓取預算(Crawl Budget):搜尋引擎分配給每個網站的抓取資源是有限的。透過 robots.txt 排除不重要的頁面,可以讓爬蟲把資源集中在真正重要的內容上。
- 防止重複內容問題:避免搜尋引擎抓取到列印版頁面、篩選排序後的重複頁面,減少重複內容對排名的負面影響。
- 保護敏感區域:阻止爬蟲進入後台管理頁面、測試環境或其他不應該出現在搜尋結果中的頁面。
- 引導 Sitemap 位置:在 robots.txt 中指定 sitemap 的位置,幫助搜尋引擎更快發現和索引你的內容。
Robots.txt 基本語法解析
robots.txt 的語法非常簡潔,主要由以下幾個指令組成:
User-agent(使用者代理)
指定規則適用的爬蟲。使用星號 * 代表所有爬蟲,也可以針對特定爬蟲設定規則。
Disallow(禁止抓取)
指定不允許爬蟲訪問的路徑。例如 Disallow: /admin/ 表示禁止抓取 /admin/ 目錄下的所有頁面。
Allow(允許抓取)
在已被 Disallow 的目錄中,特別允許某些路徑被抓取。這個指令通常與 Disallow 搭配使用。
Sitemap(網站地圖)
告訴搜尋引擎你的 XML Sitemap 所在位置,例如 Sitemap: https://example.com/sitemap.xml。
常見 Robots.txt 設定範例
範例一:允許所有爬蟲抓取整個網站
這是最簡單的設定,適合希望所有內容都被搜尋引擎收錄的網站:
User-agent: *
Allow: /
範例二:禁止所有爬蟲抓取整個網站
適用於開發中的網站或不希望被搜尋引擎索引的私人網站:
User-agent: *
Disallow: /
範例三:禁止抓取特定目錄
最常見的情境,保護後台和敏感資料夾:
User-agent: *
Disallow: /admin/
Disallow: /private/
Disallow: /tmp/
Sitemap: https://example.com/sitemap.xml
範例四:針對特定爬蟲設定規則
你可以對不同的搜尋引擎設定不同的規則:
User-agent: Googlebot
Disallow: /no-google/
User-agent: Bingbot
Disallow: /no-bing/
Robots.txt 設定的最佳實踐
- 檔案位置必須正確:robots.txt 必須放在網站的根目錄下,URL 為
https://yourdomain.com/robots.txt,放在其他位置將不會被識別。 - 不要用來隱藏敏感資訊:robots.txt 是公開可見的,任何人都可以直接訪問。真正的敏感頁面應該使用密碼保護或伺服器端的存取控制。
- 避免封鎖 CSS 和 JavaScript:Google 需要渲染頁面來了解內容,如果封鎖了 CSS 和 JS 檔案,可能會影響 Google 對頁面的理解和排名。
- 定期檢查和更新:隨著網站結構的變化,robots.txt 也需要相應更新。過時的規則可能會阻止重要頁面被索引。
- 使用 Google Search Console 測試:Google 提供了 robots.txt 測試工具,可以幫你確認設定是否正確生效。
- 搭配 Sitemap 一起使用:在 robots.txt 中聲明 sitemap 位置,讓搜尋引擎更有效率地發現你的所有頁面。
使用線上工具快速生成 Robots.txt
如果你對語法不太熟悉,或者擔心手動編寫出錯,使用線上工具是最安全且高效的方式。Bear Helpers 提供了免費的線上 robots.txt 產生器,只需要透過簡單的勾選和填寫,就能自動生成符合規範的 robots.txt 檔案。
使用線上工具的好處在於,它會自動處理語法格式,確保不會因為拼寫錯誤或格式問題而導致規則失效。生成後只需下載檔案並上傳到網站根目錄即可。
常見錯誤與注意事項
- 大小寫敏感:路徑部分是大小寫敏感的,
/Admin/和/admin/是不同的路徑。 - 空白 Disallow 的含義:
Disallow:(後面沒有路徑)代表不禁止任何頁面,等同於完全開放。 - Disallow 不等於 noindex:被 Disallow 的頁面仍有可能出現在搜尋結果中(如果有其他頁面連結到它)。要完全移除索引,應使用 noindex meta 標籤。
- 萬用字元的使用:Google 和 Bing 支援
*(匹配任意字串)和$(匹配 URL 結尾)等萬用字元,但並非所有爬蟲都支援。
結語
Robots.txt 雖然只是一個簡單的文字檔案,卻在 SEO 策略中扮演著不可或缺的角色。正確的設定能幫助搜尋引擎更有效率地抓取你的網站,提升重要頁面的曝光機會,同時保護不需要被公開的內容。
無論你是剛架設網站的新手,還是想優化現有 SEO 策略的站長,花幾分鐘好好檢視你的 robots.txt 設定,絕對是值得的投資。如果需要快速生成或驗證 robots.txt 檔案,不妨試試 Bear Helpers 提供的免費工具,讓設定過程更加輕鬆無誤。