名詞
robots.txt(爬蟲規則檔)
一句話定義
放在網站根目錄、告訴爬蟲哪裡可以爬的一個純文字檔。
robots.txt · 又稱:機器人排除協定
為什麼要知道這個
它是你對爬蟲下的第一道指示。不同的爬蟲可以分開處理——搜尋引擎的、AI 的、比價的,可以給不同規則。
這也是決定「要不要讓 AI 讀你」的地方。擋掉 AI 爬蟲之後在 AI 回答裡消失,是一個要自己權衡的取捨,不是隨手設定。
最常被誤用的地方
一行寫錯可以讓整站從搜尋結果消失。Disallow: / 就是擋掉全部。網站改版時測試環境的設定被一起搬上正式站,是很常見的事故。
它擋的是「爬」,不是「收錄」。一個被 robots.txt 擋住的網址,如果有很多外部連結指過去,仍然可能出現在搜尋結果裡(只是沒有內容摘要)。真的不想被收錄要用 noindex,而 noindex 要能被爬到才讀得到——兩個一起用反而會互相打架。
它是公開的,任何人都能看。不要用它來「藏」後台路徑,那等於畫一張地圖給人看。
要引用這個定義?