台灣行銷網 TAIWAN MARKETING
名詞

robots.txt(爬蟲規則檔)

一句話定義

放在網站根目錄、告訴爬蟲哪裡可以爬的一個純文字檔。

robots.txt · 又稱:機器人排除協定

詳細釋義放在網域根目錄的純文字檔,用指令告訴各家爬蟲哪些路徑不要抓。它管的是「要不要爬」,不是「要不要出現在搜尋結果」——被別的網站連到的網址即使擋了也可能被列出來,只是沒有描述。真要讓一頁不出現,用 noindex,不是靠這個檔。

為什麼要知道這個

它是你對爬蟲下的第一道指示。不同的爬蟲可以分開處理——搜尋引擎的、AI 的、比價的,可以給不同規則。

這也是決定「要不要讓 AI 讀你」的地方。擋掉 AI 爬蟲之後在 AI 回答裡消失,是一個要自己權衡的取捨,不是隨手設定。

最常被誤用的地方

一行寫錯可以讓整站從搜尋結果消失。Disallow: / 就是擋掉全部。網站改版時測試環境的設定被一起搬上正式站,是很常見的事故。

它擋的是「爬」,不是「收錄」。一個被 robots.txt 擋住的網址,如果有很多外部連結指過去,仍然可能出現在搜尋結果裡(只是沒有內容摘要)。真的不想被收錄要用 noindex,而 noindex 要能被爬到才讀得到——兩個一起用反而會互相打架。

它是公開的,任何人都能看。不要用它來「藏」後台路徑,那等於畫一張地圖給人看。

要引用這個定義?