名詞
爬蟲
一句話定義
自動把網頁抓回去的程式,搜尋引擎和 AI 都靠它。
Crawler / Bot · 又稱:網路爬蟲、Spider、Bot、檢索器
為什麼要知道這個
它是所有能見度的最低門檻:爬不到就不存在。做再多內容、標再完整的結構化資料,爬蟲進不來都等於零。
爬蟲要不要來、來多久一次,取決於你的網站好不好爬:載入速度、內部連結、有沒有 sitemap。
最常被誤用的地方
AI 的爬蟲跟搜尋引擎的爬蟲是不同的身分,可以分開擋。很多網站在 robots.txt 擋掉 AI 爬蟲之後才發現自己在 AI 回答裡消失了——這是一個要自己權衡的取捨,不是隨手設定。
內容如果是靠 JavaScript 才生出來的,部分爬蟲抓到的會是一個空殼。要確認的話,看網頁原始碼裡有沒有那些文字,不是看瀏覽器畫面。
被爬到不等於被收錄,被收錄也不等於會被引用。這是三個獨立的關卡。
要引用這個定義?