台灣行銷網 TAIWAN MARKETING
名詞

爬蟲

一句話定義

自動把網頁抓回去的程式,搜尋引擎和 AI 都靠它。

Crawler / Bot · 又稱:網路爬蟲、Spider、Bot、檢索器

詳細釋義自動沿著連結抓網頁的程式。它有預算:一個網站每次來抓幾頁、多久來一次是有限的,大量重複或低價值的頁面會把配額吃掉,重要的頁反而排不到。現在除了搜尋引擎,各家 AI 也在用自己的爬蟲抓資料,兩邊要分開設定。

為什麼要知道這個

它是所有能見度的最低門檻:爬不到就不存在。做再多內容、標再完整的結構化資料,爬蟲進不來都等於零。

爬蟲要不要來、來多久一次,取決於你的網站好不好爬:載入速度、內部連結、有沒有 sitemap。

最常被誤用的地方

AI 的爬蟲跟搜尋引擎的爬蟲是不同的身分,可以分開擋。很多網站在 robots.txt 擋掉 AI 爬蟲之後才發現自己在 AI 回答裡消失了——這是一個要自己權衡的取捨,不是隨手設定。

內容如果是靠 JavaScript 才生出來的,部分爬蟲抓到的會是一個空殼。要確認的話,看網頁原始碼裡有沒有那些文字,不是看瀏覽器畫面。

被爬到不等於被收錄,被收錄也不等於會被引用。這是三個獨立的關卡。

要引用這個定義?