robots.txt 是放在網站根目錄的一個文字檔,內容是寫給搜尋引擎爬蟲看的「請勿進入」告示,例如叫它們別抓後台、別抓帶篩選參數的商品網址,以免浪費主機資源。在瀏覽器打開「你的網域/robots.txt」,就能看到目前的內容。
它能減少爬蟲亂抓造成的負擔,但它只是告示、不是門鎖:守規矩的搜尋引擎會照做,惡意爬蟲根本不看。常見的坑有:
- 以為擋住就不會被收錄。被擋的頁面 Google 讀不到 noindex,網址反而可能留在搜尋結果
- 不小心寫了擋掉全站的規則,或擋了 CSS、JS,Google 看不懂你的頁面
- 看到 Cloudflare 自動加上的 AI 爬蟲規則就緊張,其實那不影響 Google
WPTOOLBEAR網站工具熊