訓練爬蟲
GPTBot、ClaudeBot、Google-Extended、CCBot 等收集內容以訓練未來模型。屏蔽它們是內容授權層面的決定。
TK WebHosts 免費工具
ChatGPT、Claude 和 Perplexity 真的能讀取您的網站嗎?檢查 robots.txt 允許哪些爬蟲——區分訓練爬蟲與決定 AI 回答是否引用您的實時代理。
| 爬蟲 | 運營方 | 訪問 |
|---|
將以下內容加入 robots.txt 以開放應答爬蟲(訓練爬蟲可繼續屏蔽):
GPTBot、ClaudeBot、Google-Extended、CCBot 等收集內容以訓練未來模型。屏蔽它們是內容授權層面的決定。
OAI-SearchBot、ChatGPT-User、Claude-SearchBot 和 PerplexityBot 在用户提問時抓取您的頁面——AI 助手就是這樣引用您的。
Googlebot 和 Bingbot 依然是根基。誤屏蔽它們是致命的——本工具會立即以紅色標出。
GPTBot 收集頁面用於訓練未來模型;ChatGPT-User 和 OAI-SearchBot 則在用户提問時實時抓取並引用您的頁面。屏蔽 GPTBot 隻影響訓練。
不會。訓練爬蟲與應答爬蟲是不同的 user-agent,各有各的 robots.txt 規則。許多媒體屏蔽訓練但保持可被引用。
默認允許所有爬蟲——缺失並不是錯誤。嚴重的是文件返回服務器錯誤:Google 會視為"不要抓取該網站"。
它是約定而非鎖。主要運營方公開承諾遵守;但攔不住無視規則的抓取程序。