Whoops
資源 · 工具

AI 爬蟲存取檢查

輸入網址,看看你的 robots.txt 在規則層對各 AI 爬蟲是敞開還是關門:9 個 AI 爬蟲逐項判定,加上 Googlebot 與 Bingbot 對照、llms.txt 存在性,以及內容是否依賴 JS 渲染。

會抓取這個網址的頁面、robots.txt 與 llms.txt 三份檔案。判定依 RFC 9309 子集在你的瀏覽器完成。

怎麼讀結果

三種判定,一個關鍵區別

判定看的是規則層;規則允許之後,內容還要讀得到、引用得到。

  1. 允許robots.txt 有明確 Allow,或最長的適用規則是 Allow
  2. 封鎖最長的適用規則是 Disallow,這個爬蟲不應抓取該路徑
  3. 無規則沒有涵蓋此路徑的規則,依慣例允許;與明示 Allow 的差別在於沒有書面承諾
限制說明

這個工具不能做什麼

把範圍說清楚,判定才有意義。

robots.txt 採 RFC 9309 的實用子集解析:支援萬用字元與結尾錨點,不處理 Crawl-delay 語意與路徑解碼正規化。判定的是規則層結果,不代表 AI 平台實際抓取或引用行為;WAF 與反爬蟲防護層不在這裡的視野內。「初始 HTML 內容」是啟發式判斷,SPA 網站可能被誤判。llms.txt 是否被任何平台讀取,由各平台自行決定,Google 已公開說明不需要它。

常見問題
為什麼 GPTBot 和 OAI-SearchBot 要分開看?

它們是 OpenAI 的不同產品:GPTBot 抓內容做模型訓練,OAI-SearchBot 是 ChatGPT 搜尋的檢索器。robots.txt 對兩者是完全獨立的規則,一個允許不代表另一個也允許。

封鎖 Google-Extended 會影響 Google 搜尋排名嗎?

不會。Google-Extended 只控管 Gemini 的訓練資料取用,Google 搜尋收錄走的是 Googlebot。兩者分開檢查才不會誤判。

判定結果等於 AI 一定會(或不會)引用我的網站嗎?

不等於。這裡判斷的是 robots.txt 規則層的結果,也就是你有沒有在規則上把爬蟲擋住。平台實際要不要抓取、要不要引用,由各家模型與產品決定。

輸入你的網站網址,取得免費 Search & AI Visibility 診斷

3 個工作天內寄出具體問題清單與優先順序,不會推銷、不會有業務打擾。

以可驗證資料為依據 · 不使用黑帽 SEO · 不承諾無法控制的排名或 AI 引用