Whoops

爬取預算是什麼?7 大策略提升 Google 抓取效率

爬取預算不是一個能調高的數字,而是由爬取速率上限與爬取需求兩股力量決定的抓取額度。本文完整解析爬取預算的運作機制、用 Google Search Console 檢查的方法,以及 7 大優化策略,幫你把有限預算留給真正值得收錄的內容。

作者:褚崇名(Sliven)

本頁目錄

頁面進不了索引可能出在發現、檢索、重複內容、品質或技術設定,爬取預算只是其中一種原因,而且主要影響大型或高頻更新網站。網站有幾百篇文章或上千個商品頁時,不能看到未索引就先認定 Google「沒時間抓完」。

這個「Google 願意花在你網站上的抓取時間與資源」,有一個正式的名字,叫爬取預算(Crawl Budget)。而這篇要談的,就是當你網站規模漸漸變大,怎麼讓 Google 用更有效率的方式把該抓的頁面都抓到。

重點摘述:爬取預算是什麼,7 大優化策略又優化在哪?

爬取預算指的是 Googlebot 在一段時間內,願意且能夠在你的網站上抓取多少個網址。它由兩個東西決定:一是 crawl rate limit(抓取速率上限),也就是伺服器撐得住、Google 自己設定的抓取速度天花板;二是 crawl demand(抓取需求),也就是 Google 覺得你的這些頁面有多值得被抓(見 Google Search Central 的 Crawl budget 指南)。說穿了,爬取預算就像一家餐廳一個晚上能接待多少組客人,而你要做的,是讓 Google 把有限的「座位」留給你最想被看見的頁面。這篇文章會先把這套黑話翻成白話,誠實告訴你哪些網站根本不必為它失眠,再給你七個可以實際動手做的優化策略。

如果你想把這個主題放進更大的 SEO 藍圖,建議把這篇和三個主題一起讀:一是 Google 搜尋引擎的完整運作原理,你會更清楚「爬取」在「爬取 → 索引 → 排名」這條鏈上只是第一步;二是 確認網頁有沒有被索引的方法,因為爬取之後能不能被收錄是兩回事;三是 技術性 SEO 完全指南,爬取預算正是技術 SEO 裡最容易被過度焦慮、也最容易被漏掉的一塊。

「爬取預算」到底在算什麼?先把 Google 那套黑話翻成白話

要懂爬取預算,我們得先回到 Google 怎麼認識你的網站。Google 不會憑空知道你網站上有哪些頁面,它靠的是一支叫做 Googlebot 的程式,一個網址一個網址地去抓(crawl)。抓回來的內容會被分析、決定要不要放進索引庫,最後才有資格參加排名。你可以把 Googlebot 想成一家超大型圖書館裡的採購員,每天在無數個出版商之間跑來跑去,決定哪些書要搬回圖書館。

問題是,這個採購員不是只有你一家要跑,它一次得跑遍整個網路。所以 Google 會根據每個網站的狀況,分配給它一個「今天能花多少時間、抓多少頁」的額度。這個額度,就是爬取預算。

關鍵在於,這個額度不是單一數字,而是兩股力量拔河的結果:

  • Crawl rate limit(抓取速率上限):這是 Google 願意把你的伺服器操到什麼程度而不會把它弄掛。你的網站越快、越穩,Google 敢設的上限就越高;反之,如果你的主機常常回應慢、甚至回 5xx 錯誤,Google 會自動踩煞車,把上限壓低,避免把你打爆。這是一個「保護你伺服器」的機制。
  • Crawl demand(抓取需求):這是 Google 覺得你的這些頁面有多「值得」重新抓。一個頁面如果很熱門、常常被更新、有很多外部連結指過來,Google 會更想頻繁地去抓它。需求高,整體分配給你網站的抓取量就會往上推。

換個比喻會更好懂。想像 Google 是一家百貨公司的樓層主管,你的網站是其中一個專櫃。速率上限是「這個專櫃的店員一個小時能接待多少客人而不會手忙腳亂」,取決於你的人力配置與體力;抓取需求是「這個專櫃到底有多吸引人、值得主管派多少客人過來」,取決於你的人氣與口碑。主管最後實際派來的客人數,就是這兩者取其低、再加上他自己的判斷後的結果,這就是你的爬取預算。

這個兩股力量拔河的觀念很重要,因為它直接決定你該從哪裡下手。你網站慢,那就是速率上限在卡你,要去解速度;你的網站充滿了沒人要看的低價值頁面,那就是需求在拖累你,要去清理內容。接下來的七大策略,就是沿著這兩條線去分的。

一個殘酷的事實:你的網站可能根本不需要為爬取預算失眠

講到這裡,得先潑一盆冷水,這也是實務上常講的一句話:絕大多數的網站,根本不需要擔心爬取預算。這不是主觀看法,Google 自己就講得很白。

Google 目前把爬取預算指南定位給大型且常更新的網站,粗略例子包括每週更新、網址達一百萬以上的站,或每天更新、網址達一萬以上的站;另一個訊號是大量網址在 Search Console 顯示「已發現,目前未建立索引」。這些是分類用估計,不是硬門檻(見 Google Crawling Infrastructure 的 Optimize your crawl budget 指南)。幾十頁官網或幾百篇部落格若新頁能及時被抓,通常先維護 sitemap 與索引報表即可。

那爬取預算到底在什麼情境下才會變成真正的問題?根據 Google 的官方說明與實務上處理大型網站的經驗,真正會被爬取預算卡住的,通常是這幾種情境:

情境為什麼會吃掉爬取預算典型的例子
大型電商,商品加上篩選參數同一個商品因為顏色、尺寸、排序、分頁等參數組合,爆出成千上萬個變體網址WooCommerce、Shopify 商店啟用 faceted navigation
內容農場式的大量薄內容成千上萬篇沒有獨特價值的頁面,把爬蟲時間耗在低回報的頁面上自動產出的標籤頁、地區頁、程式拼湊的文章
論壇或 UGC 站,使用者產生大量頁面個人資料頁、閒置討論串、重複的回文頁充斥討論區、分類廣告、問答平台
頻繁更新的大型新聞或媒體站每分鐘都有新頁面誕生,爬蟲要不停回頭抓新聞媒體、即時資訊站
歷史悠久、累積大量過時頁面的老站多年來堆積的舊活動頁、過期促銷、孤兒頁仍在被爬蟲發現改版多次的企業官網、舊版內容未清理

如果你的網站落在這幾類,尤其是那種「頁面數字以萬計」的電商或內容站,那麼爬取預算就從理論問題變成實務瓶頸,這篇後面的七個策略就是寫給你的。如果你不在這幾類,你可以把這篇當成常識讀過一次,把精力先放在更會影響排名的事情上,例如 站內 SEO 的內容與技術優化,或是把 E-E-A-T 經驗訊號補起來,那才是大多數網站真正缺的東西。

在這幾種情境裡,特別把電商的 faceted navigation(篩選導覽)挑出來講,因為它是實務上看過最誇張的爬取預算黑洞。想像一個賣服飾的網站,有顏色、尺寸、價格區間、品牌、排序方式這五個篩選器,每個篩選器各有五到十個選項,再加上分頁。排列組合下來,光是同一個商品分類,就能爆出幾萬個網址變體,而其中九成以上對使用者和搜尋引擎都沒有獨特價值。Googlebot 一旦走進這個篩選迷宮,就會把大量時間花在抓這些近乎空白的組合頁上,你真正想被收錄的商品詳情頁反而排不上隊。要讓 Google 把資源花在真正有價值的頁面上,可以從分類頁與產品頁的排名策略開始規劃全站的索引優先順序。

Google 已在 2022 年移除 Search Console 的「網址參數」工具。現在要從網站端控制篩選網址:能合併的重複頁先用一致內部連結與 canonical 收斂;完全不需要 Google 抓取的無限組合,可在測試規則後用 robots.txt 阻擋;要讓已知網址退出索引,則必須讓 Google 能抓到 noindex,不能同時用 robots.txt 擋住。內容站的標籤頁與作者彙整頁也要先決定索引目的,再選工具。

這裡也要講一句公道話。很多人把「爬取預算」和「排名」混為一談,以為提升爬取預算就會提升排名,這是兩件事。爬取預算影響頁面被發現與重新抓取的效率;能否進入索引及取得排名,還要看內容、技術狀態與其他搜尋訊號。Backlinko 的 搜尋結果研究(分析 1,180 萬筆 Google 搜尋結果,2025 年 4 月)觀察到部分頁面與連結特徵和排名的關聯,但這類研究不能單獨證明因果,也不是 Google 公布的排名權重。所以請記得這個優先順序:先讓好內容有被收錄的機會,再來煩惱爬取效率。

怎麼知道自己有沒有「爬取預算不足」的問題?四個診斷訊號

既然爬取預算不是人人都要管,那你怎麼判斷自己到底需不需要動手?與其瞎猜,建議你看四個具體訊號。只要其中兩三個同時出現,就值得你認真花時間在這篇的七個策略上。

訊號一:Google Search Console 的檢索統計資料長期偏低或異常波動。進入 GSC 的「設定 → 檢索統計資料」,你會看到過去 90 天 Googlebot 每天抓了你多少網址、下載了多少資料、平均回應時間。一個健康的網站,這條線會隨著你新增內容而穩定起伏;如果一個有上萬頁的網站,每天被抓的數字卻長期只有幾十、幾百,那就是很明顯的爬取預算受限。另一個要特別留意的訊號是回應狀態碼:如果這份報表裡出現不少 5xx 伺服器錯誤,或平均回應時間長期偏高,Google 會把你的 crawl rate limit 自動往下壓,這時候你要救的是主機與程式的穩定度,sitemap 先擺一邊。如果你還不熟悉這份報表,可以先看 Google Search Console 完整操作指南 把基本功練起來。

訊號二:重要頁面的索引覆蓋率明顯偏低。「已發現,目前未建立索引」可能與抓取容量或需求有關;「已檢索,目前未建立索引」則表示 Google 已抓取頁面,不能再解釋成「還沒輪到抓」,應優先檢查重複內容、品質與索引適合性。GSC 網頁索引報表有更細的判讀方法。

訊號三:檢索日期嚴重落後。Google 已於 2024 年移除 cache: 搜尋運算子與搜尋結果的快照連結,現在要確認 Google 上次抓你的頁面是什麼時候,最直接的方式是打開 Search Console 的「網址檢查」,它會顯示上次檢索時間。如果你的首頁或分類頁的上次檢索是兩三個月前,但你明明每天都更新,這表示 Google 覺得「這個站不急著回頭抓」,需求訊號偏弱。

訊號四:伺服器 Log 檔顯示大量無效抓取。這是最硬核也最準的訊號。透過 Screaming Frog 這類爬蟲工具 或直接分析 server log,你能看到 Googlebot 到底在抓哪些網址。如果你發現它把八成的心力花在抓參數篩選頁、標籤頁、已被刪除的舊頁,幾乎沒花在你真正在意的商品頁或文章上,那就是標準的爬取預算被浪費的場景。這個訊號一出現,後面七個策略你大概要用到一半以上。

老實說,這四個訊號裡,log 分析是最有含金量的一個,因為它直接告訴你「Google 到底把時間花在哪」。但實務上很多中小網站根本沒有 log 檔可看,這時候就以前三個訊號為主,搭配 GSC 的索引報告交叉判斷,已經足夠讓你決定要不要往下做。如果你真的要進入 log 分析,最基本的方法是請主機商或工程團隊匯出近 30 天的伺服器存取紀錄,把裡面 user-agent 是 Googlebot 的那幾行過濾出來,統計它抓了哪些路徑、回傳了什麼狀態碼。這份資料會誠實告訴你哪些頁面被反覆抓、哪些從沒被青睞,是排定後續優先順序最可靠的依據。

七大爬取預算優化策略:沿著「速率」與「需求」兩條線下手

接下來是這篇的重頭戲。把七個策略沿著前面講的兩股力量分成兩組:需求側(讓 Google 更想抓、並把精力導向高價值頁面)與速率側(讓 Google 能抓得更快、更不浪費)。你會發現,多數人只會做其中一兩件事,但這兩條線一起調,效果才會疊加。

策略一(需求側):狠下心砍掉沒人要看的低價值頁面

大型網站若讓爬蟲反覆進入大量無用途的網址組合,確實可能降低整體抓取效率;但 Google 不會保證封鎖一批網址後,把同等額度轉移給其他頁面。先從可驗證的重複、無限空間與已淘汰網址下手,不要把「沒有自然流量」直接當成刪除條件。

具體要做的事,是先盤點程式自動產生的薄內容標籤頁、只為塞關鍵字而生的地方分頁、過期的活動與促銷頁,以及沒有獨特價值的重複文章,再判斷該移除、合併或補強。Ahrefs 的 搜尋流量研究(2023 年 12 月)指出,樣本中有超過九成的網頁拿不到可估算的 Google 自然搜尋流量。零流量不等於低品質或浪費爬取預算,但能作為盤點起點,再配合索引狀態、用途、連結與伺服器紀錄判斷。

清理的做法是:先在 GSC 或 analytics 裡撈出過去一年自然流量為零的頁面,逐一判斷它們是該刪除、該合併、還是該補強。刪掉的,記得回傳 410 狀態碼讓 Google 知道這是永久消失;要合併的,用 301 把權重導到最相關的主題頁。這件事的概念和 內容農場 SEO 為什麼會失敗 是同一個邏輯:別再用數量灌水,把精力集中在你真正能寫出獨特經驗的少數頁面上,反而更有機會被看見。

策略二(速率側):用 robots.txt 把「不必被抓」的頁面說清楚

robots.txt 放在網站根目錄,用來告訴遵守規範的爬蟲哪些路徑不要抓。它不是存取控制,也不能保護帳號或敏感資料;這些內容必須靠登入驗證與伺服器權限保護。大型站可用它阻擋已確認不需抓取的無限篩選與站內搜尋網址,但規則要先在測試環境驗證。

但這裡有一個常見的雷:robots.txt 跟 noindex 千萬不要搞混。如果你在 robots.txt 封鎖了一個網址,Googlebot 通常無法抓到頁面上的 noindex 標籤,網址仍可能因其他頁面的連結而出現在索引裡。這個細節在 robots.txt 與 noindex 為什麼不能同時使用 有完整的拆解。簡單的原則是:要限制一般爬取可用 robots.txt;要讓已知網址退出 Google 索引,需允許 Google 抓到 noindex。敏感內容則必須使用登入驗證或伺服器權限,不能靠這兩者保護。想更深入了解這份檔案的寫法,可以參考 robots.txt 完整介紹

另一個 robots.txt 常見的失誤,是封鎖範圍開得太廣。實務上看過有網站為了「省爬取預算」,把整個分類目錄或 JavaScript、CSS 資源夾全部封掉,結果 Googlebot 連渲染頁面所需的樣式表與腳本都抓不到,反而無法正確理解頁面內容,排名跟著往下掉。封鎖要精準,只針對你確定不需要被索引、也不影響頁面渲染的路徑下手。如果你是用 WordPress 架站,permalink 結構本身就會產生一些預設的查詢參數頁,可以先從 WordPress 固定連結的 SEO 設定 把源頭整理好,再決定哪些要交給 robots.txt 處理。

策略三(速率側):用 canonical 收斂重複內容,別讓爬蟲在鏡像裡打轉

重複內容是爬取預算的隱形殺手。同一篇文章因為網址參數、列印版、AMP 版、分頁追蹤碼而產生好幾個網址,Google 就會把好幾倍的力氣花在抓「同一份內容」上。這不只浪費爬取預算,還會稀釋你的排名訊號,因為 Google 不知道到底該把這篇的權重算到哪個網址。

解法是 canonical 標籤。在每一個變體網址的 <head> 裡放上 <link rel="canonical" href="標準網址">,明確告訴 Google「這幾個網址其實是同一篇,請把權重併到這個標準網址上」。這個動作本身也牽動重複內容的 SEO 判定,完整的設定邏輯可以看 Canonical URL 完全指南。如果你的網站重複內容問題是全面性的,也建議一併讀 SEO 重複內容的成因與解法,把源頭堵掉,而不只是靠 canonical 補救。

策略四(需求側):把 XML Sitemap 當成你遞給 Google 的 VIP 名單

XML Sitemap 的主要用途是協助搜尋引擎發現希望被索引的標準網址,並提供可信的最後修改時間。大型網站應讓 sitemap 只包含可索引、回應正常且 canonical 一致的網址;它不會直接傳達排名或抓取優先級,仍須搭配內部連結、伺服器狀態與內容更新。

實務上有三個要點。第一,sitemap 裡只放你真的想被索引、回傳 200、且沒有 noindex 的頁面,不要把已被封鎖或重複的網址也塞進去,那會混淆訊號。第二,保持更新頻率和你的內容產出同步,新增的重要頁面要盡快進 sitemap,Google 才會盡早知道。第三,善用 sitemap index 把大型網站拆成多個子 sitemap(例如商品一個、文章一個、分類一個),方便你日後逐區診斷。完整的產生與提交流程,可以照著 Sitemap 產生與提交實作教學 一步步做,背後的概念則在 網站 Sitemap 入門指南 裡有完整說明。

策略五(需求側):用內部連結架構決定「重要頁面離首頁多遠」

這是一個常被低估的策略。Googlebot 大量依賴連結來發現新頁面,一個頁面如果離首頁的點擊距離太遠(例如要點五次才到),它被發現與被抓取的優先順序就會很低。你想保護的商業頁面,應該被安排在離首頁兩三次點擊以內的位置。

具體的做法是建立一個扁平(flat)的網站架構:首頁連到主要分類頁,分類頁連到子分類與重點商品頁,再用支柱頁(pillar page)與主題叢集把同主題的內容串起來。這牽涉到整體的 網站架構與 SEO 規劃,也是 站內 SEO 裡影響最深遠的一塊。一個常見的錯誤是把重要商品頁埋在篩選層層之下,或讓它只靠一個孤零零的內部連結支撐;把它拉到離首頁更近、從多個相關頁面收到連結,爬蟲自然會更頻繁地路過它。

策略六(速率側):消滅 404、軟 404 與冗餘的重新導向鏈

這一項純粹是「別浪費」的效率工程。當 Googlebot 抓到一個回傳 404 的網址,它會試幾次才放棄,這中間每一次都是浪費。如果是軟 404(回傳 200 但內容其實是「找不到結果」的空頁面),更糟,因為 Google 會真的花力氣去分析一個沒有價值的頁面。

重新導向鏈則是另一個隱形消耗。如果一個網址經過 A → B → C 三次轉跳才到終點,Googlebot 等於多抓了三次、多消耗了三次速率額度。大型網站尤其容易在改版過程中累積出好幾層 redirect chain。處理原則是:定期用爬蟲工具掃出全站的 404 與轉跳鏈,把該修的內部連結直接指向最終網址,能合併的轉跳就合併成一步。怎麼設計一個不會誤導使用者的 404 頁、以及 301 與 302 各自該用在什麼時機,分別可以看 404 頁面設計301 與 302 重新導向指南

策略七(速率側):把網站變快,等於抬高爬蟲的速率天花板

這是最長期、也最一舉兩得的策略。前面說過,crawl rate limit 取決於你的伺服器能承受多快的抓取速度而不出錯。你的網站回應越快、越穩,Google 就敢把上限調得越高,等於直接撐大了你的爬取預算。而網站速度同時也是使用者體驗與排名因素,所以這一項投資是三重的回報。

實務上能做的包含:把主機升級或搬到回應更快的環境、用 CDN 加速 縮短全球各地使用者的等待時間、開啟 圖片與資源的 lazy loading、系統性地做 圖片壓縮(圖片往往是最大的頻寬消耗)。這些加起來,會直接反映在 Google 的 Core Web Vitals 指標上,你可以用 Core Web Vitals網頁速度優化 的方法持續追蹤。速度這條線,是少數能同時提升爬取預算、使用者體驗、與排名訊號的投資,千萬別省。

把七個策略走完一遍,你大概會發現它們彼此會互相疊加。為了讓你在動手時有個輕重的依據,把這七招整理成一張對照表,標出每一招主要施力的那條線、實作難度、以及預期的回收速度。你可以把它當成排定優先順位的參考就好,沒有非照著做的道理。

策略主要施力點實作難度回收速度
砍掉低價值頁面(策略一)需求側中(需要逐頁判斷)中等,但長期複利最高
robots.txt 封鎖無效路徑(策略二)速率側快,幾週內可見
canonical 收斂重複內容(策略三)速率側低至中中等
清乾淨 XML Sitemap(策略四)需求側
內部連結扁平化(策略五)需求側中至高(牽動資訊架構)慢,但結構性影響最大
修復 404 與轉跳鏈(策略六)速率側
網站提速(策略七)速率側中至高慢,但三重回報

從這張表看,如果你只能挑兩件事先做,建議選策略一(砍低價值頁面)搭配策略二(robots.txt 封鎖)。前者從源頭減少 Google 必須考慮的網址數量,後者立刻把爬蟲時間導離無效區域,兩者搭配,效果會比單獨做任何一招都明顯。剩下五招,再依你的網站類型與人力慢慢補上。

用 Google Search Console 的「檢索統計資料」盯緊成效

七個策略做完,你總得知道有沒有效。最直接的觀測工具,就是 Google Search Console 裡的檢索統計資料(Crawl Stats)。這份報表過去一度只在舊版介面提供,現在已經整合進新版 GSC,對大型網站特別實用。

看這份報表,建議你抓三個重點。第一是每日抓取網址數的趨勢:做完清理後,理想狀態是這個數字會往上升(因為 Google 把省下來的預算轉去抓你真正想被看見的頁面),而不是一路往下掉。第二是主機回應狀態的分佈:如果你看到大量的 3xx 或 4xx、5xx,代表你的重新導向鏈與錯誤頁還沒清乾淨,回去補強策略六。第三是抓取的檔案類型與目的:這份報表會告訴你 Google 主要在抓哪些類型的網址,如果你的重要頁面類型佔比很低,就是內部連結架構(策略五)與 sitemap(策略四)要再加碼的訊號。

如果你對 GSC 還不熟,這份報表背後的介面邏輯可以對照 Google Search Console 進階技巧 來看;而當你想針對單一重要網址、確認它目前的檢索與索引狀態,則可以用 網址檢查工具 做更精準的診斷。這一套診斷流程,也是大多數技術性 SEO 健檢會走的基本盤。

這裡還有一個很多人漏掉的細節,特別值得在前端很重的網站提出來:如果你的網站大量仰賴 JavaScript 才能渲染出內容,那麼 Google 處理你的頁面會比一般靜態頁面多一道手續。Googlebot 抓到原始 HTML 之後,會把需要執行 JavaScript 才看得到內容的頁面排進另一個數量有限的「渲染佇列」裡,等資源有空檔才回頭渲染。這個佇列本身就是一個隱形的爬取預算瓶頸,頁面太多、太依賴 JS 產出內容的網站,會發現自己的頁面就算被抓了,也長時間停在「已檢索但未索引」的狀態,等的就是渲染。如果你懷疑自己卡在這裡,可以先讀 JavaScript SEO 的運作機制,把關鍵內容盡量放進伺服器端回傳的原始 HTML,減少進入渲染佇列的頁面數量。把這個觀念和前面的「爬取 → 索引 → 排名」鏈接在一起看(更完整的脈絡可以參考 檢索在搜尋流程裡的位置),你會更明白為什麼有些網站明明被抓得很勤,內容卻始終進不了索引。

三個常見的爬取預算迷思,一次拆掉

下面拆掉三個常見迷思。這些觀念如果沒被導正,會讓你把力氣花錯地方。

常見迷思實際情況
「提交了 Sitemap,Google 就一定會來抓。」Sitemap 只是「建議名單」,不是「保證書」。Google 會綜合判斷頁面的需求、品質與你網站整體的速率上限後決定抓不抓,不是你提交了它就照單全收。
「用了 noindex,等於保住了爬取預算。」不一定。noindex 只是不讓頁面進索引,但 Googlebot 仍可能去抓這個頁面。要真正停止抓取,得在 robots.txt 封鎖;但兩者別同時用,原因前面策略二講過了。相關細節可以延伸讀 noindex 完整介紹
「爬取預算高一點,排名就會好一點。」這是兩件事。爬取預算影響頁面被發現與重新抓取的效率,不會讓低價值頁面因為抓得勤就排得比較前面。

這三個迷思的本質都一樣:把「爬取」這個前置動作,誤當成排名保證。釐清這條界線,你才會知道爬取預算優化在你的 SEO 全局裡,到底值不值得投入,以及該排在第幾順位。

在進入行動清單之前,先幫你設一個合理的期待。爬取預算的優化不是一打開開關就立刻見效的事,它更像在調整一台機器的齒輪:你修好一個環節,Google 通常需要幾週到幾個月才會在抓取行為上反映出來。所以與其每天盯著檢索統計資料的數字焦慮,不如給自己一個月的觀察期,每次只動一兩個變數,再回來比對前後差異。這種慢慢校準的節奏,才是大型網站做技術性 SEO 最務實的方式。如果你過去曾在 SEO 上吃過急就章的虧,SEO 常見錯誤 裡有更多值得借鏡的教訓,建議一併看看。

你的下一步行動方案

讀到這裡,別只想著把七個策略背下來,現在就動手做一件具體的事更實在。這裡給你一個可以這個禮拜就跑完的行動清單:

  1. 先確認自己需不需要管這件事。打開 GSC 的檢索統計資料,看看過去 90 天的抓取量與你的網站規模搭不搭。如果你的頁面不到幾千個、抓取量也正常,就把這篇存起來,回去把心力放在內容與 反向連結 上,別過度優化。
  2. 盤點低價值頁面。從 analytics 撈出過去一年零流量的頁面,列出清單。該刪的刪、該合併的合併、該補強的補強。這是性價比最高的第一步。
  3. 檢查 robots.txt 與 noindex 有沒有打架。把你封鎖的網址逐一過一遍,確認沒有「robots.txt 封鎖了,卻又在頁面放 noindex」的矛盾組合。
  4. 清查重複網址與轉跳鏈。用爬蟲工具掃一次全站,把參數造成的重複頁加上 canonical,把多層 redirect 攤平成一步。
  5. 把你的 XML Sitemap 清乾淨。只放高優先、可索引、回傳 200 的頁面,移除被封鎖與重複的網址,重新提交。
  6. 挑一個速度瓶頸,本週修掉它。從 CDN、圖片壓縮、lazy loading 裡挑一項動手,這是長期複利最高的一步。
  7. 設一個月一次的健檢節奏。每個月回來看一次檢索統計資料,確認抓取量與重要頁面索引覆蓋率在往對的方向走。

爬取預算這件事,最迷人的地方在於它把一個抽象的「Google 怎麼看我網站」的問題,變成了一張你可以實際調整的資源分配表。你不需要一次把七個策略全做完,但只要照著上面這個節奏走,你會慢慢看到 Google 把力氣花在對的頁面上,而那些真正用心寫的內容,也才終於有機會被看見。

也要提醒一句:爬取預算優化最後往往會逼你面對一個更深層的問題,那就是你的網站到底有沒有「值得被收錄的內容」。如果你清完低價值頁面後,發現剩下的頁面其實也談不上有獨特經驗或觀點,那真正的瓶頸往往出在內容本身,爬取預算只是代罪羔羊。這種時候,與其繼續在 robots.txt 與 sitemap 上鑽牛角尖,不如把力氣轉去補強 長尾關鍵字策略 與內容深度,讓每一個被收錄的頁面都值得被收錄。技術面把門打開,內容面把人留住,這兩條腿一起走,才是 SEO 真正能滾出雪球的關鍵。這也是為什麼每當有人問起,被 Google 演算法 波及、或流量莫名下滑時該從哪裡查起,實務上總會建議先回頭確認兩件事:一是技術面有沒有把好內容擋在門外,二是內容面有沒有真的在為真人解決問題。把這兩點想清楚,爬取預算自然會回到它該有的位置,一個重要的支援角色,而不是主角。

如果你在跑這個清單的過程中,發現自己的網站規模已經大到光靠自己難以盤點,或是需要有人陪你一起把網站架構、技術 SEO 與內容策略重新理一遍,這正是 Whoops SEO 平常在幫客戶做的事。需要找人一起理一遍時,Whoops SEO 隨時可以聊聊;不過最重要的,還是你今天願意從清單上挑出第一件事,真的動手做下去。剩下的,時間會證明。

常見問題

小網站需要特別管理爬取預算嗎?
頁面數量少的小型網站,Google 資源充足,通常當天就能完整抓取,不必特別處理。只有當網站充斥低品質內容、錯誤頁或結構混亂時,才會拖累爬取效率,基本功仍不能省。
GSC 的「已檢索尚未建立索引」數字很大代表什麼?
代表 Google 已經讀過這些網址卻選擇暫不收錄。數量偏大時通常指向兩種可能:這批頁面優先級太低,或網站結構讓爬蟲抓不到重點,這時應該檢查的是內部連結與頁面價值。
網站改版用大量 301 轉址會影響爬取預算嗎?
會。大量 301 會讓 Google 重新理解網站結構,過渡期會消耗較多預算,應盡量讓每個舊網址一跳就指向最終目的地,不要串接多層轉址,每多一層都讓爬蟲多花一次請求才抵達內容。
robots.txt 封鎖、noindex、410 刪除,三種做法該怎麼選?
robots.txt 適合封鎖整條不必收錄的路徑(如後台、測試環境、無窮篩選頁),但無法保證頁面不被收錄;noindex 適合單一頁面不想被收錄、但爬蟲要能讀到指令的情況,且不可與 robots.txt 同時用於同一頁面;410 狀態碼用於宣告網址永久移除,適合停售商品頁與已下架活動頁。

主題聚落|技術 SEO 與網站架構 看「SEO 搜尋引擎優化」中樞 →

相關文章

褚崇名(Sliven) 創辦人・巫普斯科技有限公司

長期投入技術 SEO、GEO/AEO 與 AI 搜尋實務。本站文章以可驗證資料、公開來源與實作觀察整理而成。

完整作者介紹LinkedInGitHubX

想把這篇的方法用在自己的站上?

SEO 健檢、GEO/AEO 引用優化、網頁設計諮詢——把文章裡的方法落地到你的網站。