Whoops

網站若把合約、報價明細或聯絡資料放在公開網址上,就可能被搜尋引擎收錄;還沒上線的測試頁若誤推到正式網址,也可能連同「Lorem ipsum」之類的佔位文字一起出現在搜尋結果。這些頁面本來就不該成為搜尋入口。

不想被索引,不是逃避 SEO,它本身就是 SEO 的一部分。把不該曝光、還沒準備好、或價值太低的頁面擋在索引之外,是一種主動的品質管理。這一篇把實務上真正能用的四個方法一次講清楚:noindex 標籤、robots.txt、Google Search Console 移除工具、刪除頁面或上鎖。每一個方法都會誠實告訴你它能做什麼、做不到什麼,以及最常踩到的坑。如果你僅是要快速答案,先把接下來這段快速總覽看完。

重點摘述

  • 想讓 Google 不要索引某一頁,第一選擇是 noindex 標籤,不是 robots.txt。
  • robots.txt 擋的是「爬取」,不是「索引」,兩個千萬不要搞混。
  • 已經被收錄、又急著下架的頁面,用 GSC 移除工具加 noindex 雙管齊下。
  • 真正機密、不能外流的內容,不要僅靠 noindex,直接上鎖或刪除才保險。

為什麼「不被索引」本身就是一種 SEO 策略

很多人把 noindex 想成「藏東西」,好像僅有見不得光的頁面才需要。這個想法僅對了一半。先打破這個框架:不讓頁面被收錄,不一定是消極的閃躲,它常常是一種積極的取捨。

一份大規模研究指出,超過 96% 的受測網頁沒有從 Google 取得自然搜尋流量(Ahrefs 於 2023 年發表的〈96.55% of Content Gets No Traffic From Google〉)。但「沒有自然流量」不等於頁面毫無價值,更不能直接推論它會拖累整站。真正該處理的是不該公開、重複或由系統無限產生的網址。

所以當你主動告訴 Google「這幾頁不值得你收錄,請把資源留給重要的頁面」,這不是退縮,而是把火力集中。實務上需要刻意不被索引的頁面,大概有三類:

  • 還沒準備好的頁面:開發中的活動頁、剛搬完家還沒校稿的舊內容、測試用的 staging 環境。這些頁面內容空泛或錯誤,被收錄僅會扣分。
  • 低價值或重複的頁面:分頁第 50 頁、標籤聚合頁、篩選器產生的參數組合、與主題重複的過渡頁。它們製造重複內容的風險,也吃掉爬蟲時間。
  • 機密或私人頁面:合約範本、報價單、後台、會員專屬內容、內部公告。這些不是「內容」,是工具,根本不該出現在公開搜尋結果。

把這三類頁面梳理清楚之後,你會發現「不被索引」其實是站內 SEO 很核心的一塊,它跟爬取預算、跟主題權威、跟整體內容品質,全部綁在一起。

方法一|noindex 標籤:最直接,也最常被誤用

講到不想被索引,第一個該搬出來的就是 noindex。它是 Google 官方明確推薦的做法,目的就一個:告訴搜尋引擎「這一頁不要放進索引庫」(見 Search Central 的 noindex 官方文件,2026)。如果你對這個指令還很陌生,可以先從noindex 的基本觀念建立底子,這一篇直接切入實戰操作。

noindex 有兩種寫法,你可以依據自己能掌控的層級來選:

  1. robots meta 標籤:放在 HTML 的 <head> 裡,長這樣:<meta name="robots" content="noindex">。這是最常見、也最容易在 CMS 裡設定的方式。
  2. X-Robots-Tag HTTP 標頭:在伺服器回應網頁時,直接在 HTTP header 加上 X-Robots-Tag: noindex。適合用在 PDF、圖片、或那些沒有 HTML <head> 可以改的檔案。

content 屬性可以單獨用 noindex,也可以跟其他指令組合。以下整理了一張表,把實務上最常用的組合列出來,你不用全背,但起碼要分得清楚 noindex、nofollow 跟 nosnippet 各自管的是什麼。

content 值 意思 典型用途
noindex 不要收錄這一頁 感謝頁、後台、測試頁
noindex, follow 不要收錄,但可以順著連結繼續爬 要刪除的舊頁,但頁面上的連結還想保留價值
noindex, nofollow 不要收錄,也不要爬頁面上的連結 完全隔離的內部頁面,例如管理後台
nosnippet 可以收錄,但不在搜尋結果顯示文字或影片摘要 要限制搜尋摘要呈現的頁面

這裡有一個非常關鍵、卻被忽略到不行的前提:noindex 要生效,Google 必須真的「爬得到」這一頁、讀得到這個標籤。什麼意思?意思是如果你同時在 robots.txt 把這個頁面 Disallow 掉,Googlebot 根本進不來,它就看不到你的 noindex,結果是它可能還是會憑別人連過來的連結文字,把這個網址以「僅有網址、沒有標題摘要」的形式收錄。這是最經典的自爆,也因此特別值得拉出來講。

如果你使用 WordPress,還要留意設定裡的「阻擋搜尋引擎索引這個網站」勾選框。現行 WordPress 會透過 robots meta 指令要求搜尋引擎不要索引,而不是把它當成存取控制。測試站上線前若忘了取消,正式頁面就可能持續帶著 noindex。

X-Robots-Tag 聽起來技術門檻高一點,但它解決的問題非常實際。想像你網站上放了一整批 PDF 型錄、報價單、技術手冊,這些檔案沒有 HTML 的 <head> 可以讓你塞 meta 標籤,但它們一樣會被 Google 收錄、一樣會出現在搜尋結果。這時候你能做的,就是在伺服器層級動手:在 nginx 或 Apache 的設定檔裡,針對特定路徑或副檔名回傳 X-Robots-Tag: noindex。一個很常見的應用,是把整個 /downloads/ 目錄底下的 PDF 一次設成 noindex,等於一刀切乾淨。另一個建議你養成的習慣,是善用 CMS 外掛的單頁開關。主流的 SEO 外掛都會在每一篇文章的編輯頁提供「是否阻擋搜尋引擎索引此頁」的勾選,它背後做的事就是幫你寫入 noindex。這個開關的好處是精準,你可以僅針對單一一頁動手,不必動到全站設定;它的代價是太方便,反而容易被忘記。最好的做法是搭配一份簡單的紀錄,每一頁被標成 noindex 的原因都寫清楚,半年後回頭檢查才不會一頭霧水。

方法二|robots.txt:能擋爬取,卻擋不住索引

第二個方法要打臉一個流傳很廣的誤解。很多人以為,若在 robots.txt 寫一行 Disallow: /secret/,那個資料夾下的頁面就「不會被索引」了。這個認知是錯的。

換句話說,robots.txt 控制的是「爬蟲能不能來抓取這個網址」,它不是用來控制「要不要把這個網址放進索引庫」。Google 自己的官方說明講得很清楚:當一個網址被 robots.txt 擋住,但同時有其他網站用連結指到它,Google 仍然可能把它收錄,搜尋結果裡僅會出現網址本身,沒有標題也沒有摘要。

這就是所謂的「URL-only 收錄」。對使用者來說,他在搜尋結果還是看得到你那個網址,僅是資訊比較少。如果你的目的是「完全不要讓這頁出現」,robots.txt 單獨用是做不到的。

robots.txt 跟 noindex 的責任邊界,用一張表拆開,你會看得更清楚:

面向 robots.txt Disallow noindex
能擋爬蟲抓取內容? 否(仍會正常爬)
能阻止建立索引? 否(可能出現 URL-only)
生效速度 取決於下次爬取 取決於下次爬取並讀到標籤
最適合的用途 大量低價值路徑、節省爬取預算、保護伺服器資源 精準控制單一頁面要不要被收錄

所以正確的搭配方式是:要讓某頁不要被索引,就用 noindex,而且不要在 robots.txt 同時擋掉那一頁。讓 Googlebot 進得來、看得到 noindex,指令才有機會生效。如果要控制大量低價值參數頁的爬取,才評估 robots.txt 或從網址生成與站內連結下手;Search Console 的網址參數工具已在 2022 年退場。

方法三|Google Search Console 移除工具:緊急下架的最快路徑

前面兩個方法有一個共同的特性:你做完設定之後,必須等 Google 重新爬過這一頁才會生效。這段等待時間可能是一天,也可能是兩三週。如果你的頁面已經被收錄、而且正在洩漏不該公開的資訊,你根本等不了那麼久。這時候 Google Search Console 的移除工具,就是你最快的一刀。

這個工具在 GSC 後台叫「移除」(Removals),它分成兩種用途,目的完全不同,不要送錯(見 Google 的內容移除說明,2026)。

  • 暫時移除(Temporary removals):可以立刻把某個網址從搜尋結果隱藏,大約維持六個月。它是一個「緊急煞車」,目的是幫你爭取時間去處理底層問題,不是永久解法。
  • 過時內容:GSC 的「移除」報表會顯示透過公開的「更新過時內容」工具提出的申請;該工具適合頁面已刪除或內容已更新,但搜尋結果仍顯示舊資訊的情況。

送出移除申請的時候,有一個欄位要特別小心:你要移除的是「精確網址」還是「所有以此為前綴的網址」。前者僅移除你輸入的那一頁,後者會把整個路徑底下的所有頁面一次隱藏。如果你的機密內容放在某個資料夾下、而且不僅一頁,用前綴移除可以省掉逐頁申請的麻煩;反過來說,一旦前綴設得太寬,很可能誤傷你根本不想隱藏的頁面。送出之前,務必先把那個路徑底下所有會被牽連的網址在腦海裡想一遍,確認範圍沒有設錯。

暫時移除通常提供約六個月的隱藏期;若底層狀態未處理,期限後網址可能再次出現。應同時使用適合的長期方式,例如 noindex、刪除內容或權限保護,再等待 Google 重新處理;不要承諾某個網址會在固定時間「永久消失」。

送出移除申請之後,你要驗證它到底有沒有成功。這時候 網址檢查工具就派上用場,它能告訴你 Google 目前對這個網址的最新狀態、有沒有讀到你的 noindex、上次爬取是什麼時候。整個流程走完,再用 site:你的網址 這個搜尋指令確認它真的從結果裡消失了。

方法四|刪除頁面或上鎖:從根源斷掉被收錄的可能

前三個方法,本質上都在跟 Google「溝通」,告訴它「這一頁請不要收錄」。方法四不一樣,它是釜底抽薪:直接讓這個頁面不存在,或讓它變成僅有經過授權的人才看得到。不溝通,直接斷源。

實務上有兩種主要做法:

  1. 刪除頁面,回傳 404 或 410 Gone。Google 看到網址持續回傳這兩種狀態碼,會逐步把它從索引移除。410 的 HTTP 語意是資源已永久消失,但不要把它當成保證更快移除的捷徑;若有相近替代頁,才改用 301 轉址。
  2. 上鎖:密碼保護、登入牆、HTTP Basic Auth。當一個頁面必須登入才能看,Googlebot 看到登入牆,原則上不會去收錄它的內容。這對會員專屬內容、客戶下載區、內部公告這類頁面是最穩妥的做法。

這裡補充一個容易被看漏的觀念:404 跟 410 要真的讓 Google 把頁面移除,需要「持續」回傳這個狀態碼。如果你今天回 404、明天又恢復 200,Google 會把它當成暫時性的不穩定,遲遲不肯從索引裡刪掉。這裡也要小心一種叫做「soft 404」的陷阱:頁面其實已經沒有有效內容了,但你讓它回傳 200,還顯示一個「找不到資料」的訊息給使用者看。Google 會自己判斷這種頁面其實等於不存在,把它歸類為 soft 404,但這個判斷有時候會誤傷你真正想保留的頁面。乾淨的做法是:要刪就給真正的 410,要留就給真正的 200 跟實質內容,不要夾在中間。

什麼時候該動用到方法四?實務上的判斷標準很簡單:如果這個頁面的內容真的不能被一般人看到,合約、報價、個資、客戶名單這一類,那就不要僅靠 noindex。你要理解一件事:noindex 是一種「君子協定」,它依賴 Google 遵守你的指示;而刪除與上鎖是物理隔離,它不依賴對方守不守規矩。一旦內容涉及隱私或商業機密,永遠選物理隔離。

如果你的網站正在搬家或改版,那更是方法四的主場。在新站還沒完全上線之前,正確做法是把整個測試環境上鎖,或用 noindex 把全站擋住,等正式開張那一天再一口氣解除。一個沒上鎖的 staging 環境被 Google 收錄,是網站搬家災難裡最常見的開場。

還有一種情況跟企業網站無關,但值得順帶一提:如果你要移除的是出現在 Google 搜尋結果裡的個人資訊,例如身分證字號、銀行帳戶、私密照片、未經同意被刊登的聯絡方式,那是另一條獨立的申訴管道,由 Google 專人審核,跟網站管理員的移除工具是兩回事(申請方式見 Google 的個人資訊移除說明,2026)。

四個方法誰該用哪個?一張決策表幫你選

四個方法講完了,但你不會每次都從零開始想。下面這張決策表把最常見的情境、跟對應的推薦做法整理在一起,下次遇到狀況直接對照,不用再猶豫。

情境 第一選擇 為什麼
開發中、還沒上線的網站或頁面 整站上鎖或全站 noindex 內容還沒定稿,收錄了僅會留下壞紀錄,之後要洗乾淨很麻煩
表單送出後的感謝頁、結帳完成頁 noindex 頁面本身沒有搜尋價值,被收錄反而妨礙轉換追蹤與使用者體驗
流量很低、內容薄弱的舊部落格文章 刪除(404/410)或合併後 301 轉址 內容已無用途;若有相近替代頁可轉址,沒有則回傳 404 或 410
分頁、標籤、篩選參數產生的重複頁 robots.txt 或 noindex(視規模) 量大用 robots.txt 節省爬取預算,量小用 noindex 精準控制
合約、報價、客戶下載區等機密頁 上鎖(登入牆)+ noindex 機密內容不能僅靠君子協定,要用物理隔離保底
已刪除卻還出現在搜尋結果的頁面 GSC 過時內容移除 頁面已不存在,僅是 Google 的快照還沒更新,主動要求刷新最快
個資、機密資料意外外流 GSC 暫時移除+個人資訊申訴管道 緊急下架爭取時間,同時走正式申訴爭取永久移除

這張表涵蓋常見狀況,但不能宣稱固定比例。真正費心的環節,是判斷頁面用途、公開範圍與是否有替代內容。

三種最容易失控的網址:參數頁、分頁、站內搜尋

真正會讓一個網站的索引狀態大爆炸的,通常是系統自動產生、數量難以控制的 URL;那一兩頁你手動建立的內容,往往僅是冰山一角。以下把實務上最容易出包的三種拉出來講,你對照自己的網站檢查一遍,通常能挖出一堆你根本不知道存在的頁面。

第一種是參數頁,也就是篩選器、排序、追蹤碼製造出來的變體。一個電商商品列表頁,若加上顏色、尺寸、價格排序、分頁,再加一組 UTM 追蹤參數,就能組合出幾十、幾百個內容近似的網址。處理時要先區分參數是否產生有獨立搜尋價值的內容;純追蹤或排序變體可用 canonical 收斂到乾淨版本,並統一 sitemap 與站內連結。GSC 的網址參數工具已退場,不能再靠後台設定處理。

特別要提醒的是 UTM 追蹤參數。對外連結加上 utm_sourceutm_mediumutm_campaign 追蹤轉換沒有問題,但不要把 UTM 用在站內連結。若已有大量帶參數網址被發現,應讓這些版本 canonical 到不含 UTM 的乾淨網址,並修正站內連結;GSC 已沒有網址參數工具可供設定。更完整的判斷方式可接著看網址查詢參數

第二種是分頁。Google 會把分頁序列中的每一頁視為獨立網址,官方建議每頁使用自己的網址與 self-canonical,不要把第 2 頁以後全部 canonical 到第 1 頁。若後續頁是 Google 發現商品或文章的重要路徑,也不宜一律 noindex;應先確保每頁有可爬取的 HTML 連結,再個別處理純排序或篩選變體。

第三種是站內搜尋結果頁。這是最容易被忽略、也最危險的一種。很多網站把使用者在站內搜尋框輸入的字,直接變成網址參數,產生一個可以被抓取的頁面。問題是,這些頁面內容空洞、又被垃圾連結攻擊者拿來濫用,等於幫別人開了一個免費的內容後門。實務上的建議是,站內搜尋結果頁一律 noindex,甚至直接在 robots.txt 擋掉這個路徑,因為它根本沒有被搜尋引擎收錄的價值。

這三種網址的共同特色是「你沒有主動建立,它們卻自動長出來」。養成習慣,每隔一段時間用爬蟲工具或 GSC 的報表回頭清點一次,才不會等到流量莫名下滑、才發現網站裡早就塞滿了連你自己都不認得的頁面。

怎麼確認自己做對了?回頭用報表驗收

設定完 noindex 或刪除頁面,工作僅做了一半。你還得回頭驗收,確認 Google 真的照你的意思處理了。很多網站的問題出在 noindex 設了卻沒生效,而自己也沒發現。

第一步,打開 GSC 的網頁索引報表,你會看到 Google 把所有網址分成幾個狀態。「已索引」代表頁面正在索引庫裡;「已建立索引,但未提交於 sitemap」則代表 Google 自己找到、但你沒主動告知的頁面,這一類特別值得看,因為裡面常常藏著你不知道存在的頁面。最需要留意的是「已排除」這一塊,它底下會細分原因,其中有一項叫做「已遭 noindex 標記排除」,看到這個狀態就代表你的 noindex 真的被 Google 讀到了、而且成功生效。如果你的頁面應該被排除卻還顯示「已索引」,那就是 noindex 還沒被讀到,得再等等或主動提交重新檢索。

報表裡還有兩個常見原因值得認識。「已檢索,目前未建立索引」表示 Google 已抓取但目前未收錄,官方不會為單一網址提供更精確原因;「重複網頁,Google 選擇的標準網頁與使用者不同」則表示 Google 未採用你宣告的 canonical。這些狀態不能直接翻譯成品質問題或「權重被集中」。

如果想一次檢查整個網站、而非逐頁點開,可用網站爬蟲工具掃描全站,列出哪些頁面帶有 noindex、哪些回傳 404 或 410、哪些 canonical 指向異常。爬蟲報表不能取代 Google 的實際索引狀態,重要網址仍要用 Search Console 驗證。

驗收不是一次性的動作,它是一個需要定期重複的習慣。建議根據網站規模設定一個節奏:小型網站每季跑一次全站檢查就夠了;中大型網站,特別是有商品列表或大量篩選器的電商站,最好每個月都到 GSC 看一次索引報表的變化。重點不是把數字記下來,而是觀察「已排除」的數量有沒有突然暴增,因為那通常代表網站又自動長出一批你沒預期的頁面。把這個檢查排進行事曆,才不會等到流量掉了才回頭找原因,那時候往往已經付出代價。

已經被索引的頁面,怎麼讓它消失得最快

前面的方法偏向「預防」,但多數人找上這篇文章的時候,頁面已經被收錄了。所以接著把「事後補救」的流程也講一遍。假設你今天發現一個不該存在的頁面已經躺在 Google 搜尋結果裡,按這個順序做,是最快讓它消失的路徑:

  1. 先處理根本原因。給這一頁加上 noindex,或直接刪除它、回傳 410。沒做這一步,後面所有動作都是白搭,因為六個月後它又會回來。
  2. 用 GSC 網址檢查工具驗證。先執行即時測試,確認 Googlebot 能存取網址,且頁面確實輸出 noindex 或正確的 404/410 狀態碼;移除仍要等 Google 重新處理。
  3. 如果情況緊急,同時送暫時移除申請。這一步是加速器,能讓你在幾小時內就把頁面藏起來,買到等待重新檢索的時間。
  4. 等待並驗證。給 Google 幾天到兩週的時間重新爬取。之後用 site:你的網址/那個頁面 確認它真的從索引裡消失,也可以到網頁收錄查詢交叉比對。

若網址需要緊急退出結果,可用移除工具暫時隱藏,並同步完成 noindex、刪除或權限保護等長期處理。一般非緊急頁面不一定需要送出移除申請。

noindex 最常見的坑與實務上的真實失誤

涉及個資、合約或未公開報價的檔案,不應放在任何人知道網址就能下載的位置。若已出現在搜尋結果,應先撤除公開存取或加上登入權限,再用 GSC 移除工具暫時隱藏結果;noindex 僅是索引控制,不能代替權限保護。

除了這個案例,底下這幾個失誤在實務上也反覆出現,值得你拿出來當成檢查清單:

  • noindex 跟 Disallow 同時用:前面講過的自爆。你一邊用 robots.txt 擋掉頁面,一邊又放 noindex,結果 Google 進不來、看不到 noindex,最終可能還是收錄了網址。想深入了解這對組合的陷阱,可以看robots.txt 與 noindex 為什麼不能同時用這篇。
  • noindex 跟 canonical 混用:你指定這頁 noindex,卻又同時用 canonical 指向另一頁,兩個訊號的目的不同。要合併重複網址就用 canonical;要讓網址退出搜尋結果就用 noindex,不要期待兩者疊加後同時完成訊號合併與移除。
  • 用 JavaScript 動態注入 noindex:Google 可以在渲染後讀到 JavaScript 加入的 noindex,但渲染會增加處理環節。重要的索引指令若能由伺服器直接輸出在初始 HTML,通常較容易驗證,也較不容易被前端錯誤影響。
  • 改完忘了驗證:很多人加了 noindex 就以為搞定,根本沒去確認 Google 有沒有真的讀到。養成習慣,改完之後一定用瀏覽器開發者工具(F12)或網址檢查工具確認標籤真的有輸出在原始碼裡。

這些坑有一個共同特徵:都是「以為設好了,其實沒有」。技術 SEO 最容易出事的環節,從來不是你不會寫,而是你寫了、卻沒驗證它真的照你想的方式運作。

從「不被索引」到「降低維護負擔」

noindex 的戰略價值,在於讓搜尋結果與網站實際用途一致,而不是把刪頁包裝成排名捷徑。

一份針對大量搜尋結果的相關性研究,觀察到內容與連結等特徵和排名之間的關係(見 Backlinko 的排名因素研究,2025 年 4 月)。相關性研究不能證明刪除低流量頁面會提升其他頁面排名,也不能直接還原 Google 的因果機制。

大量由系統產生、內容相同的網址,可能增加爬取與 canonical 管理負擔,也會讓報表難以判讀。但零流量頁面不等於低品質,單一頁面的低 CTR 也不會直接「拖低整站 CTR」形成公開的網站懲罰。處理依據應是頁面用途、內容是否重複,以及是否適合作為搜尋入口。

Google 沒有公布「內容密度」或刪除零碎頁面就能提高 AI 引用率的規則。AI Overviews 與 AI Mode 目前沿用一般搜尋的索引與摘要資格;使用 noindex 的可確認效果,是讓該網址失去成為支援連結的資格,而不是替其他頁面集中一個可量測的 AI 權重。

判斷頁面去留時,可以把低曝光列為複查線索,但不能以流量作唯一標準。先確認頁面是否服務導覽、客服、合規或既有顧客,再檢查內容是否重複、過期或空白。若刪除的網址有真正對應的替代頁,才使用 301;沒有相近替代內容時,應回傳 404 或 410,不要一律轉到首頁。

成熟的內容治理包含新增、更新、合併與移除,但沒有「把一百頁砍成十頁就能集中 Google 注意力」的保證。每次調整都應保留仍有用途的內容,並在變更後用索引報表與成效資料驗證。

想更全面理解這一層的技術基礎,可以回頭看技術性 SEO 完全指南,把爬取、索引、網站架構這幾塊串起來看,你會更清楚 noindex 在整個系統裡的位置。

現在就能做的五個動作

觀念跟方法都講完了,接下來是落地。底下把這整篇文章濃縮成五個具體的下一步,照著走,你的網站今天就能開始變乾淨。

  1. 盤點全站,列出所有「不該被收錄」的頁面。感謝頁、結帳頁、後台、測試頁、合約範本、分頁參數頁,全部列出來。這一步最重要,因為你沒列出來的,就是 Google 收錄了你也渾然不覺的。
  2. 給每一頁標上正確的處理方式。對照前面的決策表,決定它是該 noindex、該刪除、還是該上鎖。不要全部都用 noindex,機密頁要上鎖,垃圾頁要砍掉。
  3. 檢查 robots.txt 有沒有跟 noindex 打架。這是出錯率最高的一環。逐頁確認你想 noindex 的頁面,沒有被 robots.txt 同時擋掉。
  4. 用 GSC 驗證關鍵頁面的收錄狀態。挑出那幾個最重要的頁面(首頁、主要服務頁、金流相關頁),用網址檢查工具確認它們的索引狀態跟你預期一致。
  5. 建立一份「頁面用途 → 是否索引」的內部規範。白紙黑字寫下來:哪一類頁面一律 noindex、哪一類要上鎖、哪一類正常收錄。未來工程師或內容人員新增頁面時,就照這份規範走,避免同樣的問題一犯再犯。

把不適合公開搜尋的頁面整理好,可以減少索引錯誤與維護成本,但不應宣稱會替其他頁面直接加分。重點是讓每一類頁面使用適合的公開、索引與權限設定。

作者:Sliven 褚崇名,Whoops SEO 創辦人。把基礎打穩,比任何花俏的操作都重要。

常見問題

不想被索引該怎麼做?
先判斷要擋的是爬取還是索引這一關,再二選一:擋索引用 noindex,擋爬取用 robots.txt,機密內容則改用登入權限或實體隔離。noindex 與 robots.txt 不要同時掛,否則會互相拆台。
noindex 跟 robots.txt 可以同時使用嗎?
不建議。robots.txt 會擋住爬蟲讀取頁面,連帶讓頁面上的 noindex 也讀不到,搜尋引擎收不到「這頁不要收」的訊號,兩個方法等於互相抵銷、保護效果歸零,二選一即可。
robots.txt 能完全防止被索引嗎?
不能。robots.txt 只控制爬蟲要不要進入路徑,不保證頁面不會被索引;若有外部網站連到該頁面,爬蟲仍可能順著連結把它收進索引,索引裡只剩網址、沒有內容描述。
移除網址工具可以永久移除索引嗎?
不行。GSC 移除網址工具只能暫時撤下網址,效果大約維持半年;要永久不被索引,必須再搭配 noindex、robots.txt 或權限隔離才能真正根治。

操作步驟

  1. 判斷階段:問自己「這份內容如果被陌生人看到,最壞的後果是什麼?」後果輕微(尷尬、不夠專業)用 noindex 處理;後果嚴重(個資外洩、合約違約、商業機密)直接用登入權限或下架。
  2. 一個階段只用一個方法:擋索引用 noindex,擋爬取用 robots.txt,兩者永遠二選一;機密內容跳過這兩者,改用權限保護或實體隔離。
  3. 掛完一定要驗證:用 Google Search Console 網址檢查工具確認 noindex 真的被讀到,並用網頁索引報表定期追蹤收錄狀態,沒驗證等於沒做。

主題聚落|技術 SEO 與網站架構 看「SEO 搜尋引擎優化」中樞 →

相關文章

褚崇名(Sliven) 創辦人・巫普斯科技有限公司

長期投入技術 SEO、GEO/AEO 與 AI 搜尋實務。本站文章以可驗證資料、公開來源與實作觀察整理而成。

完整作者介紹LinkedInGitHubX

想把這篇的方法用在自己的站上?

SEO 健檢、GEO/AEO 引用優化、網頁設計諮詢——把文章裡的方法落地到你的網站。