「爬取預算」這個詞常被講得很玄,好像是什麼高深技術。我是吳承學,做 SEO 二十年,我的看法很實際:爬取預算就是搜尋引擎願意花在你網站上的抓取力氣,這份力氣有限,你把它浪費在沒價值的頁面上,真正重要的頁面就得排隊。這篇要談的是爬取預算到底是什麼、哪些頁面在偷偷吃掉它,以及我怎麼用 robots、參數處理和內部連結,把預算留給值得的頁面。這套做法到 2026 年依然是我處理大型網站的第一線工具。

1. 我怎麼跟客戶解釋爬取預算這件事

面對非技術背景的客戶,我不談演算法,我談力氣分配。爬取預算的核心概念,用生活化的方式反而講得更清楚。

1-1 爬取預算不是每個網站都要煩惱

先講清楚門檻:幾百頁、幾千頁的中小型網站,通常不必為爬取預算焦慮,搜尋引擎的抓取量足夠涵蓋。真正需要在意的,是頁面數量以萬計、或頁面更新頻繁的大型網站。如果你的網站規模不大卻覺得頁面老是抓不完,問題多半不在預算,而在內容或技術阻礙。把力氣花對地方,比空談預算重要。

1-2 它由兩件事決定,我分開看

搜尋引擎願意抓多少,大致取決於兩個面向。一是你的伺服器能承受多少抓取而不變慢,這關乎網站的健康與速度;二是你的內容有多少值得抓取的價值,這關乎需求。伺服器又慢又常出錯,抓取量會被壓低;內容大量重複、更新停滯,抓取意願也會下降。我做診斷時會分開檢查這兩面,因為它們的解法不同。

1-3 浪費預算的代價,我用一句話講白

代價就是重要頁面被延後發現、延後更新。當爬蟲把有限的抓取次數用在一堆沒價值的網址上,你剛上線的產品頁、剛更新的內容,可能要等更久才被看到。對時效性強或更新頻繁的網站,這個延遲直接影響成效。我常跟客戶說,爬取預算不是要你去「增加」搜尋引擎的抓取量,那不在你掌控範圍;你能做的是「省」,把原本被浪費掉的抓取次數,重新分配給真正該被看到的頁面。所以優化爬取預算的目標很單純:讓爬蟲少走冤枉路,把力氣留在刀口上。

2. 哪些頁面在偷吃我的預算

要省預算,得先知道錢花到哪去。我稽核時有一份固定的嫌疑清單,這些頁面往往數量龐大又沒有索引價值。

2-1 參數衍生的無限變體

排序、篩選、追蹤參數會讓同一份內容長出無數個網址。一個商品列表加上幾種排序、幾種篩選、幾種來源標記,組合起來可能是成千上萬個網址,內容卻幾乎一樣。這是我看過最會吃預算的類型。爬蟲一個一個去抓這些變體,抓完發現都是同樣的東西,力氣就這樣沒了。

2-2 低價值與重複的頁面

站內搜尋的結果頁、空的標籤頁、只有一兩筆內容的分類頁、大量雷同的樣板頁,這些都是預算黑洞。我遇過一個匿名的內容型網站,光是自動產生的標籤頁就有好幾萬個,多數只掛著一兩篇文章,爬蟲卻得逐一造訪。這類頁面對使用者沒幫助,對索引也沒貢獻,卻實實在在佔用抓取次數。

2-3 技術性的浪費

還有一類是技術面造成的:過長的轉址鏈、指向已失效頁面的內部連結、大量的軟性 404。爬蟲順著一條轉了三四次的轉址鏈走,或反覆撞上該回 404 卻回了 200 的空頁面,都是白費力氣。下面這張表整理我盤點時的主要嫌疑對象。

浪費來源 典型樣貌 對預算的影響
參數變體 排序、篩選、追蹤參數組合 同內容衍生大量網址
低價值頁 站內搜尋頁、空標籤頁 抓了也沒有索引價值
技術浪費 轉址鏈、軟性 404 抓取力氣耗在無效路徑

3. 我用來把預算留給好頁面的三個工具

找出浪費之後,接下來是動手止血。我主要靠 robots、參數處理和內部連結這三件事,各有各的適用時機,用錯了反而幫倒忙。

3-1 robots.txt:擋住不該被抓的路徑

對於整批確定不需要被抓的路徑,例如站內搜尋結果、後台、購物車,我用 robots.txt 直接封鎖。這是最省事的方式,能讓爬蟲根本不去碰這些區域。但我會提醒兩件事:被 robots 擋住的頁面,搜尋引擎連內容都讀不到,所以想被索引的頁面絕對不能擋;另外 robots 擋的是「抓取」不是「索引」,若某頁已經被收錄,光靠 robots 擋反而讓它無法讀到你後來加的 noindex,這種情況要改用別的做法。

User-agent: *
Disallow: /search
Disallow: /cart
Disallow: /*?sort=

3-2 參數處理:讓變體收斂回主網址

對付參數衍生的變體,我的主力是 canonical。讓帶參數的網址 canonical 指向乾淨的主網址,等於告訴搜尋引擎這些變體都以主網址為準,權重集中、也減少被當成獨立頁面重複抓取。同時我會在網站內部避免主動連向帶參數的網址,從源頭減少爬蟲發現這些變體的機會。對於純粹的追蹤參數,能不在站內連結使用就不用。

3-3 內部連結:把權重和抓取引導到重要頁

內部連結是我最重視、也最常被低估的工具。爬蟲主要靠連結發現頁面,你在網站內部大量連向哪些頁面,就等於在告訴它哪些頁面重要。我的做法是確保重要頁面從首頁三次點擊內可達、用具描述性的錨文字連向它們,同時砍掉指向低價值頁的內部連結,別再主動把爬蟲往黑洞裡帶。下面這張表對照三個工具的分工。

工具 適合處理 要注意的地雷
robots.txt 整批不需被抓的路徑 擋了就讀不到,想索引的頁別擋
canonical 與參數處理 同內容的參數變體 指向的主網址要能正常開啟
內部連結 引導抓取到重要頁 別把連結權重浪費在低價值頁

4. 我優化爬取預算的實際節奏

工具知道了,怎麼有條理地執行也很重要。我不會一次亂改一通,而是按步驟來,每一步都能觀察到效果。

4-1 先看紀錄,確認爬蟲把時間花在哪

我會從伺服器的存取紀錄下手,看搜尋引擎的爬蟲實際上都在抓哪些網址。這一步常常會嚇到客戶,因為爬蟲花最多力氣的地方,往往是那些他們根本不在乎的參數網址或低價值頁。用真實紀錄說話,比憑感覺猜有說服力得多,也讓後續要砍哪些頁面有依據。

4-2 從影響最大的浪費先動手

盤點出浪費之後,我按「數量乘上無價值程度」排序,先處理那種數量龐大又完全沒價值的類型,通常就是參數變體和自動產生的空頁。這類一處理,抓取次數馬上省下一大塊。至於零星的小問題,我放到後面再收,避免一開始就陷在細節裡。

4-3 改完之後我怎麼確認有效

我不靠感覺判斷成效,而是回頭比對兩個訊號:站長工具回報的抓取統計有沒有把力氣挪回有價值的頁面、重要頁面被重新抓取和更新的速度有沒有變快。若爬蟲對低價值路徑的造訪明顯下降、對重要頁面的關注上升,就代表預算的分配確實被導正了。這是一個持續觀察、逐步調整的過程,不是改一次就結束。

5. 常見問題

5-1 我的網站只有幾百頁,要優化爬取預算嗎

多半不用。小型網站的頁面量在搜尋引擎的抓取能力範圍內,通常不會有預算不足的問題。若你覺得頁面抓不完,先檢查是不是伺服器太慢、或有大量重複與技術阻礙,那才是真正的原因。

5-2 用 robots.txt 擋住的頁面會從搜尋結果消失嗎

不一定,而且這是常見誤解。robots.txt 擋的是抓取,不是索引。如果某頁在被擋之前已經被收錄,它可能還會留在搜尋結果裡,只是搜尋引擎讀不到最新內容。想讓頁面確實不被收錄,要用 noindex,而且那頁不能同時被 robots 擋住,否則搜尋引擎讀不到這個指令。

5-3 把低價值頁全部 noindex 就能省預算嗎

幫助有限。noindex 是告訴搜尋引擎不要收錄,但爬蟲還是得先抓取這頁、讀到 noindex 才知道。所以 noindex 省的是索引空間,不是抓取次數。要真正減少抓取,得靠減少這些頁面的存在、或不在站內連向它們。

5-4 我怎麼知道爬蟲到底把時間花在哪

最直接的是看伺服器存取紀錄,篩出搜尋引擎爬蟲的造訪,就能看到它實際抓了哪些網址、多常抓。站長工具的抓取統計也提供概況。兩者搭配,你會清楚看到力氣的分配,往往跟你以為的不一樣。

5-5 加快網站速度對爬取預算有幫助嗎

有幫助。伺服器回應越快、越穩定,搜尋引擎越敢提高抓取量而不怕拖垮你的網站。相反地,網站常變慢或出錯,抓取量會被保守地壓低。所以效能優化不只影響使用者,也間接影響爬蟲願意花多少力氣。

5-6 優化爬取預算多久能看到效果

沒有固定時間,取決於搜尋引擎重新評估你網站的節奏。通常你會先在存取紀錄看到爬蟲對低價值路徑的造訪下降,接著才慢慢反映在重要頁面被更快抓取上。這是漸進的過程,需要持續觀察,不會改完隔天就翻盤。