我是吳承學,做 SEO 與 AI 搜尋優化二十幾年。這一兩年只要開會提到「要不要做 AI SEO」,幾乎一定有人問到 llms.txt。它被講得很神,好像放一個檔案,ChatGPT、Gemini 就會乖乖引用你的網站。我想用比較務實的角度把這件事說清楚:llms.txt 不是壞東西,但它遠遠不是 AI SEO 的重點,而且做錯了還會扯後腿。真正讓 AI 願意引用你的,是另外一批更基本的功夫。

我用一家工業儲存廠商的實際情況來談。他們的網站在健檢時被系統標出一個問題:llms.txt 這個檔案回應了 500 錯誤。這個小事件其實很典型,它把 llms.txt 該有的定位、以及很多人對 AI 爬蟲的誤解,一次都攤開來了。

1. 先搞懂 llms.txt 是什麼,以及它不是什麼

1.1 它是一份給 AI 看的網站摘要,不是排名開關

llms.txt 的構想,是在網站根目錄放一個純文字檔案,用結構化的方式告訴 AI 爬蟲:這個網站是做什麼的、有哪些重要頁面、內容重點在哪。用意是幫 AI 更快理解你的網站。但它是一個業界提案,不是搜尋引擎的正式標準,主流 AI 目前也沒有公開保證會依它來決定引用誰。把它想成一張自我介紹的名片可以,把它當成排名或引用的開關就想錯了。

1.2 它回應 500 錯誤,比沒有這個檔案還糟

那家工業儲存廠商的情況就很值得講。系統偵測到他們的 llms.txt 回應 500 錯誤,推測是檔案格式不對、不是純文字 UTF-8,或伺服器設定有問題。這裡有個關鍵判斷:如果根本沒有這個檔案,正常應該回應 404,也就是「查無此檔」,這對網站沒有任何傷害。但回應 500 是「伺服器內部錯誤」,代表有東西壞了。一個壞掉的檔案送出錯誤訊號,比乾脆沒有這個檔案更需要處理。所以我當時給的建議不是急著把內容寫得多漂亮,而是先確認:這個檔案到底存不存在?如果不存在,為什麼不是回 404 而是報 500?先把伺服器行為弄對,再談要不要放內容。

1.3 務實的態度:可做可不做,但不能放著壞

我對 llms.txt 的立場很清楚。以投報率來說,它的必要性沒有大家想的那麼高,一個資源有限的網站,我不會把它排在前面。但如果你已經有這個檔案,它就不能是壞的。壞掉的檔案送錯誤碼,是明確要修的;至於要不要從無到有去建一個,那是餘力之後的事,不是優先事項。這個分寸抓對,才不會把力氣花錯地方。

2. AI 爬蟲真正在乎的,其實跟傳統 SEO 高度重疊

2.1 內容要能被抓到,這是一切的前提

很多人談 AI SEO 談得很玄,其實 AI 爬蟲要引用你,第一關跟傳統搜尋引擎一樣:內容要進得來、讀得到。如果你的重要內容藏在需要大量互動才載入的地方、或是被規則擋在門外,再厲害的 AI 也引用不到。我在那家工業儲存廠商身上做的,反而是很基本的事:確認頁面回應正常、沒有被錯誤地封鎖、內容在原始碼裡就讀得到。這些基本功比 llms.txt 重要太多。

2.2 別在爬蟲設定上自己擋自己

我看過一個很常見、也很可惜的錯誤:網站在爬蟲規則裡把某些爬蟲整個擋掉,結果連社群平台或 AI 抓取預覽的爬蟲都被拒於門外,分享出去沒有預覽圖、AI 也讀不到內容。那家廠商當時的爬蟲規則就有類似的異常設定,把該放行的爬蟲擋住了。這種問題修起來很快,但不修的話,你做再多內容,特定管道就是看不到你。定期檢查爬蟲規則有沒有誤擋,是我每次健檢的固定動作。

2.3 結構化資料才是讓機器讀懂你的主力

如果真要問什麼能實質幫助 AI 理解網站,我的答案是結構化資料,而不是 llms.txt。用機器能明確解析的格式標註出「這是產品、這是它的規格、這是一篇新聞、這是發布日期」,效果遠比一個摘要檔案直接。那家工業儲存廠商我優先建議補的,就是產品、新聞文章、麵包屑與組織資訊的結構化標記,而不是花時間雕 llms.txt。下面這張表,把兩者的定位講清楚。

做法 成熟度 對 AI 的實質幫助 優先序
結構化資料標記 成熟且被廣泛支援 高,能精準傳達內容類型與屬性 優先做
內容可被抓取 基本要求 高,是被引用的前提 優先做
爬蟲規則正確 基本要求 高,避免自己擋自己 優先做
llms.txt 業界提案、未成標準 不確定,主流未公開保證採用 有餘力再做

3. 一套我會給企業站的 AI 可見度優先順序

3.1 先把技術地基修對

面對一個想提升 AI 可見度的網站,我一定從技術地基開始:頁面回應正不正常、有沒有錯誤的封鎖、重要內容是不是在原始碼裡讀得到、爬蟲規則有沒有誤擋。這些聽起來不性感,卻是決定 AI 到底看不看得到你的關鍵。那家工業儲存廠商的清單裡,llms.txt 只是其中很小的一項,真正花時間的是把這些基本盤逐一確認過。

3.2 用結構化資料把內容翻譯給機器

地基穩了之後,我會把力氣放在結構化資料。產品頁標清楚產品名稱、型號、描述、圖片;新聞頁標清楚標題與發布日期;有麵包屑的頁面補上路徑標記;組織資訊補齊地址與社群連結。這些標記讓 AI 不必用猜的,就能明確知道每一段內容是什麼。要注意的是,這些屬性要動態帶入每個頁面的真實資料,不能全站套同一組,否則標記與內容對不上反而扣分。

3.3 內容本身要值得被引用

技術做好、標記補齊,最後回到最根本的:內容有沒有被引用的價值。AI 傾向引用資訊正確、結構清楚、能獨立被理解的段落。與其糾結 llms.txt 要寫什麼,不如把每一頁的內容寫得讓人一看就懂、資訊經得起查證。這件事沒有捷徑,卻是所有 AI SEO 手法裡最耐久的一項。工業產品這種專業內容尤其如此,規格準確、案例真實,本身就是最強的引用誘因。

4. 常見的 llms.txt 與 AI 爬蟲迷思

4.1 「放了 llms.txt,AI 就會引用我」

這是最需要澄清的一個期待。llms.txt 目前是業界提案,主流 AI 並未公開承諾會依它來決定引用對象。放了它,不等於你就會被引用;沒放它,也不代表你不會被引用。真正影響引用的,是內容能不能被抓到、能不能被理解、以及本身有沒有價值,這三件事跟這個檔案沒有直接關係。

4.2 「檔案報錯沒關係,反正是新東西」

錯。檔案回應 500 錯誤代表伺服器有東西壞了,這跟「這個檔案重不重要」是兩回事。一個送出錯誤碼的端點,本身就是需要處理的技術異常。正確的行為是:檔案不存在時回 404,存在時回正常的純文字內容。介於中間的 500 錯誤,是我一定會請工程端釐清的項目。

4.3 「做了 AI SEO 就不用管傳統 SEO」

這個誤解會讓人把資源放錯地方。AI 爬蟲要引用你的前提,跟傳統搜尋引擎高度重疊:內容要可被抓取、要可被理解、要有品質。所謂 AI SEO,大半是把傳統 SEO 的基本功做扎實,再加上結構化資料這類讓機器讀懂的手法,而不是另起爐灶去追一堆新名詞。下面這張表整理了我最常被問到的迷思與務實回應。

常見說法 務實看法
放 llms.txt 就會被 AI 引用 主流 AI 未公開保證採用,不能當引用開關
沒有這個檔案很吃虧 沒有就回 404,對網站沒有傷害
檔案報 500 沒差 是伺服器異常,必須修
AI SEO 跟傳統 SEO 無關 前提高度重疊,基本功先做

5. 常見問題

5.1 我的網站到底需不需要 llms.txt?

以投報率來說,它的必要性沒有被宣傳得那麼高,資源有限時我不會把它排在前面。如果你行有餘力想做,可以做,但要確保它是一個格式正確的純文字檔案。更重要的是,如果你已經有這個檔案而且回應了錯誤,那一定要先修好,因為壞掉的檔案比沒有還糟。

5.2 llms.txt 回應 500 錯誤代表什麼?該怎麼處理?

500 代表伺服器內部錯誤,通常是檔案格式不對、不是純文字 UTF-8,或伺服器設定有問題。處理的第一步是確認這個檔案到底存不存在:如果不存在,正常應該回 404 而不是 500,那要查為什麼伺服器回錯了狀態碼;如果存在,就把它修成格式正確的純文字檔案。

5.3 沒有 llms.txt 會不會被 AI 忽略?

不會因此被忽略。AI 是否引用你,取決於內容能不能被抓取、能不能被理解、以及本身有沒有價值,這些跟有沒有這個檔案沒有直接關係。與其擔心少了這個檔案,不如先確認你的重要內容在原始碼裡讀得到、沒有被爬蟲規則誤擋。

5.4 想提升 AI 可見度,第一步該做什麼?

先修技術地基,而不是先做 llms.txt。確認頁面回應正常、沒有錯誤的封鎖、重要內容可被抓取、爬蟲規則沒有誤擋掉該放行的爬蟲。這些基本盤穩了之後,再用結構化資料把內容類型與屬性標清楚,這兩步對 AI 理解網站的幫助,遠比一個摘要檔案來得實在。

5.5 結構化資料和 llms.txt,哪個對 AI 比較有用?

結構化資料。它是成熟且被廣泛支援的做法,能用機器明確解析的格式標註內容是產品、新聞還是組織資訊,讓 AI 不必用猜的。llms.txt 目前還是未成標準的業界提案,主流 AI 未公開保證採用。若要在兩者間排優先序,我會先把結構化資料做好,llms.txt 留到有餘力再說。