文章專欄
網站點樣先俾 AI 讀得晒?llms.txt/robots.txt 技術地圖
AI crawler 點樣進入你個網站?robots.txt、sitemap、llms.txt/llms-full.txt 各自做咩?呢篇技術地圖講解點樣設定同驗證,等 AI 引擎真正讀得到全站內容。
Anson Ng
4 分鐘閱讀
好多品牌以為「網站上線,AI 自然會知」,但其實 AI 引擎要爬得到、讀得明,先有機會引用你。呢篇技術地圖講解 AI crawler 進入網站嘅路徑,同 robots.txt、sitemap、llms.txt/llms-full.txt 各自嘅角色。
AI crawler 點樣進入網站?
一般流程係:
- AI crawler 讀
robots.txt,睇下邊啲可以爬 - Crawler 沿住 sitemap 同內部連結行入頁面
- 讀取 HTML 內容、結構化數據同圖片
- 內容進入 AI 引擎嘅索引/知識庫,先有機會被引用
任何一步出問題(例如 block 咗 crawler、sitemap 冇更新、內容靠 JavaScript 先出現),品牌就「存在但 AI 睇唔到」。
robots.txt:管「准唔准入」
robots.txt 放喺網站根目錄,用 User-agent 同 Allow/Disallow 話畀 crawler 知邊啲可以爬。
AI 時代嘅重點:
- 唔好意外 block 咗 AI crawler——檢查有冇 Disallow 咗 GPTBot、PerplexityBot、Bytespider(豆包)等
- Google 相關 crawler(Googlebot、Google-Extended)都要 allow,先會影響 AI Overview/AI Mode
- 最簡單安全嘅政策係
User-agent: * Allow: /,再按需要精準排除
sitemap:畀 crawler 一張地圖
Sitemap 列出網站所有重要 URL,同 robots.txt 一齊幫 crawler 發現新頁面。新文章、新案例上線之後,sitemap 要有更新(包括 lastmod),先會快啲被發現。
llms.txt/llms-full.txt:幫 AI「入到之後快啲明」
llms.txt 係網站放喺根目錄嘅純文字檔案,向 AI 語言模型介紹個網站:公司係咩、主要頁面喺邊、直接答案喺邊。概念好似 robots.txt 畀 crawler 睇權限,但 llms.txt 係畀 LLM 睇內容地圖。
llms-full.txt 係完整版,可以包含成個網站嘅主要內容全文,令 AI 一次過讀到更多資料(GNS-GEO 網站就同時提供兩份)。
點樣設定同驗證?
1. 檢查 robots.txt
睇下有冇 block 咗主流 AI crawler;可以用 curl -A "GPTBot" 呢類方式模擬測試。
2. 檢查 llms.txt 存在同內容
直接開啟 https://你的網域/llms.txt,確認有網站簡介、關鍵頁面同直接答案。
3. 檢查 sitemap
確認新內容 URL 有喺 sitemap 入面,lastmod 有更新。
4. 定期複測
AI crawler 政策同網站結構都會變,建議每個月檢查一次,確保冇意外 block 咗新功能或新內容。
常見誤解
- 「robots.txt 唔 allow 都冇所謂」? 有。AI crawler 會尊重 robots.txt,block 咗就真係唔會爬。
- 「有 sitemap 就夠」? sitemap 幫 crawler 發現 URL,但 llms.txt 幫 LLM 理解內容——兩者角色唔同。
- 「llms.txt 係 SEO 噱頭」? 佢係 2025 年起愈嚟愈普及嘅 AI 可讀性標準;對內容多嘅網站,確實幫 AI 更快掌握全站結構。
總結
要 AI 引用你,先要 AI 讀到你:robots.txt 開放、sitemap 齊全、llms.txt/llms-full.txt 提供內容地圖,再加結構化數據(詳見Schema 教學文章),先係完整嘅「AI 友好」技術基礎。
想知自己網站而家喺 AI 搜尋嘅表現?攞一份免費 AI 能見度報告,睇下有冇技術缺口。
常見問題
llms.txt 同 robots.txt 有咩分別?
robots.txt 話畀 crawler 知「邊啲可以爬、邊啲唔可以」;llms.txt 係一份畀 AI 語言模型讀嘅文字索引,列出網站簡介、關鍵頁面同直接答案。robots.txt 管「准唔准入」,llms.txt 幫 AI「入到之後快啲明」。
AI crawler 要 allow 邊啲?
至少要 allow Google 嘅 crawler(Googlebot、Google-Extended)同主流 AI crawler(例如 GPTBot、PerplexityBot、Bytespider 等)。最穩陣做法係 `User-agent: * Allow: /`,除非有特別原因要 block 某段內容。
llms-full.txt 係咩?點樣生成?
llms.txt 通常係精簡索引;llms-full.txt 可以包含成個網站嘅全文內容,令 AI 一次過讀到更多資料。生成方式通常係由內容系統自動產生(GNS-GEO 網站用 script 由文章/新聞/白皮書重新生成)。
點樣驗證 AI crawler 真係讀到我個網站?
可以模擬 crawler 嘅 User-Agent 用 curl 測試 robots.txt/llms.txt/頁面是否回傳 200;亦可以用 Google Search Console 睇收錄情況。定期測試,確保冇意外 block 咗新內容。