返回文章

文章專欄

網站點樣先俾 AI 讀得晒?llms.txt/robots.txt 技術地圖

AI crawler 點樣進入你個網站?robots.txt、sitemap、llms.txt/llms-full.txt 各自做咩?呢篇技術地圖講解點樣設定同驗證,等 AI 引擎真正讀得到全站內容。

Anson Ng

4 分鐘閱讀

好多品牌以為「網站上線,AI 自然會知」,但其實 AI 引擎要爬得到、讀得明,先有機會引用你。呢篇技術地圖講解 AI crawler 進入網站嘅路徑,同 robots.txt、sitemap、llms.txt/llms-full.txt 各自嘅角色。

AI crawler 點樣進入網站?

一般流程係:

  1. AI crawler 讀 robots.txt,睇下邊啲可以爬
  2. Crawler 沿住 sitemap 同內部連結行入頁面
  3. 讀取 HTML 內容、結構化數據同圖片
  4. 內容進入 AI 引擎嘅索引/知識庫,先有機會被引用

任何一步出問題(例如 block 咗 crawler、sitemap 冇更新、內容靠 JavaScript 先出現),品牌就「存在但 AI 睇唔到」。

robots.txt:管「准唔准入」

robots.txt 放喺網站根目錄,用 User-agentAllow/Disallow 話畀 crawler 知邊啲可以爬。

AI 時代嘅重點:

  • 唔好意外 block 咗 AI crawler——檢查有冇 Disallow 咗 GPTBot、PerplexityBot、Bytespider(豆包)等
  • Google 相關 crawler(Googlebot、Google-Extended)都要 allow,先會影響 AI Overview/AI Mode
  • 最簡單安全嘅政策係 User-agent: * Allow: /,再按需要精準排除

sitemap:畀 crawler 一張地圖

Sitemap 列出網站所有重要 URL,同 robots.txt 一齊幫 crawler 發現新頁面。新文章、新案例上線之後,sitemap 要有更新(包括 lastmod),先會快啲被發現。

llms.txt/llms-full.txt:幫 AI「入到之後快啲明」

llms.txt 係網站放喺根目錄嘅純文字檔案,向 AI 語言模型介紹個網站:公司係咩、主要頁面喺邊、直接答案喺邊。概念好似 robots.txt 畀 crawler 睇權限,但 llms.txt 係畀 LLM 睇內容地圖

llms-full.txt 係完整版,可以包含成個網站嘅主要內容全文,令 AI 一次過讀到更多資料(GNS-GEO 網站就同時提供兩份)。

點樣設定同驗證?

1. 檢查 robots.txt

睇下有冇 block 咗主流 AI crawler;可以用 curl -A "GPTBot" 呢類方式模擬測試。

2. 檢查 llms.txt 存在同內容

直接開啟 https://你的網域/llms.txt,確認有網站簡介、關鍵頁面同直接答案。

3. 檢查 sitemap

確認新內容 URL 有喺 sitemap 入面,lastmod 有更新。

4. 定期複測

AI crawler 政策同網站結構都會變,建議每個月檢查一次,確保冇意外 block 咗新功能或新內容。

常見誤解

  • 「robots.txt 唔 allow 都冇所謂」? 有。AI crawler 會尊重 robots.txt,block 咗就真係唔會爬。
  • 「有 sitemap 就夠」? sitemap 幫 crawler 發現 URL,但 llms.txt 幫 LLM 理解內容——兩者角色唔同。
  • 「llms.txt 係 SEO 噱頭」? 佢係 2025 年起愈嚟愈普及嘅 AI 可讀性標準;對內容多嘅網站,確實幫 AI 更快掌握全站結構。

總結

要 AI 引用你,先要 AI 讀到你:robots.txt 開放、sitemap 齊全、llms.txt/llms-full.txt 提供內容地圖,再加結構化數據(詳見Schema 教學文章),先係完整嘅「AI 友好」技術基礎。

想知自己網站而家喺 AI 搜尋嘅表現?攞一份免費 AI 能見度報告,睇下有冇技術缺口。

常見問題

llms.txt 同 robots.txt 有咩分別?

robots.txt 話畀 crawler 知「邊啲可以爬、邊啲唔可以」;llms.txt 係一份畀 AI 語言模型讀嘅文字索引,列出網站簡介、關鍵頁面同直接答案。robots.txt 管「准唔准入」,llms.txt 幫 AI「入到之後快啲明」。

AI crawler 要 allow 邊啲?

至少要 allow Google 嘅 crawler(Googlebot、Google-Extended)同主流 AI crawler(例如 GPTBot、PerplexityBot、Bytespider 等)。最穩陣做法係 `User-agent: * Allow: /`,除非有特別原因要 block 某段內容。

llms-full.txt 係咩?點樣生成?

llms.txt 通常係精簡索引;llms-full.txt 可以包含成個網站嘅全文內容,令 AI 一次過讀到更多資料。生成方式通常係由內容系統自動產生(GNS-GEO 網站用 script 由文章/新聞/白皮書重新生成)。

點樣驗證 AI crawler 真係讀到我個網站?

可以模擬 crawler 嘅 User-Agent 用 curl 測試 robots.txt/llms.txt/頁面是否回傳 200;亦可以用 Google Search Console 睇收錄情況。定期測試,確保冇意外 block 咗新內容。