突發:robots.txt 對 AI 爬蟲的約束力正在瓦解
2026年8月14日,Search Engine Journal 報導了一項對 SEO 業界影響深遠的發現:OpenAI 的官方文件承認,robots.txt 可能無法阻止 ChatGPT-User 爬蟲抓取網站內容。
這不是一個技術漏洞,而是 OpenAI 明確設計的「功能」。根據 OpenAI 的爬蟲文件說明,ChatGPT-User 只有在 ChatGPT 用戶提出問題時才會訪問頁面,由於這些動作由用戶發起,因此 robots.txt 的規則可能不適用。
這對香港的網站營運者和 SEO 從業者來說,意味著一個根本性的問題:如果 robots.txt 擋不住 AI 爬蟲,我們還能靠什麼來控制內容被 AI 使用?
TollBit 報告:ChatGPT-User 違規最嚴重
TollBit 發布的《2026上半年 AI 爬蟲狀態報告》提供了令人震驚的數據:
| 指標 | 數據 |
|---|---|
| 被禁止的網站比例 | ChatGPT-User 被超過 9% 的歐洲網站明確禁止 |
| 違規訪問率 | 在歐洲網站中,約 15% 的 AI 頁面抓取請求訪問了 robots.txt 禁止的 URL |
| 違規最多的爬蟲 | ChatGPT-User 違規次數冠絕所有 AI 爬蟲,近半數禁止它的網站仍被訪問 |
| 其他爬蟲對比 | Claude-User 僅 9% 被禁,Perplexity-User 約 13%,遠低於 ChatGPT-User |
Perplexity 也持類似立場,表示 Perplexity-User 一般會忽略 robots.txt,因為同樣由用戶請求觸發。
但值得留意的是,Anthropic(Claude 的開發者)採取完全不同的態度——明確表示其三款爬蟲都會遵守 robots.txt。
一個關鍵區別:ChatGPT-User vs. OAI-SearchBot
香港網站營運者最容易犯的錯誤,就是把所有 OpenAI 爬蟲當作同一回事。
OpenAI 的爬蟲文件清楚區分了兩個角色:
- OAI-SearchBot:負責決定網站是否在 ChatGPT Search 搜尋結果中出現的爬蟲。
- ChatGPT-User:當用戶問問題時,負責抓取頁面內容供模型回答的爬蟲。
關鍵問題來了:如果網站同時封鎖了這兩個爬蟲,你實際上是在做一個「兩頭不到岸」的決定:
- 你失去了在 ChatGPT Search 中被推薦的曝光機會(因為封了 OAI-SearchBot)
- 你仍然可能被 ChatGPT-User 抓取內容去回答用戶問題(因為 OpenAI 說 robots.txt 對它未必有效)
- 結果是:你的內容被使用,但你的網站不會被引用為來源
TollBit 更直接:該公司將任何對 robots.txt 禁止 URL 的請求都視為違規,無論爬蟲營運者如何解釋。
Cloudflare 的應對方案:9月15日起改變規則
值得注意的是,Cloudflare 正在採取行動來解決這個問題。由 2026年9月15日 起,新加入 Cloudflare 的域名將預設:
- 封鎖 Training 和 Agent 爬蟲(在有廣告的頁面上)
- 允許 Search 爬蟲繼續運作
Cloudflare 的作法將爬蟲合規的決定權從爬蟲營運者轉移到網絡層面,這意味著無論爬蟲自己聲稱是否遵守 robots.txt,Cloudflare 都會在網絡層直接攔截。
但對於現有 Cloudflare 用戶,以及使用其他 CDN 或主機服務的香港網站,這個問題仍然需要自行處理。
香港網站應立即採取的行動
1. 檢查伺服器日誌,了解實際情況
不要只看 robots.txt 就以為萬事大吉。打開你的伺服器日誌或 CDN 分析,查看以下爬蟲的實際訪問情況:
- ChatGPT-User(User-Agent:
ChatGPT-User) - OAI-SearchBot(User-Agent:
OAI-SearchBot) - Bytespider(字節跳動的 AI 爬蟲)
- Claude-User / Claude-Web(Anthropic)
- Perplexity-User(Perplexity)
你可能會發現,即使 robots.txt 禁止了這些爬蟲,它們仍然在訪問你的網站。
2. 重新思考你的封鎖策略
香港 SEO 常見的迷思:「封鎖所有 AI 爬蟲等於保護內容。」
事實是:一刀切封鎖可能讓你失去 AI 搜尋的曝光機會,同時沒有真正阻止內容被使用。
建議的策略:
- 如果你希望被 AI 搜尋推薦:只封鎖 ChatGPT-User(如果擔心未授權抓取),保留 OAI-SearchBot 以維持在 ChatGPT Search 中的曝光
- 如果你完全不希望內容被 AI 使用:在 robots.txt 封鎖所有相關爬蟲,但要知道這可能無法完全阻止 ChatGPT-User
- 考慮升級 CDN 方案:使用 Cloudflare 或其他支援網絡層爬蟲管理的服務
3. 在伺服器層級增加額外限制
由於 robots.txt 對 ChatGPT-User 的約束力存疑,香港網站應考慮在伺服器層級(如 Apache/Nginx 設定、CDN WAF 規則)直接封鎖或限制特定 AI 爬蟲的訪問速率。
4. 定期監控爬蟲行為變化
AI 爬蟲的行為和規則正在快速變化。建議每季度檢查一次主流的爬蟲清單,並更新你的 robots.txt 和伺服器設定。
對香港 SEO 策略的深層影響
這項新聞對香港 SEO 的影響不僅僅是技術層面的:
- AI 搜尋優化(GEO)的重要性提升:既然無法完全阻止內容被 AI 爬蟲抓取,不如主動確保你的內容在 AI 回應中被正確引用。這意味著結構化數據、權威性內容和清晰的品牌信號變得前所未有的重要。
- 內容保護 vs. 曝光權衡:香港企業需要為每個頁面或內容類型做出明確的決定——這篇內容適合被 AI 引用以獲得曝光,還是需要保護不被 AI 使用?
- 監控工具需求增加:傳統的 SEO 工具無法追蹤 AI 爬蟲行為。建議使用伺服器日誌分析工具或 CDN 分析來追蹤 AI 爬蟲的實際訪問情況。
總結
OpenAI 的這項承認,標誌著 robots.txt 作為內容控制工具的時代正在改變。對於香港的 SEO 從業者而言,關鍵不在於恐慌,而在於理解這個新現實,並調整策略。
好消息是,仍然有方法可以管理 AI 爬蟲——只是不能再依賴 robots.txt 這一個工具。結合伺服器層級控制、CDN 規則和明智的爬蟲管理策略,你仍然可以在保護內容與獲得 AI 曝光之間取得平衡。
參考來源:Search Engine Journal「OpenAI Says Robots.txt May Not Apply To ChatGPT’s Fetch Bot」,TollBit 2026上半年AI爬蟲狀態報告