AI 與自動化

明天生效:Cloudflare 把 AI 爬蟲拆成三種,勾過「Block AI bots」的網站連 Googlebot 都會被擋

2026.09.14 · 63 次瀏覽
明天生效:Cloudflare 把 AI 爬蟲拆成三種,勾過「Block AI bots」的網站連 Googlebot 都會被擋

9 月 15 日新預設上路:Search 放行、Agent 與 Training 在廣告頁預設封鎖,多用途爬蟲一律採最嚴規則——對台灣中小企業來說,這不是保護,是把自己從 AI 索引裡刪掉

分享:

明天,2026 年 9 月 15 日,Cloudflare 會把 AI 爬蟲的預設值整個換掉。這個開關在 7 月 1 日的第二屆 Content Independence Day 就宣布了,第一手公告寫在 Cloudflare 官方部落格〈Your site, your rules〉:爬蟲被拆成 Search、Agent、Training 三類,在有顯示廣告的頁面上,Training 與 Agent 預設封鎖,Search 維持放行。真正會咬人的是不起眼的第二句——多用途爬蟲依所有行為判定,採最嚴規則。TechCrunch 當日報導確認,新預設涵蓋新客戶、既有客戶新增的網站,以及所有既有免費方案客戶。

這不是巧合。Cloudflare 共同創辦人 Matthew Prince 點名一個里程碑:網路上非人類流量首次超過人類,比預期早一年。爭執核心是爬取與回流的落差——以 2026 年 7 月下旬的 28 天視窗計,Anthropic 的 ClaudeBot 每送回一位訪客要爬約 2,237 頁,OpenAI 的 GPTBot 約 217 頁,Google 只要 4.6 頁;更難看的是超過五成的 AI 爬取花在重抓根本沒變動的頁面。2025 年 7 月的 Pay Per Crawl 是第一版收費嘗試,今年 7 月進化成 Pay Per Use:改按內容何時產生價值計費,首批夥伴是 Ceramic.ai 與 You.com

同一層的對手沒人走這條路。AWS WAF Bot Control 只分常見與針對性兩級,Akamai Bot Manager 與 DataDome 仍圍繞詐欺盜刷,Fastly 鎖在企業合約裡。沒人把爬蟲用途變成全網預設政策。Cloudflare 有底氣,是因為它守著全球約兩成的網站。2025 年 9 月推出的 Content Signals Policy 今年再加上第四個欄位 use,值域是 immediate、reference、full,把「能不能抓」延伸成「抓完可以留多少」。

台灣中小企業網站有很高比例掛在 Cloudflare 免費方案上,設定多半是幾年前順手勾的。如果你開過那個看起來很安全的 Block AI bots,明天之後它的效果不是保護,是讓你從 AI 索引裡消失。以下拆解改了什麼、誰會中招、24 小時內該做什麼。

事件細節:三個分類、一條最嚴規則、一個沒人注意的副作用

三個分類值得逐條看,每一類對應不同的商業後果。

  • Search:蒐集並建立索引,之後用來回答關於你的問題。網站主可預期換到轉介流量或補償,因此預設放行。
  • Agent:即時代替真人完成任務,包含 ChatGPT-User 這類 chat fetch bot 與驅動瀏覽器的 Gemini、Claude 代理,另一端有人在等。
  • Training:把內容吸進模型權重裡永久使用。

企業版另有 BotBase,把已知 bot 列成 11 種行為分類。但決定生死的是兩句話。第一,廣告頁預設改成擋 Training 與 Agent,理由是有廣告代表這頁寫給人看。第二,多用途爬蟲採最嚴規則,官方點名 Googlebot、Applebot、BingBot:只要你曾用新選單或舊版 Block AI bots 勾過封鎖 Training,這三隻明天起會一起被擋,而舊開關本身也在同日停用。每一類都有三種處置:全站封鎖、只在廣告頁封鎖、放行。

Verified 的意義也變了:以前 Verified 就放行,現在只代表可被歸類,進不進得來看你允許哪些類別。這對 Google 特別敏感——它有 Google-Extended 讓你退出 Gemini 與 Vertex 訓練,但 Googlebot 同時服務 Search、AI Overviews 與 AI Mode,不能拆。

三類讀者的立刻行動

品牌主/中小企業老闆

  • ☐ 今天就登入 Cloudflare,到 Security Settings 的 Configure AI bot policies 確認三類狀態並截圖。
  • ☐ 若目標是被 ChatGPT、Gemini、Perplexity 推薦,Search 與 Agent 都要放行,只考慮擋 Training。
  • ☐ 有掛 AdSense 的內容頁特別檢查,那是預設優先動手的區域。

行銷/SEO 操作者

  • ☐ 把 9 月 15 日標成分水嶺,對照 GA4 的 AI Assistant 管道與 Search Console 生成式 AI 報表,看兩週內曲線有沒有斷。
  • ☐ 用 robots.txt 的 Content Signals 四欄位表態,尤其 use=reference:允許索引摘錄但要回連。
  • ☐ 建立「本站允許哪隻 bot」的白名單文件,每次改版核對一次。

開發者/接案商

  • ☐ 從 nginx access log 或 Cloudflare Logpush 撈各 bot 的 User-Agent,算出每隻的 crawl-to-refer 比值。
  • ☐ 檢查客戶 CDN 設定是否覆蓋 staging 與子網域,災難常發生在沒人管的 blog 子站。
  • ☐ 用 Laravel scheduler 每日對 robots.txt 與 bot 設定做 diff,有變更就寄信告警。

AI 爬蟲控管工具比較表

選工具先問一件事:能不能把 Search、Agent、Training 分開設定。分不開,就只剩「全擋」或「全放」兩種爛選項,而這兩種對想被 AI 推薦的公司都是錯的。

方案能否分 Search/Agent/Training公開計價(依官方定價頁)適合誰
Cloudflare Free可,三類皆可獨立設定US$0單站 SMB、部落格
Cloudflare Pro/Business可,另有 Super Bot Fight Mode 與 Bot Analytics每域每月約 US$25/US$250有電商或表單的中型站
AWS WAF Bot Control否,只分 Common/Targeted每 web ACL 每月 US$10 + 每百萬請求 US$1 起已在 AWS 上的架構
DataDome否,主打詐欺與盜刷約每月 US$1,590 起高價值交易網站
自架 nginx/Laravel middleware可,但規則自己維護僅伺服器成本接案商與內部平台

他們不會告訴你的事

一、這不是中小企業的勝利,是分發稅。坐得上 Pay Per Use 談判桌的是有量體的出版商。月流量三千的台灣服務業官網,授權金是零,失去的 AI 曝光卻是實的。

二、擋 Agent 是最容易誤傷自己的一刀。Cloudflare 自己的定義就說了,Agent 的另一端有真人在等結果,那正是你最想要的高意圖流量。廣告頁預設擋 Agent 是為出版商的展示廣告模型設計,對靠詢價單吃飯的公司完全不成立。

三、Cloudflare 不是中立第三方。它同時是流量守門員、收費市集經營者與 AI 產品供應商;把用途分類變成全網預設,等於讓自己成為收費站。

不花 SaaS 訂閱:SMB 的三階段自救路線

  • 第一階段(今天到明天)|止血:登入 Cloudflare 確認三類設定;若目標是 AI 曝光,Search 與 Agent 放行、Training 自行決定,並在 Security settings 標記是否套用新預設。
  • 第二階段(第 1 週)|表態:在 robots.txt 補上 Content Signals 四欄位,常見組合是允許 search、關閉 ai-train、標記 use=reference,同一份宣告也涵蓋不走 Cloudflare 的子網域。零成本、跨平台、不綁廠商。
  • 第三階段(第 2 至 4 週)|量測:寫腳本每天解析 access log,統計 GPTBot、ClaudeBot、PerplexityBot、Googlebot 的請求數,對照 GA4 的 AI Assistant 管道工作階段數,算出自己的 crawl-to-refer 比值,才知道封鎖或放行是賺還是虧。

常見問題 FAQ

我沒有掛廣告,是不是就不受影響?

廣告頁只是優先動手的區域。跨全站生效的是「多用途爬蟲採最嚴規則」,只要勾過封鎖 Training,Googlebot、BingBot、Applebot 都會一起被擋。

擋掉 Training 會讓我不被 ChatGPT 引用嗎?

不一定,但風險很高。訓練與即時檢索理論上是兩條路徑,問題是不少模型商用同一隻爬蟲跑多種用途,最嚴判定的結果是連檢索也一起失去。

怎麼確認自己中不中招?

到 Security Settings 的 Configure AI bot policies 看三類狀態,再看舊版 Block AI bots 是否開啟。兩處都要看,舊開關的效果明天之後會被重新解釋。

SMB 有機會從 Pay Per Use 拿到錢嗎?

短期內幾乎不可能。首批夥伴只有 Ceramic.ai 與 You.com,門檻與量體都指向出版商,別為它犧牲現在的曝光。

我的觀點

我的判斷跟現在的輿論方向相反:對 99% 的台灣中小企業網站而言,封鎖 AI 爬蟲是負 ROI 的決定,未來 12 個月真正的風險不是內容被拿走,是預設值悄悄把你從 AI 索引裡刪掉。出版商賣的是內容本身,被摘走就沒了;你賣的是服務與交付,被引用一次遠比少爬十頁值錢。另一個不受歡迎的判斷:Pay Per Use 在 18 個月內不會讓任何 SMB 收到有意義的款項,Cloudflare 真正在賣的是可見度控制面板。

對 ScriptWalker 這種 Laravel + Flutter 團隊,機會在恐慌與無知之間,可包成兩個交付物:(一)AI 爬蟲健檢與治理——盤點 CDN 設定、robots.txt、Content Signals 與子網域,產出白名單文件,適合 3 到 20 站的集團客戶;(二)爬蟲流量儀表板——用 Laravel 解析 log 與 Logpush,逐 bot 對照 GA4 的 AI Assistant 管道,把 crawl-to-refer 做成月報。工具商賣開關,我們賣知道該怎麼扳。

資料來源

分享:
AI 與自動化 返回文章列表