網誌 / 趨勢
Cloudflare 9 月 15 日的改動:檢查一下你有沒有在攔住 AI 爬蟲
2026 年 9 月 15 日,Cloudflare 會改動 AI 爬蟲的預設處理方式,並淘汰舊版「Block AI bots」開關。新網域的廣告頁面會預設攔截 Training 與 Agent 類機器人。至於仍在用舊開關的現有客戶,會發現它連身兼搜尋與訓練兩職的爬蟲也開始一併攔下,Cloudflare 說當中包括 Googlebot、Applebot 與 Bingbot。如果你從未檢查過自己的 CDN 向 AI 爬蟲提供了什麼,這個月就是該看的時候。
我寫這一篇有個私人理由。今年夏天較早前,我發現這個網站——通篇講的就是「如何讓 AI 找到你」——一直在向外送出一份由平台代管的 robots.txt,叫 GPTBot、ClaudeBot 和 Google-Extended 走開。那不是我設的,是平台的預設,而我從來沒想過要去查一查。修好用了十五分鐘。不知道這件事,代價遠高於十五分鐘。
具體改什麼?
Cloudflare 在 2026 年 7 月 1 日宣布,把爬蟲控制分成三類:Search、Agent、Training。那些控制現時對所有客戶(包括免費帳戶)都已生效。有日期的那項改動,是預設值。
由 9 月 15 日起,用 Cloudflare 自己的說法:「對所有新加入 Cloudflare 的網域,Training 與 Agent 類別將在顯示廣告的頁面上被預設攔截,而 Search 維持預設允許。」這比不少評論所暗示的窄得多。它適用於新網域,不是每一個現存的免費網站,而且只針對有廣告的頁面。
影響面更廣的,是舊控制的退場。Cloudflare 同日淘汰舊版「Block AI bots」設定,由那日起,爬蟲只要身兼多職,任何「攔截訓練」的設定都會連它一併攔下。Cloudflare 特別點名 Googlebot、Applebot 與 Bingbot 屬混合用途爬蟲。如果你的網站仍然用着那個舊開關,它的行為會在你毫不知情之下變樣。
這對 AI 能見度為何重要?
因為引擎從來讀不到的內容,不可能用來砌答案並引用你。
ACM SIGIR 2026 接納了一篇同儕評審論文,分析 11,500 條實時查詢,結論是「攔截 Google AI 爬蟲的網站,明顯較少被 AI Overviews 取用,即使能取得那些內容」。那是觀察性研究,所以顯示的是關聯而非已證實的因果,論文也沒有給出任何搶眼的百分比。但一盤生意想讓人找得到,單看這個方向已經夠清楚,足以據此行事。
同一份研究發現,51.5% 的查詢都出現 AI Overviews,而砌出那些答案的來源,跟下面的自然搜尋結果幾乎沒有重疊。換句話說,AI 答案取用什麼,並不是照抄下面的排名。那是另一條檢索路徑,有另一套規則,而存取權限是其中第一條。
誰該放行這些爬蟲?
這是一條真正的商業決定,不應該由某個預設意外替你答了。
出版商靠讀者落到頁面、看見廣告、願意留下來賺錢,要限制訓練類爬蟲,確實有道理。Cloudflare 那個廣告頁面預設,正是因為這群人提出要求才存在。如果內容本身就是產品,保護它站得住腳。
一家專業服務公司、B2B 軟件公司、企業服務供應商或金融科技公司,面對的問題幾乎相反。沒有人因為讀了你的網誌、覺得排版舒服,就買一份法律服務。他們肯買,是因為問助理「香港有誰做這類工作」的時候,答案報出了你的名字。那些頁面瀏覽量本來就沒有替你變現,為了保住它而攔走砌答案的爬蟲,這筆帳明顯划不來。在那些答案中缺席的代價不會在儀表板上跌給你看,只會變成一批從未上門的查詢。
最尷尬的是中間那一批:根本從未做過這個選擇的生意。直到七月,這個網站也是這樣。這種情況比想像中普遍,因為相關設定藏在基建那一層——市場部很少打開,IT 也很少會把它跟開發客源扯上關係。
這改變了技術 GEO 的什麼
多年來,搜尋能見度的技術層主要關乎「能被爬取」與「夠快」。AI 時代多了一層:准不准爬。而這一層,愈來愈多由平台的預設決定,不再由網站擁有者自己選。
這帶來兩個後果。第一,「我們 2024 年做過技術 SEO」已經不夠了,因為 CDN 在 2026 年改一次政策,你一行程式碼都不用動,能見度所倚賴的存取權就這樣沒了。第二,任何人向你推銷 AI 能見度,都應該在賣內容之前先檢查這一項。內容重新編排得再漂亮、再方便引用,門一關上,也不過是花大錢買隱形。
這個檢查其實很簡單:打開你實時的 robots.txt,看清楚它向 AI 爬蟲交出了什麼——不是看你程式庫裏那份檔案寫了什麼——再確認 CDN 目前放行哪幾類爬蟲。這個網站的兩個答案,曾經一連幾個星期對不上。趁 9 月替你決定之前,值得先知道你那邊指向哪一邊。
如果你寧願讓別人來看,我做的審計正是由這一項開始,因為門一關上,再怎樣為引用鋪路都是白費。
常見問題
9 月 15 日改什麼? 兩件事。新加入的網域,廣告頁面預設攔截 Training 與 Agent 機器人,Search 仍允許。另外,混合用途爬蟲會被任何攔截訓練的設定一併攔住,包括同日淘汰的舊版「Block AI bots」開關;Cloudflare 點名 Googlebot、Applebot 與 Bingbot。
現有網站會突然被攔嗎? 不會因那個廣告頁面預設,它只適用於新網域。但若你在用舊版「Block AI bots」,它的行為會改變,而它即將消失。主動轉到新的三分控制。
攔住 AI 爬蟲為何傷害能見度? 一篇 SIGIR 2026 論文發現,攔截 Google AI 爬蟲的網站明顯較少被 AI Overviews 取用,即使內容可取得。那是關聯而非已證實因果,亦無附百分比,但方向一致。
該攔還是該放行? 取決於你的內容是產品,還是店面。出版商有理由限制訓練爬蟲;想被助理推薦的公司通常沒有。真正的錯誤,是讓一個你從未讀過的預設替你決定。
常見問題
> Cloudflare 在 2026 年 9 月 15 日改什麼?
兩件事。對新加入 Cloudflare 的網域,Training 與 Agent 類別的機器人會在顯示廣告的頁面上被預設攔截,而 Search 類別維持預設允許。另外一件——這件會影響現有客戶——是同時服務搜尋與訓練用途的混合爬蟲,將被任何「攔截訓練」的設定一併攔住,包括舊版的「Block AI bots」開關,而該開關同日起停用。Cloudflare 點名的混合用途爬蟲包括 Googlebot、Applebot 與 Bingbot。
> 這是否代表我現有的網站會突然被攔?
不會因為那個「廣告頁面預設」而被攔,該預設只適用於新加入 Cloudflare 的網域。但如果你本來就在用舊版「Block AI bots」設定,那個設定的行為會改變,而且它正在被淘汰。任何依賴它的人,都應該主動轉到新的 Search、Agent、Training 三分控制,而不是讓一次淘汰替你決定。
> 攔住 AI 爬蟲為什麼會傷害能見度?
一篇獲 SIGIR 2026 接納的同儕評審論文發現,攔截 Google AI 爬蟲的網站,明顯較少被 AI Overviews 取用,即使 AI Overviews 本來能取得那些內容。那是關聯而非已證實的因果,論文也沒有附上百分比,但方向已經夠清楚:攔還是不攔,應該由你自己拍板,而不是某個預設替你造成的意外。
> 我應該攔還是應該放行?
取決於你的內容是什麼。收入依賴讀者落在頁面上的出版商,確實有理由限制訓練類爬蟲。而一家專業服務公司或 B2B 企業,想在買家問助理「該找誰」時成為那個被點名的答案,攔截通常是在跟自己作對。真正的錯誤不是選錯哪一邊,而是根本沒有選,讓基建替你悄悄選了。