Cloudflare, Inc.(NYSE: NET)推出全新的「負責任」AI網絡爬蟲標籤。為配合此措施,Cloudflare同步推出「禁止AI訓練」(Disallow AI Training)設定,讓網站即使拒絕其內容被用作AI訓練,仍可繼續完整出現在搜尋結果中。數月前,Cloudflare表示網站擁有人應擁有真正控制權,以決定AI如何使用其內容;並列出爬蟲營運商若欲持續存取網站須符合的條件。
Apple、Google和Microsoft已獲標示為「負責任」等級,並已證明符合相關標準,或已承諾在指定期限內達成要求。至於其他混合型爬蟲,若網站擁有人啟用「禁止AI訓練」,其存取權限將被封鎖。
混合型爬蟲佔爬蟲流量的36.6%
近三十年來,網站與網絡爬蟲之間一直遵循一項簡單原則:爬蟲存取網站內容,並為網站帶來流量。然而,AI改變了這個模式。集搜尋索引與AI訓練於一身的混合型爬蟲,如今佔Cloudflare網絡已驗證爬蟲流量的36.6%,成為最大類別。大多數網站仍然希望被搜尋引擎發現。只有不足1%的網站封鎖搜尋爬蟲,但有17%限制AI訓練用途。過往若要拒絕AI訓練,往往意味放棄那些缺乏相應控制機制的爬蟲所帶來的搜尋流量。
混合型爬蟲曾是AI訓練問題中最棘手的部分。接下來的挑戰是AI摘要功能:被Cloudflare列為「負責任」的營運商,都必須讓網站擁有人選擇退出AI摘要機制。目前,此類設定仍需逐間平台處理,且只有「允許」或「拒絕」兩個選項。Cloudflare的目標是在明年初之前,讓網站擁有人透過單一平台,統一管理內容被摘要引用的程度。
全新的控制選項與推薦設定
Cloudflare正將其「封鎖AI機器人」的功能拆分為三項獨立控制功能:一個用於搜尋,一個用於AI訓練,一個用於AI代理。未來,新加入Cloudflare的網站將根據其商業模式獲得相應的建議設定。投放廣告的網站:允許搜尋爬取,禁止AI訓練,並在包含廣告的頁面上阻止AI代理存取。其他網站:允許搜尋、AI訓練和AI代理存取,與大多數不依賴廣告收入的網站現有運作方式一致。
同時,Cloudflare將以「機械人偏好同步」功能取代現有的「Managed Robots.txt」。網站管理員只需設定一次爬取偏好,系統便可自動套用至所有支援的爬蟲。客戶亦可隨時輕鬆修改相關設定及偏好。
建立負責任的AI爬取機制
Cloudflare為負責任及透明的AI爬取行為制定明確標準,當中亦涵蓋混合型爬蟲。營運商必須符合相關標準,或承諾在指定期限內達成以下四項要求:提供清晰機制,允許網站擁有人透過robots.txt或同等標準退出AI訓練;允許網站擁有人選擇退出AI生成的搜尋摘要;提供URL級別的透明度,讓網站擁有人了解其內容如何被用於搜尋及AI訓練;公開確認選擇退出AI訓練不會影響網站在傳統搜尋中的排名。
Apple、Google及Microsoft已展示其符合上述標準。例如,Google提供Google-Extended控制機制,讓網站可拒絕AI訓練,同時不影響其在Google Search的可見性。今年稍早,Google亦推出多項新工具,協助網站擁有人應對AI融入搜尋所帶來的轉變。其他領先AI公司則將搜尋與訓練用途分開,使用不同爬蟲。因此,Cloudflare可以在不影響搜尋流量的情況下封鎖其AI訓練爬蟲,並將相關爬蟲列為「負責任」類別。Cloudflare已於Cl
