圍繞 AI 基礎設施的探討,長期以來以算力為核心。由 WD 贊助的 IDC 白皮書《為規模化而設: HDD 在AI 時代的持久價值》(Built for Scale: The Enduring Role of HDDs in the AI Era)發現在受訪組織當中,AI 正在推動數據儲存需求出現結構性增長。各類組織正在產生更多數據,賦予數據更高的價值、延長數據留存時間,並更頻繁地將歷史數據重新上線,以支援新的 AI 工作負載。
由此形成一個持續複合增長的數據循環:AI 不僅需要數據,亦會提升已儲存數據的潛在價值。運算需求會因工作負載及投資週期而有所不同,但 AI 產生的數據卻會持續留存及不斷累積,令儲存容量、可存取性及成本效益正成為 AI 基礎設施設計中愈來愈重要的考量。
AI 正催生持續複合增長的數據循環
AI 正催生持續複合增長的數據循環,94.7% 的受訪組織表示,由於 AI 與生成式 AI 的普及應用,其儲存的資料量在過去 12 個月內持續增加。 61% 的受訪組織在過去一年因 AI 驅動而錄得 25% 或以上的數據增長;74% 預期未來三年數據量將增長 25% 或以上。85.4% 的受訪組織表示其數據湖容量在過去 12 個月持續擴大。59.4% 的受訪組織表示,AI 生成數據,包括合成數據、推理輸出及模型日誌,是推動數據湖容量增長的首要因素。
數據留存時間延長,活躍度及價值同步提升,近 95% 的受訪組織表示,採用 AI 及生成式 AI 後,其組織的數據價值有所提升。74.3% 的受訪組織表示, AI 及生成式 AI 令其延長數據留存時間。75.9% 的受訪組織表示,正將愈來愈多已封存的冷數據重新上線,以支援 AI 工作負載。96% 的受訪組織預計需要更快地擷取封存數據,以支援 AI 推理及檢索增強生成(RAG)應用。
AI 基礎設施必須按完整數據生命週期設計
受訪組織的企業數據中,有 74.6% 位於溫儲存層、低頻存取儲存層與冷儲存層。超過 60% 的數據湖容量由冷數據或低頻存取數據組成。98.2% 的受訪組織認為,每 TB 的總體擁有成本在儲存決策中屬重要或非常重要的考量。
WD 行政總裁 Irving Tan 表示:「在過去數年間,關於 AI 基礎設施的討論一直集中於運算能力。實際上,AI 的運作建基於數據。各類組織正在產生更多數據、延長數據留存時間,並探索從現有數據中創造價值的新方式。運算需求將隨時間演變,但各類組織對大規模儲存、管理及存取數據的需求只會持續增長。這項數據基礎將在決定 AI 未來發展潛力方面發揮關鍵作用。
從運算週期走向長期延續的數據生命週期
AI 工作負載在整個生命週期中均會產生數據,包括訓練數據集、模型檢查點、推理輸出、日誌及合成數據。與處理這些數據的運算週期不同,當中大部分數據在相關工作負載完成後仍會持續留存,並可成為未來 AI 應用的輸入數據。研究結果顯示,隨著各類組織延長數據留存時間,並從現有數據中發掘新用途,數據儲存需求正出現結構性增長。
研究亦顯示,活躍數據與封存數據之間的傳統界線正在改變。隨著歷史數據逐漸成為 AI 工作負載的重要輸入,曾經靜默封存的資料正重新進入活躍資料生命週期,亦改變組織對如何留存、管理及按需調用方式的預期。
AI 基礎設施是一套完整系統
這些轉變進一步凸顯了為完整 AI 數據生命週期構建儲存架構的必要性。隨著數據量增長、留存時間延長,以及歷史數據再次變得活躍,組織更加需要因應不同工作負載需求,平衡效能、容量、可存取性及成本效益。在 AI 規模化環境下,數據儲存的位置,以及儲存和存取相關數據所需的成本,正日益成為架構規劃的重要考量。
能否以具成本效益的方式大規模管理數據,已不再是基礎設施的次要考量,而是正逐漸成為決定 AI 成敗的關鍵因素。
