Meta 大規模 AI Storage 架構解析:Scale 與效能優化策略

文章摘要

Meta 致力解決 AI 訓練中的儲存瓶頸,優化其大規模儲存架構以提升 GPU 使用率與研究效率。核心架構 Tectonic 為具備水平擴充能力的基礎區塊層,結合糾刪碼技術與多層次儲存(HDD 與 Flash),透過智慧資料分層管理 I/O。現階段訓練技術正由傳統 NFS 檔案系統轉向 BLOB 儲存介面,以統一存取大規模資料湖。

此舉旨在克服現代 AI 工作負載對「資料飢渴」的特性,特別是高吞吐量需求與不規則 I/O 模式。當大規模 GPU 叢集進行同步訓練時,單一儲存延遲即會引發連鎖反應,導致全體運算停滯。透過優化 BLOB 儲存的低延遲與高輸送表現,Meta 確保 GPU 在預取資料時不因 I/O 等待而閒置,進而提升訓練速度與降低計算成本。該架構服務於 Meta 全球業務,目標使用者涵蓋內部 AI 研究團隊與工程部門。儘管該架構具高度擴充性,但在地理分散的 GPU 環境下,跨區域資料移動仍可能受限於網路頻寬與傳輸速度,影響研究迭代效率。此技術演進對於縮短前沿模型研發週期及提升硬體利用率具有關鍵重要性。

AI 大叔解析

【新聞懶人包】
Meta 為了解決AI模型訓練時GPU頻繁卡頓的問題,全面檢討並重塑其大規模BLOB儲存架構。核心原因在於舊有設計中,多層級的metadata查詢與資料代理(data proxy)造成數百毫秒的I/O延遲,導致耗資巨大的GPU長時間閒置。Meta的新架構,透過簡化metadata查找至O(1)複雜度,並讓客戶端SDK直接從底層Tectonic系統串流資料,大幅降低了延遲、提升GPU利用率,並加速AI研究迭代速度,同時有效控制了電力成本,以應對「data hungry」的現代AI工作負載。

【主戰場】
算力與基礎設施

【真正主訊號】
名稱:Meta 重塑 AI 儲存架構以解決 GPU 效能瓶頸
證據等級:A★★★★★
原因:AI工作負載對儲存的低延遲與高吞吐要求,導致傳統儲存架構成為GPU停滯的主因,直接影響算力利用率和研發時程。Meta的改造針對核心I/O問題,提升了昂貴算力資源的實際效益。

【以前卡哪?現在卡哪?】
* **以前卡在:**
1. **高延遲的Metadata查詢:** 多層級、具狀態(stateful)的BLOB儲存架構,metadata查找需經過Name、Volumes、Container等多層,查詢延遲可達數百毫秒,尤其跨區域時更明顯。
2. **資料代理開銷:** API伺服器作為資料代理從Tectonic層轉發資料給客戶端,增加了額外處理環節與延遲。
3. **架構設計未符AI需求:** 舊架構是為傳統網頁應用和HDD(硬碟)存取模式設計,無法滿足AI工作負載對毫秒級Flash(快閃記憶體)存取、突發性高吞吐及可預測峰值延遲(pMax latencies)的需求。
* **現在換卡哪:**
1. **單次Lookup的Metadata Store:** 新設計的metadata store,實現O(1)查找每塊資料(per chunk),大幅降低查詢延遲。
2. **客戶端直接串流:** 客戶端SDK內嵌Tectonic BlockClient,可直接從底層Tectonic系統串流資料,完全移除資料代理層的開銷。
3. **統一且高效的BLOB儲存介面:** 從NFS-like FileSystem介面遷移到現代BLOB儲存介面,統一存取大規模資料湖,並專注於最大化GPU利用率。

【真正關鍵】
名稱:高延遲的metadata存取與資料代理造成的I/O瓶頸
原因:舊有架構的metadata查找需經過多個有狀態的層級,導致延遲累積,加上資料代理轉發的額外負荷,造成GPU頻繁停滯,影響整體AI訓練效率與電力消耗。

【另外兩個重點】
1. **AI工作負載的獨特挑戰:** 現代AI工作負載具有高吞吐、突發性強、需要穩定低延遲(predictable and bounded pMax latencies)等特性,這與傳統web應用模式截然不同,使得既有儲存架構難以適應。
2. **分散式與巨量資料的研發痛點:** 隨著GPU佈局日益「geo-distributed」(地理分佈)且資料集規模龐大,研究人員耗費大量時間在跨區域資料擷取與移動上,降低了研究迭代速度(research velocity)。

【毒舌吐槽】
搞半天,這些頂尖科技公司所謂的「演進」,說穿了就是把以前層層疊疊、為了舊應用堆出來的「技術債」給還掉,尤其像這種metadata lookup慢得像蝸牛,data proxy在那邊當二房東收租金拖累速度的設計,早就該改了啦。新聞裡也承認「storage bottlenecks continue to be one of the primary contributors to GPU stalls」,這根本是「Infra Bottleneck」的經典案例。說什麼最大化GPU利用率跟研究速度,不就是被這些I/O瓶頸搞到幾十萬顆GPU都在發呆、研發人員都在等資料傳輸?還說「eliminating the data proxy, we also stay within budget for the power footprint」,嘿,如果GPU都被storage stall住,那電費不是白燒嗎?早點把架構搞好,省下的電費跟時間才是真正的成本效益,這哪是創新,根本是亡羊補牢。

【為什麼重要?】
* **系統影響:**
* **效能與穩定性:** 透過消除多層級metadata查詢和資料代理,大幅降低了I/O延遲,特別是對AI這種要求「可預測且有界限的pMax latencies」(峰值延遲)的工作負載。客戶端SDK直接從Tectonic獲取資料,減少了中間環節,提高了資料存取效率,確保昂貴的GPU能持續獲得資料處理,降低「GPU stalls」(GPU卡頓)的發生,直接提升了整個AI訓練Pipeline的效率。
* **架構簡化與統一:** 從複雜、多層次的舊架構轉向新的O(1) metadata store與直接資料串流,這不僅簡化了儲存堆棧,也推動了大規模資料湖的「統一儲存存取」。這有助於降低系統維運的複雜度與人力成本,並為未來更多元、更龐大的AI應用打下堅實基礎。
* **全球協作效率:** 在GPU「geo-distributed」(地理分佈)且資料集「massive」(巨量)的趨勢下,降低跨區域資料移動和擷取的時間,直接提升了全球各地研究團隊的協同開發速度與「research velocity」,不再讓資料傳輸成為AI研究進程的瓶頸。
* **成本或能力變化:**
* **營運成本降低:** 減少GPU閒置時間,直接提升了數十萬顆昂貴GPU硬體的利用率。新聞中提到GPU每兩年效能約三倍,但儲存和互連成長較慢,導致GPU等待資料成為開支大宗。這次優化,降低了因I/O瓶頸造成的「expenditures」(開支),並透過消除資料代理來「stay within budget for the power footprint」(維持在電力預算內),實質上減少了電費支出與閒置算力成本。
* **研發能力增強:** 加速AI模型訓練和研究迭代速度。從原本「幾個月」才能發布新模型縮短到「幾週」,表示Meta能更快地推出新的AI模型或產品功能,搶佔市場先機,進而提升競爭力與商業價值。
* **苦主與爽主:**
* 苦主:過去被I/O瓶頸拖累的Meta內部AI研究員與開發者(因「spend a significant amount of time ingesting and moving data across regions」),以及因GPU閒置導致算力浪費的營運部門。
* 爽主:Meta的AI部門與整體業務(因AI產品能更快開發部署、模型訓練效率提升),以及最終能體驗到更快、更智能產品的Meta平台使用者。

【實戰建議】
全面盤點現有AI/ML訓練與推論基礎設施的I/O性能瓶頸,特別是儲存系統的metadata存取延遲與資料傳輸路徑,並優先處理這些「Infra Bottleneck」。
對象:所有依賴大規模GPU算力進行AI/ML開發的大型科技公司或企業。

【一句話總結】
Meta藉由重構其AI儲存架構,解決了長期困擾GPU的I/O瓶頸,確保昂貴算力資源不再空轉,大幅加速了AI模型開發與研究進程。