長期以來,GPU讀取資料必須通過CPU進行調度,這種宿主模式在處理AI推理產生的大量512位元組微小請求時,會造成嚴重的微秒級延遲。
雖然之前的GPUDirect Storage(GDS)實現了資料鏈路的CPU繞過,但指令控制仍需CPU參與,使得系統在小粒度讀寫任務中提前觸發性能瓶頸、IO資源率先耗盡。

此次推出的SCADA技術徹底解決了這一難題,SCADA允許GPU直接發起儲存I/O請求,管理NVMe硬碟的佇列深度,實測資料顯示,在處理資料分析任務時,SCADA的速度是CPU觸發模式的5.3倍,而硬體成本最高可降低21.7倍。
在美光展示的參考設計中,使用3顆H100顯示卡成功驅動了44塊PCIe Gen6 SSD,實現了驚人的2.3億次隨機讀IOPS。這意味著單台伺服器的儲存吞吐達到了118GB/s,且負責調度的單顆CPU在整個過程中幾乎處於空閒狀態。

同時針對AI推理中KV快取頻繁產生的小資料讀寫,輝達正式推出Storage-Next產業聯盟計畫,重點最佳化512位元組磁區的讀寫表現,以解決傳統硬碟在4KB磁區下造成的8倍讀取放大問題。
該構想最早在2025年GTC大會提出,目前聯盟成員已超40家快閃記憶體與儲存廠商,包含DDN、鎧俠、美光,還有儲存控製器企業、散熱廠商以及標準化組織,各方將共同制定一套新標準:當GPU取代CPU成為儲存訪問主體時,固態硬碟應當如何適配運行。
硬體層面上,為承載cuFile開源生態與SCADA全新儲存架構的落地,輝達打造了新一代基於Vera BlueField-4儲存處理器的STX架構系統,並計畫在2026年下半年正式推出商用整機。

雖然目前英特爾也已加入開源組織並參與程式碼維護,標誌著傳統CPU主導IO調度的格局被顛覆,cuFile與SCADA也從輝達私有技術,升級為全行業通用開源標準,有效改善了跨平台相容性。
但該技術的規模化普及仍受兩大核心條件制約,一是STX+SCADA新架構的跨硬體、跨平台適配最佳化進度。二是美光、三星等廠商能否針對512位元組小包場景完成主控與韌體的底層重寫。
這兩點最終決定了這套新一代AI儲存架構的商用普及節奏。




























































































