若把AI比作工業時代的電力,那麼強大的算力設施與高效的數據傳輸網絡,就是新時代的「超級發電廠」與「特高壓輸電網」。對於正在爆發的大模型應用而言,如何讓成千上萬張計算卡協同工作,以及如何讓海量數據在不同城市間瞬間抵達,是決定發展速度的兩大瓶頸。中國相繼披露了兩項針對這兩大瓶頸的關鍵突破。
中國國家級工程「未來網絡試驗設施」十二月三日在南京正式運行,解決了數據傳輸速度與穩定性的問題。負責人劉韻潔示範將遠在貴州的「中國天眼」所產生的七十二TB天文數據,傳輸到一千公里外的華中科技大學。在傳統互聯網環境下,傳輸同等規模的數據可能耗時六百九十九天,但新通道僅需一點六小時。
這不僅變得更快,更變得「更穩」。該系統被設計成一種「確定性網絡」,像是為數據開闢一條專屬高鐵線路,而傳統互聯網則像隨時會塞車的普通公路。測試顯示,即使在網絡模擬擁塞的情況下,新通道仍能保持高速穩定,而舊通道的網速迅速崩潰。這對於需要跨越城市進行大模型訓練至關重要,避免因網絡延遲導致訓練週期從幾天拉長到幾個月。
算力集成的難題也在十二月十八日迎來新進展。中科曙光在崑山發布了名為scaleX的萬卡超集群,這是能讓超過一萬張AI加速卡協同作戰的超級系統。要讓一萬張高性能芯片聚在一起工作,散熱和通信是挑戰。中科曙光採用高密度液冷技術,將六百四十張卡集成在一個機櫃內,讓冷卻液直接降溫,大幅降低耗能。更關鍵的是,它建立了一套高速內部通信網絡,能讓這些計算卡之間的延遲低於一微秒。無論是訓練千億參數的大模型,還是處理複雜的科學計算,系統都能像只有單一大腦般高效運轉,且資源利用率提高了百分之五十五。
