9月30日(週三),中國AI公司 DeepSeek 通過官方微信公衆號宣佈,與華爲聯合開發了一套面向昇騰(Ascend)AI 芯片的編程工具包,並以開源形式免費發佈。據路透社報道,這套工具包括高級編程語言 TileLang,以及 DeepGEMM、FlashMLA、TileKernel、DeepSelect、DeepEP 等計算與通信庫。
這套工具專門針對華爲昇騰 950 芯片優化,還支持把最多 128 顆加速器連成"超節點"(supernode)的組網方案。DeepSeek 表示,華爲在整個開發過程中提供了全面的技術支持。彭博社記者 Luz Ding 援引的消息稱,雙方的合作深度超出外界預期。
值得注意的是,DeepSeek 還在內蒙古建設一座大型數據中心,規劃部署超過 16 萬顆華爲昇騰處理器。與此同時,DeepSeek 正在完成一輪融資,估值約 740 億美元,並傳出可能 IPO 的消息。
DeepSeek 的官方口徑毫不含糊:目標是打造"新一代獨立自主、可控的 GPU 軟件生態"。公司稱,TileLang 提供"比 CUDA 更簡單的編程模型","建立一門通用、易編程、又能發揮硬件全部性能的高級語言,是第一要務"。
有意思的細節是,DeepSeek 並非從零開始:它先在英偉達的平臺上驗證了 TileLang 的思路,如今其 V4 模型訓練中的大部分計算操作都用 TileLang 完成。昇騰版本則封裝了華爲芯片的底層指令,讓開發者可以用高級語言編程,同時不損失性能。
兩週前,華爲剛剛發佈了新一代昇騰處理器和超節點計算系統,預計到 2027 年成爲 AI 模型訓練的主流選擇。軟件工具包的發佈,正好卡在這個硬件換代的時間點上。
爲什麼軟件比芯片更重要?因爲英偉達真正的護城河不是芯片,而是 CUDA——這套編程生態已經統治 AI 開發十多年。開發者用 CUDA 寫的代碼,天然就被鎖定在英偉達硬件上;競爭對手哪怕造出性能相當的芯片,沒有順手的軟件工具,開發者也不會遷移。
這正是華爲昇騰一直以來的短板:硬件參數不差,但軟件生態跟不上,開發者用腳投票。DeepSeek 這次開源的工具包,每一個組件都對應它此前爲英偉達芯片發佈過的同類工具,兩套一一對應——等於把開發者在英偉達生態裏熟悉的那套工作流,原樣搬到了昇騰上。
更大的背景是美國的芯片出口管制。先進製程被卡之後,中國公司只能把賭注壓在國產替代上。DeepSeek 此前就以"用更少的算力訓出更好的模型"聞名全球,這次它把省算力的本事,打包成了別人也能用的工具。
直接受衝擊的是英偉達的軟件鎖定。CUDA 的網絡效應一旦鬆動,英偉達"硬件+軟件"的雙重收費模式就少了一條腿。短期內英偉達的財務數據不會有感覺——它的財報剛創下歷史紀錄,但長期看,中國這個全球最大的 AI 芯片增量市場,正在系統性地"去英偉達化"。
對華爲來說,這是昇騰生態最關鍵的一塊拼圖。芯片賣得動的前提是有人願意爲它寫代碼,DeepSeek 帶來的不僅是工具,還有它作爲頂級 AI 實驗室的示範效應。
對開發者而言,多一個免費、開源、可用的選項總是好事。尤其在中國市場,用昇騰做訓練的合規與供應鏈風險,遠低於想方設法搞英偉達芯片。
接下來有三件事值得盯。第一是採用率:工具開源了,但開發者買不買賬,要看未來幾個季度昇騰平臺上的實際項目數量。第二是內蒙古數據中心:16 萬顆昇騰處理器的部署規模如果兌現,將是中國本土算力最大的一次集中亮相,也是對這套軟件棧的終極壓力測試。第三是 DeepSeek 的 IPO:740 億美元估值能否落地,取決於市場相不相信"中國版 CUDA"這個故事。
英偉達當然不會坐視。它的回應大概率是加速 CUDA 本身的開放與降價——護城河被攻擊時,加深護城河是最常見的打法。這場圍繞"開發者用哪套工具寫 AI"的戰爭,纔剛剛開場。
讀者評論