Technology

開源社群出手:AMD GPU 推論加速的秘密武器,正在繞過 CUDA 高牆

阿爾法塔 (Alpha Tower)August 26, 20265 min read
開源社群出手:AMD GPU 推論加速的秘密武器,正在繞過 CUDA 高牆

一組名為 Netra Kernel 的開源 AMDGCN 核心程式登上 Hacker News,直指 AMD 顯卡執行 LLM 推論的最大痛點——軟體生態。這不是單一專案的勝利,而是「去 CUDA 化」浪潮的最新訊號,對深耕 GPU 供應鏈的台灣而言,意義遠超過一場社群技術秀。

一組放在 GitHub 上的開源核心程式,為什麼值得供應鏈高層認真看待?

2026 年 8 月下旬,名為 Netra Kernel 的開源專案登上 Hacker News,主打為 AMD GCN 架構 GPU 打造 LLM 推論最佳化的低階運算核心(https://github.com/NetraRuntime/netra-kernel)。表面看,這只是又一個開源專案。但放在 NVIDIA 市占超過八成的 AI 加速器市場裡看,這是社群正在用最底層的方式,拆 CUDA 護城河的磚。

關鍵1:推論戰場,才是 AMD 的真正機會

LLM 推論與訓練的需求結構完全不同。訓練需要數千張卡協同作戰,軟體成熟度門檻極高,這是 NVIDIA 的主場。推論則是分散式、單機可跑、對成本極度敏感,正好是 AMD 便宜顯卡與遊戲 PC 閒置算力可以切入的縫隙。

同週 Reddit 上的討論就是明證:有人提出能否像當年 SETI@home 一樣,動員全球遊戲 PC 與實驗室的分散算力來訓練開源模型(https://www.reddit.com/r/LocalLLM/comments/1vvqe1s/could_we_train_open_source_llms_like_setihome/)。該討論也點出核心難題:分散式反向傳播的通訊開銷,讓閒置 GPU 難以用在訓練上。推論沒有這個包袱。

關鍵2:手寫 AMDGCN 核心,補的是 ROCm 最大的洞

AMDGCN 是 AMD GPU 的指令集架構。社群直接手寫這一層的推論核心,等於繞過 ROCm 生態相容性不足的老問題——不需要等 AMD 官方把每個模型都調好,開發者自己下到指令集層級榨效能。這種做法的意義在於:它證明「生態系缺陷」可以被第三方補,AMD 硬體性價比的優勢才有兌現的通道。

對照同期的開源動態更能看出趨勢:NVIDIA 開源了 110 億參數的全雙工語音對話模型 NemotronLabs VoiceChat,號稱約 448 毫秒的流暢輪替延遲、可支援打斷式對話(https://www.reddit.com/r/unsloth/comments/1vtktfu/nvidia_releases_nemotronlabs_voicechat_11b_an/,數據為發文者轉述)。硬體霸權者持續用開源模型綁生態,挑戰者則用開源核心鬆動硬體綁定。開源變成雙向武器。

關鍵3:開源的另一面——供應鏈信任的暗面

但開源不等於可信。同日 Hacker News 上另一篇文章警告,開源模型可能藏有「定時發作」的後門(https://morgin.ai/articles/your-open-source-model-could-have-a-hidden-time-release-backdoor.html)。當企業把開源權重與開源核心直接部署到自家機房,供應鏈安全就多了一層無法用傳統資安掃描覆蓋的風險。而 debloat.dev 這類「去蕪存菁開源替代品」目錄的走紅(https://debloat.dev/),反映的正是社群對軟體供應鏈日趨謹慎的集體情緒。

台灣的鏡子:賣鏟人不能只押一家挖礦者

對台灣讀者,這條新聞的重量在於:無論 CUDA 高牆何時鬆動,算力需求都會落到晶圓代工、先進封裝與記憶體上——差別只在訂單來自哪一家。AMD 推論生態若因社群力量而補齊短板,受惠的不只 AMD,而是整條非 NVIDIA 陣營的硬體鏈。反之,若 CUDA 鎖定依舊,算力集中在單一客戶的風險也會繼續集中。

社群工程師正在寫的,不只是幾支核心程式,而是 AI 算力市場的第二種劇本。這個劇本會不會上演,接下來一年 ROCm 社群專案的星星數,或許比任何法說會都誠實。

Related Stories