NVIDIA CMP 170HX 最近重新進入二手硬體市場的視野。社群研究稱,這張原本用於以太坊挖礦的 GA100 顯示卡,可以透過韌體安全漏洞和硬體改造解除部分運算、PCIe 與 HBM 顯示記憶體限制。部分賣家隨後開始用「80GB 顯示記憶體」「接近 A100」「適合本地大模型」等說法抬高售價。
但「能夠顯示 80GB」不等於「80GB 可以長期穩定使用」,參數解鎖也不等於拿到一張低價 A100。對於準備執行本地大模型的人,目前更合理的態度是把它視為研究硬體,而不是成熟的生產力顯示卡。
快速結論
- CMP 170HX 與 A100 同屬 GA100 平台,並擁有約 1.5TB/s 的 HBM2e 頻寬,確實適合頻寬敏感的 AI 推論任務。
- 公開研究和社群專案已經證明,原有限制並非全部無法繞過;FP32、FP16 等運算能力有進一步釋放的空間。
- 所謂 40GB、64GB 或 80GB 顯示記憶體解鎖仍缺少大樣本、長時間、跨批次的可靠性測試。
- ECC、PCIe 世代、通道寬度、散熱、供電和 Linux 軟體環境仍可能成為實際瓶頸。
- 如果賣家只展示
nvidia-smi容量截圖或短時間模型執行影片,不能證明整張卡穩定。
因此,一般使用者不應只按「每 GB 顯示記憶體價格」判斷是否值得購買。沒有退換保障、完整壓力測試和技術支援時,價格越接近成熟運算卡或新款遊戲卡,風險越不划算。
CMP 170HX 原本是什麼顯示卡
CMP 170HX 發布於 2021 年,定位是專用礦卡。它採用 GA100 核心和 HBM2e 顯示記憶體,頻寬約為 1493GB/s,但 CUDA 核心數量、運算指令、PCIe 和可用記憶體容量等能力受到不同程度限制。
這類硬體在礦潮結束後價格大幅下降。隨著本地大模型興起,高記憶體頻寬再次變得有吸引力:模型推論經常受記憶體頻寬限制,而不只是受理論浮點算力限制。CMP 170HX 因此成為社群重新研究的對象。
不過它仍是礦卡,不具備 GeForce 的顯示輸出、遊戲驅動體驗和廣泛軟體相容性。購買前要先確認自己的目標是 Linux 運算研究,而不是日常桌面、遊戲或即插即用的 AI 工作站。
這次所謂「破解」涉及哪些能力
根據來源文章引用的安全研究與社群專案,目前討論主要集中在以下方向:
| 項目 | 社群所稱進展 | 仍需確認的問題 |
|---|---|---|
| 運算限制 | FP16、FP32、FP64 等能力可進一步釋放 | 不同驅動程式、應用程式和負載是否一致穩定 |
| HBM 容量 | 部分卡可辨識 40GB、64GB,最高出現 80GB | 高位址記憶體是否持續無錯誤,不同卡片是否一致 |
| PCIe 速度 | 可從受限狀態提高到 PCIe 2.0 | PCIe 3.0 實體層限制仍未解決 |
| PCIe 通道 | 補齊元件後可能從 x4 改為 x16 | 需要焊接,存在硬體損壞和返修風險 |
| ECC | 暫未形成成熟可用方案 | HBM 出錯時缺少資料保護能力 |
這些進展說明 CMP 170HX 確實有研究價值,但不能把「理論上可解除限制」直接換算成穩定吞吐量。尤其是大模型載入成功、產生幾十個 Token,與連續執行數天、反覆載入模型、長上下文推論並不是同一種測試。
為什麼 80GB 容量截圖不能作為購買依據
記憶體容量被系統辨識,只能證明位址空間已經暴露。真正需要驗證的是所有記憶體區域能否在高溫、長時間和高頻寬讀寫下保持正確。
賣家至少應提供以下證據:
- 完整的顯示卡型號、PCB、HBM 顆粒和改造位置照片。
nvidia-smi、驅動程式版本、Linux 發行版和核心資訊。- 覆蓋全部已解鎖記憶體的讀寫或壓力測試,而不是只占用前幾 GB。
- 數小時以上的持續負載記錄,包括溫度、功耗、頻率和錯誤日誌。
- 實際模型、量化版本、上下文長度、產生速度和記憶體占用。
- 重新啟動後是否需要再次解鎖,驅動程式升級後是否仍可使用。
如果只能看到一張容量截圖、一次啟動成功或一段短影片,應把它視為示範,而不是驗收報告。
用於本地大模型還會遇到哪些瓶頸
PCIe 2.0 可能拖慢模型載入和多卡通訊
單卡推論在模型完全進入 HBM 後,PCIe 影響可能沒有記憶體頻寬明顯。但模型頻繁載入、CPU/GPU 混合卸載、多卡張量平行和大量資料傳輸都會受到 PCIe 限制。
即使透過焊接恢復 x16 通道,PCIe 世代仍可能停留在 2.0。多卡部署前還要檢查主機板的通道分配、Above 4G Decoding 和大位址空間支援,可參考 Above 4G Decoding 對多 PCIe 裝置的作用。
沒有 ECC 會放大大容量記憶體風險
大容量 HBM 的意義不只是裝得下模型,還要保證運算結果可信。若解鎖區域出現靜默錯誤,程式可能不會當機,卻產生異常輸出或損壞資料。
這與購買舊款資料中心卡時檢查 ECC 的思路相同。可以結合 Tesla V100 ECC 錯誤檢查方法 理解錯誤計數、壓力測試和長期日誌為什麼比一次跑分重要。
軟體環境並不面向一般使用者
目前公開社群資料主要圍繞 Linux、驅動程式設定、韌體研究和硬體改造。部署者需要自行處理驅動程式相容性、核心更新、功耗限制、散熱、水冷或風道,以及解鎖工具更新。
如果目標只是穩定執行 Ollama、llama.cpp 或 vLLM,成熟遊戲卡和資料中心卡通常更省時間。CMP 170HX 的低購入價可能被除錯、改造和停機成本抵消。
二手購買驗收清單
決定購買前,建議逐項確認:
- 賣家說明的是原始容量、已解鎖容量,還是只有軟體辨識容量。
- 解鎖檔位是否可以選擇,不要預設 80GB 一定比 40GB 穩定。
- 是否提供全容量記憶體測試、持續時間和錯誤日誌。
- 是否完成 PCIe x16 硬體改造,焊點和元件來源是否可追溯。
- 使用什麼驅動程式、核心和解鎖版本,環境能否重現。
- 是否限制功耗,散熱器、風扇或水冷是否包含在價格內。
- 是否允許在自己的主機上驗卡,是否支援故障退換。
- 價格是否已經接近有保固的替代顯示卡。
不要接受「會折騰就能用」「點亮不退」「只保證辨識容量」作為生產部署的保障。對於已經明顯上漲的二手價格,應把穩定性折價和售後成本一起算進去。
哪些人適合買,哪些人不適合
適合考慮 CMP 170HX 的人:
- 有 Linux、CUDA、韌體和顯示卡硬體除錯經驗;
- 希望研究 GA100、HBM 或礦卡再利用;
- 能接受停機、回復和自行維修;
- 可以在付款前完成全容量壓力測試。
不適合購買的人:
- 需要開機即用的本地大模型工作站;
- 依賴 Windows 桌面、遊戲或顯示輸出;
- 需要穩定的多卡訓練和 ECC 保障;
- 無法承擔礦卡壽命、焊接改造和無售後服務的風險。
總結
CMP 170HX 的解鎖研究讓一張受限制的 GA100 礦卡重新具備運算價值,也為硬體安全和電子廢棄物再利用提供了有趣案例。但現階段最值得關注的不是「80GB 顯示記憶體只賣多少錢」,而是解鎖區域是否可靠、軟體環境能否重現、硬體改造是否安全,以及出現錯誤後由誰負責。
在長期穩定性測試、ECC 與跨批次驗證完善之前,把它視為實驗平台更合適。若目的是穩定執行本地大模型,應優先比較整機成本、維護時間和替代顯示卡,而不是只比較記憶體容量。
參考資料: