CMP 170HX 解鎖 80GB 顯示記憶體可靠嗎?AI 礦卡購買風險與驗證清單

CMP 170HX 據稱可解除部分算力、PCIe 和 HBM 顯示記憶體限制,但 40GB、64GB、80GB 模式仍缺少長期穩定性驗證。本文整理技術邊界、購買風險與驗收清單。

NVIDIA CMP 170HX 最近重新進入二手硬體市場的視野。社群研究稱,這張原本用於以太坊挖礦的 GA100 顯示卡,可以透過韌體安全漏洞和硬體改造解除部分運算、PCIe 與 HBM 顯示記憶體限制。部分賣家隨後開始用「80GB 顯示記憶體」「接近 A100」「適合本地大模型」等說法抬高售價。

但「能夠顯示 80GB」不等於「80GB 可以長期穩定使用」,參數解鎖也不等於拿到一張低價 A100。對於準備執行本地大模型的人,目前更合理的態度是把它視為研究硬體,而不是成熟的生產力顯示卡。

快速結論

  • CMP 170HX 與 A100 同屬 GA100 平台,並擁有約 1.5TB/s 的 HBM2e 頻寬,確實適合頻寬敏感的 AI 推論任務。
  • 公開研究和社群專案已經證明,原有限制並非全部無法繞過;FP32、FP16 等運算能力有進一步釋放的空間。
  • 所謂 40GB、64GB 或 80GB 顯示記憶體解鎖仍缺少大樣本、長時間、跨批次的可靠性測試。
  • ECC、PCIe 世代、通道寬度、散熱、供電和 Linux 軟體環境仍可能成為實際瓶頸。
  • 如果賣家只展示 nvidia-smi 容量截圖或短時間模型執行影片,不能證明整張卡穩定。

因此,一般使用者不應只按「每 GB 顯示記憶體價格」判斷是否值得購買。沒有退換保障、完整壓力測試和技術支援時,價格越接近成熟運算卡或新款遊戲卡,風險越不划算。

CMP 170HX 原本是什麼顯示卡

CMP 170HX 發布於 2021 年,定位是專用礦卡。它採用 GA100 核心和 HBM2e 顯示記憶體,頻寬約為 1493GB/s,但 CUDA 核心數量、運算指令、PCIe 和可用記憶體容量等能力受到不同程度限制。

這類硬體在礦潮結束後價格大幅下降。隨著本地大模型興起,高記憶體頻寬再次變得有吸引力:模型推論經常受記憶體頻寬限制,而不只是受理論浮點算力限制。CMP 170HX 因此成為社群重新研究的對象。

不過它仍是礦卡,不具備 GeForce 的顯示輸出、遊戲驅動體驗和廣泛軟體相容性。購買前要先確認自己的目標是 Linux 運算研究,而不是日常桌面、遊戲或即插即用的 AI 工作站。

這次所謂「破解」涉及哪些能力

根據來源文章引用的安全研究與社群專案,目前討論主要集中在以下方向:

項目 社群所稱進展 仍需確認的問題
運算限制 FP16、FP32、FP64 等能力可進一步釋放 不同驅動程式、應用程式和負載是否一致穩定
HBM 容量 部分卡可辨識 40GB、64GB,最高出現 80GB 高位址記憶體是否持續無錯誤,不同卡片是否一致
PCIe 速度 可從受限狀態提高到 PCIe 2.0 PCIe 3.0 實體層限制仍未解決
PCIe 通道 補齊元件後可能從 x4 改為 x16 需要焊接,存在硬體損壞和返修風險
ECC 暫未形成成熟可用方案 HBM 出錯時缺少資料保護能力

這些進展說明 CMP 170HX 確實有研究價值,但不能把「理論上可解除限制」直接換算成穩定吞吐量。尤其是大模型載入成功、產生幾十個 Token,與連續執行數天、反覆載入模型、長上下文推論並不是同一種測試。

為什麼 80GB 容量截圖不能作為購買依據

記憶體容量被系統辨識,只能證明位址空間已經暴露。真正需要驗證的是所有記憶體區域能否在高溫、長時間和高頻寬讀寫下保持正確。

賣家至少應提供以下證據:

  1. 完整的顯示卡型號、PCB、HBM 顆粒和改造位置照片。
  2. nvidia-smi、驅動程式版本、Linux 發行版和核心資訊。
  3. 覆蓋全部已解鎖記憶體的讀寫或壓力測試,而不是只占用前幾 GB。
  4. 數小時以上的持續負載記錄,包括溫度、功耗、頻率和錯誤日誌。
  5. 實際模型、量化版本、上下文長度、產生速度和記憶體占用。
  6. 重新啟動後是否需要再次解鎖,驅動程式升級後是否仍可使用。

如果只能看到一張容量截圖、一次啟動成功或一段短影片,應把它視為示範,而不是驗收報告。

用於本地大模型還會遇到哪些瓶頸

PCIe 2.0 可能拖慢模型載入和多卡通訊

單卡推論在模型完全進入 HBM 後,PCIe 影響可能沒有記憶體頻寬明顯。但模型頻繁載入、CPU/GPU 混合卸載、多卡張量平行和大量資料傳輸都會受到 PCIe 限制。

即使透過焊接恢復 x16 通道,PCIe 世代仍可能停留在 2.0。多卡部署前還要檢查主機板的通道分配、Above 4G Decoding 和大位址空間支援,可參考 Above 4G Decoding 對多 PCIe 裝置的作用

沒有 ECC 會放大大容量記憶體風險

大容量 HBM 的意義不只是裝得下模型,還要保證運算結果可信。若解鎖區域出現靜默錯誤,程式可能不會當機,卻產生異常輸出或損壞資料。

這與購買舊款資料中心卡時檢查 ECC 的思路相同。可以結合 Tesla V100 ECC 錯誤檢查方法 理解錯誤計數、壓力測試和長期日誌為什麼比一次跑分重要。

軟體環境並不面向一般使用者

目前公開社群資料主要圍繞 Linux、驅動程式設定、韌體研究和硬體改造。部署者需要自行處理驅動程式相容性、核心更新、功耗限制、散熱、水冷或風道,以及解鎖工具更新。

如果目標只是穩定執行 Ollama、llama.cpp 或 vLLM,成熟遊戲卡和資料中心卡通常更省時間。CMP 170HX 的低購入價可能被除錯、改造和停機成本抵消。

二手購買驗收清單

決定購買前,建議逐項確認:

  • 賣家說明的是原始容量、已解鎖容量,還是只有軟體辨識容量。
  • 解鎖檔位是否可以選擇,不要預設 80GB 一定比 40GB 穩定。
  • 是否提供全容量記憶體測試、持續時間和錯誤日誌。
  • 是否完成 PCIe x16 硬體改造,焊點和元件來源是否可追溯。
  • 使用什麼驅動程式、核心和解鎖版本,環境能否重現。
  • 是否限制功耗,散熱器、風扇或水冷是否包含在價格內。
  • 是否允許在自己的主機上驗卡,是否支援故障退換。
  • 價格是否已經接近有保固的替代顯示卡。

不要接受「會折騰就能用」「點亮不退」「只保證辨識容量」作為生產部署的保障。對於已經明顯上漲的二手價格,應把穩定性折價和售後成本一起算進去。

哪些人適合買,哪些人不適合

適合考慮 CMP 170HX 的人:

  • 有 Linux、CUDA、韌體和顯示卡硬體除錯經驗;
  • 希望研究 GA100、HBM 或礦卡再利用;
  • 能接受停機、回復和自行維修;
  • 可以在付款前完成全容量壓力測試。

不適合購買的人:

  • 需要開機即用的本地大模型工作站;
  • 依賴 Windows 桌面、遊戲或顯示輸出;
  • 需要穩定的多卡訓練和 ECC 保障;
  • 無法承擔礦卡壽命、焊接改造和無售後服務的風險。

總結

CMP 170HX 的解鎖研究讓一張受限制的 GA100 礦卡重新具備運算價值,也為硬體安全和電子廢棄物再利用提供了有趣案例。但現階段最值得關注的不是「80GB 顯示記憶體只賣多少錢」,而是解鎖區域是否可靠、軟體環境能否重現、硬體改造是否安全,以及出現錯誤後由誰負責。

在長期穩定性測試、ECC 與跨批次驗證完善之前,把它視為實驗平台更合適。若目的是穩定執行本地大模型,應優先比較整機成本、維護時間和替代顯示卡,而不是只比較記憶體容量。

參考資料: