NVIDIA CMP 170HX 最近重新进入二手硬件市场的视野。社区研究称,这张原本用于以太坊挖矿的 GA100 显卡,可以通过固件安全漏洞和硬件改造解除部分计算、PCIe 与 HBM 显存限制。部分卖家随后开始用“80GB 显存”“接近 A100”“适合本地大模型”等说法抬高售价。
但“能够显示 80GB”不等于“80GB 可以长期稳定使用”,参数解锁也不等于拿到一张低价 A100。对于准备运行本地大模型的人,当前更合理的态度是把它看成研究硬件,而不是成熟的生产力显卡。
快速结论
- CMP 170HX 与 A100 同属 GA100 平台,并拥有约 1.5TB/s 的 HBM2e 带宽,这确实适合带宽敏感的 AI 推理任务。
- 公开研究和社区项目已经证明,原有限制并非全部不可绕过;FP32、FP16 等计算能力有进一步释放的空间。
- 所谓 40GB、64GB 或 80GB 显存解锁仍缺少大样本、长时间、跨批次的可靠性测试。
- ECC、PCIe 代际、通道宽度、散热、供电和 Linux 软件环境仍可能成为实际瓶颈。
- 如果卖家只展示
nvidia-smi容量截图或短时间模型运行视频,不能证明整卡稳定。
因此,普通用户不应仅按“每 GB 显存价格”判断是否值得购买。没有退换保障、完整压力测试和技术支持时,价格越接近成熟计算卡或新款游戏卡,风险越不划算。
CMP 170HX 原本是什么显卡
CMP 170HX 发布于 2021 年,定位是专用挖矿卡。它采用 GA100 核心和 HBM2e 显存,显存带宽约为 1493GB/s,但 CUDA 核心数量、计算指令、PCIe 和显存容量等能力受到不同程度限制。
这类硬件在矿潮结束后价格大幅下降。随着本地大模型兴起,高显存带宽再次变得有吸引力:模型推理经常受显存带宽限制,而不是单纯受理论浮点算力限制。CMP 170HX 因此成为社区重新研究的对象。
不过它仍是矿卡,不具备 GeForce 的显示输出、游戏驱动体验和广泛软件兼容性。购买前要先确认自己的目标是 Linux 计算研究,而不是日常桌面、游戏或即插即用的 AI 工作站。
这次所谓“破解”涉及哪些能力
根据来源文章引用的安全研究与社区项目,目前讨论主要集中在以下方向:
| 项目 | 社区所称进展 | 仍需确认的问题 |
|---|---|---|
| 计算限制 | FP16、FP32、FP64 等能力可进一步释放 | 不同驱动、程序和负载是否一致稳定 |
| HBM 容量 | 部分卡可识别 40GB、64GB,最高出现 80GB | 高地址显存是否持续无错误,卡与卡之间是否一致 |
| PCIe 速度 | 可从受限状态提高到 PCIe 2.0 | PCIe 3.0 物理层限制仍未解决 |
| PCIe 通道 | 补齐元件后可能从 x4 改为 x16 | 需要焊接,存在硬件损坏和返修风险 |
| ECC | 暂未形成成熟可用方案 | HBM 出错时缺少数据保护能力 |
这些进展说明 CMP 170HX 确实有研究价值,但不能把“理论上可解除限制”直接换算成稳定吞吐量。尤其是大模型加载成功、生成几十个 Token,与连续运行数天、反复装卸模型、长上下文推理并不是同一种测试。
为什么 80GB 容量截图不能作为购买依据
显存容量被系统识别,只能证明地址空间已经暴露。真正需要验证的是所有显存区域能否在高温、长时间和高带宽读写下保持正确。
卖家至少应提供以下证据:
- 完整的显卡型号、PCB、HBM 颗粒和改造位置照片。
nvidia-smi、驱动版本、Linux 发行版和内核信息。- 覆盖全部已解锁显存的读写或压力测试,而不是只占用前几 GB。
- 数小时以上的持续负载记录,包括温度、功耗、频率和错误日志。
- 实际模型、量化版本、上下文长度、生成速度和显存占用。
- 重启后是否需要重新解锁,驱动升级后是否仍可使用。
如果只能看到一张容量截图、一次启动成功或一段短视频,应把它当作演示,而不是验收报告。
用于本地大模型还会遇到哪些瓶颈
PCIe 2.0 可能拖慢模型装载和多卡通信
单卡推理在模型完全进入 HBM 后,PCIe 影响可能没有显存带宽明显。但模型频繁装载、CPU/GPU 混合卸载、多卡张量并行和大批量数据传输都会受到 PCIe 限制。
即使通过焊接恢复 x16 通道,PCIe 代际仍可能停留在 2.0。多卡部署前还要检查主板的通道分配、Above 4G Decoding 和大地址空间支持,可参考 Above 4G Decoding 对多 PCIe 设备的作用。
没有 ECC 会放大大容量显存风险
大容量 HBM 的意义不仅是装得下模型,还要保证计算结果可信。若解锁区域出现静默错误,程序可能不崩溃,却产生异常输出或损坏数据。
这与购买老款数据中心卡时检查 ECC 的思路相同。可以结合 Tesla V100 ECC 错误检查方法 理解错误计数、压力测试和长期日志为什么比一次跑分重要。
软件环境并不面向普通用户
目前公开社区资料主要围绕 Linux、驱动配置、固件研究和硬件改造。部署者需要能够自行处理驱动兼容、内核更新、功耗限制、散热、水冷或风道,以及解锁工具更新。
如果目标只是稳定运行 Ollama、llama.cpp 或 vLLM,成熟游戏卡和数据中心卡通常更省时间。CMP 170HX 的低购入价可能被调试、改造和停机成本抵消。
二手购买验收清单
决定购买前,建议逐项确认:
- 卖家说明的是原始容量、已解锁容量,还是仅有软件识别容量。
- 解锁档位是否可以选择,不要默认 80GB 一定比 40GB 稳定。
- 是否提供全容量显存测试、持续时间和错误日志。
- 是否完成 PCIe x16 硬件改造,焊点和元件来源是否可追溯。
- 使用什么驱动、内核和解锁版本,环境能否复现。
- 是否限制功耗,散热器、风扇或水冷是否包含在价格内。
- 是否允许在自己的主机上验卡,是否支持故障退换。
- 价格是否已经接近带保修的替代显卡。
不要接受“会折腾就能用”“点亮不退”“只保证识别容量”作为生产部署的保障。对于已经明显上涨的二手价格,应把稳定性折价和售后成本一起算进去。
哪些人适合买,哪些人不适合
适合考虑 CMP 170HX 的人:
- 有 Linux、CUDA、固件和显卡硬件调试经验;
- 希望研究 GA100、HBM 或矿卡再利用;
- 能接受停机、回退和自行维修;
- 可以在付款前完成全容量压力测试。
不适合购买的人:
- 需要开机即用的本地大模型工作站;
- 依赖 Windows 桌面、游戏或显示输出;
- 需要稳定的多卡训练和 ECC 保障;
- 无法承担矿卡寿命、焊接改造和无售后的风险。
总结
CMP 170HX 的解锁研究让一张被限制的 GA100 矿卡重新具备计算价值,也为硬件安全和电子废物再利用提供了有趣案例。但现阶段最值得关注的不是“80GB 显存只卖多少钱”,而是解锁区域是否可靠、软件环境能否复现、硬件改造是否安全,以及出现错误后由谁负责。
在长期稳定性测试、ECC 与跨批次验证完善之前,把它当作实验平台更合适。若目的是稳定运行本地大模型,应优先比较整机成本、维护时间和可替代显卡,而不是只比较显存容量。
参考资料: