¿Es fiable desbloquear 80 GB en la CMP 170HX? Riesgos y lista de compra para IA

La CMP 170HX puede desbloquear ciertos límites de cómputo, PCIe y HBM, pero sus modos de 40, 64 y 80 GB aún carecen de pruebas de estabilidad prolongadas.

La NVIDIA CMP 170HX ha vuelto a llamar la atención en el mercado de hardware de segunda mano. Según investigaciones de la comunidad, esta GPU GA100, creada originalmente para minar Ethereum, puede eliminar parte de sus restricciones de cómputo, PCIe y memoria HBM mediante vulnerabilidades del firmware y modificaciones físicas. Algunos vendedores han aprovechado el interés para subir los precios con frases como «80 GB de VRAM», «casi una A100» o «ideal para modelos locales».

Sin embargo, conseguir que el sistema muestre 80 GB no demuestra que los 80 GB sean estables a largo plazo. Eliminar límites tampoco convierte la tarjeta en una A100 barata. Quien quiera ejecutar modelos locales debería tratarla, por ahora, como hardware experimental y no como una GPU de producción madura.

Respuesta rápida

  • La CMP 170HX comparte la plataforma GA100 con la A100 y ofrece cerca de 1,5 TB/s de ancho de banda HBM2e, algo realmente atractivo para inferencia de IA sensible al ancho de banda.
  • Las investigaciones públicas y los proyectos comunitarios demuestran que no todas las restricciones originales son imposibles de eludir; existe margen para recuperar más capacidad FP32, FP16 y de otros formatos.
  • Los desbloqueos anunciados de 40, 64 u 80 GB todavía no cuentan con pruebas prolongadas, muestras amplias ni validación entre distintos lotes.
  • ECC, la generación y el ancho de PCIe, la refrigeración, la alimentación y el entorno de Linux pueden seguir siendo cuellos de botella reales.
  • Una captura de capacidad de nvidia-smi o un vídeo breve ejecutando un modelo no demuestra la estabilidad de toda la tarjeta.

Por eso, un comprador normal no debería decidir solo por el «precio por GB de VRAM». Sin devolución, pruebas completas de estrés y soporte técnico, el riesgo resulta cada vez menos razonable a medida que el precio se acerca al de una GPU de cómputo consolidada o una tarjeta de consumo más nueva.

Para qué se diseñó la CMP 170HX

La CMP 170HX se lanzó en 2021 como tarjeta dedicada a minería. Utiliza un núcleo GA100 y memoria HBM2e con unos 1.493 GB/s de ancho de banda, pero el número de núcleos CUDA, determinadas instrucciones de cómputo, PCIe y la capacidad disponible quedaron limitados de distintas maneras.

Estas tarjetas bajaron mucho de precio al terminar el auge de la minería. La expansión de los modelos locales volvió a hacer atractivo el gran ancho de banda: la inferencia suele estar limitada por la memoria, no solo por el rendimiento teórico de coma flotante. Por eso la comunidad retomó el estudio de la CMP 170HX.

Aun así, sigue siendo una tarjeta de minería. No ofrece salidas de vídeo GeForce, la comodidad de sus controladores para juegos ni una compatibilidad de software amplia. Antes de comprarla, conviene confirmar que el objetivo es investigar cómputo en Linux, no usar un escritorio cotidiano, jugar o montar una estación de IA lista para funcionar.

Qué abarca realmente el supuesto «desbloqueo»

Según las investigaciones de seguridad y los proyectos comunitarios citados por el artículo original, el trabajo actual se concentra sobre todo en estas áreas:

Área Avance comunicado por la comunidad Qué falta por verificar
Restricciones de cómputo Se pueden recuperar más capacidades FP16, FP32, FP64 y relacionadas Si distintos controladores, aplicaciones y cargas mantienen la misma estabilidad
Capacidad HBM Algunas tarjetas reconocen 40 o 64 GB, con demostraciones de hasta 80 GB Si las direcciones altas permanecen sin errores y los resultados son uniformes entre tarjetas
Velocidad PCIe La interfaz restringida puede elevarse a PCIe 2.0 La limitación física de PCIe 3.0 sigue sin resolverse
Carriles PCIe Añadir componentes ausentes podría cambiar x4 por x16 Requiere soldadura y conlleva riesgo de daños y reparaciones
ECC Aún no existe una solución madura y utilizable Falta protección de datos cuando se producen errores en HBM

Estos avances dan a la CMP 170HX un valor real para investigación, pero no permiten convertir «teóricamente desbloqueable» directamente en rendimiento sostenido. Cargar un modelo y generar unas decenas de Token no equivale a funcionar durante días, recargar modelos repetidamente o realizar inferencia con contextos largos sin errores.

Por qué una captura de 80 GB no basta para comprar

Que el sistema operativo reconozca la capacidad solo demuestra que se ha expuesto el espacio de direcciones. Lo importante es comprobar si todas las regiones siguen siendo correctas con temperaturas altas y accesos prolongados de gran ancho de banda.

Como mínimo, el vendedor debería aportar:

  1. Fotografías completas del modelo, PCB, módulos HBM y zonas modificadas.
  2. Salida de nvidia-smi, versión del controlador, distribución de Linux e información del kernel.
  3. Pruebas de lectura, escritura o estrés que cubran toda la memoria desbloqueada, no solo los primeros GB.
  4. Varias horas de carga continua con temperatura, consumo, frecuencia y registros de errores.
  5. Modelo utilizado, cuantización, longitud de contexto, velocidad de generación y consumo de memoria.
  6. Si hay que repetir el desbloqueo tras reiniciar y si continúa funcionando después de actualizar el controlador.

Si solo existe una captura de capacidad, un arranque correcto o un vídeo corto, debe considerarse una demostración, no una prueba de aceptación.

Qué otros límites afectan a los modelos locales

PCIe 2.0 puede ralentizar la carga y la comunicación entre GPU

En inferencia con una sola GPU, PCIe puede importar menos cuando todo el modelo ya está en HBM. Sin embargo, las cargas frecuentes, la descarga mixta CPU/GPU, el paralelismo tensorial entre tarjetas y las grandes transferencias sí pueden quedar limitados por PCIe.

Aunque se recuperen los carriles x16 mediante soldadura, la generación puede seguir en PCIe 2.0. Un sistema multi-GPU también debe comprobar la distribución de carriles de la placa, Above 4G Decoding y el soporte de grandes espacios de direcciones. Consulta cómo afecta Above 4G Decoding a varios dispositivos PCIe.

La ausencia de ECC aumenta el riesgo de una memoria grande

La utilidad de una gran HBM no consiste solo en que quepa el modelo: los resultados también deben ser fiables. Un error silencioso en una región desbloqueada puede producir salidas anómalas o corromper datos sin bloquear el programa.

Es el mismo criterio que se aplica al revisar ECC en GPU antiguas de centro de datos. La guía para comprobar errores ECC en una Tesla V100 explica por qué los contadores, las pruebas de estrés y los registros prolongados importan más que un único benchmark.

El software no está pensado para usuarios normales

La documentación pública actual se centra en Linux, configuración de controladores, investigación del firmware y modificaciones físicas. El propietario debe resolver por su cuenta la compatibilidad del controlador, las actualizaciones del kernel, los límites de potencia, la refrigeración, el bloque de agua o flujo de aire y las actualizaciones de las herramientas de desbloqueo.

Si el objetivo es ejecutar Ollama, llama.cpp o vLLM con estabilidad, las GPU de consumo y de centro de datos consolidadas suelen ahorrar tiempo. El menor precio de compra de la CMP 170HX puede desaparecer entre depuración, modificaciones y tiempo de inactividad.

Lista de comprobación para una compra usada

Antes de decidir, confirma cada punto:

  • Si el vendedor habla de capacidad original, desbloqueada o simplemente reconocida por el software.
  • Si se puede elegir el nivel de desbloqueo; no supongas que 80 GB serán más estables que 40 GB.
  • Si hay pruebas de toda la memoria, duración de la prueba y registros de errores.
  • Si se completó la modificación PCIe x16 y se pueden revisar las soldaduras y el origen de los componentes.
  • Qué versiones de controlador, kernel y herramienta se usaron y si el entorno es reproducible.
  • Si se limita la potencia y si el disipador, los ventiladores o el bloque de agua están incluidos.
  • Si puedes probarla en tu equipo y devolverla si falla.
  • Si el precio ya se acerca al de una alternativa con garantía.

No aceptes «funciona si sabes trastear», «sin devolución después de encender» o «solo se garantiza la capacidad detectada» como garantías de producción. Si el precio usado ya ha subido mucho, incluye en el cálculo el descuento por inestabilidad y el coste del soporte.

Para quién puede servir y para quién no

La CMP 170HX puede interesar a quien:

  • Tenga experiencia depurando Linux, CUDA, firmware y hardware de GPU.
  • Quiera investigar GA100, HBM o la reutilización de tarjetas de minería.
  • Pueda aceptar paradas, regresiones y reparaciones propias.
  • Pueda completar una prueba de estrés de toda la memoria antes de pagar.

No es adecuada para quien:

  • Necesite una estación de modelos locales lista para usar.
  • Dependa del escritorio de Windows, juegos o salidas de vídeo.
  • Necesite entrenamiento multi-GPU estable y protección ECC.
  • No pueda asumir el desgaste de una tarjeta minera, las soldaduras y la falta de servicio posventa.

Resumen

La investigación sobre la CMP 170HX devuelve valor de cómputo a una tarjeta GA100 limitada y ofrece un caso interesante de seguridad de hardware y reutilización de residuos electrónicos. Pero la pregunta importante no es «¿cuánto cuestan 80 GB de VRAM?», sino si la memoria desbloqueada es fiable, si el entorno se puede reproducir, si la modificación es segura y quién responde cuando aparecen errores.

Hasta que mejoren las pruebas prolongadas, ECC y la validación entre lotes, conviene tratarla como plataforma experimental. Si buscas ejecutar modelos locales con fiabilidad, compara el coste total, el tiempo de mantenimiento y las GPU alternativas, no solo la capacidad de memoria.

Referencias: