DeepSeek V4 local: memoria de Pro y Flash, hardware y elección de API

Guía basada en datos oficiales que separa parámetros totales y activos, tamaño teórico de pesos, memoria real, viabilidad multi-GPU y uso de la API para DeepSeek V4 Pro y Flash.

DeepSeek V4 no se puede entender de la misma manera que los modelos 7B y 32B normales. Las dos versiones anunciadas oficialmente son modelos MoE:

  • DeepSeek-V4-Pro: alrededor de 1,6T de parámetros totales, cada token activa alrededor de 49B de parámetros;
  • DeepSeek-V4-Flash: Aproximadamente 284 mil millones de parámetros en total, cada token activa alrededor de 13 mil millones de parámetros.

“Pocos parámetros de activación” afectan principalmente la cantidad de cálculos de un solo paso, y no significa que solo necesite preparar la memoria de video para los parámetros de activación. Si en el enrutamiento intervienen todos los pesos, también es necesario almacenar todos los pesos expertos. Para una única tarjeta gráfica de consumo, la API oficial suele ser mucho más realista que una implementación local completa.

Separar hechos oficiales de estimaciones

Las notas de la versión oficial confirman el nombre del modelo, los parámetros generales, los parámetros de activación, el contexto y los cambios de API. El bajo volumen de bits a continuación es una estimación matemática, no un valor medido real de un archivo GGUF oficial, ni significa que la comunidad haya proporcionado un paquete de cuantificación que pueda ejecutarse directamente.

La fórmula peso-volumen más básica es:

La cuantificación

1
权重体积(GiB)≈ 参数量 × 每参数位数 ÷ 8 ÷ 1024³

también aumentará la escala de agrupación, los metadatos y la sobrecarga de alineación; La inferencia también requiere caché KV, búfer de tiempo de ejecución y espacio de comunicación, por lo que la memoria real debe ser mayor que el peso nominal.

Tamaño teórico de los pesos

Modelo Parámetros totales Valor teórico BF16 Valor teórico de 8 bits Valor teórico de 4 bits
V4 Pro 1,6T Aproximadamente 2,91 TiB Aproximadamente 1,46 TiB Aproximadamente 745 GiB
Flash V4 284B Aproximadamente 529 GiB Aproximadamente 264 GiB Aproximadamente 132 GiB

Estos números sólo responden “¿cuál es el peso mínimo?” Por ejemplo, el peso de 4 bits de Flash es teóricamente de unos 132 GiB. En la implementación real, se debe reservar espacio para metadatos cuantificados, caché KV y almacenamiento en búfer de back-end. Incluso si Pro es de 4 bits, ya se encuentra en la gama de servidores multimáquina o multitarjeta de alta gama.

Por qué el contexto consume memoria adicional

La caché KV está relacionada con los siguientes factores:

  • Número de tokens de contexto;
  • Número de solicitudes simultáneas y tamaño del lote;
  • Tipo de datos de caché KV;
  • Número de capas del modelo, estructura de atención e implementación del backend;
  • Si se debe habilitar el almacenamiento en caché de prefijos u otras optimizaciones.

Por lo tanto, “soportar contexto 1M” no significa que la computadora local deba iniciarse con 1M, ni significa que la memoria de video permanezca sin cambios. La evaluación de la implementación debe comenzar con un contexto de 4K u 8K, simultaneidad única y aumentar y registrar picos.

¿Qué tipo de máquina vale la pena probar?

Medio ambiente Flash V4 V4 Pro
Tarjeta única de 8 a 24 GB No apto para peso completo No apto
Estaciones de trabajo de 32 a 96 GB Sólo se pueden considerar grandes descargas de CPU/RAM, velocidad desconocida No apto
Más de 192GB de memoria unificada o múltiples tarjetas Se pueden realizar experimentos cuantitativos y se requiere soporte de back-end real Sigue siendo muy difícil
Servidor de alta memoria para varias máquinas Depende del formato de peso y del marco de inferencia Requiere una solución distribuida especializada

“Se puede cargar” y “se puede usar de forma interactiva” son dos cosas diferentes. Una gran cantidad de descarga de CPU puede hacer que la velocidad del primer token y de generación sea tan lenta que no tenga ningún valor práctico.

Validación mínima usando API oficial

La descripción oficial de DeepSeek V4 proporciona llamadas compatibles con OpenAI Chat Completions. Primero guarde la clave en la variable de entorno y luego envíe la solicitud mínima:

1
2
3
4
5
$env:DEEPSEEK_API_KEY = "你的密钥"
curl.exe https://api.deepseek.com/chat/completions `
  -H "Authorization: Bearer $env:DEEPSEEK_API_KEY" `
  -H "Content-Type: application/json" `
  -d '{"model":"deepseek-v4-flash","messages":[{"role":"user","content":"只回复 OK"}]}'

debería devolver JSON en caso de éxito y ver el mensaje de ayuda en choices en la respuesta. Si se devuelve 401, verifique primero la clave; Si el modelo devuelto no existe, consulte la lista de modelos oficiales y no utilice el nombre del artículo anterior e inténtelo de nuevo.

El anuncio oficial señaló que los antiguos deepseek-chat y deepseek-reasoner ingresaron al proceso de migración después de que V4 se puso en línea. Los nombres de los modelos, los precios y las fechas de retiro están sujetos a cambios, y las configuraciones de producción deben estar sujetas a la documentación API actual.

Lista de verificación para el paquete de cuantificación local

Si el peso cuantificado V4 aparece en la comunidad en el futuro, al menos verifique:

  1. Si el flujo ascendente apunta al almacén de pesas oficial de DeepSeek;
  2. Si el expediente cubre todos los fragmentos y expertos;
  3. Si el algoritmo de cuantificación, los datos de calibración y el backend de inferencia se hacen públicos;
  4. ¿El backend admite claramente la arquitectura MoE y no solo puede leer el encabezado del archivo?
  5. ¿El resultado de la prueba indica GPU, CPU, RAM, contexto, concurrencia y tokens?
  6. Si el hash, la licencia y la fuente de descarga son verificables.

Cuando no hay archivos reales ni pruebas de back-end, solo puede publicar una “estimación de capacidad” y no puede escribir “Una determinada tarjeta gráfica puede ejecutarse de acuerdo con las pruebas reales”.

Confirmar qué se ha descargado realmente

Antes de hablar de V4 local, clasifica la descarga en cuatro categorías:

  1. Peso completo oficial;
  2. Nombre oficial del modelo API;
  3. Cuantificación o conversión de pesos por parte de terceros;
  4. Sólo modelos derivados no oficiales con nombres similares.

El nombre de la API no se puede utilizar para demostrar que los pesos han sido expuestos; ni un repositorio de Hugging Face puede probar que contiene la V4 completa basándose únicamente en el título. Si el archivo tiene solo unos pocos GB, lo más probable es que se trate de un adaptador, una configuración, un tokenizador, un índice o un fragmento incompleto.

Antes de descargar cientos de gigabytes de archivos, verifique la lista de archivos del repositorio y el tamaño total, y confirme que todos los números de fragmentos sean consecutivos.

Calcular el servidor mínimo desde los pesos

La planificación de capacidad no puede utilizar “la memoria de vídeo total es exactamente igual al peso” como solución. Tomando como ejemplo el valor teórico de 4 bits de V4 Flash de aproximadamente 132 GiB, también debes reservar:

  • Escala de cuantificación, agrupación de información y metadatos;
  • caché KV;
  • contexto CUDA/ROCm;
  • Activación y buffer de cálculo temporal;
  • El marco de razonamiento está ocupado por sí mismo;
  • Comunicación multitarjeta y margen de tolerancia a fallos.

La ingeniería a menudo requiere dejar un margen considerable en lugar de llevar cada tarjeta al 100%. La proporción específica debe ser confirmada por los registros reales del marco de destino.

La VRAM agregada es solo el primer requisito

Suponiendo que la memoria de video total de varias GPU puede acomodar Flash, aún debe confirmar:

  • Si el marco admite el enrutamiento experto de V4;
  • Si los pesos pueden dividirse razonablemente entre expertos o tensores;
  • Si se utiliza NVLink, PCIe o red entre máquinas entre tarjetas;
  • Si hay una tarjeta responsable de la incrustación adicional, las capas de salida o el almacenamiento en búfer;
  • Si el enlace más lento retrasa toda la solicitud;
  • Si los canales de alimentación, refrigeración y placa base de una sola máquina son suficientes.

Agregar memoria de video solo puede demostrar que la capacidad es posible, pero no puede probar que se puede iniciar el razonamiento, y mucho menos que la velocidad esté disponible.

Validar el servidor por etapas

Si realmente deseas estudiar V4 local, se recomienda dividir la aceptación en los siguientes niveles:

Nivel 1: Identificar la configuración

Lea solo el índice de configuración y peso y confirme que el marco actual puede reconocer el tipo de modelo, la cantidad de fragmentos, el tipo d y los parámetros expertos. No asigne todas las GPU en este momento.

Nivel 2: Cargar contexto breve

Comience con una única solicitud, el contexto más corto disponible. Registre el uso de memoria de cada GPU y host para confirmar que no haya un respaldo silencioso a la asignación de CPU o disco.

Nivel 3: Generar respuestas cortas fijas

Pruebe entre 32 y 64 tokens de salida con indicaciones deterministas, observando la latencia del primer token, la velocidad de generación, el registro de errores y la comunicación entre tarjetas.

Nivel 4: aumentar gradualmente el contexto

Crezca en 4K, 8K, 16K, no pruebe contextos extremos directamente. Reinicie cada vez y registre el valor máximo para excluir el impacto del caché anterior.

Nivel 5: aumentar la simultaneidad

Sólo la simultaneidad de prueba después de una única solicitud es estable. La simultaneidad cambia el almacenamiento en caché, la programación y el rendimiento, lo que potencialmente hace que las configuraciones estén disponibles para solicitudes únicas al instante OOM.

¿Qué datos se necesitan para una prueba real de varias tarjetas creíble?

Al menos públicamente:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
模型仓库与 commit:
权重格式与量化方法:
推理框架与 commit:
GPU 型号、数量、单卡显存:
CPU、系统内存、NUMA:
卡间连接与网络:
上下文、输入/输出 token:
并发与批大小:
每卡峰值显存:
首 token 延迟、tokens/s、总吞吐:
是否使用 CPU offload 或磁盘映射:

Cuando faltan el archivo del modelo y la versión del marco, los números de velocidad no se pueden reproducir; cuando faltan el contexto y la concurrencia, los números de memoria no tienen sentido para comparar.

Pruebas de aceptación de la API oficial

Una vez que la solicitud mínima sea exitosa, también se deben verificar la latencia, el uso, el manejo de errores y el cambio de modelo.

PowerShell puede registrar la duración total de una solicitud:

El registro

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
$headers = @{
  Authorization = "Bearer $env:DEEPSEEK_API_KEY"
  'Content-Type' = 'application/json'
}

$payload = @{
  model = 'deepseek-v4-flash'
  messages = @(
    @{ role = 'user'; content = '将这段日志归纳为三条排错建议。' }
  )
  temperature = 0
} | ConvertTo-Json -Depth 5

$elapsed = Measure-Command {
  $response = Invoke-RestMethod `
    -Uri 'https://api.deepseek.com/chat/completions' `
    -Method Post `
    -Headers $headers `
    -Body $payload
}

$elapsed.TotalSeconds
$response.usage
$response.choices[0].message.content

usage puede ayudar a verificar la facturación de entrada, salida y caché; Los campos y precios específicos están sujetos a la documentación API oficial actual.

Migrar desde nombres de modelos antiguos

No se limite a reemplazar cadenas en los archivos de configuración. Para una verificación de migración completa:

  • Si el nuevo nombre del modelo está disponible en la cuenta y región actuales;
  • Si los parámetros de muestreo y aviso del sistema siguen siendo compatibles;
  • Si el evento de respuesta de transmisión cambia;
  • Si el cliente analiza correctamente la estructura de llamada de la herramienta;
  • Si es necesario ajustar la salida máxima, el contexto y el tiempo de espera;
  • Si todavía se conserva la entrada de retroceso del modelo antiguo.

Primero copie una solicitud de producción para realizar pruebas paralelas, compare la calidad de la respuesta, el retraso, el uso del token y la tasa de fallas, y luego cambie gradualmente el tráfico.

Los códigos de error deben procesarse en capas

Fenómeno Inspección prioritaria Qué no hacer
401 Clave API, variables de entorno, encabezados de solicitud Escriba la clave en el código fuente y pruébela repetidamente
404/El modelo no existe Lista de modelos oficiales actuales, URL base Adivina varios nombres de modelos antiguos para realizar encuestas
429 Estrategias de limitación de velocidad, concurrencia y reintento Reintentos infinitos sin intervalos
5xx Estado del servicio, ID de solicitud, retroceso Cambie inmediatamente la solicitud a una estación de transferencia desconocida
Tiempo de espera Longitud de entrada, límite superior de salida, tiempo de espera del cliente Solo aumenta el tiempo de espera sin retraso en la grabación

Límites de claves y datos

La clave API debe colocarse en una variable de entorno, un almacén de credenciales del sistema o un administrador de secretos de equipo. No lo escriba en Markdown, configuración de Git, JavaScript frontal ni comparta capturas de pantalla.

Antes de enviar datos de la empresa a la API de la nube, también debes aclarar:

  • Qué campos contienen información personal o secretos comerciales;
  • Si es necesaria la desensibilización;
  • ¿El registro conservará el cuerpo de la solicitud o solo las métricas?
  • Si los miembros del equipo comparten claves;
  • Proceso de rotación y revocación tras fuga de claves.

Si su política de datos requiere desconectarse completamente, debe elegir un modelo abierto más pequeño que pueda implementarse de manera estable en el hardware existente, en lugar de pretender estar “en las instalaciones” con un intermediario externo opaco.

Cómo identificar promociones exageradas con una sola tarjeta

Las siguientes declaraciones requieren evidencia adicional:

  • “49B activos, por lo que sólo se necesitan 49B de memoria de vídeo”;
  • “4 bits es igual al parámetro total dividido directamente por dos”;
  • “El contexto de 1M no aumenta la memoria de vídeo”;
  • “La tarjeta única se cargó correctamente, por lo que puede funcionar sin problemas”;
  • “Utiliza un modelo con el mismo nombre, por lo que debe ser un V4 oficial”;
  • “La captura de pantalla muestra 20 GB y el uso es el modelo completo”.

Los informes confiables deben explicar si los pesos están completos, cuántas capas hay en la CPU, si se utiliza una API remota y cómo se mide la velocidad.

Cómo elegir entre API y modelo local

Demanda Dirección más adecuada
Acceso rápido a las capacidades V4 API oficial
Concurrencia elástica API oficial, con limitación de corriente y reintentos
Estrictamente fuera de línea Modelo de peso abierto más pequeño y verificable
Investigación del marco de razonamiento Experimento multitarjeta Flash V4
El costo es estable y predecible Comparación tras pruebas de estrés con tokens y tráfico reales
Servicio de intranet de latencia ultrabaja Elija un modelo que pueda residir completamente en función del hardware local

La selección debe basarse en tareas, límites de datos, latencia y costo total, en lugar de simplemente comparar cantidades de parámetros.

Recomendaciones prácticas

  • Individuos y equipos de desarrollo en general: dar prioridad al uso de la API oficial;
  • Los datos no pueden salir de la intranet: evalúe primero los modelos de peso abierto más pequeños en lugar de cargar V4 a la fuerza;
  • Investigar el marco de razonamiento: comenzar con Flash, contexto breve, concurrencia única y registrar completamente el software y el hardware;
  • Para ver la velocidad precisa de una sola tarjeta o la tabla de memoria: primero verifique si los archivos cuantitativos, los registros de backend y las configuraciones de prueba son públicos.

Referencias oficiales de DeepSeek