DeepSeek V4 no se puede entender de la misma manera que los modelos 7B y 32B normales. Las dos versiones anunciadas oficialmente son modelos MoE:
DeepSeek-V4-Pro: alrededor de 1,6T de parámetros totales, cada token activa alrededor de 49B de parámetros;DeepSeek-V4-Flash: Aproximadamente 284 mil millones de parámetros en total, cada token activa alrededor de 13 mil millones de parámetros.
“Pocos parámetros de activación” afectan principalmente la cantidad de cálculos de un solo paso, y no significa que solo necesite preparar la memoria de video para los parámetros de activación. Si en el enrutamiento intervienen todos los pesos, también es necesario almacenar todos los pesos expertos. Para una única tarjeta gráfica de consumo, la API oficial suele ser mucho más realista que una implementación local completa.
Separar hechos oficiales de estimaciones
Las notas de la versión oficial confirman el nombre del modelo, los parámetros generales, los parámetros de activación, el contexto y los cambios de API. El bajo volumen de bits a continuación es una estimación matemática, no un valor medido real de un archivo GGUF oficial, ni significa que la comunidad haya proporcionado un paquete de cuantificación que pueda ejecutarse directamente.
La fórmula peso-volumen más básica es:
La cuantificación
|
|
también aumentará la escala de agrupación, los metadatos y la sobrecarga de alineación; La inferencia también requiere caché KV, búfer de tiempo de ejecución y espacio de comunicación, por lo que la memoria real debe ser mayor que el peso nominal.
Tamaño teórico de los pesos
| Modelo | Parámetros totales | Valor teórico BF16 | Valor teórico de 8 bits | Valor teórico de 4 bits |
|---|---|---|---|---|
| V4 Pro | 1,6T | Aproximadamente 2,91 TiB | Aproximadamente 1,46 TiB | Aproximadamente 745 GiB |
| Flash V4 | 284B | Aproximadamente 529 GiB | Aproximadamente 264 GiB | Aproximadamente 132 GiB |
Estos números sólo responden “¿cuál es el peso mínimo?” Por ejemplo, el peso de 4 bits de Flash es teóricamente de unos 132 GiB. En la implementación real, se debe reservar espacio para metadatos cuantificados, caché KV y almacenamiento en búfer de back-end. Incluso si Pro es de 4 bits, ya se encuentra en la gama de servidores multimáquina o multitarjeta de alta gama.
Por qué el contexto consume memoria adicional
La caché KV está relacionada con los siguientes factores:
- Número de tokens de contexto;
- Número de solicitudes simultáneas y tamaño del lote;
- Tipo de datos de caché KV;
- Número de capas del modelo, estructura de atención e implementación del backend;
- Si se debe habilitar el almacenamiento en caché de prefijos u otras optimizaciones.
Por lo tanto, “soportar contexto 1M” no significa que la computadora local deba iniciarse con 1M, ni significa que la memoria de video permanezca sin cambios. La evaluación de la implementación debe comenzar con un contexto de 4K u 8K, simultaneidad única y aumentar y registrar picos.
¿Qué tipo de máquina vale la pena probar?
| Medio ambiente | Flash V4 | V4 Pro |
|---|---|---|
| Tarjeta única de 8 a 24 GB | No apto para peso completo | No apto |
| Estaciones de trabajo de 32 a 96 GB | Sólo se pueden considerar grandes descargas de CPU/RAM, velocidad desconocida | No apto |
| Más de 192GB de memoria unificada o múltiples tarjetas | Se pueden realizar experimentos cuantitativos y se requiere soporte de back-end real | Sigue siendo muy difícil |
| Servidor de alta memoria para varias máquinas | Depende del formato de peso y del marco de inferencia | Requiere una solución distribuida especializada |
“Se puede cargar” y “se puede usar de forma interactiva” son dos cosas diferentes. Una gran cantidad de descarga de CPU puede hacer que la velocidad del primer token y de generación sea tan lenta que no tenga ningún valor práctico.
Validación mínima usando API oficial
La descripción oficial de DeepSeek V4 proporciona llamadas compatibles con OpenAI Chat Completions. Primero guarde la clave en la variable de entorno y luego envíe la solicitud mínima:
|
|
debería devolver JSON en caso de éxito y ver el mensaje de ayuda en choices en la respuesta. Si se devuelve 401, verifique primero la clave; Si el modelo devuelto no existe, consulte la lista de modelos oficiales y no utilice el nombre del artículo anterior e inténtelo de nuevo.
El anuncio oficial señaló que los antiguos deepseek-chat y deepseek-reasoner ingresaron al proceso de migración después de que V4 se puso en línea. Los nombres de los modelos, los precios y las fechas de retiro están sujetos a cambios, y las configuraciones de producción deben estar sujetas a la documentación API actual.
Lista de verificación para el paquete de cuantificación local
Si el peso cuantificado V4 aparece en la comunidad en el futuro, al menos verifique:
- Si el flujo ascendente apunta al almacén de pesas oficial de DeepSeek;
- Si el expediente cubre todos los fragmentos y expertos;
- Si el algoritmo de cuantificación, los datos de calibración y el backend de inferencia se hacen públicos;
- ¿El backend admite claramente la arquitectura MoE y no solo puede leer el encabezado del archivo?
- ¿El resultado de la prueba indica GPU, CPU, RAM, contexto, concurrencia y tokens?
- Si el hash, la licencia y la fuente de descarga son verificables.
Cuando no hay archivos reales ni pruebas de back-end, solo puede publicar una “estimación de capacidad” y no puede escribir “Una determinada tarjeta gráfica puede ejecutarse de acuerdo con las pruebas reales”.
Confirmar qué se ha descargado realmente
Antes de hablar de V4 local, clasifica la descarga en cuatro categorías:
- Peso completo oficial;
- Nombre oficial del modelo API;
- Cuantificación o conversión de pesos por parte de terceros;
- Sólo modelos derivados no oficiales con nombres similares.
El nombre de la API no se puede utilizar para demostrar que los pesos han sido expuestos; ni un repositorio de Hugging Face puede probar que contiene la V4 completa basándose únicamente en el título. Si el archivo tiene solo unos pocos GB, lo más probable es que se trate de un adaptador, una configuración, un tokenizador, un índice o un fragmento incompleto.
Antes de descargar cientos de gigabytes de archivos, verifique la lista de archivos del repositorio y el tamaño total, y confirme que todos los números de fragmentos sean consecutivos.
Calcular el servidor mínimo desde los pesos
La planificación de capacidad no puede utilizar “la memoria de vídeo total es exactamente igual al peso” como solución. Tomando como ejemplo el valor teórico de 4 bits de V4 Flash de aproximadamente 132 GiB, también debes reservar:
- Escala de cuantificación, agrupación de información y metadatos;
- caché KV;
- contexto CUDA/ROCm;
- Activación y buffer de cálculo temporal;
- El marco de razonamiento está ocupado por sí mismo;
- Comunicación multitarjeta y margen de tolerancia a fallos.
La ingeniería a menudo requiere dejar un margen considerable en lugar de llevar cada tarjeta al 100%. La proporción específica debe ser confirmada por los registros reales del marco de destino.
La VRAM agregada es solo el primer requisito
Suponiendo que la memoria de video total de varias GPU puede acomodar Flash, aún debe confirmar:
- Si el marco admite el enrutamiento experto de V4;
- Si los pesos pueden dividirse razonablemente entre expertos o tensores;
- Si se utiliza NVLink, PCIe o red entre máquinas entre tarjetas;
- Si hay una tarjeta responsable de la incrustación adicional, las capas de salida o el almacenamiento en búfer;
- Si el enlace más lento retrasa toda la solicitud;
- Si los canales de alimentación, refrigeración y placa base de una sola máquina son suficientes.
Agregar memoria de video solo puede demostrar que la capacidad es posible, pero no puede probar que se puede iniciar el razonamiento, y mucho menos que la velocidad esté disponible.
Validar el servidor por etapas
Si realmente deseas estudiar V4 local, se recomienda dividir la aceptación en los siguientes niveles:
Nivel 1: Identificar la configuración
Lea solo el índice de configuración y peso y confirme que el marco actual puede reconocer el tipo de modelo, la cantidad de fragmentos, el tipo d y los parámetros expertos. No asigne todas las GPU en este momento.
Nivel 2: Cargar contexto breve
Comience con una única solicitud, el contexto más corto disponible. Registre el uso de memoria de cada GPU y host para confirmar que no haya un respaldo silencioso a la asignación de CPU o disco.
Nivel 3: Generar respuestas cortas fijas
Pruebe entre 32 y 64 tokens de salida con indicaciones deterministas, observando la latencia del primer token, la velocidad de generación, el registro de errores y la comunicación entre tarjetas.
Nivel 4: aumentar gradualmente el contexto
Crezca en 4K, 8K, 16K, no pruebe contextos extremos directamente. Reinicie cada vez y registre el valor máximo para excluir el impacto del caché anterior.
Nivel 5: aumentar la simultaneidad
Sólo la simultaneidad de prueba después de una única solicitud es estable. La simultaneidad cambia el almacenamiento en caché, la programación y el rendimiento, lo que potencialmente hace que las configuraciones estén disponibles para solicitudes únicas al instante OOM.
¿Qué datos se necesitan para una prueba real de varias tarjetas creíble?
Al menos públicamente:
|
|
Cuando faltan el archivo del modelo y la versión del marco, los números de velocidad no se pueden reproducir; cuando faltan el contexto y la concurrencia, los números de memoria no tienen sentido para comparar.
Pruebas de aceptación de la API oficial
Una vez que la solicitud mínima sea exitosa, también se deben verificar la latencia, el uso, el manejo de errores y el cambio de modelo.
PowerShell puede registrar la duración total de una solicitud:
El registro
|
|
usage puede ayudar a verificar la facturación de entrada, salida y caché; Los campos y precios específicos están sujetos a la documentación API oficial actual.
Migrar desde nombres de modelos antiguos
No se limite a reemplazar cadenas en los archivos de configuración. Para una verificación de migración completa:
- Si el nuevo nombre del modelo está disponible en la cuenta y región actuales;
- Si los parámetros de muestreo y aviso del sistema siguen siendo compatibles;
- Si el evento de respuesta de transmisión cambia;
- Si el cliente analiza correctamente la estructura de llamada de la herramienta;
- Si es necesario ajustar la salida máxima, el contexto y el tiempo de espera;
- Si todavía se conserva la entrada de retroceso del modelo antiguo.
Primero copie una solicitud de producción para realizar pruebas paralelas, compare la calidad de la respuesta, el retraso, el uso del token y la tasa de fallas, y luego cambie gradualmente el tráfico.
Los códigos de error deben procesarse en capas
| Fenómeno | Inspección prioritaria | Qué no hacer |
|---|---|---|
| 401 | Clave API, variables de entorno, encabezados de solicitud | Escriba la clave en el código fuente y pruébela repetidamente |
| 404/El modelo no existe | Lista de modelos oficiales actuales, URL base | Adivina varios nombres de modelos antiguos para realizar encuestas |
| 429 | Estrategias de limitación de velocidad, concurrencia y reintento | Reintentos infinitos sin intervalos |
| 5xx | Estado del servicio, ID de solicitud, retroceso | Cambie inmediatamente la solicitud a una estación de transferencia desconocida |
| Tiempo de espera | Longitud de entrada, límite superior de salida, tiempo de espera del cliente | Solo aumenta el tiempo de espera sin retraso en la grabación |
Límites de claves y datos
La clave API debe colocarse en una variable de entorno, un almacén de credenciales del sistema o un administrador de secretos de equipo. No lo escriba en Markdown, configuración de Git, JavaScript frontal ni comparta capturas de pantalla.
Antes de enviar datos de la empresa a la API de la nube, también debes aclarar:
- Qué campos contienen información personal o secretos comerciales;
- Si es necesaria la desensibilización;
- ¿El registro conservará el cuerpo de la solicitud o solo las métricas?
- Si los miembros del equipo comparten claves;
- Proceso de rotación y revocación tras fuga de claves.
Si su política de datos requiere desconectarse completamente, debe elegir un modelo abierto más pequeño que pueda implementarse de manera estable en el hardware existente, en lugar de pretender estar “en las instalaciones” con un intermediario externo opaco.
Cómo identificar promociones exageradas con una sola tarjeta
Las siguientes declaraciones requieren evidencia adicional:
- “49B activos, por lo que sólo se necesitan 49B de memoria de vídeo”;
- “4 bits es igual al parámetro total dividido directamente por dos”;
- “El contexto de 1M no aumenta la memoria de vídeo”;
- “La tarjeta única se cargó correctamente, por lo que puede funcionar sin problemas”;
- “Utiliza un modelo con el mismo nombre, por lo que debe ser un V4 oficial”;
- “La captura de pantalla muestra 20 GB y el uso es el modelo completo”.
Los informes confiables deben explicar si los pesos están completos, cuántas capas hay en la CPU, si se utiliza una API remota y cómo se mide la velocidad.
Cómo elegir entre API y modelo local
| Demanda | Dirección más adecuada |
|---|---|
| Acceso rápido a las capacidades V4 | API oficial |
| Concurrencia elástica | API oficial, con limitación de corriente y reintentos |
| Estrictamente fuera de línea | Modelo de peso abierto más pequeño y verificable |
| Investigación del marco de razonamiento | Experimento multitarjeta Flash V4 |
| El costo es estable y predecible | Comparación tras pruebas de estrés con tokens y tráfico reales |
| Servicio de intranet de latencia ultrabaja | Elija un modelo que pueda residir completamente en función del hardware local |
La selección debe basarse en tareas, límites de datos, latencia y costo total, en lugar de simplemente comparar cantidades de parámetros.
Recomendaciones prácticas
- Individuos y equipos de desarrollo en general: dar prioridad al uso de la API oficial;
- Los datos no pueden salir de la intranet: evalúe primero los modelos de peso abierto más pequeños en lugar de cargar V4 a la fuerza;
- Investigar el marco de razonamiento: comenzar con Flash, contexto breve, concurrencia única y registrar completamente el software y el hardware;
- Para ver la velocidad precisa de una sola tarjeta o la tabla de memoria: primero verifique si los archivos cuantitativos, los registros de backend y las configuraciones de prueba son públicos.