Mejores LLM locales para RTX 3060 12 GB: cuantización, contexto y pruebas

Cómo elegir y medir modelos GGUF de 7B, 8B y 12B en una RTX 3060 de 12 GB con Ollama, llama.cpp, nvidia-smi, presupuestos reales de VRAM y recuperación de fallos.

Esta recomendación se basa en Desktop RTX 3060 12GB. NVIDIA también tiene un modelo RTX 3060 de 8 GB, y el consumo de energía, la disipación de calor y la memoria de video de la versión portátil también son diferentes; Si tu tarjeta no es de 12GB, las conclusiones de este artículo no se pueden aplicar directamente.

El rango más cómodo para 12 GB de VRAM suele ser la cuantificación Q4/Q5 de los modelos 7B–9B. Puedes probar Q4 para modelos de nivel 12B, pero necesitas controlar el contexto; Los modelos más grandes de 20B y 32B a menudo requieren descargar la CPU y poder cargarla no significa una buena experiencia.

Confirma el hardware primero

La salida

1
nvidia-smi --query-gpu=name,memory.total,driver_version --format=csv

debe mostrar claramente el nombre de la GPU, la memoria de video total y el controlador. Si es la versión de 8GB, dé prioridad a 7B/8B Q4 y acorte el contexto.

Nivel recomendado

Gol Dirección del modelo Punto de partida cuantitativo recomendado Descripción
General chino, código Modelo de instrucción de nivel Qwen 7B/8B Q4_K_M o Q5_K_M El más equilibrado en 12GB
universal en ingles Modelo de comando Llama nivel 8B Q4_K_M o Q5_K_M Utiliza tarjeta modelo oficial con GGUF de confianza
Razonamiento ligero Nivel de destilación DeepSeek 7B/8B Q4_K_M “Inferencia” no significa que los hechos sean necesariamente correctos
Multilenguaje y gráficos Gemma 4 E4B o cuantización 12B adaptada E4B Q5; 12B Q4 comenzando Las capacidades visuales requieren soporte de archivos de proyección y back-end
Llamadas a herramientas de baja latencia Modelo de instrucción 3B–4B Se puede probar Q6/Q8 Es más fácil dejar el espacio contextual a los modelos pequeños

Las versiones de los modelos se actualizan rápidamente y el nombre específico debe confirmarse en la organización oficial del desarrollador o en la tarjeta del modelo. No descargue “versiones optimizadas” con nombres similares pero de fuentes desconocidas.

Cómo elegir la cuantización

  • Q4_K_M: Calidad, velocidad y capacidad equilibradas, adecuada como primera prueba;
  • Q5_K_M: El archivo es más grande, la calidad suele ser más estable, el nivel 8B a menudo se puede probar en 12 GB;
  • Q6_K / Q8_0: ocupa más memoria de vídeo y es adecuado para modelos más pequeños o contextos cortos;
  • Q2 / Q3: La presión de capacidad es pequeña, pero la pérdida de calidad debe verificarse mediante sus propias tareas.

El tamaño del archivo GGUF es solo el punto de partida para la ocupación del peso. La caché KV, los buffers de ejecución y los programas de escritorio también usan memoria de video, así que no descargue un archivo que se acerque a los 12 GB y espere un uso completo de la GPU.

Presupuesto para 12 GB de memoria de vídeo

Las herramientas de escritorio, navegador, reproducción de vídeo y desarrollo ocuparán primero parte de la memoria de vídeo. El espacio disponible del modelo debe calcularse en función de la memoria de vídeo libre antes del inicio, no de los 12 GB nominales de la tarjeta gráfica.

1
nvidia-smi --query-compute-apps=pid,process_name,used_memory --format=csv

puede dividir el presupuesto en:

Proyecto ¿Está arreglado? Método de procesamiento
Programas de escritorio y residentes No Cierre los programas innecesarios antes de realizar la prueba
Pesos del modelo Básicamente arreglado Determinado por escala de parámetros y cuantificación
Caché KV Crece con el contexto Utilice 4K primero y luego aumente gradualmente
Búfer de cálculo Relacionado con el backend Lectura del registro de inicio
Solicitudes simultáneas Aumentar con la concurrencia El usuario único mantiene primero 1
Proyección visual Relacionado con el modelo Los modelos gráficos y de texto se cuentan por separado

Si solo le quedan 10 GB antes de iniciar, no presione la “Tabla de recomendación de tarjetas gráficas de 12 GB” para seleccionar un archivo de modelo cercano a 12 GB.

Validar primero el controlador y el backend CUDA

Antes de probar el modelo, primero confirme que el controlador pueda informar la tarjeta gráfica normalmente:

El registro de arranque

1
nvidia-smi

llama.cpp debería mostrar el backend CUDA e informar la descarga de la GPU; Ollama puede verificar PROCESSOR a través de ollama ps. Si el modelo pequeño 3B muestra 100% de CPU, resuelva primero el problema del controlador o del backend y luego analice el rendimiento de 8B y 12B.

No asuma que la aplicación debe llamar a la GPU solo porque está instalado el kit de herramientas CUDA completo. El programa precompilado puede venir con su propia biblioteca de tiempo de ejecución, pero la base real para el juicio siguen siendo los registros, procesos y cambios en la memoria de video.

Seleccionar por tarea, no por lista

Escritura en chino y trabajo con conocimiento

Pruebe primero el modelo de comando de nivel Qwen 7B/8B. Concéntrese en comprobar la expresión china, la fidelidad fáctica, el resumen largo y el cumplimiento del formato. Si el quinto trimestre aún puede albergar completamente la GPU, se puede comparar con el cuarto trimestre en la misma pregunta.

Asistente de código local

Prepare un pequeño repositorio real y pruebe la lectura de varios archivos, la generación de parches, la corrección de pruebas unitarias y el cumplimiento de las restricciones del proyecto. Permitir que el modelo escriba solo una función no puede reflejar tareas de código de varios archivos.Las escenas de código también verifican el contexto: 8B Q5 puede tener mejor calidad, pero si la memoria de video no es suficiente para retener el contexto del código requerido, el efecto real puede no ser tan bueno como el de Q4.

Preguntas y respuestas sobre RAG y documentación

RAG requiere modelos integrados, bibliotecas vectoriales y modelos generativos. No utilice de forma predeterminada todos los 12 GB disponibles para LLM. Puede incorporar la CPU o elegir un modelo generativo más pequeño para dejar espacio para la recuperación de resultados y el caché KV.

Durante la prueba, se registra la cantidad de fichas de documentos ingresados, la cantidad de párrafos recordados y si las citas de las respuestas son correctas.

Comprensión de la imagen

Confirme que el modelo, la proyección visual y el backend coincidan. Cuando RTX 3060 procesa varias imágenes grandes, el token visual y el búfer de proyección aumentarán la memoria de video. Comience con una única imagen ampliada en lugar de cargar en masa las fotos originales.

Agente de automatización

El agente presta más atención al formato de llamada de herramientas, la baja latencia y la estabilidad, y no necesariamente requiere los parámetros máximos. Si el modelo 3B–8B puede generar JSON legal de manera estable, puede ser más adecuado que el modelo 12B/20B que requiere descarga de CPU.

Cómo gestionar archivos de modelo

Diferentes herramientas pueden descargar el mismo modelo repetidamente. Se recomienda crear un directorio claro y guardar las fuentes:

1
2
3
4
5
6
7
8
9
D:\Models\
  qwen\
    8b\
      model-q4_k_m.gguf
      SHA256.txt
      source-url.txt
  gemma\
    12b\
      model-q4_k_m.gguf

guardar hash:

1
2
Get-FileHash 'D:\Models\qwen\8b\model-q4_k_m.gguf' -Algorithm SHA256 |
  Format-List

No se limite a nombrar varios archivos con model.gguf, de lo contrario se confundirá rápidamente acerca del modelo, la cuantificación y la fuente.

Crea una configuración diaria de 8B

llama.cpp puede comenzar con parámetros conservadores:

Lista de modelos de aceptación

1
2
3
4
5
6
7
.\llama-server.exe `
  -m 'D:\Models\qwen\8b\model-q5_k_m.gguf' `
  -ngl 999 `
  -c 4096 `
  -np 1 `
  --host 127.0.0.1 `
  --port 8080

:

1
curl.exe http://127.0.0.1:8080/v1/models

Si el servicio solo se usa localmente, conserve 127.0.0.1. No supervise directamente las direcciones de redes públicas para el acceso a teléfonos móviles; También se deben agregar restricciones de firewall y servidores proxy de autenticación al uso compartido de LAN.

Haga una línea de base antes de probar 12B

Primero complete la línea de base de 8B Q5 y luego cambie a 12B Q4. Corregido:

  • Versión de fondo;
  • Contexto 4K;
  • Concurrencia única;
  • El mismo equipo de prueba;
  • Mismos parámetros de muestreo;
  • Mismo modo de conducción y potencia.

Esto responderá a la pregunta “¿Vale la pena los costos de memoria y velocidad por la mejora de calidad de 12B?” Si actualiza el backend y cambia el contexto al mismo tiempo, las conclusiones no serán comparables.

Utilice PowerShell para grabar series temporales de memoria de video

Los datos se pueden escribir en un archivo durante la observación continua:

Después de que

1
2
3
4
5
nvidia-smi `
  --query-gpu=timestamp,name,memory.used,utilization.gpu,temperature.gpu,power.draw `
  --format=csv `
  -l 1 `
  -f .\rtx3060-llm-test.csv

complete la prueba, presione Ctrl+C para detenerla. CSV puede ver los picos de carga del modelo, la utilización de la etapa de construcción, la temperatura y el consumo de energía, en lugar de solo una instantánea del momento.

Temperatura, consumo de energía y velocidad sostenida.

El RTX 3060 es muy rápido a corto plazo, pero eso no significa que siga siendo estable después de funcionar durante una hora. La prueba dura al menos 15 a 30 minutos, observando:

  • Si la temperatura sigue aumentando;
  • Si el reloj de la GPU baja debido a la temperatura o al consumo de energía;
  • ¿Es aceptable el ruido del ventilador?
  • Si el suministro de energía es estable;
  • Si los tokens se desintegran con el tiempo.

No haga funcionar la tarjeta gráfica a temperaturas anormales durante mucho tiempo solo para obtener una pequeña velocidad. Priorizar la mejora de los conductos de aire del chasis, la limpieza del polvo y el uso de ajustes de energía razonables; Comprenda los riesgos del hardware antes de modificar los límites de voltaje o consumo de energía.

Cómo afecta la memoria del sistema a la descarga de la CPU

Cuando algo de peso va a la CPU, la capacidad de la memoria del sistema y el ancho de banda afectan directamente la velocidad. Se recomienda utilizar al menos memoria de doble canal y asegurarse de que el modelo se ejecute sin una gran actividad de archivos de paginación.

Verifique la presión de la memoria:

1
Get-Counter '\Memory\Available MBytes','\Paging File(_Total)\% Usage'

Si la memoria disponible está casi agotada y el archivo de página continúa creciendo, debe dejar de realizar pruebas y utilizar un modelo más pequeño o una cuantificación baja. Aumentar el archivo de página puede evitar fallas, pero no restaurará la inferencia a velocidades normales.

Cómo diseñar el formulario de evaluación

Complete para cada modelo candidato:

Proyecto Grabar contenido
Fuente del modelo Organización oficial, URL de tarjeta modelo, compromiso
Archivo Nombre de archivo completo, cuantificación, SHA256
Configuración Contexto, simultaneidad, descarga de GPU
Recursos Memoria de vídeo sin carga/pico, memoria del sistema
Retraso Primera ficha, tiempo total invertido
Velocidad token/s de aviso y generación
Calidad Tasa real de aprobación de tareas
Estabilidad Errores, ralentizaciones, temperaturas en 30 minutos

Finalmente, filtre según la tasa de aprobación de tareas, en lugar de configurar directamente el modelo con los tokens más altos como predeterminado.

¿Cuándo debería actualizar el hardware?

Considere cambiar la tarjeta gráfica o aumentar la memoria en las siguientes situaciones:

  • Las misiones reales deben utilizar modelos Clase 20B/32B;
  • Los contextos superiores a 8K son requisitos fijos;
  • Requiere varios usuarios simultáneos;
  • El modelo visual y el modelo textual deben convivir al mismo tiempo; -La descarga de CPU se ha convertido en la principal fuente de latencia;
  • Los servicios de producción requieren mayores márgenes de estabilidad.Si solo necesita un modelo más grande ocasionalmente, puede resultar más económico utilizar la API oficial mediante pago por uso que comprar el hardware. Se deben comparar las tarjetas gráficas, las fuentes de alimentación, la refrigeración, el tiempo de inactividad y los costes de mantenimiento.

Límites de privacidad para servicios locales

No ejecutarse localmente automáticamente significa que los datos nunca se enviarán. Es posible que el administrador de modelos, la interfaz, el complemento o el componente de telemetría aún estén en línea. Cuándo es necesario procesar datos confidenciales:

  • Verificar fuentes de descarga y actualización;
  • Verificar las solicitudes de red del front-end y los complementos;
  • La API local sólo escucha la dirección de loopback;
  • No sincronizar los registros de chat con una nube desconocida;
  • Actualizar periódicamente el backend para solucionar problemas de seguridad;
  • Realizar revisión de información personal en la salida del modelo.

Cuando los requisitos fuera de línea son estrictos, se debe realizar una prueba completa en un entorno desconectado en lugar de simplemente cerrar el navegador.

Prueba rápida de Ollama

Tome como ejemplo la etiqueta 8B que realmente existe en la biblioteca de modelos:

Verifique después de ejecutar

1
ollama run qwen3:8b

:

Entre

1
2
ollama ps
nvidia-smi

ollama ps, PROCESSOR está cerca de 100% GPU, lo que indica que el modelo se encuentra principalmente en la tarjeta gráfica; la presencia de un híbrido CPU/GPU indica que se ha producido una descarga parcial. Los posibles cambios en las etiquetas de los modelos y su cuantificación deben confirmarse en la página de detalles de la biblioteca de modelos, en lugar de simplemente mirar las cantidades de los parámetros en las etiquetas.

prueba controlada llama.cpp

Usando un GGUF de una fuente confiable, comience con el contexto 4K en PowerShell:

1
2
3
4
5
6
7
.\llama-server.exe `
  -m .\model-q4_k_m.gguf `
  -ngl 999 `
  -c 4096 `
  -np 1 `
  --host 127.0.0.1 `
  --port 8080

Abra otra terminal y continúe observando:

Los registros

1
nvidia-smi -l 1

deben mostrar el backend de CUDA, las capas de descarga, el búfer de modelo y la caché de KV. Registre el retraso del primer token y los tokens generados en la primera ronda, y luego use la misma palabra para comparar otras cuantificaciones.

Un conjunto justo de condiciones de comparación

Corregido al comparar modelos:

  • Mismo RTX 3060, modos de energía del controlador y del sistema;
  • La misma versión de backend;
  • mismo contexto (primero 4096, luego 8192);
  • Concurrencia única;
  • Misma temperatura, semilla y longitud máxima de salida;
  • Cada modelo utiliza su propia plantilla de chat oficial;
  • Apague juegos, mejoras de video y otros programas de razonamiento que consuman memoria de video.

Se recomienda probar las tareas que realmente puede realizar: resumen en chino, modificación de código, JSON estructurado, recuperación de texto largo e invocación de herramientas. La lista pública solo puede filtrar candidatos y no puede reemplazar el flujo de trabajo nativo.

Fallos comunes y recuperación de la memoria de video de 12 GB

CUDA OOM

Reduzca el contexto, la simultaneidad y el tamaño de cuantificación en ese orden. Si aún falla, reduzca la descarga de la GPU y deje que algo de peso vaya a la memoria del sistema.

Puede correr pero muy lentamente.

Verifique el registro ollama ps o llama.cpp. Si se pone mucho peso en la CPU, el cuello de botella suele ser el ancho de banda de la memoria del sistema y las transferencias PCIe. En lugar de forzar una ejecución de 32B, prefiero cambiar a un modelo 8B/12B de mejor calidad.

La memoria de video es suficiente pero la salida es anormal.

Compruebe si el modelo es la versión del comando, si la plantilla de chat es correcta y si el backend admite la arquitectura. Tener suficiente memoria de video no significa compatibilidad de formato.

Fallo después de una larga conversación

El crecimiento del contexto ampliará la caché KV. Limite el contexto máximo, reinicie el modelo de lanzamiento del servicio y vuelva a probar la memoria máxima.

Elección de cuantización de Qwen3 para RTX 3060

Veamos primero la conclusión: ¿Cuál debería elegir, 3060 12GB?

Objetivo Modelos de recomendación y cuantificación. Por qué
Preferido por defecto Qwen3-8B Q6_K La calidad, la velocidad y el margen de memoria están relativamente equilibrados
Menos memoria/contexto más largo Qwen3-8B Q5_K_M Deje más espacio para la caché KV, la calidad sigue siendo adecuada para el uso diario
Preste más atención a la calidad de la salida Qwen3-8B Q8_0 Los usuarios individuales pueden probar el contexto breve, pero la reserva de 12 GB es pequeña
Quiere mejorar las capacidades del modelo. Qwen3-14B Q4_K_M Puedo intentarlo, pero el contexto, la concurrencia y la estabilidad son más limitados.
¿Quieres probar MoE? Qwen3-30B-A3B Cuantización baja + descarga mixta de CPU/GPU No apto para la solución predeterminada de 12 GB, que ejerce mayor presión sobre los archivos y la memoria del modelo.

Si solo desea descargar una versión y no quiere pasar por problemas repetidos, seleccione Qwen3-8B Q6_K.

¿Por qué no simplemente ir a 14B o 30B-A3B?

Qwen3-8B tiene alrededor de 8,2 mil millones de parámetros, el contexto nativo oficial es 32 K y se puede extender a contextos más largos a través de YaRN. Para RTX 3060 de 12 GB, la ventaja clave del modelo 8B no es “el más fuerte”, sino la capacidad de colocar el modelo, la sobrecarga de tiempo de ejecución y parte del caché KV en la memoria de video.

Qwen3-14B Q4_K_M tiene un mayor potencial de calidad, pero el archivo cuantificado en sí ya ocupa notablemente 12 GB. Incluso si el modelo se carga, es más probable que las indicaciones largas, los modos de pensamiento, los resultados largos o los contextos más amplios agoten la memoria de video. Es más adecuado para personas que están dispuestas a sacrificar el contexto y la velocidad por la calidad de una respuesta de una sola ronda.

Qwen3-30B-A3B es un modelo MoE con menos parámetros por activación, pero aún es necesario cargar los pesos completos. MoE puede reducir parte de la presión informática y no puede convertir docenas de archivos de modelos de GB en modelos de memoria de vídeo de 12 GB. En el 3060, puede usar la memoria de la CPU con algo de descarga de la GPU para realizar experimentos, pero la velocidad, el uso de la memoria y la complejidad del ajuste de parámetros aumentarán.

Por lo tanto, la “mejor versión cuantificada” no es la versión con el tamaño de archivo más grande, ni la versión con la mayor cantidad de parámetros, sino la versión que puede ejecutarse de manera estable bajo la longitud de su contexto común, tiene suficiente calidad de salida y es menos propensa a OOM.

Cómo elegir entre Q6_K, Q5_K_M y Q8_0

Tres opciones comunes pueden entenderse como:

Cuantificar Recomendaciones sobre RTX 3060 12GB
Q5_K_M Dale prioridad cuando necesites más caché KV, publiques a menudo códigos largos o quieras abrir un contexto superior.
Q6_K La recomendación predeterminada para la mayoría de las personas, con un equilibrio entre calidad y uso de memoria.
Q8_0 Más cerca de la alta precisión, pero con menos margen de memoria; puedes probarlo cuando tengas un contexto breve y solo ejecutes un modelo.

La selección de cuantificación no puede entenderse únicamente en términos de “cuanto mayor sea el ancho de bits, mejor”. Para la inferencia local, el margen de memoria afectará directamente la longitud del contexto, el procesamiento por lotes, el retraso del primer token y la estabilidad operativa. Q8_0 Si se ve obligado a reducir el contexto a un nivel muy bajo, es posible que la experiencia real no sea mejor que Q6_K.

Se recomienda realizar la prueba primero en el siguiente orden:

  1. Con Q6_K, el contexto se establece en 8192.
  2. Observe el uso de la memoria, la velocidad de generación y la estabilidad.
  3. Cuando trabaje con frecuencia con códigos y documentos largos, cambie Q5_K_M y compare nuevamente.
  4. Si solo desea realizar una breve sesión de preguntas y respuestas y aún queda memoria, intente Q8_0 nuevamente.

configuración recomendada llama.cpp

Qwen recomienda oficialmente usar el llama.cpp más nuevo para obtener soporte completo para Qwen3. Aquí hay un punto de partida práctico para el RTX 3060 de 12 GB:

1
2
3
4
5
6
7
8
9
./llama-cli \
  -hf Qwen/Qwen3-8B-GGUF:Q6_K \
  --jinja \
  -ngl 99 \
  -c 8192 \
  -n 1024 \
  --temp 0.6 \
  --top-k 20 \
  --top-p 0.95

El significado de varios parámetros:

  • -ngl 99: Intente colocar la capa descargable en la GPU. Si la memoria de video es insuficiente o falla el inicio, redúzcala gradualmente.
  • -c 8192: comience primero con el contexto de 8K, no establezca 32K al principio.
  • -n 1024: limita la duración de una sola generación para evitar que la producción prolongada ocupe recursos continuamente.
  • --jinja: organiza la entrada según la plantilla de chat modelo. Qwen3 no recomienda escribir a mano en un formato aleatorio.

Cuando quieras realizar servicios, puedes utilizar:

1
2
3
4
5
6
./llama-server \
  -hf Qwen/Qwen3-8B-GGUF:Q6_K \
  --jinja \
  -ngl 99 \
  -c 8192 \
  --port 8080

Después de comenzar, mire primero nvidia-smi. Si la memoria de video está casi llena, la respuesta del sistema se vuelve lenta o se informa un error cuando el mensaje es largo por primera vez, primero reduzca el contexto o cambie a Q5_K_M y no continúe agregando capas a ciegas.

¿Cómo eligen los usuarios de Ollama?

Ollama se puede ejecutar directamente:

1
ollama run qwen3:8b

Es más adecuado para personas que quieren usarlo rápidamente y no quieren lidiar con archivos GGUF. Pero hay dos puntos a tener en cuenta:

  1. La versión cuantificada correspondiente real detrás de la etiqueta se puede actualizar con el almacén y no se puede inferir en qué GGUF debe basarse simplemente en qwen3:8b.
  2. Es posible que la configuración de contexto predeterminada de Ollama no sea adecuada para su tarea. Cuando se requiere un contexto extenso, num_ctx se debe ajustar explícitamente y se debe prestar atención a los cambios en la memoria de video.

Si desea un control preciso sobre Q5_K_M, Q6_K o Q8_0, suele ser más intuitivo importar GGUF en llama.cpp, LM Studio o manualmente.

Cómo degradar la computadora portátil RTX 3060 de 6GB/8GB

La memoria de vídeo del portátil RTX 3060 suele ser de 6 GB u 8 GB, y la conclusión de 12 GB no se puede copiar.

Memoria de vídeo sugerencia
8GB Priorizar Qwen3-4B Q6_K/Q8_0; Si quieres probar 8B, elige un ancho de bits más bajo y reduce el contexto.
6GB Prefiere Qwen3-4B Q4_K_M/Q5_K_M o modelos más pequeños
12GB Qwen3-8B Q6_K es el valor predeterminado preferido, Q5_K_M deja más contexto, Q8_0 solo es adecuado para intentos cortos de contexto

Los portátiles también deben tener en cuenta el consumo de energía y la disipación de calor. Incluso si la memoria de video es la misma, la velocidad de generación continua puede ser significativamente menor que la de una tarjeta de escritorio; Primero ejecútelo con un mensaje breve durante 10 a 20 minutos y luego juzgue si la configuración es realmente adecuada para el uso diario.

No ignore el caché KV y los patrones de pensamiento

El hecho de que el archivo del modelo se pueda colocar en la memoria de video no significa que la tarea real se ejecutará sin problemas. El contexto de Qwen3, las conversaciones históricas y el contenido generado formarán un caché KV; cuanto más largo sea el contexto, mayor será el uso de la memoria gráfica.

Especialmente para los siguientes tipos de tareas, se recomienda dar prioridad a Q5_K_M o reducir -c:

  • Publique varios códigos fuente, registros o documentos extensos al mismo tiempo;
  • largas conversaciones continuas;
  • Habilite el modo de pensamiento y permita una salida muy larga;
  • La API local atiende múltiples solicitudes simultáneamente.

El 3060 de 12 GB es más adecuado para asistentes locales de usuario único y de contexto corto a medio. Si el objetivo son contextos de más de 32 KB, concurrencia de varias personas o RAG a gran escala, generalmente ahorra más tiempo actualizar la memoria de gráficos o cambiar a la inferencia en la nube que continuar con la compresión.

Registre estos cuatro elementos durante la medición real.

No se limite a mirar los tokens. Pruebe con la misma palabra clave y registre:

proyecto que ver
Memoria de vídeo ¿Está casi lleno? ¿Queda espacio restante para la caché KV?
Retraso del primer token ¿Necesita esperar demasiado bajo un mensaje largo?
Velocidad de generación Tokens/s bajo el mismo mensaje y la misma longitud de salida
estabilidad ¿Es OOM, ralentizar o ralentizar el sistema después de un funcionamiento continuo?

Q6_K que puede completar de manera estable sus tareas comunes suele ser más digno de retención a largo plazo que Q8_0 que ocasionalmente tiene una calidad ligeramente superior pero con frecuencia explota la memoria de video.

Conclusión de la selección

  • Para uso diario estable: 8B Q4_K_M/Q5_K_M;
  • Quiere mejorar la calidad: pruebe 12B Q4 y mantenga el contexto 4K–8K;
  • Quiere aumentar la velocidad: elija el modelo 3B–4B o un contexto más corto;
  • Quiere ejecutar 20B/32B: primero acepte la obvia descarga de CPU y la caída de velocidad, y luego decida si vale la pena;
  • Se requieren servicios de producción: además de la memoria de video, también se deben probar la concurrencia, la estabilidad a largo plazo y la recuperación de fallas.

Plantilla de registro de pruebas

1
2
3
4
5
6
7
8
9
GPU:RTX 3060 12GB / 驱动版本
后端:Ollama 或 llama.cpp 版本
模型与来源:
量化与文件 SHA256:
上下文 / 并发:
GPU offload:
峰值显存:
首 token 延迟 / tokens/s:
任务准确性:

Referencias