RTX 3060 12GB向けローカルLLM:量子化・コンテキスト・実測で選ぶ

デスクトップRTX 3060 12GBを基準に、7B・8B・12BのGGUFを選び、Ollama、llama.cpp、nvidia-smiでVRAMと速度を実測します。

この推奨事項は デスクトップ RTX 3060 12GB に基づいています。 NVIDIA には 8GB RTX 3060 モデルもあり、ノートブック版の消費電力、放熱性、ビデオメモリも異なります。カードが 12GB でない場合、この記事の結論をそのまま適用することはできません。

12GB の VRAM で最も快適な範囲は、通常、7B ~ 9B モデルの Q4/Q5 量子化です。 12B レベルのモデルに対して Q4 を試すことはできますが、コンテキストを制御する必要があります。より大きな 20B および 32B モデルでは、多くの場合 CPU オフロードが必要であり、ロードできるからといってエクスペリエンスが向上するわけではありません。

まずハードウェアを確認してください

1
nvidia-smi --query-gpu=name,memory.total,driver_version --format=csv

出力には、GPU 名、合計ビデオ メモリ、ドライバーが明確に表示されます。 8GB版の場合は7B/8B Q4を優先してコンテキストを短縮します。

推奨モデルの段階

目標 モデルの方向 推奨される定量的開始点 説明
中国の一般、コード Qwen 7B/8B レベルの指導モデル Q4_K_M または Q5_K_M 12GB で最もバランスが取れています
英語でユニバーサル ラマ レベル 8B コマンド モデル Q4_K_M または Q5_K_M 信頼できるGGUFのオフィシャルモデルカードを使用
軽量な推論 DeepSeek 蒸留レベル 7B/8B Q4_K_M 「推論」は、事実が必ずしも正しいことを意味するものではありません。
多言語とグラフィックス Gemma 4 E4B または適応された 12B 量子化 E4B Q5; 12B Q4 スタート ビジュアル機能にはバックエンドと投影ファイルのサポートが必要です。
低遅延ツール呼び出し 3B ~ 4B の指導モデル Q6/Q8は試せます 小さいモデルはコンテキスト スペースから離れるのが簡単です。

モデルのバージョンはすぐに更新されるため、具体的な名前は開発者の公式組織またはモデル カードで確認する必要があります。名前が似ているがソースが不明な「最適化バージョン」をダウンロードしないでください。

量子化の選び方

  • Q4_K_M: 品質、速度、容量のバランスが取れており、最初のテストに適しています。
  • Q5_K_M: ファイルは大きくなり、品質は通常より安定し、12GB では 8B レベルを試せることがよくあります。
  • Q6_K / Q8_0: より多くのビデオ メモリを使用し、小型のモデルまたは短いコンテキストに適しています。
  • Q2 / Q3: 能力のプレッシャーは小さいですが、品質の低下は自分のタスクで検証する必要があります。

GGUF ファイル サイズは、重量占有の開始点にすぎません。 KV キャッシュ、実行バッファ、およびデスクトップ プログラムもビデオ メモリを使用するため、12 GB に近いファイルをダウンロードして GPU のフル使用を期待しないでください。

12 GB のビデオ メモリの予算

デスクトップ、ブラウザ、ビデオ再生および開発ツールは、最初にビデオ メモリの一部を占有します。モデルの利用可能な容量は、公称 12GB のグラフィックス カードではなく、起動前の空きビデオ メモリに基づいて計算する必要があります。

1
nvidia-smi --query-compute-apps=pid,process_name,used_memory --format=csv

は予算を次のように分割できます。

プロジェクト 修正されましたか 加工方法
デスクトップおよび常駐プログラム いいえ テストする前に不要なプログラムを閉じてください。
モデルの重み 基本的に修正されました パラメータのスケールと定量化によって決定される
KVキャッシュ コンテキストに応じて成長する 最初は 4K を使用し、その後徐々に増やします。
計算バッファ バックエンド関連 起動ログからの読み取り
同時リクエスト 同時実行による増加 単一ユーザーは最初に 1
視覚的投影 模型関連 グラフィック モデルとテキスト モデルは別々にカウントされます。

起動前に 10GB しか残っていない場合は、「12GB グラフィックス カード推奨表」を押して 12GB に近いモデル ファイルを選択しないでください。

ドライバーとCUDAバックエンドを先に検証する

モデルをテストする前に、まずドライバーがグラフィックス カードを正常に報告できることを確認します。

1
nvidia-smi

llama.cpp ブート ログには CUDA バックエンドが表示され、GPU オフロードがレポートされるはずです。オラマは、ollama ps 経由で PROCESSOR を確認できます。 3B の小型モデルがすべて 100% の CPU を示している場合は、まずドライバーまたはバックエンドの問題を解決してから、8B と 12B のパフォーマンスについて話し合います。

完全な CUDA ツールキットがインストールされているからといって、アプリケーションが GPU を呼び出す必要があるとは考えないでください。プリコンパイルされたプログラムには独自のランタイム ライブラリが付属している場合がありますが、実際の判断基準は依然としてログ、プロセス、ビデオ メモリの変更です。

リストではなくタスクによって選択します

中国語の文章と知識の編集

最初に Qwen 7B/8B レベルのコマンド モデルをテストします。中国語の表現、事実の忠実性、長い要約、形式の準拠性のチェックに重点を置きます。 Q5 が依然として GPU を完全にホストできる場合は、同じ質問で Q4 と比較できます。

ローカルコードアシスタント

小さな実際のリポジトリを準備し、複数のファイルの読み取り、パッチの生成、単体テストの修正、プロジェクトの制約の順守をテストします。モデルに 1 つの関数を記述させるだけでは、複数ファイルのコード タスクを反映することはできません。コード シーンはコンテキストもチェックします。8B Q5 の品質は向上する可能性がありますが、ビデオ メモリが必要なコード コンテキストを保持するのに十分でない場合、実際の効果は Q4 ほど良くない可能性があります。

RAG とドキュメントの Q&A

RAG には、埋め込みモデル、ベクトル ライブラリ、生成モデルの両方が必要です。 LLM で使用できるすべての 12GB をデフォルトにしないでください。エンベディングを CPU に配置することも、より小さい生成モデルを選択して、検索結果と KV キャッシュ用の余地を残すこともできます。

テスト中、入力文書トークンの数、呼び出された段落の数、および回答の引用が正しいかどうかが記録されます。

イメージの理解

モデル、視覚的投影、およびバックエンドが一致していることを確認します。 RTX 3060 が複数の大きな画像を処理する場合、ビジュアル トークンと投影バッファーによってビデオ メモリが増加します。元の写真を一括アップロードするのではなく、ズームした 1 枚の画像から始めます。

自動化エージェント

エージェントは、ツールの呼び出し形式、低遅延、安定性にさらに注意を払い、必ずしも最大のパラメータを必要とするわけではありません。合法な JSON を安定して出力できる 3B ~ 8B モデルであれば、CPU オフロードが必要な 12B/20B モデルよりも適している可能性があります。

モデルファイルの管理方法

異なるツールが同じモデルを繰り返しダウンロードする場合があります。クリアなディレクトリを作成してソースを保存することをお勧めします。

1
2
3
4
5
6
7
8
9
D:\Models\
  qwen\
    8b\
      model-q4_k_m.gguf
      SHA256.txt
      source-url.txt
  gemma\
    12b\
      model-q4_k_m.gguf

保存ハッシュ:

1
2
Get-FileHash 'D:\Models\qwen\8b\model-q4_k_m.gguf' -Algorithm SHA256 |
  Format-List

単に model.gguf という名前を複数のファイルに付けないでください。そうしないと、モデル、定量化、ソースについてすぐに混乱してしまいます。

毎日 8B の構成を作成する

llama.cpp は保守的なパラメータで開始できます。

1
2
3
4
5
6
7
.\llama-server.exe `
  -m 'D:\Models\qwen\8b\model-q5_k_m.gguf' `
  -ngl 999 `
  -c 4096 `
  -np 1 `
  --host 127.0.0.1 `
  --port 8080

受け入れモデルリスト:

1
curl.exe http://127.0.0.1:8080/v1/models

サービスがローカルでのみ使用される場合は、127.0.0.1 を保持します。携帯電話へのアクセスについては、パブリック ネットワーク アドレスを直接監視しないでください。ファイアウォール制限と認証プロキシも LAN 共有に追加する必要があります。

12B をテストする前にベースラインを実行する

まず 8B Q5 のベースラインを完了してから、12B Q4 に切り替えます。修正済み:

  • バックエンドのバージョン;
  • 4K コンテキスト;
  • 単一同時実行。
  • 同じテストセット。
  • 同じサンプリングパラメータ。
  • 同じドライブと電力モード。

これは、「12B の品質向上にはメモリと速度のコストに見合う価値があるのか​​?」という質問に答えます。バックエンドをアップグレードし、同時にコンテキストを変更すると、結論は比較できなくなります。

PowerShell を使用してビデオ メモリの時系列を記録する

連続観察中にデータをファイルに書き込むことができます。

1
2
3
4
5
nvidia-smi `
  --query-gpu=timestamp,name,memory.used,utilization.gpu,temperature.gpu,power.draw `
  --format=csv `
  -l 1 `
  -f .\rtx3060-llm-test.csv

がテストを完了したら、Ctrl+C を押して停止します。 CSV では、単なる瞬間のスナップショットではなく、モデルの読み込みピーク、ビルド ステージの使用率、温度、電力消費を確認できます。

温度、消費電力、持続速度

RTX 3060 は短期的には非常に高速ですが、1 時間実行した後も安定しているという意味ではありません。テストは少なくとも 15 ~ 30 分間続き、次のことを観察します。

  • 温度が上昇し続けているかどうか。
  • GPU クロックが温度や電力消費によって低下するかどうか。
  • ファンの騒音は許容範囲ですか?
  • 電源が安定しているかどうか。
  • トークンは時間の経過とともに減衰するかどうか。

わずかな速度を上げるためだけに、異常な温度でグラフィックス カードを長時間実行しないでください。シャーシのエアダクトの改善、ほこりの除去、および適切な電力設定の使用を優先します。電圧または消費電力の制限を変更する前に、ハードウェアのリスクを理解してください。

システムメモリが CPU オフロードに与える影響

CPU にある程度の負担がかかると、システム メモリの容量と帯域幅が速度に直接影響します。少なくともデュアル チャネル メモリを使用し、大量のページ ファイル アクティビティが発生しないようにモデルが実行されるようにすることをお勧めします。

メモリ負荷を確認します。

1
Get-Counter '\Memory\Available MBytes','\Paging File(_Total)\% Usage'

使用可能なメモリがほぼ枯渇し、ページ ファイルが増大し続ける場合は、テストを中止し、より小さいモデルまたは低量子化を使用する必要があります。ページ ファイルを増やすとクラッシュを回避できる可能性がありますが、推論を通常の速度に戻すことはできません。

評価フォームの設計方法

各候補モデルを入力します。

プロジェクト 記録内容
モデルソース 公式組織、モデルカードURL、コミット
ファイル 完全なファイル名、量子化、SHA256
構成 コンテキスト、同時実行性、GPU オフロード
リソース 無負荷/ピーク時のビデオ メモリ、システム メモリ
遅延 最初のトークン、費やした合計時間
スピード プロンプトと生成トークン/秒
品質 実際のタスクの合格率
安定性 30 分以内のエラー、速度低下、温度

最後に、最高のトークン/秒を持つモデルをデフォルトとして直接設定するのではなく、タスクの通過率に基づいてフィルターします。

ハードウェアをいつアップグレードする必要がありますか?

次の状況では、グラフィックス カードを変更するかメモリを増設することを検討してください。

  • 実際のミッションではクラス 20B/32B モデルを使用する必要があります。
  • 8K を超えるコンテキストは固定要件です。
  • 複数の同時ユーザーが必要です。
  • ビジュアル モデルとテキスト モデルは同時に存在する必要があります。 -CPU オフロードが遅延の主な原因となっています。
  • 実稼働サービスには、より大きな安定マージンが必要です。より大きなモデルが時々必要になるだけの場合は、ハードウェアを購入するよりも、従量制で公式 API を使用した方が安くなる可能性があります。グラフィックス カード、電源、冷却、アイドル時間、メンテナンス コストを比較する必要があります。

ローカル サービスのプライバシー境界

ローカルで自動的に実行されないということは、データが送信されないことを意味します。モデル マネージャー、フロントエンド、プラグイン、またはテレメトリ コンポーネントがまだオンラインである可能性があります。機密データを処理する必要がある場合:

  • ダウンロードとアップデートのソースを確認します。
  • フロントエンドとプラグインのネットワークリクエストをチェックします。
  • ローカル API はループバック アドレスのみをリッスンします。
  • チャット ログを不明なクラウドに同期しないでください。
  • バックエンドを定期的に更新してセキュリティ問題を修正します。
  • モデル出力における個人情報のレビューを実施します。

オフライン要件が厳しい場合は、ブラウザを閉じるだけではなく、切断された環境で完全なテストを完了する必要があります。

オラマのクイックテスト

例として、モデル ライブラリに実際に存在する 8B タグを取り上げます。

1
ollama run qwen3:8b

の実行後に確認します。

1
2
ollama ps
nvidia-smi

ollama ps のうち、PROCESSOR100% GPU に近く、モデルが主にグラフィックス カード上にあることを示しています。 CPU/GPU ハイブリッドの存在は、部分的なオフロードが発生したことを示します。モデル ラベルの変更の可能性とその定量化は、ラベル内のパラメーター量だけを確認するのではなく、モデル ライブラリの詳細ページで確認する必要があります。

llama.cpp 制御テスト

信頼できるソースからの GGUF を使用して、PowerShell で 4K コンテキストから始めます。

1
2
3
4
5
6
7
.\llama-server.exe `
  -m .\model-q4_k_m.gguf `
  -ngl 999 `
  -c 4096 `
  -np 1 `
  --host 127.0.0.1 `
  --port 8080

別の端末を開いて、観察を続けます。

1
nvidia-smi -l 1

ログには、CUDA バックエンド、オフロード レイヤー、モデル バッファー、および KV キャッシュが表示されるはずです。最初のトークン遅延と最初のラウンドで生成されたトークンを記録し、同じプロンプト ワードを使用して他の定量化を比較します。

公正な比較条件のセット

モデルを比較する際の修正:

  • 同じ RTX 3060、ドライバーおよびシステム電力モード。
  • 同じバックエンド バージョン。
  • 同じコンテキスト (最初は 4096、次に 8192)。
  • 単一同時実行。
  • 同じ温度、シード、最大出力長。
  • 各モデルは独自の公式チャット テンプレートを使用します。
  • ビデオ メモリを消費するゲーム、ビデオ拡張機能、およびその他の推論プログラムをオフにします。

実際に実行できるタスク (中国語の要約、コードの修正、構造化 JSON、長いテキストの取得、ツールの呼び出し) をテストすることをお勧めします。公開リストは候補をフィルタリングすることのみが可能であり、ネイティブ ワークフローを置き換えることはできません。

12GB ビデオ メモリの一般的な障害と回復

CUDA OOM

コンテキスト、同時実行性、量子化サイズの順に小さくします。それでも失敗する場合は、GPU オフロードを減らし、一部の重みをシステム メモリに割り当てます。

実行できますが、非常に遅いです

ollama ps または llama.cpp ログを確認してください。 CPU に多くの負荷がかかる場合、ボトルネックになるのは通常、システム メモリ帯域幅と PCIe 転送です。無理に 32B を実行するのではなく、より高品質の 8B/12B モデルに切り替えたいと思います。

ビデオメモリは十分にありますが、出力が異常です。

機種がコマンドのバージョンか、チャットテンプレートが正しいか、バックエンドがアーキテクチャをサポートしているかを確認してください。ビデオ メモリが十分であるということは、フォーマットの互換性を意味するものではありません。

長い会話の後にクラッシュする

コンテキストの成長により、KV キャッシュが拡張されます。最大コンテキストを制限し、サービス リリース モデルを再起動し、ピーク メモリを再テストします。

RTX 3060 向け Qwen3 量子化の選び方

結論から先に言うと、3060 12GBとどちらを選ぶべきなのでしょうか?

ターゲット 推奨モデルと定量化 なぜ
デフォルトの優先 Qwen3-8B Q6_K 品質、速度、メモリマージンが比較的バランスが取れている
メモリが少ない/コンテキストが長い Qwen3-8B Q5_K_M KV キャッシュ用にさらに多くのスペースを残しておきますが、品質は依然として日常使用に適しています
出力品質にさらに注意を払う Qwen3-8B Q8_0 単一ユーザーは短いコンテキストを試すことができますが、12GB の予約は少ないです
モデルの機能を向上させたい Qwen3-14B Q4_K_M 試すことはできますが、コンテキスト、同時実行性、安定性がより制限されます
MoEを試してみたい Qwen3-30B-A3B 低量子化 + CPU/GPU 混合オフロード モデル ファイルとメモリへの負担が大きくなる 12GB のデフォルト ソリューションには適していません

1 つのバージョンのみをダウンロードし、トラブルを繰り返したくない場合は、Qwen3-8B Q6_K を選択してください。

14B または 30B-A3B に行ってみませんか?

Qwen3-8B には約 8.2B のパラメータがあり、公式のネイティブ コンテキストは 32K で、YaRN を通じてより長いコンテキストに拡張できます。 RTX 3060 12GB の場合、8B モデルの主な利点は「最強」ではなく、モデル、ランタイム オーバーヘッド、および KV キャッシュの一部をビデオ メモリに配置できることです。

Qwen3-14B Q4_K_M には高品質の可能性がありますが、量子化されたファイル自体がすでに 12GB を著しく圧迫しています。モデルが読み込まれる場合でも、長いプロンプト、思考モード、長い出力、または大きなコンテキストはビデオ メモリに負担をかける可能性が高くなります。これは、単一ラウンドの回答の品質のためにコンテキストと速度を犠牲にすることを厭わない人に適しています。

Qwen3-30B-A3B は、アクティブ化ごとのパラメータが少ない MoE モデルですが、それでも完全なウェイトをロードする必要があります。 MoE はコンピューティング負荷の一部を軽減できますが、数十 GB のモデル ファイルを 12 GB のビデオ メモリ モデルに変換することはできません。 3060 では、GPU オフロードを伴う CPU メモリを使用して実験を行うことができますが、速度、メモリ使用量、パラメータ調整の複雑さは増加します。

したがって、「最適な量子化バージョン」とは、ファイル サイズが最も大きいバージョンやパラメータが最も多いバージョンではなく、一般的なコンテキスト長で安定して実行でき、十分な出力品質を備え、OOM が発生しにくいバージョンです。

Q6_K、Q5_K_M、Q8_0 の選択方法

3 つの一般的なオプションは次のように理解できます。

定量化する RTX 3060 12GB の推奨事項
Q5_K_M より多くの KV キャッシュが必要な場合、長いコードを頻繁に投稿する場合、またはより上位のコンテキストを開きたい場合に優先してください。
Q6_K 品質とメモリ使用量のバランスを考慮した、ほとんどの人にとってのデフォルトの推奨事項。
Q8_0 高精度に近づきますが、メモリ マージンは低くなります。コンテキストが短く、モデルが 1 つだけ実行されている場合に試すことができます。

量子化の選択は「ビット幅が大きいほど良い」という観点だけでは理解できません。ローカル推論の場合、メモリ マージンはコンテキストの長さ、バッチ処理、最初のトークンの遅延、動作の安定性に直接影響します。 Q8_0 コンテキストを非常に低くする必要がある場合、実際のエクスペリエンスは Q6_K よりも良くない可能性があります。

最初に次の順序でテストすることをお勧めします。

  1. Q6_K を使用すると、コンテキストは 8192 に設定されます。
  2. メモリ使用量、生成速度、安定性を観察します。
  3. 長いコードや長いドキュメントを扱うことが多い場合は、Q5_K_M に変更して再度比較してください。
  4. 短い Q&A を実行するだけで、メモリがまだ残っている場合は、Q8_0 をもう一度試してください。

llama.cpp の推奨構成

Qwen は、Qwen3 を完全にサポートするには、新しい llama.cpp を使用することを公式に推奨しています。 RTX 3060 12GB の実際的な出発点は次のとおりです。

1
2
3
4
5
6
7
8
9
./llama-cli \
  -hf Qwen/Qwen3-8B-GGUF:Q6_K \
  --jinja \
  -ngl 99 \
  -c 8192 \
  -n 1024 \
  --temp 0.6 \
  --top-k 20 \
  --top-p 0.95

いくつかのパラメータの意味:

  • -ngl 99: オフロード可能なレイヤーを GPU に配置してみます。ビデオメモリが不足したり、起動に失敗する場合は、徐々にメモリを減らしてください。
  • -c 8192: 最初に 8K コンテキストから開始します。最初に 32K を設定しないでください。
  • -n 1024: 長い出力が継続的にリソースを占有するのを防ぐために、単一世代の長さを制限します。
  • --jinja: モデル チャット テンプレートに従って入力を整理します。 Qwen3 では、ランダムな形式で手書きすることはお勧めしません。

サービスを実行したい場合は、以下を使用できます。

1
2
3
4
5
6
./llama-server \
  -hf Qwen/Qwen3-8B-GGUF:Q6_K \
  --jinja \
  -ngl 99 \
  -c 8192 \
  --port 8080

開始したら、まずnvidia-smiを見てください。ビデオ メモリがほぼいっぱいになった場合、システムの応答が遅くなった場合、またはプロンプトが初めて長いときにエラーが報告された場合は、まずコンテキストを減らすか Q5_K_M に切り替え、やみくもにレイヤーの追加を続けないでください。

Ollama ユーザーはどのように選択しますか?

Ollama は直接実行できます。

1
ollama run qwen3:8b

すぐに使いたいが、GGUF ファイルを扱いたくない人に適しています。ただし、注意すべき点が 2 つあります。

  1. ラベルの背後にある実際の対応する定量化されたバージョンはウェアハウスによって更新される可能性があり、qwen3:8b に基づいてのみどの GGUF であるかを推測することはできません。
  2. Ollama のデフォルトのコンテキスト設定は、タスクには適していない可能性があります。長いコンテキストが必要な場合は、num_ctx を明示的に調整し、ビデオ メモリの変更に注意を払う必要があります。

Q5_K_MQ6_K、または Q8_0 を正確に制御したい場合は、llama.cpp、LM Studio、または手動で GGUF をインポートする方が直感的です。

RTX 3060 ラップトップ 6GB/8GB をダウングレードする方法

ノートPC RTX 3060のビデオメモリは通常6GBか8GBで、12GBの結論はコピーできません。

ビデオメモリ 提案
8GB Qwen3-4B Q6_K/Q8_0 を優先します。 8B を試したい場合は、より低いビット幅を選択し、コンテキストを低くします。
6GB Qwen3-4B Q4_K_M/Q5_K_M またはそれより小さいモデルを推奨します
12GB Qwen3-8B Q6_K がデフォルトで推奨され、Q5_K_M はより多くのコンテキストを残し、Q8_0 は短いコンテキストの試行にのみ適しています。

ノートパソコンでは、消費電力と熱放散も考慮する必要があります。ビデオ メモリが同じであっても、連続生成速度はデスクトップ カードよりも大幅に遅くなる場合があります。最初に短いプロンプトを表示して 10 ~ 20 分間実行し、その後、その構成が日常の使用に本当に適しているかどうかを判断します。

KV キャッシュと思考パターンを無視しないでください

モデル ファイルをビデオ メモリに配置できるからといって、実際のタスクがスムーズに実行されるとは限りません。 Qwen3 のコンテキスト、履歴会話、生成されたコンテンツはすべて KV キャッシュを形成します。コンテキストが長いほど、グラフィックス メモリの使用量が多くなります。

特に次のタイプのタスクでは、Q5_K_M を優先するか、-c を減らすことをお勧めします。

  • 複数のソースコード、ログ、または長いドキュメントを一度に投稿します。
  • 長く続く会話。
  • 思考モードを有効にして、非常に長い出力を許可します。
  • ローカル API は複数のリクエストを同時に処理します。

3060 12GB は、シングルユーザー、短~中程度のコンテキストのローカル アシスタントに適しています。ターゲットが 32K を超えるコンテキスト、複数人による同時実行、または大規模な RAG である場合、通常は、圧縮を続けるよりもグラフィックス メモリをアップグレードするか、クラウド推論に切り替える方が時間を節約できます。

実際の測定時にこの4項目を記録します

トークンだけを見てはいけません。同じプロンプト単語と記録を使用してテストします。

プロジェクト 見るべきもの
ビデオメモリ ほぼ満席でしょうか? KV キャッシュ用のスペースは残っていますか?
最初のトークンの遅延 長いプロンプトで長時間待つ必要がありますか?
生成速度 同じプロンプトおよび同じ出力長の下にあるトークン/秒
安定性 OOM、継続実行後のシステムの速度低下、または速度低下ですか?

一般的なタスクを安定して完了できる Q6_K は、通常、品質がわずかに高いこともありますが、頻繁にビデオ メモリをバーストする Q8_0 よりも長期保存に値します。

モデル選定の結論

  • 安定した日常使用の場合: 8B Q4_K_M/Q5_K_M。
  • 品質を向上させたい: 12B Q4 をテストし、4K ~ 8K のコンテキストを維持します。
  • 速度を向上させたい場合: 3B ~ 4B モデルまたはより短いコンテキストを選択します。
  • 20B/32B を実行したい: まず明らかな CPU オフロードと速度の低下を受け入れてから、それに値するかどうかを判断します。
  • 実稼働サービスが必要です。ビデオ メモリに加えて、同時実行性、長期安定性、障害回復性もテストする必要があります。

実測記録テンプレート

1
2
3
4
5
6
7
8
9
GPU:RTX 3060 12GB / 驱动版本
后端:Ollama 或 llama.cpp 版本
模型与来源:
量化与文件 SHA256:
上下文 / 并发:
GPU offload:
峰值显存:
首 token 延迟 / tokens/s:
任务准确性:

参考資料