Kimi K3 がフルモデルのウェイトを正式にリリースしました。 Moonshot AI は、これをオープンウェイトを備えた世界初の 3 兆パラメータ レベル モデルと呼んでいます。合計パラメータは 2.8 兆、各トークンは約 1,040 億のパラメータをアクティブにし、ビジュアル入力と 100 万のトークン コンテキストをネイティブにサポートします。 ウェイトは Hugging Face から無料でダウンロードできますが、「無料でダウンロードできる」ということは「低コストで通常のコンピュータで実行できる」という意味ではありません。 公式モデルの倉庫には現在 96 個の Safetensors 重量の破片が含まれており、合計は約 1.42 TiB になります。ダウンロード、検証、ロード、推論にはサーバーレベルのリソースが必要です。 この記事では、単にランキングや「世界最強」という文章だけを見てしまうことがないよう、リリース情報、ダウンロードコマンド、ハードウェアの判断、展開の入口、ライセンスと性能の比較を個別に解説しています。
最初に最も一般的な 3 つの質問に答えてください
確かに、API や技術レポートだけでなく、Kimi K3 の全重量が公開されています。
正式な入り口は moonshotai/Kimi-K3 で、GitHub リポジトリには、vLLM、SGLang、TokenSpeed の 3 つのデプロイ ルートも明確にリストされています。
モデル ファイルは無料でダウンロードできますが、リポジトリ全体のサイズは 1 TiB を超え、7B、32B、または通常の消費者向け定量モデルと同じ方法ではハードウェアを推定できません。
公式ベンチマークでは、一部のプログラミング、エージェント、ナレッジ ワーク テストでClaude、GPT-5.6 シリーズ以上であることが示されていますが、すべてが 1 位であるわけではありません。
したがって、ミッションやテスト条件で絶対的に最強であると宣言するのではなく、「オープンウェイトモデルのフラッグシップレベルの選択」という方が正確です。
今回公開されるコンテンツ
README、Kimi K3 ライセンス、および技術レポートは、公式 GitHub リポジトリで入手できます。 Hugging Face モデル ページには、構成、トークナイザー、カスタム モデリング コード、および完全な Safetensor ウェイトが提供されます。 ウェイトは、表示するために適用する必要があるプレースホルダー ファイルではありません。 Hugging Face にログインした後、CLI を介してローカルまたはサーバーにダウンロードできます。 同関係者はモデル構造、定量的形式、主な評価結果、推奨推論エンジンも明らかにした。
ただし、これは完全なトレーニング データ パッケージではありません。 「重みをオープン」とは、モデルのパラメータを取得してデプロイできることを意味しており、学習コーパスやすべての学習パイプライン、各評価環境が公開されていることを意味するものではありません。 オープン性の度合いを判断するときは、プロジェクト タイトルのオープンソースだけを見るのではなく、重み、コード、ライセンス、トレーニング データ、複製実験を個別に見る必要があります。
2.8 兆パラメータの仕組み
Kimi K3 は、合計 896 人のエキスパート (トークンごとに 16 人が選択され、2 人の共有エキスパートが使用されます) を備えた混合エキスパート アーキテクチャを使用します。 合計パラメータは 2.8T で、活性化パラメータは約 104B です。 これは、2.8T 密モデルのように 1 回の推論ですべてのパラメーターが有効になるわけではありませんが、すべてのエキスパートの重みを保存、整理し、デバイス間で転送する必要があることを意味します。
モデルには合計 93 層があり、そのうち注目層は 69 層の KDA と 24 層の Gated MLA で構成されます。 ビジュアル エンコーダーは MoonViT-V2 で、パラメーターは約 4 億 1,000 万です。 コンテキストの上限は 1,048,576 トークンですが、プロトコルの上限に達しても、どの展開でも 100 万個のコンテキストを経済的に提供できるわけではありません。 KV キャッシュ、同時実行数、入力画像、出力長はVRAMを消費し続けます。
MXFP4 を「小規模メモリ量子化バージョン」
と直接同一視することはできません。 Kimi K3 は、教師付き微調整段階から量子化を意識したトレーニングを開始します。公式のウェイトは MXFP4 を使用し、アクティベーションは MXFP8 を使用します。 これは、後で BF16 の重みを 4 ビットに圧縮するよりも、モデルのネイティブ設計に近くなります。 ただし、MXFP4 ファイルを保存できるからといって、どの GPU も対応するオペレーターを効率的に実行できるわけではありません。 推論エンジンのバージョン、GPU アーキテクチャ、通信ライブラリ、カーネルのサポートによって、起動と実際の速度が決まります。
最終的なディスクを見積もるために「2.8T × 0.5 バイト」だけを使用しないでください。 リポジトリには、ビジョン モジュール、スケール情報、インデックス、トークナイザー、その他の構成も含まれています。ファイル システムは、一時ファイル、キャッシュ、ログをダウンロードするためのスペースも予約します。 Hugging Face の現在のドキュメント リストは、リリース前の見積もりを引用するのではなく、展開前のガイドラインとして使用する必要があります。
実際の総重量はどのくらいですか
この記事の確認時点では、公式モデル リポジトリには 96 個の .safetensors シャードが含まれています。
Hugging Face API を通じてこれらのファイルの size フィールドを要約すると、合計は 1,560,936,091,448 バイト、約 1.42 TiB になります。
これは、ダウンロード、コンテナー イメージ、Python 環境、実行ログの一時的な占有を除いた、Safetensors の重みの合計にすぎません。
実際の展開では、少なくとも 2 TiB の利用可能な高速ローカル ストレージを準備することをお勧めします。
ダウンロード ツールがキャッシュと local-dir データの 2 つのコピーを保持する場合、必要なスペースがさらに増加する可能性があります。
メカニカル ハードディスクはアーカイブには適していますが、頻繁にコールド スタートを行う非常に大規模なモデルには適していません。共有ネットワーク ディスクの場合は、スループットとメタデータのパフォーマンスを最初にテストする必要があります。
をダウンロードする前に容量の事前チェックを行ってください Linux はターゲット パーティションを表示できます:
|
|
Windows PowerShell はデータ ディスクを確認できます:
|
|
容量に加えて、ファイル システムが大きなファイルをサポートしていること、ディレクトリ クォータに制限がないこと、ダウンロード アカウントにターゲット ディレクトリへの書き込み権限があることを確認してください。 クラウド サーバーでは、まずデータ ディスク、スナップショット、送信トラフィックのコストを計算します。ウェイトの無料ダウンロードは、クラウド ディスクが無料であることを意味するものではありません。
ハグフェイス CLI
をインストールする huggingface_hub の現在のバージョンをスタンドアロン Python 環境にインストールします:
|
|
Windows PowerShell の使用法:
|
|
リポジトリへのアクセスにログインが必要な場合は、Hugging Face で読み取り専用トークンを作成します:
|
|
コマンド履歴、Dockerfile、またはパブリック デプロイメント スクリプトにトークンを置かないでください。
まずドライランを使用してファイルリスト
新しいバージョンの CLI は、実際にダウンロードする前にプランを確認することをサポートしています:
|
|
現在の CLI が --dry-run を認識しない場合は、まず huggingface_hub をアップグレードしてから、
|
|
を確認してください。 コマンド例が旧バージョン huggingface-cli と異なるからといって、複数の重複する環境を同時にインストールしないでください。
後で同じ重量を再現できるように、ダウンロードの開始時に hf --version とモデル リビジョンを記録します。
完全なリポジトリをダウンロード
ターゲット ディレクトリは、ローカル SSD または十分な容量を持つ高スループットの並列ファイル システム上にある必要があります:
|
|
ダウンロードプロセス中にキャッシュを繰り返し削除しないでください。 Hugging Face のダウンローダーは完成したファイルを再利用できます。ネットワークが中断された後、同じコマンドを実行してネットワークを復元します。 サーバーを再起動する前にログを保存し、ターゲット ディレクトリが一時的なシステム ディスクではないことを確認してください。
クラスター全体でファイルの不整合を避けるためにリビジョンを修正
モデル リポジトリは、README、構成、コード、または重みインデックスを更新し続ける場合があります。 運用環境では、検証済みのコミット SHA:
|
|
をロックする必要があります。 マルチノード展開の場合、各マシンが異なる時間に main をダウンロードできるようにしないでください。
まずリビジョンを決定し、次にすべてのノードと同期し、最後にファイル リストとハッシュを比較します。
ローリング アップデート中は以前のディレクトリを保持し、新しいバージョンをロードできることを確認した後で古いウェイトをクリーンアップします。
をダウンロードした後にファイルを数えるだけではありません インデックス、合計サイズ、異常に小さいファイルを確認してください:
|
|
config.json、Tokenizer ファイル、重みインデックス、カスタム コードがすべて存在することを確認します。
シャードが数 KB しかない場合は、Git LFS/Xet ポインターか未完了の一時ファイルを取得した可能性があります。
不完全なディレクトリで推論サービスを繰り返し開始したり、実際のダウンロードの問題がエラー ログによってかき消されたりしないようにしてください。
普通のコンピュータで Kimi K3 を実行できますか?
フルウェイトは、通常のデスクトップ、ゲーム用ラップトップ、またはシングルコンシューマ GPU には適していません。 重みだけでも約 1.42 TiB で、実際のサービスにはランタイム、アクティベーション、通信バッファリング、KV キャッシュも必要です。 CPU オフロードによってすべての重みがかろうじて保存されたとしても、メモリ帯域幅とディスク スワップによって対話速度が非実用的になります。
「トークンごとに 104B をアクティブにする」ということは、104B パラメーターのみをロードする必要があるという意味であることを理解していません。 MoE ルーティングでは、異なるトークン間で異なるエキスパートが選択されますが、エキスパートの完全なセットにアクセスできる必要があります。 モデルを体験したい個人ユーザーは、最初にハードウェアを購入するのではなく、まず Kim 公式 API、認定推論プロバイダー、または Kim Code を選択する必要があります。
サーバー構成はエンジン レシピ
から逆にする必要があります。 公式は、すべての GPU に適用される単一マシンの最小構成表を提供していません。 まず、vLLM、SGLang、または TokenSpeed の公式 Kimi K3 レシピを選択し、次にサポートされている GPU モデル、ノード数、インターコネクト、精度を確認するのが合理的です。 非常に大規模な MoE 展開では、多くの場合、複数の GPU または複数のノードが必要となり、高速 NVLink、NVSwitch、または InfiniBand タイプの相互接続に依存します。
VRAMの総量は最初のレベルのみです。 ノード間の帯域幅が不十分であると、エキスパートの並列通信がボトルネックになる可能性があります。ドライバー、CUDA、NCCL、および推論エンジンのバージョンが一致しないと、ロードする前に失敗する可能性があります。 マシンを準備するときは、GPU アーキテクチャ、シングルカード VRAM、トポロジ、システム メモリ、ローカル ディスク スループットも記録する必要があります。
vLLM を使用する前に、専用レシピ
を確認してください 公式リポジトリでは vLLM が推奨されており、Kimi K3 のデプロイメント レシピへのリンクがあります。 まず分離環境を作成し、バージョンを記録します:
|
|
Hugging Face ページにある一般的な入り口は次のとおりです:
|
|
Kimi K3 のサイズのモデルの場合、このコマンドはインターフェイス形式のみであり、シングル カード導入のコミットメントではありません。 テンソル並列処理、エキスパート並列処理、マルチノード アドレス、ポート、およびメモリ パラメーターは、現在のレシピのハードウェアに対応する構成を使用する必要があります。 他の MoE モデルのパラメータに基づいて並列トポロジを推測しないでください。
SGLang は公式推奨ルートでもあります
基本的な起動入り口は次のとおりです:
|
|
まず、ローカル検証のために 127.0.0.1 をバインドします。認証されていないモデル サービスをパブリック ネットワークに直接公開しないでください。
完全なクラスターでは、SGLang 公式クックブックに従って並列モード、ノード検出、および通信パラメーターを構成する必要もあります。
MXFP4 がサポートされていない、アーキテクチャが不明である、またはカスタム コードが欠落していることがログに示されている場合は、まずエンジンのバージョンと Kimi K3 のサポート ステータスを確認してください。
OpenAI 互換インターフェイス
を使用して最初のリクエストを行う サービスが正常になったら、短いテキスト リクエストを送信します:
|
|
モデルは常に思考を可能にし、reasoning_content 経由で推論コンテンツを返します。
最初のテストでは短いコンテキストと低い同時実行性を使用し、テキスト、推論フィールド、終了理由、トークン統計を確認してから、負荷を徐々に増やしていきます。
開始直後に入力として 100 万トークンを送信しないでください。これにより、モデル読み込みの問題と KV キャッシュのプレッシャーが混在することになります。
複数回の対話では思考履歴を保持する必要がある
Kimi K3 は思考履歴保存モードを使用します。
複数ラウンドの会話やツール呼び出しを継続する場合は、reasoning_content と tool_calls を含む、前のアシスタント メッセージをそのまま messages に戻す必要があります。
最後の content のみを保存すると、推論とツールの状態を引き継ぐモデルの機能が破壊される可能性があります。
アプリケーション データベースもこれらのフィールドを保存できる必要があります。 プライバシーやストレージのコストが懸念される場合は、要求前に履歴の一部を無計画に削除するのではなく、製品の設計段階で保存期間を決定する必要があります。 推論テキストは外部に表示するときに非表示にすることができますが、モデルに送信される履歴構造は依然として公式プロトコルに準拠している必要があります。
「ClaudeやGPT-5.6に匹敵する性能」
の見方 公式形式 Kimi K3 がすべての指標で勝っているわけではありません。 たとえば、ターミナルベンチ 2.1 では、Kimi K3 は 88.3、GPT-5.6 ソルは 88.8 です。 DeepSWE はそれぞれ 67.5 と 73.0 です。 しかし、FrontierSWE では、Kimi K3 は 81.2 で、表内の GPT-5.6 ソル 71.3 よりも高くなります。 SWEマラソンではキミK3が42.0点、GPT-5.6ソルが39.0点。 公式の BrowseComp テーブルでは、Kimi K3 が 91.2、GPT-5.6 ソルが 90.4、Claude オーパス 4.8 が 84.3 です。
このデータは、「一部のプログラミングとエージェント タスクがクローズド ソースの主力レベルに達している」ことを裏付けています。 「すべてのクローズド ソース モデルを包括的に超えるシナリオ」はサポートされません。 モデルの選択では、中国の品質、レイテンシー、スループット、ツールのフレームワーク、拒否動作、出力の安定性、実際のコストもテストされます。
横方向データムはハーネスの違いを無視できません
公式には、異なるモデルが常に同じエージェント フレームワークを使用するとは限りません。 Kimi K3 はキミ コードまたはClaude コードとペアリングすることができ、GPT-5.6 Sol は通常コーデックスとペアリングすることができ、他のモデルも独自の最適なハーネスを使用することができます。 さまざまなツール、プロンプト、コンテキスト圧縮戦略、最大の思考強度がすべて結果に影響します。
一部のスコアはモデル メーカーのテストから取得され、一部はサードパーティのリストを参照し、一部は内部ベンチマークです。 表を読みながら、脚注、実行数、ハードウェア、およびタスクのサブセットに注目してください。 企業を選択するときは、独自のコード ベース、ドキュメント、ツール チェーンを使用してブラインド テストを実施するのが最善です。合計スコアの 1 つの列のみに基づいてクラスターを購入しないでください。
Kimi K3 ライセンスは、標準の許容ライセンス
の単純なコピーではありません。 このライセンスでは、追加の商業条件を条件として、使用、コピー、変更、出版、配布、サブライセンス、販売、展開、および微調整が許可されます。 企業とその関連会社が Model as a Service を運営し、総収益が 12 か月連続で 2,000 万米ドルを超える場合、ソフトウェアまたは派生バージョンを商業目的で使用するには、Moonshot AI との別途契約が必要です。
商用製品やサービスの月間アクティブ ユーザー数が 1 億人を超える場合、または月間収益が 2,000 万米ドルを超える場合は、インターフェイス上で「Kimi K3」を目立つように表示する必要があります。 ライセンスには、内部使用、公式製品、および認定推論パートナーに対する例外が記載されています。 商用利用、再配布、またはモデルサービスの提供を準備する場合、法務部門は完全なライセンスを読む必要があり、単に「無料商用利用」と書くことはできません。
重みダウンロード後のセキュリティ境界
Hugging Face の例では trust_remote_code=True を使用しています。これは、モデルのロード時にリポジトリ内のカスタム Python コードの実行が許可されていることを意味します。
実稼働サーバーでは、特権のないコンテナーまたは専用アカウントで実行する前に、リビジョンをロックダウンし、コードをレビューする必要があります。
モデル サービス アカウントに SSH 秘密キー、クラウド資格情報、または運用データベースのバックアップを読み取らせないでください。
認証、TLS、リクエスト本文の制限、およびレート制限は、API ポートの前に設定する必要があります。 画像、ビデオ、および非常に長いコンテキストのサイズ制限を設定して、単一のリクエストで KV キャッシュまたはディスクがいっぱいになるのを防ぎます。 プロンプトや推論ログを保存する際に非感作を行い、ユーザーデータの保存期間を明確にする。
ダウンロードに関する一般的な問題
No space left on device これは、必ずしもターゲット ディスクが実際にいっぱいであることを意味するわけではありません。あるいは、デフォルトでキャッシュがより小さいシステム ディスクに書き込まれている可能性があります。
HF_HOME、コンテナのマウント、一時ディレクトリの実際の場所を確認してください。
ダウンロード速度が突然ゼロに戻った場合は、プロセスをすぐに強制終了せずに、最初にディスクの書き込みとファイルの検証を確認してください。
401 または 403 が表示されたら、トークンの権限、ログイン アカウント、リポジトリのアクセス条件を確認してください。
チェックサムまたはシャードが欠落している場合は、同じリビジョンのダウンロード コマンドを再実行し、ツールにファイルを完了させます。
複数のノードでモデルが見つからない場合は、マウント パスと権限を比較します。同じディレクトリ名は、各ノードが同じストレージ部分を認識することを意味するものではありません。
一般的な起動エラー
unknown model type は、通常、Transformers または推論エンジンのバージョンに Kimi K3 サポートがまだ含まれていないことを意味します。
unsupported quantization は、MXFP4 コア、GPU アーキテクチャ、またはエンジン ビルドの不一致を示しています。
NCCL タイムアウトは主にノード ネットワーク、ネットワーク カードの選択、ファイアウォール、または並列トポロジに関連するため、タイムアウトを無限に増やしてマスクするべきではありません。
ロードの途中でシステムによって強制終了された場合は、GPU メモリ以外のホスト メモリと cgroup の制限を確認してください。 ロードはできるが速度が異常に遅い場合は、各カードの使用率、カード間のトラフィック、最初のトークンの遅延、およびデコード速度を記録します。 GPU の一部だけがアイドル状態になっており、通常は並列構成またはエキスパート分散が期待どおりに動作していないことを示しています。
API を直接利用すべき場面 を直接利用すべき場面 を直接利用すべき場面 を直接利用すべき場面
を直接使用する必要があるのはどのような場合ですか? 個人開発、機能検証、同時実行性の低いアプリケーション、および GPU クラスターを持たないチームの場合は、Kimi API または認定推論サービスが推奨されます。 API では 1.42 TiB の重みをダウンロードする必要がなく、エンジンのアップグレード、障害回復、クラスター通信のコストも発生しません。 既存の Kimi K3 API 呼び出し、ビジュアル入力、およびツールの使用例については、[Kimi K3 API クイック スタート] (/ja/2026/07/18/kimi-k3-api-python-streaming-vision-tools-quickstart/) を参照してください。
オンプレミス展開は、重みの制御、データの分離、推論スタックの変更、またはハイエンド GPU クラスターをすぐに利用できるようにする必要がある組織に適しています。 その場合でも、セルフホスト型のスループット、レイテンシー、総所有コストを測定する前に、まず API を通じて品質ベースラインを確立することをお勧めします。 「正常にダウンロードされました」は展開の開始にすぎず、サービスが実稼働標準に達したことを意味するものではありません。
オンラインにする前に再現可能なリストを記録する
- モデル リポジトリのコミット SHA とライセンス バージョン。
- 96 個の重み付けされたシャードの数、合計サイズ、ステータスを確認します。
- 推論エンジン、PyTorch、CUDA、ドライバー、NCCL のバージョン。
- GPU モデル、ノード トポロジ、VRAM、およびホスト メモリ。
- コンテキストの長さ、同時実行性、思考努力、最大出力。
- 最初のトークンのレイテンシ、出力速度、エラー率、およびピーク リソース。
- 独自のタスクセットにおける API、Claude、GPT-5.6 との比較結果。
- API 認証、ログ マスキング、電流制限、データ保持ポリシー。
これらの記録を完了すると、後でウェイトやエンジンをアップグレードするときにパフォーマンスの変化がどこから来たのかを判断できます。
公式入場
Kimi K3 の重要性は、高得点モデルのリリースだけでなく、フラッグシップの全重量がすでに研究、レビュー、展開できることでもあります。 ただし、1.42 TiB の重量、クラスター通信、カスタム ライセンスにより、これは通常のコンピューターのワンクリック ローカル モデルではないことがわかります。 最初に公式 API を通じてタスクの効果を確認し、次に修正されたリビジョンに従ってダウンロードし、vLLM または SGLang の Kimi K3 特別レシピに従ってクラスターを計画する方が安全な選択です。