Tags
5 个页面
VLLM
Kimi K3 对比 Claude 与 GPT-5.6:开源权重、基准性能与许可证说明
本地大模型 API 给 Codex 使用教程:Ollama、LM Studio 和 vLLM
LMCache 实用指南:vLLM 推理服务如何复用 KV Cache
DiffusionGemma 本地部署:用 vLLM 跑起 Google 文本扩散模型
NVIDIA 发布 Qwen3.6-35B-A3B-NVFP4:面向 vLLM 部署的 FP4 量化版本