GLM 5.2 开源:百万上下文、Agent 编程与本地部署门槛

依据 GLM 5.2 官方模型卡说明 1M 上下文、长任务与编码能力,并给出模型文件核验、部署容量估算和复现实测方法。

智谱 AI 正式开源了新的旗舰模型 GLM 5.2。

本文只采用 GLM 5.2 官方模型卡、技术报告和仓库能够核验的内容。官方将它定位为长周期任务旗舰模型,并强调稳定的 100 万 Token 上下文与可调思考强度;具体榜单成绩仍应按模型卡的评测版本、工具配置和日期理解。

这说明开源模型在 Agent 和编程方向的差距正在缩小。过去大家通常认为,最强 Agent 主要看 OpenAI,最强代码能力主要看 Anthropic,开源模型更多是在后面追赶。GLM 5.2 的出现,至少让这个判断变得没有那么绝对。

百万 Token 上下文

GLM 5.2 这次最醒目的升级,是 100 万 Token 上下文。

更关键的是,官方强调这是稳定运行的 100 万 Token 环境。很多模型都宣称支持长上下文,但真正把几十万字、复杂文档或大型代码库丢进去之后,前面的内容可能会逐渐被遗忘,或者回答开始漂移。

GLM 5.2 重点优化的是长周期任务。它适合处理:

  • 一整本小说或长篇资料;
  • 大型项目代码库;
  • 多个文档库和知识库;
  • 需要连续工作很久的 Agent 任务。

这对未来的 AI 助手很重要。真正有价值的 Agent 不只是回答一个问题,而是能围绕一个目标连续执行、调试、修复、总结,甚至持续工作几个小时或几天。

Agent 与编码能力怎么验证

不要把演示视频中的 Minecraft、3D 场景或网站生成结果当成通用结论。可复现测试至少应保存:提示词、模型与推理版本、思考强度、工具权限、生成文件、测试命令、失败次数和最终人工修改量。

一个更可靠的编码验收任务是:给模型一个带测试的公开小项目,要求它修复指定 issue;运行项目原有测试,再人工检查 diff。只有保存这些输入和输出,才能比较 GLM 5.2 与其他模型,而不是凭截图判断“谁更强”。

本地部署并不轻松

GLM 5.2 虽然是开放权重模型,但本地部署门槛很高。

目前可选部署框架包括 SGLang、vLLM 和 Transformers。如果是部署集群 Agent,SGLang 更适合追求性能和吞吐;如果只是做常规推理,也可以考虑 vLLM、Transformers,或后续适配到 LM Studio、Ollama 等工具链。

真正的问题在硬件。

不要用参数量直接猜下载大小或显存需求。部署前先查看官方仓库的权重分片总大小、数据类型和所选框架的并行要求,再加上 KV cache、激活、CUDA graph 与运行时余量。1M 上下文本身还会显著增加 KV cache,实际服务通常应从较短上下文和单并发开始验收。

1
huggingface-cli download zai-org/GLM-5.2 --dry-run

--dry-run 输出可用来确认需要下载的文件和总量;真正部署时再按官方模型卡选择 Transformers、vLLM 或 SGLang,并记录框架版本与启动参数。

企业更适合用 API

是否使用 API 应根据数据边界、并发量、延迟、运维能力和实际报价计算,不应直接给出“百万元级”固定结论。多数团队可以先用 API 和固定评测集验证业务价值,再根据调用量测算私有化的硬件与维护成本。

小结

GLM 5.2 的重点不只是参数规模,而是长上下文、Agent 编程和复杂任务执行。

官方评测说明它面向长任务和编码,但工程价值仍需用自己的仓库、测试和工具链复现。模型卡中的榜单不能替代真实项目验收。

如果只是体验和开发应用,优先使用在线平台或 API 更现实。如果是企业级隐私、安全和内网场景,再考虑 SGLang、vLLM 等本地部署方案。

参考资料