智谱 AI 正式开源了新的旗舰模型 GLM 5.2。
本文只采用 GLM 5.2 官方模型卡、技术报告和仓库能够核验的内容。官方将它定位为长周期任务旗舰模型,并强调稳定的 100 万 Token 上下文与可调思考强度;具体榜单成绩仍应按模型卡的评测版本、工具配置和日期理解。
这说明开源模型在 Agent 和编程方向的差距正在缩小。过去大家通常认为,最强 Agent 主要看 OpenAI,最强代码能力主要看 Anthropic,开源模型更多是在后面追赶。GLM 5.2 的出现,至少让这个判断变得没有那么绝对。
百万 Token 上下文
GLM 5.2 这次最醒目的升级,是 100 万 Token 上下文。
更关键的是,官方强调这是稳定运行的 100 万 Token 环境。很多模型都宣称支持长上下文,但真正把几十万字、复杂文档或大型代码库丢进去之后,前面的内容可能会逐渐被遗忘,或者回答开始漂移。
GLM 5.2 重点优化的是长周期任务。它适合处理:
- 一整本小说或长篇资料;
- 大型项目代码库;
- 多个文档库和知识库;
- 需要连续工作很久的 Agent 任务。
这对未来的 AI 助手很重要。真正有价值的 Agent 不只是回答一个问题,而是能围绕一个目标连续执行、调试、修复、总结,甚至持续工作几个小时或几天。
Agent 与编码能力怎么验证
不要把演示视频中的 Minecraft、3D 场景或网站生成结果当成通用结论。可复现测试至少应保存:提示词、模型与推理版本、思考强度、工具权限、生成文件、测试命令、失败次数和最终人工修改量。
一个更可靠的编码验收任务是:给模型一个带测试的公开小项目,要求它修复指定 issue;运行项目原有测试,再人工检查 diff。只有保存这些输入和输出,才能比较 GLM 5.2 与其他模型,而不是凭截图判断“谁更强”。
本地部署并不轻松
GLM 5.2 虽然是开放权重模型,但本地部署门槛很高。
目前可选部署框架包括 SGLang、vLLM 和 Transformers。如果是部署集群 Agent,SGLang 更适合追求性能和吞吐;如果只是做常规推理,也可以考虑 vLLM、Transformers,或后续适配到 LM Studio、Ollama 等工具链。
真正的问题在硬件。
不要用参数量直接猜下载大小或显存需求。部署前先查看官方仓库的权重分片总大小、数据类型和所选框架的并行要求,再加上 KV cache、激活、CUDA graph 与运行时余量。1M 上下文本身还会显著增加 KV cache,实际服务通常应从较短上下文和单并发开始验收。
|
|
--dry-run 输出可用来确认需要下载的文件和总量;真正部署时再按官方模型卡选择 Transformers、vLLM 或 SGLang,并记录框架版本与启动参数。
企业更适合用 API
是否使用 API 应根据数据边界、并发量、延迟、运维能力和实际报价计算,不应直接给出“百万元级”固定结论。多数团队可以先用 API 和固定评测集验证业务价值,再根据调用量测算私有化的硬件与维护成本。
小结
GLM 5.2 的重点不只是参数规模,而是长上下文、Agent 编程和复杂任务执行。
官方评测说明它面向长任务和编码,但工程价值仍需用自己的仓库、测试和工具链复现。模型卡中的榜单不能替代真实项目验收。
如果只是体验和开发应用,优先使用在线平台或 API 更现实。如果是企业级隐私、安全和内网场景,再考虑 SGLang、vLLM 等本地部署方案。