Qwen3.8 已经可以使用,但目前上线的是 Qwen3.8-Max-Preview 预览版,模型 ID 为 qwen3.8-max-preview。截至 2026 年 7 月 22 日,千问官方仍将它标注为预览模型,正式版和开放权重版本尚未发布。
这一区别很重要:现在可以通过千问 AI 平台体验和调用 Qwen3.8,但不能据此认定完整模型权重、技术报告、架构细节和正式基准已经公开。
官方文档:
快速结论
| 问题 | 当前答案 |
|---|---|
| Qwen3.8 正式版发布了吗 | 没有,目前是 Max Preview |
| 现在能不能使用 | 可以,通过 Token Plan 等官方入口 |
| 模型 ID | qwen3.8-max-preview |
| 是否支持 API | 支持 OpenAI、Anthropic 等兼容接口 |
| 是否已经开源权重 | 尚未,官方表示正式版将发布并开放权重 |
| 参数规模 | 官方预告为 2.4T 总参数 |
| 是否支持视觉输入 | 官方 Token Plan 模型表标注支持视觉理解 |
| 是否适合生产环境 | 适合评估,不建议未经回归测试直接替换稳定模型 |
如果只是想抢先测试编程、复杂推理、多 Agent 或办公任务,现在可以开始;如果目标是本地部署、量化、微调或长期稳定生产,仍需等待正式权重和完整技术资料。
Qwen3.8 到底发布了什么
目前可确认的产品是 Qwen3.8-Max-Preview。千问 AI 平台明确说明:
- 它是预览版本,能力会在预览期间持续更新。
- 预览结束后,当前模型可能下线,也可能被正式版本替换。
- 当前主要通过 Token Plan 提供访问。
- 模型支持推理、文本生成和视觉理解。
- 官方预告 Qwen3.8 正式版将发布并开放权重。
因此,“Qwen3.8 已上线”和“Qwen3.8 正式开源”是两件不同的事。前者已经发生,后者仍在等待官方落地。
2.4T 参数意味着什么
官方对 Qwen3.8 的预告提到 2.4T 参数,也就是约 2.4 万亿总参数。但在完整技术报告公布前,还不能仅凭这个数字判断实际推理成本。
对于混合专家模型,至少还要知道:
- 每个 Token 激活多少参数;
- 专家数量和路由方式;
- 上下文窗口与注意力结构;
- 推理时的显存、带宽和通信需求;
- 是否提供不同规模的稠密或 MoE 开源版本;
- 权重采用什么许可证。
总参数决定模型容量上限的一部分,激活参数和推理架构才更直接影响每次请求的速度与成本。在这些数据公开前,不宜把 2.4T 简单理解为“推理成本一定是上一代的数倍”。
Qwen3.8-Max-Preview 适合测试什么
从官方平台定位看,Qwen3.8-Max-Preview 面向复杂推理和编程任务。更适合优先测试以下场景:
长流程编程任务
不要只测试一道算法题。可以给模型一个小型真实仓库,要求它完成:
- 阅读项目结构;
- 定位一个跨文件问题;
- 给出修改计划;
- 修改代码;
- 执行测试;
- 根据错误继续修复;
- 总结变更和剩余风险。
这种测试更能观察模型在长上下文、工具调用和多步纠错上的稳定性。
前端页面还原
准备同一份设计截图和验收标准,比较 Qwen3.8 与当前常用模型的结果:
- 页面结构是否完整;
- 响应式布局是否可用;
- 是否擅自改变设计;
- 是否会生成大量重复组件;
- 首次生成后需要几轮修正;
- 最终代码能否通过构建与 lint。
只看截图是否“好看”很容易产生主观偏差,最好同时记录构建成功率、修改轮次和人工接管时间。
数据分析与 Office 工作流
可以选择一份脱敏表格,要求模型完成数据清洗、异常说明、统计汇总和报告生成。重点检查数字是否能回溯到原始数据,而不是只看报告语言是否流畅。
多 Agent 协作
如果平台或客户端支持多个 Agent,可让不同角色负责分析、执行和审查。测试重点不是角色数量,而是任务交接时是否丢失约束、重复执行或互相覆盖文件。
如何通过 API 调用
Qwen3.8-Max-Preview 当前仅限 Token Plan。购买或开通后,需要从控制台获取套餐专属的 API Key 和 Base URL,不能直接假设它与普通按量计费地址相同。
下面以 OpenAI 兼容接口为例。请把地址替换成控制台显示的 Token Plan Base URL:
|
|
Python 可以使用 OpenAI SDK:
|
|
多轮对话要注意 preserve_thinking
官方 API 文档对 qwen3.8-max-preview 有一项特别说明:preserve_thinking 默认为 true,多轮对话时需要把历史消息中的 reasoning_content 完整回传。
如果客户端只保存普通 content,忽略推理字段,可能出现:
- 后续回答质量下降;
- 多步工具任务丢失中间状态;
- 请求格式不符合模型预期;
- 客户端看似兼容,实际无法稳定继续会话。
接入前应确认 SDK、代理网关和聊天客户端是否保留未知字段。不要把 reasoning_content 直接拼接进 content,官方文档明确不支持这种处理方式。
reasoning_effort 怎样选择
Qwen3.8-Max-Preview 支持 low、high 和 xhigh 三档推理力度,默认是 xhigh。
| 档位 | 适合任务 | 使用建议 |
|---|---|---|
low |
分类、提取、简单改写 | 优先控制延迟和消耗 |
high |
编程、分析、工具规划 | 作为多数复杂任务的起点 |
xhigh |
长程推理、复杂 Agent 任务 | 先小规模测试成本和稳定性 |
并不是所有请求都需要最高档。批量任务如果默认使用 xhigh,可能把大量预算消耗在简单问题上。更稳妥的做法是按任务复杂度路由模型和推理档位。
内置工具支持情况
千问 AI 平台列出的 Qwen3.8-Max-Preview Harness 工具包括:
- 联网搜索;
- 代码解释器;
- 网页抓取;
- 以图搜图;
- 文搜图。
这些工具由平台提供,不等于模型权重内置了浏览器或代码执行环境。迁移到其他服务商或未来本地部署时,需要重新准备相应的工具、权限控制和运行沙箱。
涉及代码执行和网页访问时,还要单独限制:
- 文件系统可读写范围;
- 网络访问白名单;
- 单次执行时间;
- 子进程数量;
- 密钥和环境变量暴露;
- 下载文件大小;
- 高风险 Shell 与 Git 命令。
模型能力更强,不会自动消除工具执行风险。
现在不应下结论的内容
预览阶段最容易出现的问题,是把宣传信息提前写成确定事实。以下内容仍应等待正式资料:
开源许可证
官方表示将开放权重,但具体许可证、可商用范围、再分发要求和使用限制尚未完整公布。
本地部署门槛
2.4T 总参数模型即使采用 MoE,也不代表普通工作站能够运行。是否会同步发布小参数版本、量化权重和推理框架支持,需要等待模型卡。
完整基准成绩
内部任务表现可以用来了解产品定位,但不能代替公开数据集、第三方评测和真实业务回归测试。
稳定模型 ID
预览版可能持续更新,今天与下周调用同一个模型 ID,实际能力可能已经发生变化。生产评估应保存日期、请求参数、输入样本和完整输出。
一套可复用的评估方法
准备 20 至 50 个来自真实业务的脱敏任务,同时让当前生产模型与 Qwen3.8-Max-Preview 执行。每个任务记录:
| 指标 | 记录内容 |
|---|---|
| 成功率 | 是否满足明确验收条件 |
| 首次通过率 | 是否无需追加提示即可完成 |
| 工具调用 | 参数是否正确、是否重复调用 |
| 延迟 | 首 Token 与完整响应耗时 |
| 消耗 | 输入、推理、输出 Token 或 Credits |
| 稳定性 | 相同任务多次运行差异 |
| 人工成本 | 修正结果所需时间 |
| 安全性 | 是否越权访问文件、网络或密钥 |
不要只挑模型擅长的公开题目,也不要用一次成功结果替代重复测试。对 Agent 模型来说,完成率和可恢复性通常比单轮回答观感更重要。
常见问题
Qwen3.8 已经正式开源了吗?
没有。目前可使用的是 qwen3.8-max-preview,正式版和开放权重仍处于“即将发布”状态。
能在 Ollama 或 llama.cpp 中运行吗?
当前没有官方 Qwen3.8 开放权重,不能像已开源的小型 Qwen 模型一样直接下载运行。第三方同名模型也不能视为官方正式权重。
普通 DashScope API Key 能直接调用吗?
官方文档目前把该模型标注为仅 Token Plan 可用。应使用 Token Plan 控制台提供的专属 API Key 和 Base URL,并以控制台实际权限为准。
预览版适合替换生产模型吗?
不建议直接替换。预览期能力和接口行为可能调整,应先进行固定样本回归、成本评估、异常降级和数据合规检查。
什么时候发布正式版?
官方只给出了即将发布和开放权重的信息,没有提供可验证的精确日期。遇到具体发布日期传闻,应等千问官方模型页、模型卡或代码仓库确认。
总结
Qwen3.8 的热点是真的,但准确说法应是:Qwen3.8-Max-Preview 已上线,正式版尚未发布,开放权重仍在等待中。
现在最值得做的不是围绕参数规模下结论,而是用真实任务验证它的编程、推理、视觉理解和工具调用能力,同时保存完整测试条件。等正式模型卡、权重、许可证和公开基准落地后,再判断本地部署与生产迁移是否划算。