Qwen3.8 到底发布没有?目前只有预览版,正式开源还要等

梳理 Qwen3.8-Max-Preview 的真实发布状态、2.4T 参数信息、Token Plan 使用入口、API 调用方法及正式开源前仍待确认的问题。

Qwen3.8 已经可以使用,但目前上线的是 Qwen3.8-Max-Preview 预览版,模型 ID 为 qwen3.8-max-preview。截至 2026 年 7 月 22 日,千问官方仍将它标注为预览模型,正式版和开放权重版本尚未发布。

这一区别很重要:现在可以通过千问 AI 平台体验和调用 Qwen3.8,但不能据此认定完整模型权重、技术报告、架构细节和正式基准已经公开。

官方文档:

快速结论

问题 当前答案
Qwen3.8 正式版发布了吗 没有,目前是 Max Preview
现在能不能使用 可以,通过 Token Plan 等官方入口
模型 ID qwen3.8-max-preview
是否支持 API 支持 OpenAI、Anthropic 等兼容接口
是否已经开源权重 尚未,官方表示正式版将发布并开放权重
参数规模 官方预告为 2.4T 总参数
是否支持视觉输入 官方 Token Plan 模型表标注支持视觉理解
是否适合生产环境 适合评估,不建议未经回归测试直接替换稳定模型

如果只是想抢先测试编程、复杂推理、多 Agent 或办公任务,现在可以开始;如果目标是本地部署、量化、微调或长期稳定生产,仍需等待正式权重和完整技术资料。

Qwen3.8 到底发布了什么

目前可确认的产品是 Qwen3.8-Max-Preview。千问 AI 平台明确说明:

  1. 它是预览版本,能力会在预览期间持续更新。
  2. 预览结束后,当前模型可能下线,也可能被正式版本替换。
  3. 当前主要通过 Token Plan 提供访问。
  4. 模型支持推理、文本生成和视觉理解。
  5. 官方预告 Qwen3.8 正式版将发布并开放权重。

因此,“Qwen3.8 已上线”和“Qwen3.8 正式开源”是两件不同的事。前者已经发生,后者仍在等待官方落地。

2.4T 参数意味着什么

官方对 Qwen3.8 的预告提到 2.4T 参数,也就是约 2.4 万亿总参数。但在完整技术报告公布前,还不能仅凭这个数字判断实际推理成本。

对于混合专家模型,至少还要知道:

  • 每个 Token 激活多少参数;
  • 专家数量和路由方式;
  • 上下文窗口与注意力结构;
  • 推理时的显存、带宽和通信需求;
  • 是否提供不同规模的稠密或 MoE 开源版本;
  • 权重采用什么许可证。

总参数决定模型容量上限的一部分,激活参数和推理架构才更直接影响每次请求的速度与成本。在这些数据公开前,不宜把 2.4T 简单理解为“推理成本一定是上一代的数倍”。

Qwen3.8-Max-Preview 适合测试什么

从官方平台定位看,Qwen3.8-Max-Preview 面向复杂推理和编程任务。更适合优先测试以下场景:

长流程编程任务

不要只测试一道算法题。可以给模型一个小型真实仓库,要求它完成:

  1. 阅读项目结构;
  2. 定位一个跨文件问题;
  3. 给出修改计划;
  4. 修改代码;
  5. 执行测试;
  6. 根据错误继续修复;
  7. 总结变更和剩余风险。

这种测试更能观察模型在长上下文、工具调用和多步纠错上的稳定性。

前端页面还原

准备同一份设计截图和验收标准,比较 Qwen3.8 与当前常用模型的结果:

  • 页面结构是否完整;
  • 响应式布局是否可用;
  • 是否擅自改变设计;
  • 是否会生成大量重复组件;
  • 首次生成后需要几轮修正;
  • 最终代码能否通过构建与 lint。

只看截图是否“好看”很容易产生主观偏差,最好同时记录构建成功率、修改轮次和人工接管时间。

数据分析与 Office 工作流

可以选择一份脱敏表格,要求模型完成数据清洗、异常说明、统计汇总和报告生成。重点检查数字是否能回溯到原始数据,而不是只看报告语言是否流畅。

多 Agent 协作

如果平台或客户端支持多个 Agent,可让不同角色负责分析、执行和审查。测试重点不是角色数量,而是任务交接时是否丢失约束、重复执行或互相覆盖文件。

如何通过 API 调用

Qwen3.8-Max-Preview 当前仅限 Token Plan。购买或开通后,需要从控制台获取套餐专属的 API Key 和 Base URL,不能直接假设它与普通按量计费地址相同。

下面以 OpenAI 兼容接口为例。请把地址替换成控制台显示的 Token Plan Base URL:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
curl "$QWEN_BASE_URL/chat/completions" \
  -H "Authorization: Bearer $QWEN_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-max-preview",
    "messages": [
      {
        "role": "user",
        "content": "分析这个方案的风险,并给出可执行的验证步骤"
      }
    ],
    "stream": false
  }'

Python 可以使用 OpenAI SDK:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["QWEN_API_KEY"],
    base_url=os.environ["QWEN_BASE_URL"],
)

response = client.chat.completions.create(
    model="qwen3.8-max-preview",
    messages=[
        {
            "role": "user",
            "content": "为这个 Python 项目设计一套分层测试方案。",
        }
    ],
    extra_body={
        "reasoning_effort": "high",
        "preserve_thinking": True,
    },
)

print(response.choices[0].message.content)

多轮对话要注意 preserve_thinking

官方 API 文档对 qwen3.8-max-preview 有一项特别说明:preserve_thinking 默认为 true,多轮对话时需要把历史消息中的 reasoning_content 完整回传。

如果客户端只保存普通 content,忽略推理字段,可能出现:

  • 后续回答质量下降;
  • 多步工具任务丢失中间状态;
  • 请求格式不符合模型预期;
  • 客户端看似兼容,实际无法稳定继续会话。

接入前应确认 SDK、代理网关和聊天客户端是否保留未知字段。不要把 reasoning_content 直接拼接进 content,官方文档明确不支持这种处理方式。

reasoning_effort 怎样选择

Qwen3.8-Max-Preview 支持 lowhighxhigh 三档推理力度,默认是 xhigh

档位 适合任务 使用建议
low 分类、提取、简单改写 优先控制延迟和消耗
high 编程、分析、工具规划 作为多数复杂任务的起点
xhigh 长程推理、复杂 Agent 任务 先小规模测试成本和稳定性

并不是所有请求都需要最高档。批量任务如果默认使用 xhigh,可能把大量预算消耗在简单问题上。更稳妥的做法是按任务复杂度路由模型和推理档位。

内置工具支持情况

千问 AI 平台列出的 Qwen3.8-Max-Preview Harness 工具包括:

  • 联网搜索;
  • 代码解释器;
  • 网页抓取;
  • 以图搜图;
  • 文搜图。

这些工具由平台提供,不等于模型权重内置了浏览器或代码执行环境。迁移到其他服务商或未来本地部署时,需要重新准备相应的工具、权限控制和运行沙箱。

涉及代码执行和网页访问时,还要单独限制:

  • 文件系统可读写范围;
  • 网络访问白名单;
  • 单次执行时间;
  • 子进程数量;
  • 密钥和环境变量暴露;
  • 下载文件大小;
  • 高风险 Shell 与 Git 命令。

模型能力更强,不会自动消除工具执行风险。

现在不应下结论的内容

预览阶段最容易出现的问题,是把宣传信息提前写成确定事实。以下内容仍应等待正式资料:

开源许可证

官方表示将开放权重,但具体许可证、可商用范围、再分发要求和使用限制尚未完整公布。

本地部署门槛

2.4T 总参数模型即使采用 MoE,也不代表普通工作站能够运行。是否会同步发布小参数版本、量化权重和推理框架支持,需要等待模型卡。

完整基准成绩

内部任务表现可以用来了解产品定位,但不能代替公开数据集、第三方评测和真实业务回归测试。

稳定模型 ID

预览版可能持续更新,今天与下周调用同一个模型 ID,实际能力可能已经发生变化。生产评估应保存日期、请求参数、输入样本和完整输出。

一套可复用的评估方法

准备 20 至 50 个来自真实业务的脱敏任务,同时让当前生产模型与 Qwen3.8-Max-Preview 执行。每个任务记录:

指标 记录内容
成功率 是否满足明确验收条件
首次通过率 是否无需追加提示即可完成
工具调用 参数是否正确、是否重复调用
延迟 首 Token 与完整响应耗时
消耗 输入、推理、输出 Token 或 Credits
稳定性 相同任务多次运行差异
人工成本 修正结果所需时间
安全性 是否越权访问文件、网络或密钥

不要只挑模型擅长的公开题目,也不要用一次成功结果替代重复测试。对 Agent 模型来说,完成率和可恢复性通常比单轮回答观感更重要。

常见问题

Qwen3.8 已经正式开源了吗?

没有。目前可使用的是 qwen3.8-max-preview,正式版和开放权重仍处于“即将发布”状态。

能在 Ollama 或 llama.cpp 中运行吗?

当前没有官方 Qwen3.8 开放权重,不能像已开源的小型 Qwen 模型一样直接下载运行。第三方同名模型也不能视为官方正式权重。

普通 DashScope API Key 能直接调用吗?

官方文档目前把该模型标注为仅 Token Plan 可用。应使用 Token Plan 控制台提供的专属 API Key 和 Base URL,并以控制台实际权限为准。

预览版适合替换生产模型吗?

不建议直接替换。预览期能力和接口行为可能调整,应先进行固定样本回归、成本评估、异常降级和数据合规检查。

什么时候发布正式版?

官方只给出了即将发布和开放权重的信息,没有提供可验证的精确日期。遇到具体发布日期传闻,应等千问官方模型页、模型卡或代码仓库确认。

总结

Qwen3.8 的热点是真的,但准确说法应是:Qwen3.8-Max-Preview 已上线,正式版尚未发布,开放权重仍在等待中。

现在最值得做的不是围绕参数规模下结论,而是用真实任务验证它的编程、推理、视觉理解和工具调用能力,同时保存完整测试条件。等正式模型卡、权重、许可证和公开基准落地后,再判断本地部署与生产迁移是否划算。