Qwen3.8-Max
概述
Qwen3.8-Max 是阿里巴巴面向编程、专业知识工作、多模态理解和长周期智能体任务推出的旗舰 Qwen 模型。该模型于 2026 年 8 月 3 日正式发布,API 模型 ID 为 qwen3.8-max。模型采用 Mixture-of-Experts(MoE)架构,总参数量为 2.4 万亿,每个 token 激活 950 亿参数;支持文本、图像和视频输入,输出为文本。
核心特性
- 2.4T 参数 MoE 架构: 基于 Qwen3.5 架构基础构建,总参数量为 2.4 万亿,每个 token 激活 950 亿参数。
- 原生多模态智能: 在同一模型中处理文本、图像和视频。Qwen 将视觉能力视为智能体规划、执行和自我纠错闭环的一部分,而非独立的预处理步骤。
- 1M Token 上下文: 提供 100 万 token 上下文窗口;non-thinking 模式最多支持 991.80K 输入 token,thinking 模式最多支持 983.61K 输入 token,两种模式的最大输出均为 131.07K token。
- 可配置推理: 默认开启 thinking。API 支持
low、medium和xhigh三档reasoning_effort,默认使用xhigh,并默认跨轮保留推理内容。 - 长周期智能体工作: 发布资料展示了自主编程、研究、芯片设计优化和年度业务模拟等任务。在一个编程案例中,模型连续运行约 16 天,无人工干预地产生了 265 个 commit、127 个 pull request 和 151 个 issue。
- 智能体与 API 集成: 支持 Function Calling、结构化输出、前缀补全、批量推理、上下文缓存和内置工具;可通过 OpenAI 兼容的 Chat Completions 和 Responses API、Anthropic 兼容 API 或 DashScope 调用。
适用场景
- 自主软件工程: 使用编程智能体进行多日实现、仓库维护、测试、调试和迭代交付。
- 研究与实验: 复现论文、编写实验管线、运行迭代评估,并借助工具持续完善假设。
- 专业知识工作: 法律审查、财务分析、文档生产、数据分析、设计原型及其他多步骤办公工作流。
- 长周期规划与优化: 需要数百次反馈循环、持久状态、自适应规划和重复验证的任务。
- 多模态智能体: 结合文档、截图、图像、视频、代码执行、搜索和外部工具的工作流。
能力与限制
| 能力维度 | 说明 |
|---|---|
| 推理能力 | 默认开启 thinking。reasoning_effort 支持 low、medium 和 xhigh,默认使用 xhigh。最大映射推理预算为 262,144 token,默认预算为 131,072 token。 |
| 编程能力 | 面向自主、长周期编程设计。Qwen 报告的 Terminal-Bench 2.1 得分为 86.6、SWE-bench Pro 为 67.7、FrontierSWE 为 73.5、PaperBench 为 93.0。 |
| 多模态能力 | 支持文本、图像和视频输入,输出为文本。 |
| 上下文窗口 | 100 万 token。 |
| 最大输入 | non-thinking 模式为 991.80K token,thinking 模式为 983.61K token。 |
| 最大输出 | 两种模式均为 131.07K token。 |
| 结构化输出 | 支持。 |
| 架构 | 基于 Qwen3.5 的 Mixture-of-Experts 架构。 |
| 总参数量 | 2.4 万亿。 |
| 激活参数量 | 950 亿。 |
| 知识截止日期 | 未公开。 |
已知限制
- 默认开启跨轮推理保留。多轮客户端必须返回完整且未经修改的
reasoning_content历史;保留的推理内容同样会计入输入 token 和计费。 - 阿里巴巴尚未公布模型专属的知识截止日期、实测生成速度或完整的语言覆盖列表。
价格
| 模型名称 | 输入(Credits/Token) | 缓存写入(Credits/Token) | 缓存读取(Credits/Token) | 输出(Credits/Token) | 网页搜索(Credits/次) | 计费说明 |
|---|---|---|---|---|---|---|
| Qwen3.8-Max | 2.00 | 2.00 | 0.25 | 6.00 | - | 缓存读取采用官方隐式缓存价格。 |
价格说明
文档价格为 B.AI 平台模型标准参考价,仅供基础计费说明使用。B.AI 可能会通过充值赠送及账户权益等方式,为用户提供更低的实际使用成本。具体价格、赠送积分及账户权益请以平台页面展示及最终账单为准。