跳到主要内容

Qwen3.8-Max

概述

Qwen3.8-Max 是阿里巴巴面向编程、专业知识工作、多模态理解和长周期智能体任务推出的旗舰 Qwen 模型。该模型于 2026 年 8 月 3 日正式发布,API 模型 ID 为 qwen3.8-max。模型采用 Mixture-of-Experts(MoE)架构,总参数量为 2.4 万亿,每个 token 激活 950 亿参数;支持文本、图像和视频输入,输出为文本。

核心特性

  • 2.4T 参数 MoE 架构: 基于 Qwen3.5 架构基础构建,总参数量为 2.4 万亿,每个 token 激活 950 亿参数。
  • 原生多模态智能: 在同一模型中处理文本、图像和视频。Qwen 将视觉能力视为智能体规划、执行和自我纠错闭环的一部分,而非独立的预处理步骤。
  • 1M Token 上下文: 提供 100 万 token 上下文窗口;non-thinking 模式最多支持 991.80K 输入 token,thinking 模式最多支持 983.61K 输入 token,两种模式的最大输出均为 131.07K token。
  • 可配置推理: 默认开启 thinking。API 支持 lowmediumxhigh 三档 reasoning_effort,默认使用 xhigh,并默认跨轮保留推理内容。
  • 长周期智能体工作: 发布资料展示了自主编程、研究、芯片设计优化和年度业务模拟等任务。在一个编程案例中,模型连续运行约 16 天,无人工干预地产生了 265 个 commit、127 个 pull request 和 151 个 issue。
  • 智能体与 API 集成: 支持 Function Calling、结构化输出、前缀补全、批量推理、上下文缓存和内置工具;可通过 OpenAI 兼容的 Chat Completions 和 Responses API、Anthropic 兼容 API 或 DashScope 调用。

适用场景

  • 自主软件工程: 使用编程智能体进行多日实现、仓库维护、测试、调试和迭代交付。
  • 研究与实验: 复现论文、编写实验管线、运行迭代评估,并借助工具持续完善假设。
  • 专业知识工作: 法律审查、财务分析、文档生产、数据分析、设计原型及其他多步骤办公工作流。
  • 长周期规划与优化: 需要数百次反馈循环、持久状态、自适应规划和重复验证的任务。
  • 多模态智能体: 结合文档、截图、图像、视频、代码执行、搜索和外部工具的工作流。

能力与限制

能力维度说明
推理能力默认开启 thinking。reasoning_effort 支持 lowmediumxhigh,默认使用 xhigh。最大映射推理预算为 262,144 token,默认预算为 131,072 token。
编程能力面向自主、长周期编程设计。Qwen 报告的 Terminal-Bench 2.1 得分为 86.6、SWE-bench Pro 为 67.7、FrontierSWE 为 73.5、PaperBench 为 93.0。
多模态能力支持文本、图像和视频输入,输出为文本。
上下文窗口100 万 token。
最大输入non-thinking 模式为 991.80K token,thinking 模式为 983.61K token。
最大输出两种模式均为 131.07K token。
结构化输出支持。
架构基于 Qwen3.5 的 Mixture-of-Experts 架构。
总参数量2.4 万亿。
激活参数量950 亿。
知识截止日期未公开。

已知限制

  • 默认开启跨轮推理保留。多轮客户端必须返回完整且未经修改的 reasoning_content 历史;保留的推理内容同样会计入输入 token 和计费。
  • 阿里巴巴尚未公布模型专属的知识截止日期、实测生成速度或完整的语言覆盖列表。

价格

模型名称输入(Credits/Token)缓存写入(Credits/Token)缓存读取(Credits/Token)输出(Credits/Token)网页搜索(Credits/次)计费说明
Qwen3.8-Max2.002.000.256.00-缓存读取采用官方隐式缓存价格。
价格说明

文档价格为 B.AI 平台模型标准参考价,仅供基础计费说明使用。B.AI 可能会通过充值赠送及账户权益等方式,为用户提供更低的实际使用成本。具体价格、赠送积分及账户权益请以平台页面展示及最终账单为准。