GLM-5.3-Flash
概述
GLM-5.3-Flash 是 Z.AI 于 2026 年 8 月 26 日发布的开放权重原生多模态模型,也是 GLM-5 系列的 Flash 级模型。该模型拥有 3200 亿总参数和 180 亿激活参数,支持 1M Token 上下文,并采用稀疏注意力与线性注意力相结合的混合架构,面向编程、Agent 和视觉知识工作负载。
GLM-5.3-Flash
本活动覆盖 B.AI API 和 Chat:
- API: GLM-5.3-Flash API 调用目前按
0 Credits结算,不收取输入、缓存写入、缓存读取或输出 Token 费用。 - Chat: GLM-5.3-Flash 在 B.AI Chat 上架后免费开放,具体开放时间以模型实际上架为准;开放后,Chat 使用按
0 Credits结算。
活动结束后,GLM-5.3-Flash 将恢复本页展示的价格。
主要特性
- 高效混合架构:采用稀疏注意力、线性注意力、流形约束超连接(mHC)和 IndexPool。Z.AI 在架构对比中表示,与 GLM-5.3 相比,该模型的注意力计算量降低至约三分之一,KV Cache 体积缩小至约四分之一。
- 原生多模态理解:支持文本、图片、视频和文件输入,使 Agent 能够在任务中检查界面、渲染结果、文档及其他视觉信息。
- 编程与 Agent 评测:Z.AI 公布的评测结果包括 Terminal-Bench 2.1 为 84.3、DeepSWE v1.1 为 63.4、Toolathlon Verified 为 78.4,以及 AutomationBench v1.0.6 为 48.8。
- 可配置的始终开启推理:支持
low、high和max推理强度,默认使用max,不支持关闭推理。
适用场景
- 可视化软件工程:结合截图或渲染结果检查,构建和优化前端、游戏、3D 场景及其他交互界面。
- 长周期编程 Agent:适用于需要推理、函数调用和大上下文的代码库级实现、调试、测试及多步骤自动化任务。
- 多模态专业工作流:对文档、图表、仪表盘、演示文稿、电子表格和视频进行提取与推理,再通过 Agent 环境生成结构化文本或办公交付物。
- 成本敏感型 API 工作负载:适用于重视低 Token 成本、缓存输入价格和 1M Token 上下文的大规模文本及多模态任务。
能力与限制
| 能力 | 说明 |
|---|---|
| 推理 | 推理始终开启。reasoning_effort 支持 low、high 和 max,默认值为 max。 |
| 创意写作 | 支持通用文本和长文本生成。 |
| 编程 | Z.AI 公布的评测结果包括 Terminal-Bench 2.1:84.3、DeepSWE v1.1:63.4、NL2Repo:56.3、Toolathlon Verified:78.4,以及 AutomationBench v1.0.6:48.8。 |
| 多模态 | 支持文本、图片、视频和文件输入,输出文本。 |
| 上下文窗口 | 1,000,000 Token。 |
| 最大输出 | 最高 131,072 Token;max_tokens 默认值为 65,536。 |
| 工具调用 | 支持函数调用、流式工具调用、上下文缓存和 JSON 结构化输出。ZCode 可结合 Browser Use 和 Computer Use,用于需要视觉信息支撑的 Agent 工作流。 |
| 多语言 | 官方模型仓库标明支持英文和中文。 |
已知限制
thinking.type仅支持enabled;需要降低推理强度时,应使用reasoning_effort: "low",而不是关闭推理。
Credits 用量
| 模型 | 输入(Credits/Token) | 缓存写入(Credits/Token) | 缓存读取(Credits/Token) | 输出(Credits/Token) | 联网搜索(Credits/次) |
|---|---|---|---|---|---|
| GLM-5.3-Flash | 0.075 | 0.075 | 0.015 | 0.25 | - |
限时价格说明: 50% Token 价格活动将于 2026 年 9 月 9 日 24:00(UTC+8,新加坡时间)结束。
价格说明
文档价格为 B.AI 平台模型标准参考价,仅供基础计费说明使用。B.AI 可能会通过限时活动、充值赠送及账户权益等方式,为用户提供更低的实际使用成本。具体价格、赠送 Credits、账户权益及最终结算请以平台页面和账单记录为准。