跳到主要内容

GLM-5.3-Flash

概述

GLM-5.3-Flash 是 Z.AI 于 2026 年 8 月 26 日发布的开放权重原生多模态模型,也是 GLM-5 系列的 Flash 级模型。该模型拥有 3200 亿总参数和 180 亿激活参数,支持 1M Token 上下文,并采用稀疏注意力与线性注意力相结合的混合架构,面向编程、Agent 和视觉知识工作负载。

GLM-5.3-Flash

本活动覆盖 B.AI API 和 Chat:
  • API: GLM-5.3-Flash API 调用目前按 0 Credits 结算,不收取输入、缓存写入、缓存读取或输出 Token 费用。
  • Chat: GLM-5.3-Flash 在 B.AI Chat 上架后免费开放,具体开放时间以模型实际上架为准;开放后,Chat 使用按 0 Credits 结算。

活动结束后,GLM-5.3-Flash 将恢复本页展示的价格。

主要特性

  • 高效混合架构:采用稀疏注意力、线性注意力、流形约束超连接(mHC)和 IndexPool。Z.AI 在架构对比中表示,与 GLM-5.3 相比,该模型的注意力计算量降低至约三分之一,KV Cache 体积缩小至约四分之一。
  • 原生多模态理解:支持文本、图片、视频和文件输入,使 Agent 能够在任务中检查界面、渲染结果、文档及其他视觉信息。
  • 编程与 Agent 评测:Z.AI 公布的评测结果包括 Terminal-Bench 2.1 为 84.3、DeepSWE v1.1 为 63.4、Toolathlon Verified 为 78.4,以及 AutomationBench v1.0.6 为 48.8。
  • 可配置的始终开启推理:支持 lowhighmax 推理强度,默认使用 max,不支持关闭推理。

适用场景

  • 可视化软件工程:结合截图或渲染结果检查,构建和优化前端、游戏、3D 场景及其他交互界面。
  • 长周期编程 Agent:适用于需要推理、函数调用和大上下文的代码库级实现、调试、测试及多步骤自动化任务。
  • 多模态专业工作流:对文档、图表、仪表盘、演示文稿、电子表格和视频进行提取与推理,再通过 Agent 环境生成结构化文本或办公交付物。
  • 成本敏感型 API 工作负载:适用于重视低 Token 成本、缓存输入价格和 1M Token 上下文的大规模文本及多模态任务。

能力与限制

能力说明
推理推理始终开启。reasoning_effort 支持 lowhighmax,默认值为 max
创意写作支持通用文本和长文本生成。
编程Z.AI 公布的评测结果包括 Terminal-Bench 2.1:84.3、DeepSWE v1.1:63.4、NL2Repo:56.3、Toolathlon Verified:78.4,以及 AutomationBench v1.0.6:48.8。
多模态支持文本、图片、视频和文件输入,输出文本。
上下文窗口1,000,000 Token。
最大输出最高 131,072 Token;max_tokens 默认值为 65,536。
工具调用支持函数调用、流式工具调用、上下文缓存和 JSON 结构化输出。ZCode 可结合 Browser Use 和 Computer Use,用于需要视觉信息支撑的 Agent 工作流。
多语言官方模型仓库标明支持英文和中文。

已知限制

  • thinking.type 仅支持 enabled;需要降低推理强度时,应使用 reasoning_effort: "low",而不是关闭推理。

Credits 用量

模型输入(Credits/Token)缓存写入(Credits/Token)缓存读取(Credits/Token)输出(Credits/Token)联网搜索(Credits/次)
GLM-5.3-Flash0.0750.0750.0150.25-

限时价格说明: 50% Token 价格活动将于 2026 年 9 月 9 日 24:00(UTC+8,新加坡时间)结束。

价格说明

文档价格为 B.AI 平台模型标准参考价,仅供基础计费说明使用。B.AI 可能会通过限时活动、充值赠送及账户权益等方式,为用户提供更低的实际使用成本。具体价格、赠送 Credits、账户权益及最终结算请以平台页面和账单记录为准。