GLM-5.3-FlashX
概述
GLM-5.3-FlashX 是 Z.AI 推出的 GLM-5.3-Flash 速度优化版本,结合原生多模态理解与 1M Token 上下文窗口,面向交互式编程、工具调用 Agent 和文档工作流。Z.AI 公布的生成速度最高可达每秒 200 Token;实际速度会因请求而异,不构成单次请求的保证。
模型 ID: glm-5.3-flashx
主要特性
- 加速推理:通过服务基础设施优化提升生成速度,有助于缩短交互式任务和工具驱动工作流中的等待时间。
- 高效架构:采用 Flash 系列共享架构,拥有 3200 亿总参数和 180 亿激活参数,并结合稀疏注意力与线性注意力,降低长上下文计算量。
- 原生视觉理解:支持图片、视频、文本和文件输入,适用于结合视觉信息、语言和代码的任务。
- 可配置推理:支持
low、high和max推理强度,默认使用max,推理始终保持开启。 - Agent 集成:支持函数调用、流式工具调用、JSON 输出和自动上下文缓存。
适用场景
- 交互式编程 Agent:适用于希望缩短工具调用等待时间的实现、调试和迭代任务。
- 可视化界面开发:理解截图并检查渲染后的界面,以辅助代码修改和效果优化。
- 长文档助手:结合长篇资料、图表和多轮对话上下文,进行分析与结构化提取。
- 办公自动化:通过外部创作工具和视觉检查,规划及修改演示文稿、报告和电子表格。
能力与限制
| 能力 | 说明 |
|---|---|
| 推理 | 推理始终开启;支持工具调用过程中的交错推理,以及跨轮次保留推理内容。 |
| 多模态 | 支持文本、图片、视频和文件输入,输出文本。 |
| 上下文窗口 | 1,000,000 Token。 |
| 最大输出 | 131,072 Token。 |
| 工具调用 | 支持函数调用,并可选择流式传输工具调用参数。 |
| 结构化输出 | 支持 JSON 对象输出;暂无模型级严格 JSON Schema 约束的明确保证。 |
已知限制
- 推理无法关闭。选择
low仅会降低推理强度,不会切换为非推理模式。 - 保留推理内容需要完整、未经修改且顺序正确的历史
reasoning_content。在继续相关推理和工具调用序列时,集成方必须保留该内容。
标准价格
以下 Token 价格均以美元计价,单位为每 100 万 Token;网页搜索按次计费。
| 模型 | 输入 (USD / 1M Tokens) | 缓存写入 (USD / 1M Tokens) | 缓存读取 (USD / 1M Tokens) | 输出 (USD / 1M Tokens) | 网页搜索 (USD / 次) |
|---|---|---|---|---|---|
| GLM-5.3-FlashX | $0.37 | $0.37 | $0.075 | $1.25 | - |
Credits 结算: B.AI 按照 1 USD = 1,000,000 Credits 换算,并从账户余额中扣除 Credits。
价格说明
文档价格为 B.AI 平台模型标准参考价,仅供基础计费说明使用。B.AI 可能会通过限时活动、充值赠送及账户权益等方式,为用户提供更低的实际使用成本。具体价格、赠送 Credits、账户权益及最终结算请以平台页面和账单记录为准。