跳到主要内容

GLM-5.3-FlashX

概述

GLM-5.3-FlashX 是 Z.AI 推出的 GLM-5.3-Flash 速度优化版本,结合原生多模态理解与 1M Token 上下文窗口,面向交互式编程、工具调用 Agent 和文档工作流。Z.AI 公布的生成速度最高可达每秒 200 Token;实际速度会因请求而异,不构成单次请求的保证。

模型 ID: glm-5.3-flashx

主要特性

  • 加速推理:通过服务基础设施优化提升生成速度,有助于缩短交互式任务和工具驱动工作流中的等待时间。
  • 高效架构:采用 Flash 系列共享架构,拥有 3200 亿总参数和 180 亿激活参数,并结合稀疏注意力与线性注意力,降低长上下文计算量。
  • 原生视觉理解:支持图片、视频、文本和文件输入,适用于结合视觉信息、语言和代码的任务。
  • 可配置推理:支持 lowhighmax 推理强度,默认使用 max,推理始终保持开启。
  • Agent 集成:支持函数调用、流式工具调用、JSON 输出和自动上下文缓存。

适用场景

  • 交互式编程 Agent:适用于希望缩短工具调用等待时间的实现、调试和迭代任务。
  • 可视化界面开发:理解截图并检查渲染后的界面,以辅助代码修改和效果优化。
  • 长文档助手:结合长篇资料、图表和多轮对话上下文,进行分析与结构化提取。
  • 办公自动化:通过外部创作工具和视觉检查,规划及修改演示文稿、报告和电子表格。

能力与限制

能力说明
推理推理始终开启;支持工具调用过程中的交错推理,以及跨轮次保留推理内容。
多模态支持文本、图片、视频和文件输入,输出文本。
上下文窗口1,000,000 Token。
最大输出131,072 Token。
工具调用支持函数调用,并可选择流式传输工具调用参数。
结构化输出支持 JSON 对象输出;暂无模型级严格 JSON Schema 约束的明确保证。

已知限制

  • 推理无法关闭。选择 low 仅会降低推理强度,不会切换为非推理模式。
  • 保留推理内容需要完整、未经修改且顺序正确的历史 reasoning_content。在继续相关推理和工具调用序列时,集成方必须保留该内容。

标准价格

以下 Token 价格均以美元计价,单位为每 100 万 Token;网页搜索按次计费。

模型输入
(USD / 1M Tokens)
缓存写入
(USD / 1M Tokens)
缓存读取
(USD / 1M Tokens)
输出
(USD / 1M Tokens)
网页搜索
(USD / 次)
GLM-5.3-FlashX$0.37$0.37$0.075$1.25-

Credits 结算: B.AI 按照 1 USD = 1,000,000 Credits 换算,并从账户余额中扣除 Credits。

价格说明

文档价格为 B.AI 平台模型标准参考价,仅供基础计费说明使用。B.AI 可能会通过限时活动、充值赠送及账户权益等方式,为用户提供更低的实际使用成本。具体价格、赠送 Credits、账户权益及最终结算请以平台页面和账单记录为准。