Grok 4.6
概述
Grok 4.6 是 SpaceXAI 推出的 Grok 4 系列推理模型,于 2026 年 8 月 12 日发布,面向编码、长周期 Agent、交互与视觉项目以及知识工作。该模型可通过 API 使用,模型 ID 为 grok-4.6;支持文本和图像输入、文本输出、500,000 token 上下文窗口,以及四档可配置的推理强度。
核心特性
- 长周期 Agent 工作:在知识工作、通用编程、内核优化、Web 开发和计算机辅助设计等 Agent 强化学习任务上训练,重点提升复杂任务在多步骤执行中的持续能力。
- 可配置推理:支持
low、medium、high和xhigh推理强度,默认使用high。推理无法关闭,API 可流式返回摘要推理内容。 - 编程与知识工作评测:SpaceXAI 报告其在 CursorBench v3.2、DeepSWE v1.1、FrontierCode v1.1 Extended 和 APEX-Agents 上的得分分别为 69.9%、65.9%、61.3% 和 57.5%。
- 长上下文多模态能力:支持在 500,000 token 上下文窗口内接收文本和图像输入,并输出文本。提示词达到或超过 200,000 token 时使用长上下文价格。
- 结构化 Agent 工作流:支持函数调用、并行工具调用、结构化输出,以及网页搜索和 X 搜索等内置工具。
适用场景
- 仓库级软件工程:跨大型代码库或长周期编程会话实现功能、调试、重构和验证变更。
- 交互式产品原型:将宽泛的产品想法转化为可运行应用,包括其结构、视觉语言和核心交互,并根据反馈持续迭代。
- 工具型研究 Agent:结合推理、网页或 X 搜索、自定义函数、结构化输出与反复验证步骤。
- 技术知识工作:分析文档和图像,或在科学、工程、数学等专业领域产出技术成果。
能力与限制
| 能力维度 | 说明 |
|---|---|
| 推理能力 | 支持 low、medium、high 和 xhigh 推理强度;默认使用 high,且推理无法关闭。官方结果包括 AA Intelligence Index 得分 61,以及 GDPVal-AA v2 得分 1,753。 |
| 编程能力 | 面向长周期 Agent 编程和技术工作流设计。官方结果包括 CursorBench v3.2 得分 69.9%、DeepSWE v1.1 得分 65.9%、FrontierCode v1.1 Extended 得分 61.3%,以及 Terminal-Bench v3.0 得分 26%。 |
| 创意写作 | 支持通用文本生成和文档创建。 |
| 多模态能力 | 支持文本和图像输入,输出为文本。 |
| 响应速度 | SpaceXAI 尚未发布模型专属的延迟或每秒 token 数指标。 |
| 上下文窗口 | 500,000 token。提示词达到或超过 200,000 token 时,请求中的所有 token 按长上下文价格计费。 |
| 最大输出 | SpaceXAI 的发布说明表示该模型没有文本输出上限。 |
| 工具调用 | 支持函数调用、并行工具调用、结构化输出,以及网页搜索和 X 搜索等内置工具。Responses API 还支持代码执行、文件或集合搜索,以及 Remote MCP 工具。 |
| 多语言能力 | 支持自然语言提示。 |
| 知识截止日期 | 2026 年 2 月 1 日。 |
已知限制
- Grok 4.20 及更新模型不支持
logprobs和top_logprobs。推理请求也不支持presencePenalty、frequencyPenalty和stop。 - SpaceXAI 尚未发布模型专属吞吐量、多语言评测或单独的数值型输出 token 上限。
积分消耗
| 模型与上下文档位 | 输入 (Credits/Token) | 缓存写入 (Credits/Token) | 缓存读取 (Credits/Token) | 输出 (Credits/Token) |
|---|---|---|---|---|
| Grok 4.6 | 2.00 | 2.00 | 0.50 | 6.00 |
| Grok 4.6(提示词 >=200K token) | 4.00 | 2.00 | 1.00 | 12.00 |
- 当提示词达到 200,000 token 时,请求中的所有输入、缓存输入、推理和输出 token 均按长上下文价格计费。推理 token 按输出 token 价格计费。
价格说明
文档价格为 B.AI 平台模型标准参考价,仅供基础计费说明使用。B.AI 可能会通过充值赠送及账户权益等方式,为用户提供更低的实际使用成本。具体价格、赠送积分及账户权益请以平台页面展示及最终账单为准。