GPT-5.6 Luna
概述
GPT-5.6 Luna 是 OpenAI GPT-5.6 系列的成本友好层级模型,已于 2026 年 7 月 9 日正式可用。在 API 中,模型 ID 为 gpt-5.6-luna,OpenAI 将其定位为面向高效、高频工作负载的模型。
核心特性
- 成本友好的 GPT-5.6 层级:适合 token 成本和响应效率较重要的高频工作负载。
- 扩展推理控制:支持
none、low、medium、high、xhigh和max推理强度;GPT-5.6 还支持通过reasoning.mode: "pro"启用 Pro 模式。 - Agent 工具能力:支持 Responses API 工作流、函数调用、网页搜索、文件搜索、Computer Use、Programmatic Tool Calling、持久化推理和多 Agent beta 能力。
- 大工作上下文:支持 1.05M token 上下文窗口和最高 128K 输出 token,知识截止时间为 2026 年 2 月 16 日。
适用场景
- 高频辅助任务:摘要、改写、分类、信息抽取、路由和轻量分析。
- 响应型产品功能:用户侧助手、流程 Copilot 和成本可预测的常规自动化。
- 第一轮技术处理:初步问题分流、草拟代码审查、测试用例生成和文档分析,再将困难任务升级到 Terra 或 Sol。
能力与限制
| 能力维度 | 说明 |
|---|---|
| 推理能力 | 支持 none、low、medium、high、xhigh 和 max;API Pro 模式通过 reasoning.mode: "pro" 启用,而不是独立的 Pro 模型 ID。 |
| 编程能力 | 官方示例指标包括 SWE-Bench Pro 62.7%、DeepSWE v1.1 67.2% 和 Terminal-Bench 2.1 84.7%。 |
| 创作能力 | 支持通用文本生成。 |
| 多模态能力 | 支持文本和图像输入、文本输出;当图像 detail 为 original 或 auto 时,GPT-5.6 会保留原始图像尺寸。 |
| 响应速度 | 公共 API 延迟取决于推理强度、工具使用和处理层级;Luna 定位为高效、高频使用。 |
| 上下文窗口 | 1.05M tokens。 |
| 最大输出 | 128K tokens。 |
| 工具调用 | 函数调用、网页搜索、文件搜索、Computer Use、Programmatic Tool Calling、持久化推理和多 Agent beta。 |
| 多语言能力 | OpenAI API 模型文档列出当前模型支持多语言能力。 |
已知限制
- Luna 的能力定位低于 Terra 和 Sol,复杂推理、敏感技术工作和质量优先的工作流可能需要升级处理。
- 更高推理强度、Pro 模式、多 Agent 运行和长上下文使用会增加延迟和成本。
- 网络安全和生物相关防护可能会拒绝、阻止或暂停敏感请求,包括部分合法的双用途工作。
- GPT-5.6 模型的 Prompt Cache 写入会计费,因此建议通过
cache_write_tokens和cached_tokens监控缓存断点。
积分消耗
| 上下文档位 | 输入 (Credits/Token) | Cache Write (Credits/Token) | Cache Read (Credits/Token) | 输出 (Credits/Token) | 网页搜索(Credits/次) | 计费说明 |
|---|---|---|---|---|---|---|
| 短上下文 | 1.00 | 1.25 | 0.10 | 6.00 | 10,000 | GPT-5.6 Luna 标准价格 |
| 长上下文(输入 token >272K) | 2.00 | 2.50 | 0.20 | 9.00 | 10,000 | 长上下文价格档位 |
价格说明
文档价格为 B.AI 平台模型标准参考价,仅供基础计费说明使用。B.AI 可能会通过充值赠送及账户权益等方式,为用户提供更低的实际使用成本。具体价格、赠送积分及账户权益请以平台页面展示及最终账单为准。
- GPT-5.6 模型的缓存写入按未缓存输入价格的 1.25x 计费;缓存读取按输入价格的 0.1x 折扣计费。