常见问题(FAQ)
1. B.AI Chat 和 API 有什么区别?
Chat 适合直接在网页或 App 中对话;API 适合开发者将模型接入自己的应用或工具。两者的可用模型、功能和计费规则可能有所不同,请查看对应页面。
2. 如何获取和使用 API Key?
在 B.AI 控制台创建 API Key,然后配置到应用或客户端中。请求可使用 Authorization: Bearer <API Key> 或 x-api-key 鉴权。请妥善保管 Key,避免公开到截图、日志或代码仓库。详见 API 参考。
3. API Base URL 应该填写什么?
生产环境 Base URL 为 https://api.b.ai/v1。具体请求端点需根据客户端使用的协议选择;不同模型支持的端点可能不同。详见 API 参考。
4. 在中国大陆无法访问 B.AI,怎么办?
可在 B.AI Android App 的“B.AI 服务可用性”中查看当前可用的 Web 地址和 API Base URL。请完整复制 App 展示的地址。详见 App 与服务可用性。
5. B.AI App 从哪里下载?
可通过 Google Play 安装,或扫描 B.AI 官网右上角的 Android 下载二维码获取 APK。支持 Android 8.0 及以上版本。详见 App 与服务可用性。
6. 不知道选哪个模型怎么办?
在 Chat 中可以选择 Auto,由平台根据每次任务匹配当前账户可用的模型。如果需要固定模型或做能力测试,可以手动选择。Auto 本身不额外收费,按实际执行模型和用量结算。详见 Auto 模式。
7. API 请求中的模型名称怎么填写?
打开 API Key 页面,找到需要使用的模型,点击模型名称右侧的复制按钮,即可复制模型 ID,将其填入请求的 model 字段。
也可以通过 GET /v1/models 查询当前 API Key 可用的模型列表,并确认所选模型支持正在使用的端点。详见 API 参考。
8. 输入、输出、缓存写入和缓存读取分别怎么计费?
输入是发送给模型的内容,输出是模型生成的内容;缓存写入是建立可复用缓存,缓存读取是后续复用缓存内容。不同模型的费率、有效期和收费方式不同,部分模型还会把推理 Token 计入输出用量,请查看模型详情页。
9. 显式缓存和隐式缓存有什么区别?会额外收费吗?
显式缓存通常由调用方主动创建或指定;隐式缓存由服务自动识别可复用内容。两者都可能涉及写入或读取计费,部分模型的显式缓存还收取按存储时间计算的费用。具体支持方式和费用以模型详情页为准。
10. 联网搜索是否额外收费?
联网搜索按次单独计费,费率因模型而异。搜索生成的内容若进入模型上下文,还可能产生相应的 Token 费用。请查看模型详情页的联网搜索价格和实际用量记录。
11. 为什么实际扣费与文档价格不完全一样?
文档展示标准参考价,实际结算还可能受到活动折扣、账户权益、缓存命中、上下文档位、分时价格和工具使用的影响。详见 定价与用量及 活动与调整公告。
12. 长上下文和 DeepSeek 峰谷计费怎么理解?
部分模型在输入超过指定长度后采用不同费率,适用门槛和计费范围见模型详情页。
DeepSeek 分时模型的高峰时段为北京时间(UTC+8)周一至周五(不含中国法定节假日)09:00-12:00、14:00-18:00;其余时间,包括周末及中国法定节假日全天,均为空闲时段。空闲价为高峰价的一半,B.AI Chat 中统一采用空闲价。详见 定价与用量。
13. 如何查看余额和实际扣费?
在平台的 Usage 页面查看余额、实际模型、Token 用量和 Credits 消耗。开发者也可通过 余额 API 查询当前 API Key 可用的余额或额度。
14. 为什么模型没有给出答案,仍然扣除了积分?
模型费用按实际产生的输入、输出及缓存读写等计费用量计算。没有可见答案,并不一定意味着没有产生用量:请求可能已处理输入 Token,部分推理模型还可能生成未展示给用户的推理 Token,这些用量仍可能计费。
实际扣费以 Usage 页面中的用量记录为准。如果对某次扣费有疑问,请保留请求时间和相关记录,便于核查。
15. API 报错应该怎么排查?
先查看响应中的错误说明,再按状态码处理:
| 状态码 | 优先检查 |
|---|---|
400 | 参数、请求格式及模型与端点是否兼容 |
401 | API Key 和鉴权请求头 |
403 | 账户状态、订阅或模型权限 |
404 | 请求路径和模型 ID |
429 | 调用频率及并发量,降低并发并使用指数退避重试 |
500 / 502 / 503 | 稍后重试,并保留 request ID 供排查 |
详见 API 参考。
16. 为什么输入未达到模型标注的上下文上限,仍可能报错?
B.AI 平台未额外设置上下文长度限制,实际调用仍需遵循模型及上游接口的规则。
模型标注的上下文容量,不一定全部用于正文输入。系统提示词、历史对话和工具相关内容也会占用空间,部分接口还会为输出预留容量。此外,客户端估算的 Token 数可能与服务端统计存在差异,因此不能仅凭正文长度判断是否超限。
建议精简历史消息、按实际需求设置最大输出长度,并为上下文保留一定余量。若仍出现长度相关报错,可将超长内容分段处理,或先提取关键内容后再提交。
17. 为什么 Responses API 返回了缓存读取用量,却没有缓存写入用量?
部分模型采用隐式缓存机制,由上游服务自动管理缓存,无需客户端显式指定。同时,不同上游服务返回的用量字段可能不同,部分响应仅包含缓存读取用量,没有独立的缓存写入字段。
缺少写入字段并不代表缓存未生效。 当缓存读取用量大于 0 时,表示本次请求已命中缓存,但无法仅凭该响应确定新增缓存写入量。