跳到主要内容

常见问题(FAQ)

1. B.AI Chat 和 API 有什么区别?​

Chat 适合直接在网页或 App 中对话;API 适合开发者将模型接入自己的应用或工具。两者的可用模型、功能和计费规则可能有所不同,请查看对应页面。

2. 如何获取和使用 API Key?​

在 B.AI 控制台创建 API Key,然后配置到应用或客户端中。请求可使用 Authorization: Bearer <API Key> 或 x-api-key 鉴权。请妥善保管 Key,避免公开到截图、日志或代码仓库。详见 API 参考。

3. API Base URL 应该填写什么?​

生产环境 Base URL 为 https://api.b.ai/v1。具体请求端点需根据客户端使用的协议选择;不同模型支持的端点可能不同。详见 API 参考。

4. 在中国大陆无法访问 B.AI,怎么办?​

可在 B.AI Android App 的“B.AI 服务可用性”中查看当前可用的 Web 地址和 API Base URL。请完整复制 App 展示的地址。详见 App 与服务可用性。

5. B.AI App 从哪里下载?​

可通过 Google Play 安装,或扫描 B.AI 官网右上角的 Android 下载二维码获取 APK。支持 Android 8.0 及以上版本。详见 App 与服务可用性。

6. 不知道选哪个模型怎么办?​

在 Chat 中可以选择 Auto,由平台根据每次任务匹配当前账户可用的模型。如果需要固定模型或做能力测试,可以手动选择。Auto 本身不额外收费,按实际执行模型和用量结算。详见 Auto 模式。

7. API 请求中的模型名称怎么填写?​

打开 API Key 页面,找到需要使用的模型,点击模型名称右侧的复制按钮,即可复制模型 ID,将其填入请求的 model 字段。

也可以通过 GET /v1/models 查询当前 API Key 可用的模型列表,并确认所选模型支持正在使用的端点。详见 API 参考。

8. 输入、输出、缓存写入和缓存读取分别怎么计费?​

输入是发送给模型的内容,输出是模型生成的内容;缓存写入是建立可复用缓存,缓存读取是后续复用缓存内容。不同模型的费率、有效期和收费方式不同,部分模型还会把推理 Token 计入输出用量,请查看模型详情页。

9. 显式缓存和隐式缓存有什么区别?会额外收费吗?​

显式缓存通常由调用方主动创建或指定;隐式缓存由服务自动识别可复用内容。两者都可能涉及写入或读取计费,部分模型的显式缓存还收取按存储时间计算的费用。具体支持方式和费用以模型详情页为准。

10. 联网搜索是否额外收费?​

联网搜索按次单独计费,费率因模型而异。搜索生成的内容若进入模型上下文,还可能产生相应的 Token 费用。请查看模型详情页的联网搜索价格和实际用量记录。

11. 为什么实际扣费与文档价格不完全一样?​

文档展示标准参考价,实际结算还可能受到活动折扣、账户权益、缓存命中、上下文档位、分时价格和工具使用的影响。详见 定价与用量及 活动与调整公告。

12. 长上下文和 DeepSeek 峰谷计费怎么理解?​

部分模型在输入超过指定长度后采用不同费率,适用门槛和计费范围见模型详情页。

DeepSeek 分时模型的高峰时段为北京时间(UTC+8)周一至周五(不含中国法定节假日)09:00-12:00、14:00-18:00;其余时间,包括周末及中国法定节假日全天,均为空闲时段。空闲价为高峰价的一半,B.AI Chat 中统一采用空闲价。详见 定价与用量。

13. 如何查看余额和实际扣费?​

在平台的 Usage 页面查看余额、实际模型、Token 用量和 Credits 消耗。开发者也可通过 余额 API 查询当前 API Key 可用的余额或额度。

14. 为什么模型没有给出答案,仍然扣除了积分?​

模型费用按实际产生的输入、输出及缓存读写等计费用量计算。没有可见答案,并不一定意味着没有产生用量:请求可能已处理输入 Token,部分推理模型还可能生成未展示给用户的推理 Token,这些用量仍可能计费。

实际扣费以 Usage 页面中的用量记录为准。如果对某次扣费有疑问,请保留请求时间和相关记录,便于核查。

15. API 报错应该怎么排查?​

先查看响应中的错误说明,再按状态码处理:

状态码优先检查
400参数、请求格式及模型与端点是否兼容
401API Key 和鉴权请求头
403账户状态、订阅或模型权限
404请求路径和模型 ID
429调用频率及并发量,降低并发并使用指数退避重试
500 / 502 / 503稍后重试,并保留 request ID 供排查

详见 API 参考。

16. 为什么输入未达到模型标注的上下文上限,仍可能报错?​

B.AI 平台未额外设置上下文长度限制,实际调用仍需遵循模型及上游接口的规则。

模型标注的上下文容量,不一定全部用于正文输入。系统提示词、历史对话和工具相关内容也会占用空间,部分接口还会为输出预留容量。此外,客户端估算的 Token 数可能与服务端统计存在差异,因此不能仅凭正文长度判断是否超限。

建议精简历史消息、按实际需求设置最大输出长度,并为上下文保留一定余量。若仍出现长度相关报错,可将超长内容分段处理,或先提取关键内容后再提交。

17. 为什么 Responses API 返回了缓存读取用量,却没有缓存写入用量?​

部分模型采用隐式缓存机制,由上游服务自动管理缓存,无需客户端显式指定。同时,不同上游服务返回的用量字段可能不同,部分响应仅包含缓存读取用量,没有独立的缓存写入字段。

缺少写入字段并不代表缓存未生效。 当缓存读取用量大于 0 时,表示本次请求已命中缓存,但无法仅凭该响应确定新增缓存写入量。