Gemini 3.5 Flash-Lite
概述
Gemini 3.5 Flash-Lite 是 Gemini 3 系列模型,面向低延迟、高吞吐的多模态处理任务。它适用于文档提取、分类、翻译、结构化数据处理和并行子智能体工作流。在 B.AI 中使用模型 ID:gemini-3.5-flash-lite。
核心特性
- 高吞吐处理: 面向延迟敏感、高调用量的生产工作负载。
- 多模态输入: 支持文本、图片、视频、音频和 PDF 输入,输出为文本。
- 可配置思考: 支持多个思考等级,并提供轻量级默认配置以获得更快响应。
- 长上下文: 最多支持 1,048,576 个输入 token,适合大规模文档和数据处理。
- 工具集成: 在 API 配置启用时,支持函数调用、结构化输出、代码执行、联网检索、URL 上下文和文件搜索工作流。
推荐场景
- 从 PDF、记录、表格和其他多模态内容中提取文档和数据。
- 大规模分类、路由、翻译、标签和摘要任务。
- 需要快速响应和结构化输出的并行子智能体任务。
- 聊天机器人和高吞吐内容工作流等交互式应用。
能力与限制
| 能力 | 说明 |
|---|---|
| 推理 | 支持可配置的思考等级,用于平衡响应速度和推理深度。 |
| 编程 | 适用于聚焦型编程辅助、工具调用任务和结构化输出工作流。 |
| 多模态 | 支持文本、图片、视频、音频和 PDF 输入,输出为文本。 |
| 上下文窗口 | 最多支持 1,048,576 个输入 token。 |
| 最大输出 | 最多支持 65,536 个输出 token。 |
| 工具调用 | 在可用时支持函数调用、结构化输出、代码执行、联网检索、URL 上下文和文件搜索工作流。 |
| 多语言 | 适用于翻译和多语言生产工作负载。 |
已知限制
- 模型可能生成不准确内容;关键工作流中的提取或分类结果应先进行校验。
- 实际延迟和工具可用性会受思考等级、提示词长度、媒体输入和 API 配置影响。
- 输出仅支持文本,不包含原生图片或音频生成能力。
Credits 用量
| 模型 | 输入(Credits/Token) | 缓存写入(Credits/Token) | 缓存读取(Credits/Token) | 输出(Credits/Token) | 网页搜索(Credits/次) | 计费说明 |
|---|---|---|---|---|---|---|
| Gemini 3.5 Flash-Lite | 0.30 | 0.30 | 0.03 | 2.50 | 14,000 | - |
价格说明
文档价格为 B.AI 平台模型标准参考价,仅供基础计费说明使用。B.AI 可能会通过充值赠送及账户权益等方式,为用户提供更低的实际使用成本。具体价格、赠送积分及账户权益请以平台页面展示及最终账单为准。