Gemini 3.8 Flash
概述
Gemini 3.8 Flash 是 Google 于 2026 年 9 月 2 日正式发布的 Gemini 3 系列模型,面向长周期软件工程、自主智能体和复杂知识工作流,提供 1M Token 输入窗口及可配置的推理强度。
主要特性
- 长周期智能体执行:适合需要多步规划、反复调用工具和持续验证的软件工程及企业工作流。
- 可配置思考强度:支持
low、medium和high三档思考级别,默认为medium,不支持minimal。 - 原生多模态输入:支持文本、图像、视频、音频和 PDF 输入,输入上限为 1,048,576 Tokens,最多输出 65,536 个文本 Tokens。
- 丰富的工具能力:支持函数调用、结构化输出、代码执行、File Search、URL Context、搜索与地图信息增强,以及预览阶段的 Computer Use。
适用场景
- 智能体软件工程:适用于代码仓库分析、多文件开发、调试和迁移等需要持续推理与工具调用的任务。
- 复杂知识工作:适用于基于大型文档集、结构化数据和专业资料的长篇分析与报告生成。
- 多模态分析:结合文本指令理解文档、截图、图表、视频和音频内容。
- 工具编排应用:构建结合自定义函数、代码执行、搜索、URL 获取、文件搜索或计算机操作的智能体。
- 异步批量处理:适用于可使用 Batch 或 Flex 推理的分类、抽取、评测等非实时工作负载。
能力与限制
| 能力 | 说明 |
|---|---|
| 推理 | 支持 low、medium 和 high 思考级别,默认为 medium。提高思考强度可能改善复杂多步任务的效果,同时也可能增加 Token 消耗和延迟。 |
| 编程 | 针对长周期软件工程和智能体编程工作流优化。Google 发布材料显示其相较 Gemini 3.7 Flash 有所提升,但厂商评测结果不代表生产环境表现保证。 |
| 多模态 | 支持文本、图像、视频、音频和 PDF 输入,输出为文本。 |
| 上下文窗口 | 1,048,576 个输入 Tokens。 |
| 最大输出 | 65,536 Tokens。 |
| 工具调用 | 支持函数调用、结构化输出、代码执行、File Search、URL Context、搜索与地图信息增强,以及 Computer Use(预览)。 |
| 知识截止时间 | 整体知识截止至 2026 年 3 月;Google 说明部分领域的知识可能仅覆盖至 2025 年 1 月。处理较新或时效性信息时建议启用信息增强。 |
已知限制
- 模型可能产生不准确内容,Google 也提示偶尔可能出现响应较慢或超时。
- 复杂任务和较高思考级别可能比以往的 Flash 工作流消耗更多推理及输出 Tokens,应用应根据延迟和成本目标调整思考强度。
- 不支持
minimal思考级别。temperature、top_p和top_k等旧版采样参数会被忽略,也不支持预填充模型回复。 - Computer Use 仍处于预览阶段,模型不支持原生图像生成或原生音频生成。
价格
| 模型 | 输入(Credits/Token) | 缓存写入(Credits/Token) | 缓存读取(Credits/Token) | 输出(Credits/Token) | 网页搜索(Credits/次) |
|---|---|---|---|---|---|
| Gemini 3.8 Flash | 0.75 | 0.75 | 0.075 | 3.75 | 14,000 |
显式缓存存储费用在 2026 年 12 月 31 日前为每小时 0.50 Credits/Token,自 2027 年 1 月 1 日起为每小时 1.00 Credits/Token。