使用 3.5 Flash-Lite 时,您可以选择不同的思考级别,以优化质量、速度和令牌输出:
- 对于延迟时间敏感或更简单的分类和提取任务,请使用
thinking_level.MINIMAL:3.5 Flash-Lite 默认采用最少的思考,从而优化速度和成本效益。这非常适合高吞吐量分类、路由或 JSON 提取任务。 - 为子代理使用
thinking_level.MEDIUM或thinking_level.HIGH:如果您将 3.5 Flash-Lite 用作编写代码、运行终端命令或调用外部 API 的自主子代理,请将思维水平设置为中或高。使用最低思考水平可能会导致在多步任务中过早终止工具。
与之前的 Gemini 模型相比,3.5 Flash-Lite 包含以下可能会造成中断的变更:
- 不支持为温度、Top-K 和 Top-P 等参数设置自定义值。如果您为这些参数设置了自定义值,系统会忽略该值。
- 不支持为频次和存在性惩罚参数设置自定义值。为这些参数设置自定义值会抛出错误。
- 不支持最后一个输入轮次的角色为
Model的 API 请求。以下类型的请求会返回错误:- 使用 Interactions API 时:
input数组中的最后一个对象具有"type": "model_output"的请求。 - 使用 GenerateContent API 时:
contents数组中的最后一个对象具有"role": "model"的请求。
- 使用 Interactions API 时:
在 Agent Studio 中试用 部署示例应用 查看价格
| 模型 ID | gemini-3.5-flash-lite |
|
|---|---|---|
| 模态 |
|
|
| token 数量上限 | 上下文窗口 | 1,048,576 |
| 输出词元数上限 | 65536 | |
| 功能 |
|
|
| 工具 | ||
| 使用选项 |
|
|
| 技术规范 | 图片 |
|
| 文本 |
|
|
| 视频 |
|
|
| 音频 |
|
|
| 参数默认值 |
|
|
| 支持的区域 |
|
|
|
||
|
||
|
||
| 版本 |
|
|
| 安全控制 | 在线预测 |
|
| 批量推理 |
|
|
| 上下文缓存 |
|
|
| 如需了解详情,请参阅安全控制。 | ||