Gemini 2.5 Flash API - 定价、快速入门与提供商比较
Gemini 2.5 Flash API - Pricing, Quickstart & Provider Comparison
Gemini 2.5 Flash API 支持配置思考预算(thinking budgets),用户可跨提供商进行比较,并在5分钟内完成首次API调用。
这是 OpenRouter 上接入 Gemini 2.5 Flash 的保姆级指南,把三家 Google 提供商的延迟和定价差异摆在明面上,需要做模型选型和成本估算的开发者可以直接抄里面的 quickstart 代码。
什么是 Gemini 2.5 Flash?
Gemini 2.5 Flash 是 Google 面向高吞吐、延迟敏感且需要推理的任务的主力模型。它是首个内置思考能力的 Flash 级模型,具备可随意开关的混合推理模式。这一特点使其与 2.0 Flash 有显著不同,也值得与价格高出许多的模型一较高下。
核心能力
Gemini 2.5 Flash 支持以下输入类型:文本、代码、图像、音频、视频和文档。对于文档输入,在生产环境中有两项限制:每个文档的最大文件大小为 50MB(超过此限制的文件必须拆分为小于 50MB 的块后再提交)。支持的文档 MIME 类型仅限于 application/pdf 和 text/plain。
它不支持的功能包括:音频生成、图像生成以及 Live API。如果你需要图像生成,请使用 Gemini 2.5 Flash Image,那是一个独立的模型。
“思考”在实际中意味着什么
思考预算是一个参数,用于控制模型在生成响应之前进行多少内部推理。它是在推理阶段内置于模型架构中的。将预算设为 0 会完全禁用该功能,从而产生最快、最便宜的输出。设为 -1 则启用动态模式,模型会根据提示词的复杂程度自动调整推理深度。在 Google 的直接 API 中,默认值为 -1。而通过 OpenRouter,思考功能默认关闭,除非你显式请求开启(参见下文“通过 OpenRouter 配置”)。更高的固定预算可以提升复杂任务上的输出质量,但代价是额外的延迟和 token 消耗,且按输出费率计费。
Gemini 2.5 Flash API 定价
下表展示了三种接入方式经核实的每百万 token 费率。所有定价数据来自 ai.google.dev/gemini-api/docs/pricing 和 openrouter.ai/google/gemini-2.5-flash。OpenRouter 和 Vertex AI 的数字请在撰写当日对照其在线页面进行核实;费率可能随时更新,恕不另行通知。
核实日期:2026 年 5 月
| 提供商 | 输入 $/1M | 输出 $/1M(含思考) | 缓存读取 | 缓存存储 | 音频输入 |
|---|---|---|---|---|---|
| Google AI Studio(付费版) | $0.30 | $2.50 | $0.03 | $1.00/M/hr | $1.00 |
| Vertex AI | 查看 Vertex AI 定价 | 查看 Vertex AI 定价 | 查看 Vertex AI 定价 | 查看 Vertex AI 定价 | 查看 Vertex AI 定价 |
| OpenRouter | $0.30 | $2.50 | $0.03 | 在实时页面核实 | $1.00 |
截至 2026 年 5 月,Google AI Studio 付费档和 OpenRouter 对文本输入和输出收取相同的每 token 费率。每 token 价格一样。差异在于 API 调用之外包装的东西。
OpenRouter 位于你的代码和 3 个 Google 提供方(AI Studio、Vertex Global、Vertex)之间。如果其中一个宕机,你的请求会重新路由到健康的提供方。无需改代码。
你的集成不再与 Gemini 绑死。改一下模型字符串,你就可以调用 Claude、GPT-4o、Llama 或 300 多个模型中的任意一个。相同的基础 URL、相同的 SDK、相同的 API 密钥。几秒钟即可切换模型,无需重写你的客户端。
账单合并到一个仪表盘:一张发票、一个 API 密钥,覆盖所有模型和提供方。无需在 Google、Anthropic 和 OpenAI 的独立账户之间来回切换。
对于要上线生产环境的团队,OpenRouter 叠加了企业级控制(配置管理、按密钥消费限额、用量分析、团队管理)。护栏和内容过滤可按请求配置,因此你可以执行安全策略,而无需自建审核体系。提示词日志和可观测性功能内置于仪表盘中,方便调试生产流量。
OpenRouter 对按量付费(PAYG)充值收取 5.5% 的平台费。这涵盖了上述的故障转移、路由、计费和工具功能。Google AI Studio 是没有中间商费用的直接途径,但故障转移、模型可移植性和跨提供方计费都得你自己解决。Vertex AI 的定价不同;在把价格填入生产成本估算之前,请查看 Vertex AI 定价页面 以了解当前费率。
要了解 Gemini 2.5 Flash 的实时定价和各提供商的正常运行时间,包括实时缓存费率和各提供商的有效价格,请查看 OpenRouter 模型页面。有关降低重复上下文成本的缓存策略,请查看 缓存定价详情。
思考 Token 计费
思考 token 与输出 token 按相同费率计费。预算为 0 时,没有思考成本。在最大预算(24,576 tokens)下,思考开销可能超过可见回复本身的价格。要估算特定工作负载的成本,请将预期的思考 token 数乘以输出费率,再加到标准输出 token 成本中。
免费使用选项
Google AI Studio 提供有速率限制的免费层级。在免费层级上,你的提示词和响应会被用于改进 Google 的产品;完整的数据使用政策请参阅 服务条款。如果你的使用场景涉及用户数据,或要求数据不用于模型训练,则必须使用付费层级。
OpenRouter 的免费层级不包含 Gemini 2.5 Flash。需要至少 $5 的信用余额。
Vertex AI 为新的 Google Cloud 账户提供 $300 试用额度,可在评估期间用于 Gemini 2.5 Flash 的使用。
API 快速入门:5 分钟内发出第一个请求
OpenRouter 路径无需 Google Cloud 账号,并且可与任何兼容 OpenAI 的 SDK 配合使用。Google 直连路径需要 Google 账号和 google-genai SDK。如需更多 SDK 示例和配置选项,请参阅 OpenRouter 快速入门。
第 1 步:获取你的 API Key
OpenRouter 路径:获取你的 OpenRouter API key。无需 Google Cloud 账号。
Google 直连路径:在 aistudio.google.com/apikey 获取 key。
第 2 步:设置 Base URL(OpenRouter 路径)
OpenRouter 的 base URL 是 https://openrouter.ai/api/v1。下面三个代码示例均使用此端点。
第 3 步:发出你的第一个请求
cURL:
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer <your-openrouter-key>" \
-H "Content-Type: application/json" \
-d '{
"model": "google/gemini-2.5-flash",
"messages": [{"role": "user", "content": "Explain the difference between attention mechanisms in transformers."}]
}'
Python(OpenAI SDK):
from openai import OpenAI
client = OpenAI(
base_url="https://openrouter.ai/api/v1",
api_key="<your-openrouter-key>",
)
response = client.chat.completions.create(
model="google/gemini-2.5-flash",
messages=[{"role": "user", "content": "Explain the difference between attention mechanisms in transformers."}]
)
print(response.choices[0].message.content)
TypeScript(OpenAI SDK):
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://openrouter.ai/api/v1",
apiKey: "<your-openrouter-key>",
});
const response = await client.chat.completions.create({
model: "google/gemini-2.5-flash",
messages: [{ role: "user", content: "Explain the difference between attention mechanisms in transformers." }],
});
console.log(response.choices[0].message.content);
Google 直连路径
如果你已经拥有 Google AI Studio API 密钥,并且更倾向于不经过中间层的直接路径:
from google import genai
client = genai.Client(api_key="<your-google-api-key>")
response = client.models.generate_content(
model="gemini-2.5-flash",
contents="Explain the difference between attention mechanisms in transformers.",
)
print(response.text)
直接路径使用 google-genai SDK,它与 OpenAI 不兼容。从 OpenRouter 切换到直接路径需要同时更改你的客户端库和请求结构。直接路径没有提供商故障转移机制。
思考预算:控制推理质量与成本
思考预算是你使用该模型时要做的最重要的配置决策。设置不当,你要么为不需要的推理多付钱,要么在需要推理的任务上损失准确率。完整参数参考请参见 配置思考预算。
预算级别及其权衡
在请求配置中设置 thinkingBudget 参数。取值范围为 0 到 24,576 tokens。
预算 0:禁用思考。响应最快,成本最低,无推理开销。适用于不需要结构化推理的高吞吐量分类、抽取和摘要任务。
Budget -1(动态): 模型会根据提示词的复杂程度自动选择推理深度。这是 Google 直连 API 的默认模式。通过 OpenRouter 使用时,必须显式将 max_tokens 设置为 -1 才能启用动态模式;省略 reasoning 配置则会关闭思考。推荐大多数需要推理的工作负载使用:它可以避免在简单提示词上为重型推理付费,同时在任务需要时启用推理。
Budget 1,024 到 8,192: 中等至重度推理。适用于多步骤分析、结构化编程任务和研究类问题。
Budget 24,576(最大值): 最大推理深度,最高成本。适用于复杂数学、科学问题,以及准确性足以抵消开销的高难度编程挑战。
关键限制
如果你不在编写第一个请求之前了解以下两个限制,它们会在生产环境中引发错误:
thinkingBudget和thinkingLevel不能在同一个请求中使用。thinkingBudget用于 Gemini 2.5 系列模型。thinkingLevel用于 Gemini 3 系列模型。同时使用两者会返回 400 错误。结构化 JSON 输出与 Search Grounding 互斥。不能在同一个请求中同时启用两者。
通过 OpenRouter 进行配置
使用 extra_body 参数和 reasoning 键,通过 OpenRouter 的 API 设置思考预算:
from openai import OpenAI
client = OpenAI(
base_url="https://openrouter.ai/api/v1",
api_key="<your-openrouter-key>",
)
response = client.chat.completions.create(
model="google/gemini-2.5-flash",
messages=[{"role": "user", "content": "Solve this step by step: if f(x) = 3x^2 + 2x - 5, find all roots."}],
extra_body={"reasoning": {"max_tokens": 8192}}
)
print(response.choices[0].message.content)
要完全禁用思考,请将 max_tokens 设为 0。要使用动态模式,请将 max_tokens 设为 -1。
跨供应商性能
OpenRouter 通过三个 Google 供应商路由 Gemini 2.5 Flash,并实时追踪每个供应商的吞吐量、首 token 时间(TTFT)、端到端延迟和正常运行时间。供应商之间的差异足以影响延迟敏感型工作负载的供应商选择。
以下所有数据均需对照 openrouter.ai/google/gemini-2.5-flash 进行实时核实。
各供应商性能表现
| 供应商 | 平均吞吐量 | 平均 TTFT | 平均端到端延迟 | 正常运行时间 |
|---|---|---|---|---|
| Google Vertex (Global) | ~75 tok/s | 约0.63秒 | 在实时页面验证 | 在实时页面验证 |
| Google AI Studio | 在实时页面验证 | 在实时页面验证 | 在实时页面验证 | 在实时页面验证 |
| Google Vertex | 在实时页面验证 | 在实时页面验证 | 在实时页面验证 | 在实时页面验证 |
在近期数据中,Vertex Global 提供商展现出最高的吞吐量。AI Studio 在历史上表现出最佳的正常运行时间。三者之中,Standard Vertex 的延迟最高。当你通过 OpenRouter 路由且未指定提供商时,它会基于实时信号自动将流量分配到最健康的选择。
如需 Gemini 2.5 Flash 的实时价格和正常运行时间,请查看 OpenRouter 模型页面。
Gemini 2.5 Flash 与 Flash Lite 与 Pro 对比
根据你的工作负载需求进行选择:
对于大多数智能体和推理工作负载,请使用 Gemini 2.5 Flash。当你需要思考能力又不想承担 Pro 级别的成本时,它是默认推荐。
对于大批量的分类、抽取或翻译任务,请使用 Gemini 2.5 Flash Lite,这类任务不需要思考能力,且每次请求的成本是首要约束。Flash Lite 默认禁用思考功能。
对于准确性足以证明比 Flash 高出 5 到 10 倍成本溢价合理的复杂推理任务,请使用 Gemini 2.5 Pro:前沿数学、高难度编程挑战,以及多步骤科学分析。
技术规格
下表是 Gemini 2.5 Flash 的权威参考。如需最权威版本,请参阅 Google AI for Developers 模型页面(更新于 2026-04-01)和 Vertex AI 文档(更新于 2026-04-03)。
| 属性 | 值 |
|---|---|
| 模型 ID | gemini-2.5-flash |
| OpenRouter 模型字符串 | google/gemini-2.5-flash |
| 上下文窗口 | 1,048,576 tokens |
| 最大输出 | 65,536 tokens |
| 输入类型 | 文本、图像、视频、音频、代码、文档(仅支持 PDF 和 text/plain,最大 50MB) |
| 输出类型 | 文本 |
| 思考预算范围 | 0 至 24,576 个 token(默认:动态 / -1) |
| 知识截止日期 | 2025 年 1 月 |
| 正式发布(GA) | 2025 年 6 月 17 日 |
| 停用日期 | 2026 年 10 月 16 日 |
| 支持的能力 | 函数调用、结构化输出、代码执行、搜索 grounding、Batch API、上下文缓存(隐式和显式)、文件搜索、URL 上下文 |
| 不支持 | 音频生成、图像生成、Live API、thinkingLevel 参数 |
弃用通知:[ Gemini 2.5 Flash 计划于 2026 年 10 月 16 日在 Vertex AI 上停用。如果您正在构建的使用场景将延伸到该日期之后,请规划迁移到后续模型,并关注 ai.google.dev/gemini-api/docs/models 以获取更新。
常见问题解答
Gemini 2.5 Flash 可以免费使用吗?
Google AI Studio 提供带速率限制的免费额度。在免费额度下,你的提示词和响应会被用于改进 Google 的产品;在将用户数据用于其上之前,请先阅读[服务条款。OpenRouter 的免费额度不包含 Gemini 2.5 Flash;需要至少 $5 的充值余额。Vertex AI 为新的 Google Cloud 账户提供 $300 试用额度。
Gemini 2.5 Flash 的思考预算(thinking budget)是什么?
thinkingBudget 参数(范围:0 到 24,576 token,或 -1 表示动态)控制模型在响应前进行多少内部推理。预算设为 0 表示禁用思考:最快且最便宜。预算设为 -1 表示启用动态模式:模型根据提示词复杂度自动调整。在 Google 的直连 API 上,默认值为 -1。通过 OpenRouter 使用时,除非你明确请求开启思考(例如 extra_body={"reasoning": {"max_tokens": -1}} 表示动态,或任意正数预算),否则思考功能是关闭的。更高的固定预算可以提升复杂任务上的输出质量,但会增加延迟和成本,按输出 token 费率计费。
Gemini 2.5 Flash 与 GPT-4o 相比如何?
Flash 支持 1M token 的上下文窗口,而 GPT-4o 为 128K,并且具备 GPT-4o 所没有的可配置思考功能。Flash 的每 token 定价更低。GPT-4o 拥有更广泛的第三方生态系统支持和更长的生产环境使用记录。本指南中没有发布两款模型在同一评测上的直接基准对比;可使用[OpenRouter 排行榜获取最新的第三方评测数据。
我可以用 Gemini 2.5 Flash 进行图像生成吗?
不能。Gemini 2.5 Flash 只输出文本。它支持图像输入,模型可以处理图像并对其进行推理。若要生成图像,请使用 Gemini 2.5 Flash Image,这是一个独立的模型,有各自的定价。
哪些提供商在 OpenRouter 上提供 Gemini 2.5 Flash?
三家:Google AI Studio、Google Vertex Global 和 Google Vertex。OpenRouter 会根据实时吞吐量和在线率数据自动路由到状态最佳的提供商。你也可以使用 OpenRouter 的 提供商路由控制固定到某个特定提供商。
Gemini 2.5 Flash 和 Flash Lite 有什么区别?
Flash 支持可配置的思考功能(预算 0 到 24,576),输出质量更高。Flash Lite 则针对超低延迟和低成本进行了优化,默认关闭思考功能(不过可以开启)。当推理能力重要时使用 Flash;对于以每请求成本为主要约束的大批量任务,则使用 Lite。
来源:OpenRouter:Announcements(RSS) · openrouter.ai