跳到正文
北京时间
原文
OpenRouter:Announcements(RSS)·· 2026-06-10精选AI 评分64

Gemini 2.5 Flash API - 定价、快速入门与提供商比较

Gemini 2.5 Flash API - Pricing, Quickstart & Provider Comparison

AI 导读

Gemini 2.5 Flash API 支持配置思考预算(thinking budgets),用户可跨提供商进行比较,并在5分钟内完成首次API调用。

推荐理由

这是 OpenRouter 上接入 Gemini 2.5 Flash 的保姆级指南,把三家 Google 提供商的延迟和定价差异摆在明面上,需要做模型选型和成本估算的开发者可以直接抄里面的 quickstart 代码。

正文 · AI 翻译

什么是 Gemini 2.5 Flash?

Gemini 2.5 Flash 是 Google 面向高吞吐、延迟敏感且需要推理的任务的主力模型。它是首个内置思考能力的 Flash 级模型,具备可随意开关的混合推理模式。这一特点使其与 2.0 Flash 有显著不同,也值得与价格高出许多的模型一较高下。

核心能力

Gemini 2.5 Flash 支持以下输入类型:文本、代码、图像、音频、视频和文档。对于文档输入,在生产环境中有两项限制:每个文档的最大文件大小为 50MB(超过此限制的文件必须拆分为小于 50MB 的块后再提交)。支持的文档 MIME 类型仅限于 application/pdf 和 text/plain。

它不支持的功能包括:音频生成、图像生成以及 Live API。如果你需要图像生成,请使用 Gemini 2.5 Flash Image,那是一个独立的模型。

“思考”在实际中意味着什么

思考预算是一个参数,用于控制模型在生成响应之前进行多少内部推理。它是在推理阶段内置于模型架构中的。将预算设为 0 会完全禁用该功能,从而产生最快、最便宜的输出。设为 -1 则启用动态模式,模型会根据提示词的复杂程度自动调整推理深度。在 Google 的直接 API 中,默认值为 -1。而通过 OpenRouter,思考功能默认关闭,除非你显式请求开启(参见下文“通过 OpenRouter 配置”)。更高的固定预算可以提升复杂任务上的输出质量,但代价是额外的延迟和 token 消耗,且按输出费率计费。

Gemini 2.5 Flash API 定价

下表展示了三种接入方式经核实的每百万 token 费率。所有定价数据来自 ai.google.dev/gemini-api/docs/pricing 和 openrouter.ai/google/gemini-2.5-flash。OpenRouter 和 Vertex AI 的数字请在撰写当日对照其在线页面进行核实;费率可能随时更新,恕不另行通知。

核实日期:2026 年 5 月

提供商 输入 $/1M 输出 $/1M(含思考) 缓存读取 缓存存储 音频输入
Google AI Studio(付费版) $0.30 $2.50 $0.03 $1.00/M/hr $1.00
Vertex AI 查看 Vertex AI 定价 查看 Vertex AI 定价 查看 Vertex AI 定价 查看 Vertex AI 定价 查看 Vertex AI 定价
OpenRouter $0.30 $2.50 $0.03 在实时页面核实 $1.00

截至 2026 年 5 月,Google AI Studio 付费档和 OpenRouter 对文本输入和输出收取相同的每 token 费率。每 token 价格一样。差异在于 API 调用之外包装的东西。

OpenRouter 位于你的代码和 3 个 Google 提供方(AI Studio、Vertex Global、Vertex)之间。如果其中一个宕机,你的请求会重新路由到健康的提供方。无需改代码。

你的集成不再与 Gemini 绑死。改一下模型字符串,你就可以调用 Claude、GPT-4o、Llama 或 300 多个模型中的任意一个。相同的基础 URL、相同的 SDK、相同的 API 密钥。几秒钟即可切换模型,无需重写你的客户端。

账单合并到一个仪表盘:一张发票、一个 API 密钥,覆盖所有模型和提供方。无需在 Google、Anthropic 和 OpenAI 的独立账户之间来回切换。

对于要上线生产环境的团队,OpenRouter 叠加了企业级控制(配置管理、按密钥消费限额、用量分析、团队管理)。护栏和内容过滤可按请求配置,因此你可以执行安全策略,而无需自建审核体系。提示词日志和可观测性功能内置于仪表盘中,方便调试生产流量。

OpenRouter 对按量付费(PAYG)充值收取 5.5% 的平台费。这涵盖了上述的故障转移、路由、计费和工具功能。Google AI Studio 是没有中间商费用的直接途径,但故障转移、模型可移植性和跨提供方计费都得你自己解决。Vertex AI 的定价不同;在把价格填入生产成本估算之前,请查看 Vertex AI 定价页面 以了解当前费率。

要了解 Gemini 2.5 Flash 的实时定价和各提供商的正常运行时间,包括实时缓存费率和各提供商的有效价格,请查看 OpenRouter 模型页面。有关降低重复上下文成本的缓存策略,请查看 缓存定价详情。

思考 Token 计费

思考 token 与输出 token 按相同费率计费。预算为 0 时,没有思考成本。在最大预算(24,576 tokens)下,思考开销可能超过可见回复本身的价格。要估算特定工作负载的成本,请将预期的思考 token 数乘以输出费率,再加到标准输出 token 成本中。

免费使用选项

Google AI Studio 提供有速率限制的免费层级。在免费层级上,你的提示词和响应会被用于改进 Google 的产品;完整的数据使用政策请参阅 服务条款。如果你的使用场景涉及用户数据,或要求数据不用于模型训练,则必须使用付费层级。

OpenRouter 的免费层级不包含 Gemini 2.5 Flash。需要至少 $5 的信用余额。

Vertex AI 为新的 Google Cloud 账户提供 $300 试用额度,可在评估期间用于 Gemini 2.5 Flash 的使用。

API 快速入门:5 分钟内发出第一个请求

OpenRouter 路径无需 Google Cloud 账号,并且可与任何兼容 OpenAI 的 SDK 配合使用。Google 直连路径需要 Google 账号和 google-genai SDK。如需更多 SDK 示例和配置选项,请参阅 OpenRouter 快速入门。

第 1 步:获取你的 API Key

OpenRouter 路径:获取你的 OpenRouter API key。无需 Google Cloud 账号。

Google 直连路径:在 aistudio.google.com/apikey 获取 key。

第 2 步:设置 Base URL(OpenRouter 路径)

OpenRouter 的 base URL 是 https://openrouter.ai/api/v1。下面三个代码示例均使用此端点。

第 3 步:发出你的第一个请求

cURL:

curl https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer <your-openrouter-key>" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "google/gemini-2.5-flash",
    "messages": [{"role": "user", "content": "Explain the difference between attention mechanisms in transformers."}]
  }'

Python(OpenAI SDK):

from openai import OpenAI

client = OpenAI(
    base_url="https://openrouter.ai/api/v1",
    api_key="<your-openrouter-key>",
)

response = client.chat.completions.create(
    model="google/gemini-2.5-flash",
    messages=[{"role": "user", "content": "Explain the difference between attention mechanisms in transformers."}]
)

print(response.choices[0].message.content)

TypeScript(OpenAI SDK):

import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://openrouter.ai/api/v1",
  apiKey: "<your-openrouter-key>",
});

const response = await client.chat.completions.create({
  model: "google/gemini-2.5-flash",
  messages: [{ role: "user", content: "Explain the difference between attention mechanisms in transformers." }],
});

console.log(response.choices[0].message.content);

Google 直连路径

如果你已经拥有 Google AI Studio API 密钥,并且更倾向于不经过中间层的直接路径:

from google import genai

client = genai.Client(api_key="<your-google-api-key>")

response = client.models.generate_content(
    model="gemini-2.5-flash",
    contents="Explain the difference between attention mechanisms in transformers.",
)

print(response.text)

直接路径使用 google-genai SDK,它与 OpenAI 不兼容。从 OpenRouter 切换到直接路径需要同时更改你的客户端库和请求结构。直接路径没有提供商故障转移机制。

思考预算:控制推理质量与成本

思考预算是你使用该模型时要做的最重要的配置决策。设置不当,你要么为不需要的推理多付钱,要么在需要推理的任务上损失准确率。完整参数参考请参见 配置思考预算。

预算级别及其权衡

在请求配置中设置 thinkingBudget 参数。取值范围为 0 到 24,576 tokens。

预算 0:禁用思考。响应最快,成本最低,无推理开销。适用于不需要结构化推理的高吞吐量分类、抽取和摘要任务。

Budget -1(动态): 模型会根据提示词的复杂程度自动选择推理深度。这是 Google 直连 API 的默认模式。通过 OpenRouter 使用时,必须显式将 max_tokens 设置为 -1 才能启用动态模式;省略 reasoning 配置则会关闭思考。推荐大多数需要推理的工作负载使用:它可以避免在简单提示词上为重型推理付费,同时在任务需要时启用推理。

Budget 1,024 到 8,192: 中等至重度推理。适用于多步骤分析、结构化编程任务和研究类问题。

Budget 24,576(最大值): 最大推理深度,最高成本。适用于复杂数学、科学问题,以及准确性足以抵消开销的高难度编程挑战。

关键限制

如果你不在编写第一个请求之前了解以下两个限制,它们会在生产环境中引发错误:

  1. thinkingBudget 和 thinkingLevel 不能在同一个请求中使用。thinkingBudget 用于 Gemini 2.5 系列模型。thinkingLevel 用于 Gemini 3 系列模型。同时使用两者会返回 400 错误。

  2. 结构化 JSON 输出与 Search Grounding 互斥。不能在同一个请求中同时启用两者。

通过 OpenRouter 进行配置

使用 extra_body 参数和 reasoning 键,通过 OpenRouter 的 API 设置思考预算:

from openai import OpenAI

client = OpenAI(
    base_url="https://openrouter.ai/api/v1",
    api_key="<your-openrouter-key>",
)

response = client.chat.completions.create(
    model="google/gemini-2.5-flash",
    messages=[{"role": "user", "content": "Solve this step by step: if f(x) = 3x^2 + 2x - 5, find all roots."}],
    extra_body={"reasoning": {"max_tokens": 8192}}
)

print(response.choices[0].message.content)

要完全禁用思考,请将 max_tokens 设为 0。要使用动态模式,请将 max_tokens 设为 -1。

跨供应商性能

OpenRouter 通过三个 Google 供应商路由 Gemini 2.5 Flash,并实时追踪每个供应商的吞吐量、首 token 时间(TTFT)、端到端延迟和正常运行时间。供应商之间的差异足以影响延迟敏感型工作负载的供应商选择。

以下所有数据均需对照 openrouter.ai/google/gemini-2.5-flash 进行实时核实。

各供应商性能表现

来源:OpenRouter 实时模型页面。

供应商 平均吞吐量 平均 TTFT 平均端到端延迟 正常运行时间
Google Vertex (Global) ~75 tok/s 约0.63秒 在实时页面验证 在实时页面验证
Google AI Studio 在实时页面验证 在实时页面验证 在实时页面验证 在实时页面验证
Google Vertex 在实时页面验证 在实时页面验证 在实时页面验证 在实时页面验证

在近期数据中,Vertex Global 提供商展现出最高的吞吐量。AI Studio 在历史上表现出最佳的正常运行时间。三者之中,Standard Vertex 的延迟最高。当你通过 OpenRouter 路由且未指定提供商时,它会基于实时信号自动将流量分配到最健康的选择。

如需 Gemini 2.5 Flash 的实时价格和正常运行时间,请查看 OpenRouter 模型页面。

Gemini 2.5 Flash 与 Flash Lite 与 Pro 对比

根据你的工作负载需求进行选择:

对于大多数智能体和推理工作负载,请使用 Gemini 2.5 Flash。当你需要思考能力又不想承担 Pro 级别的成本时,它是默认推荐。

对于大批量的分类、抽取或翻译任务,请使用 Gemini 2.5 Flash Lite,这类任务不需要思考能力,且每次请求的成本是首要约束。Flash Lite 默认禁用思考功能。

对于准确性足以证明比 Flash 高出 5 到 10 倍成本溢价合理的复杂推理任务,请使用 Gemini 2.5 Pro:前沿数学、高难度编程挑战,以及多步骤科学分析。

技术规格

下表是 Gemini 2.5 Flash 的权威参考。如需最权威版本,请参阅 Google AI for Developers 模型页面(更新于 2026-04-01)和 Vertex AI 文档(更新于 2026-04-03)。

属性 值
模型 ID gemini-2.5-flash
OpenRouter 模型字符串 google/gemini-2.5-flash
上下文窗口 1,048,576 tokens
最大输出 65,536 tokens
输入类型 文本、图像、视频、音频、代码、文档(仅支持 PDF 和 text/plain,最大 50MB)
输出类型 文本
思考预算范围 0 至 24,576 个 token(默认:动态 / -1)
知识截止日期 2025 年 1 月
正式发布(GA) 2025 年 6 月 17 日
停用日期 2026 年 10 月 16 日
支持的能力 函数调用、结构化输出、代码执行、搜索 grounding、Batch API、上下文缓存(隐式和显式)、文件搜索、URL 上下文
不支持 音频生成、图像生成、Live API、thinkingLevel 参数

弃用通知:[ Gemini 2.5 Flash 计划于 2026 年 10 月 16 日在 Vertex AI 上停用。如果您正在构建的使用场景将延伸到该日期之后,请规划迁移到后续模型,并关注 ai.google.dev/gemini-api/docs/models 以获取更新。

常见问题解答

Gemini 2.5 Flash 可以免费使用吗?

Google AI Studio 提供带速率限制的免费额度。在免费额度下,你的提示词和响应会被用于改进 Google 的产品;在将用户数据用于其上之前,请先阅读[服务条款。OpenRouter 的免费额度不包含 Gemini 2.5 Flash;需要至少 $5 的充值余额。Vertex AI 为新的 Google Cloud 账户提供 $300 试用额度。

Gemini 2.5 Flash 的思考预算(thinking budget)是什么?

thinkingBudget 参数(范围:0 到 24,576 token,或 -1 表示动态)控制模型在响应前进行多少内部推理。预算设为 0 表示禁用思考:最快且最便宜。预算设为 -1 表示启用动态模式:模型根据提示词复杂度自动调整。在 Google 的直连 API 上,默认值为 -1。通过 OpenRouter 使用时,除非你明确请求开启思考(例如 extra_body={"reasoning": {"max_tokens": -1}} 表示动态,或任意正数预算),否则思考功能是关闭的。更高的固定预算可以提升复杂任务上的输出质量,但会增加延迟和成本,按输出 token 费率计费。

Gemini 2.5 Flash 与 GPT-4o 相比如何?

Flash 支持 1M token 的上下文窗口,而 GPT-4o 为 128K,并且具备 GPT-4o 所没有的可配置思考功能。Flash 的每 token 定价更低。GPT-4o 拥有更广泛的第三方生态系统支持和更长的生产环境使用记录。本指南中没有发布两款模型在同一评测上的直接基准对比;可使用[OpenRouter 排行榜获取最新的第三方评测数据。

我可以用 Gemini 2.5 Flash 进行图像生成吗?

不能。Gemini 2.5 Flash 只输出文本。它支持图像输入,模型可以处理图像并对其进行推理。若要生成图像,请使用 Gemini 2.5 Flash Image,这是一个独立的模型,有各自的定价。

哪些提供商在 OpenRouter 上提供 Gemini 2.5 Flash?

三家:Google AI Studio、Google Vertex Global 和 Google Vertex。OpenRouter 会根据实时吞吐量和在线率数据自动路由到状态最佳的提供商。你也可以使用 OpenRouter 的 提供商路由控制固定到某个特定提供商。

Gemini 2.5 Flash 和 Flash Lite 有什么区别?

Flash 支持可配置的思考功能(预算 0 到 24,576),输出质量更高。Flash Lite 则针对超低延迟和低成本进行了优化,默认关闭思考功能(不过可以开启)。当推理能力重要时使用 Flash;对于以每请求成本为主要约束的大批量任务,则使用 Lite。

来源:OpenRouter:Announcements(RSS) · openrouter.ai