跳到正文
北京时间
原文
OpenRouter:Announcements(RSS)· OpenRouter·· 2026-06-16精选AI 评分75

免费LLM API比较:速率限制、模型与真实成本(2026)

Free LLM APIs Compared: Rate Limits, Models, and Real Costs (2026)

AI 导读

13个平台提供免费LLM API,含永久免费层与试用额度。OpenRouter拥有20+免费模型,单密钥无需信用卡;Groq以约320 tokens/秒运行Llama 3.3 70B;Google AI Studio支持1M上下文;Mistral实验层约10亿token/月但需同意数据训练;Cerebras约1M token/天;GitHub Models提供GPT-4o、Claude 3.5 Sonnet等前沿模型。各免费层有速率限制、数据训练授权、上下文缩减等隐藏成本,建议早期测试2-3个方案并设置故障转移。

推荐理由

免费 LLM API 不是免费的,这篇文章把 13 家平台的隐藏成本、速率限制和真实可用性都算清楚了,想省钱的开发者值得花五分钟看一遍。

正文 · AI 翻译

Free LLM APIs Compared: Rate Limits, Models, and Real Costs (2026)

你正在做一个副业项目或早期阶段的应用,还不想为 LLM 调用付费。你搜索“free llm api”,结果被几十个声称免费的服务淹没。有些确实提供了真正的价值。另一些只给一点点试用额度,一个下午就用光了。还有少数会在不事先披露的情况下,用你的提示词去训练它们的下一个模型。

OpenRouter 将流量路由到 60+ 家 LLM 提供商,每月处理 100 万亿 token。由于它位于这些提供商之前,它会路由到这些提供商所服务的相同模型,包括最快和上下文最长的那些,这一点在你对比下面这些服务时值得记住。

简而言之

  • 2026 年有 13 个平台提供可用的免费 LLM API 访问,其中包括几个面向文本推理的永久免费额度。各家的限制和取舍差异很大。
  • OpenRouter 是一个很好的起点,拥有 20+ 个免费模型、一个 API key,且无需信用卡。
  • 就原始速度而言,Groq 的 LPU 硬件运行 Llama 3.3 70B 大约可达每秒 320 token(Artificial Analysis)。就长上下文而言,Google AI Studio 和若干开放模型可达到 1M token。OpenRouter 会路由到这两者,因此你可以通过一个 key 访问它们,也可以直接访问。
  • 每个免费额度都有隐藏成本。速率限制、数据训练选择加入、上下文窗口缩减以及质量下降,都是这类服务不可避免的一部分。
  • 尽早测试 2 到 3 个选项并实现故障转移。这能省去的麻烦,比任何单一端点所能做到的都要多。

2026 年“免费 LLM API”究竟意味着什么

免费 LLM 访问分为 3 个截然不同的类别。“免费”一词被随意使用,从而造成了混淆。

永久免费额度让你无需信用卡或到期时间即可无限期访问。你只需管理速率限制,别无其他。

试用额度是临时性的营销优惠($1 到 $30),会在几周后过期,或要求存档信用卡。它们适合一次性测试,而非持续性的工作。

本地推理意味着下载开放权重模型,并使用 Ollama 或 vLLM 等工具在你自己的机器上运行它们。设置完成后没有按 token 计费,但硬件、电力和维护都由你负责。

永久免费额度(OpenRouter、Google AI Studio、Groq、Mistral、Cerebras)是你应该起步的地方。试用额度适合一次性评估。如果你有硬件,本地推理适合最大程度的隐私和无限量使用。

免费 LLM API 提供商对比(2026)

这份对比涵盖 13 个平台,包括永久免费套餐和试用额度方案,并已对照 cheahjs/free-llm-api-resources 仓库(2026 年 3 月更新)以及截至 2026 年 4 月的提供商文档进行核实。

在下表中,RPM 是每分钟请求数,RPD 是每日上限,TPM 是以每分钟模型 token 数衡量的吞吐量限制。

提供商免费模型RPMRPD / 每月限制上下文窗口兼容 OpenAI信用卡数据训练
OpenRouter20+(多提供商)2050/天(充值 $10 后 1,000/天)最高 1M是否否
Google AI Studio8 个 Gemini/Gemma 变体5–1520–1,500/天最高 1M部分否是(欧盟/英国/欧洲经济区以外)
GroqLlama 3.3 70B、Mixtral 及其他301,000/天128K是否否
MistralCodestral、Mistral Small/Large可变约 1B tokens/月32K–256K是否是(Experiment 层级)
CerebrasLlama 3.3 70B、其他30约 1M tokens/天最高 1M是否否
Cloudflare Workers AI20+ 个模型高约 10K neurons/天2K–8K部分否否
GitHub ModelsGPT-4o、Claude 3.5 Sonnet、Llama、Phi15150–1,000/天8K–128K是否否
CohereCommand R+10–20约 100/天128K部分否否(仅限非商业用途)
Hugging Face10 万+ 开源模型不定社区版 / 有速率限制视模型而定部分支持否否
NVIDIA NIMNemotron、Llama 系列变体高约 1,000/天128K部分支持否否
Chutes各类开源模型不定社区版视模型而定是否否
SambaNovaLlama 3.1 405B可变$5 试用额度128K是是否
Vercel AI Gateway多提供商(BYOK)可变取决于提供商视情况而定是否取决于后端

OpenRouter 在模型多样性和易用性方面领先,而且由于它会路由到下方这些提供商,你可以通过同一个密钥获得 Groq 的速度或 100 万上下文窗口的模型。直接使用 Groq、Cerebras 或 Google AI Studio,则能获得该提供商完整的原生免费额度与 SDK 功能。没有任何单一方案能在所有维度上胜出,这正是为什么将一个路由器与一两个直连集成搭配使用,往往是更具韧性的选择。

永久免费额度详解

OpenRouter(多样性)。一个 API 密钥和一个 OpenAI 兼容端点,即可对来自不同模型族的 20 多个免费模型进行基准测试。当你想要测试多个提供商而又不想管理多个独立账户时,就用它。

Google AI Studio(上下文)。处理长文本数据的强力选择。免费额度在 Gemini Flash 上支持最高 100 万 token 的上下文窗口,而且 Gemini 模型能处理多模态输入(文本、图像、音频)。在标准聊天任务上部分兼容 OpenAI,但若要使用基于文件的 RAG 等高级功能,推荐使用 Google 的原生 SDK。

Groq(速度)。专用 LPU 硬件运行 Llama 3.3 70B 可达约每秒 320 token(Artificial Analysis)。该 API 完全兼容 OpenAI,因此非常适合语音智能体、实时聊天以及其他对延迟敏感的 UX 场景。

Mistral(用量)。Experiment 层级每月约 10 亿 token,是这里最慷慨的永久免费配额之一,但你必须选择加入数据训练才能使用。

Cerebras(吞吐量)。在 Llama 3.3 70B 及其他模型上每天约 100 万 token。非常适合需要大批量且不牺牲速度的批处理场景。

GitHub Models(前沿模型访问)。通过基于 Azure 的 OpenAI 兼容端点免费访问 GPT-4o、Claude 3.5 Sonnet、Llama 和 Phi。需绑定 GitHub 账号。附带一个基于浏览器的 playground,可在集成前测试提示词。

Cloudflare Workers AI(边缘)。20+ 个模型,请求额度慷慨,非常适合边缘部署的推理。上下文窗口比大多数替代方案更小。

Cohere(RAG)。Trial API key 可使用 Command R+,每天上限约 100 次请求,无需绑定银行卡。严格限于非商业用途。

注意:免费层级可能会使用你的提示词和响应来改进其产品。在 EU/UK/EEA 之外,Google 的政策对此表述最为明确。

提供试用额度的服务商

试用额度提供商会在要求付费之前提供 1 到 30 美元的评估预算,其中 DeepSeek 是例外,提供的是 1000 万 token。这些优惠有时间限制或消费额度限制。适合一次性评估,不适合持续免费使用。

  • Fireworks(1 美元额度)。 在较小模型上足够进行数千次请求。适合对 Fireworks 托管的 Llama 和 Mixtral 变体进行基准测试。注册时无需信用卡。
  • Baseten(30 美元额度)。 本列表中最大方的试用额度。足以端到端地原型开发一个小型应用。额度用尽后需要信用卡。
  • Nebius(1 美元额度)。 额度有限,但足以测试其托管的开放权重模型阵容。
  • SambaNova(5 美元额度)。 可使用 Llama 3.1 405B,这是任何免费层级中可用的最大开放权重模型之一。注册时需要信用卡。
  • DeepSeek(1000 万 token)。 一个慷慨的基于 token 的试用额度。DeepSeek R1 擅长多步推理、数学问题求解和逻辑演绎,因此这对于评估推理密集型工作负载很有用。
  • AI21(10 美元额度)。 可试用 Jamba 系列。如果你特别需要 AI21 的混合 SSM-Transformer 架构,这会很有用。

试用额度最好当作评估预算来用。把真正的原型搭建在永久免费层上,用试用额度来对比你之后可能会付费使用的特定模型。

速率限制对比

每分钟 20 次请求意味着每 3 秒一次请求。每天 1,000 次请求意味着大约每小时 40 次。这些都是对你所能构建内容的真实约束。

提供商每分钟请求数每天请求数每分钟 Token 数最适合
Groq301,000高实时应用、语音智能体
Cerebras30约相当于每天 1M tokens高批量处理、吞吐量
Mistral(实验性)可变约 1B tokens/月可变编码工作负载、高并发量
OpenRouter2050(充值 $10 后为 1,000)可变实验、跨模型路由
GitHub Models15150–1,000可变前沿模型访问
Google AI Studio5–1520–1,500变量长上下文分析
Cohere10–20~100低RAG 原型开发(非商业用途)
NVIDIA NIM高~1,000变量NVIDIA 托管的推理
Cloudflare Workers AI高~10K neurons/day变量边缘部署
Hugging Face变量社区速率限制变量开源模型探索

所有数据均已对照 cheahjs/free-llm-api-resources(2026 年 3 月更新)以及截至 2026 年 4 月的提供商文档进行核实。免费套餐的速率限制变动频繁;在正式采用前请核实当前数据。

Groq 和 Cerebras 在其免费套餐上提供高吞吐量。Google AI Studio 在较低的请求量下提供最高 1M tokens 的上下文。OpenRouter 让你用一个密钥跨这些提供商访问并支持故障转移。根据你的瓶颈是单提供商配额、速度还是上下文来选择,并记住你可以混合使用直连和路由访问。

“免费”LLM API 的隐藏成本

免费套餐并不免费。成本从你的钱包转移到了你的隐私、性能或可靠性上。有 4 个权衡最为关键。

数据训练选择加入是最大的隐私隐患。除非你位于欧盟、英国或欧洲经济区,否则 Google 会使用你的提示词来改进其模型。Mistral 的 Experiment 套餐要求你选择加入训练,才能获得每月 1B token 的配额。如果你处理的是专有代码、客户数据或任何机密内容,这些政策会带来合规风险,日后补救的成本远高于现在购买付费套餐的费用。

上下文窗口缩水会让开发者措手不及。有些提供商在免费端点上提供的上下文窗口比同一模型在付费方案上的更小,于是长对话会被截断,RAG 系统会丢失上下文,文档分析也可能中途失败。请查看你正在使用的那个具体免费端点的上下文长度,而不是模型宣传的标称数字。

更低的量化精度则更为隐蔽。为了控制成本,一些平台在免费层提供量化后的模型权重(例如 8-bit 或 4-bit),而非全精度版本。较低的精度会降低复杂任务上的输出质量,所以如果准确性很重要,请查看量化级别。OpenRouter 会列出每个端点的量化信息。

没有服务等级协议就意味着零保障。免费层可能在没有预警的情况下收紧速率限制、在高峰时段增加延迟,或者遭遇完全宕机且没有任何补偿。对个人项目尚可接受,对任何面向客户的东西都有风险。

IP 封禁和反滥用措施也很常见。许多平台会积极封禁 VPN、共享主机 IP 或数据中心 IP 段,以防止滥用。如果你在某些环境中开发,可能会发现自己被拒之门外,直到你升级或更换服务。

对于敏感工作,更安全的默认选择是那些有明确不训练政策的服务(OpenRouter、Groq、Cerebras),或者用 Ollama 在本地运行模型。

你应该使用哪个免费 LLM API?

并不存在普适的最佳免费 LLM API。正确的选择取决于你当下最主要的约束条件。

长文档分析或研究。 Google AI Studio 在 Gemini Flash 上提供的 1M token 上下文窗口,无需激进分块即可处理整本书、大型代码库或长篇 PDF,而且 Gemini 还支持多模态输入(图像和音频)。通过 OpenRouter 也能获得免费的 1M 上下文模型(例如 Qwen3 Coder),因此你可以路由到其中一个,而不必直接集成 Google。

对速度要求苛刻的应用(语音、实时聊天)。 Groq 的专用 LPU 硬件运行 Llama 3.3 70B 时可达约每秒 320 个 token(Artificial Analysis)。你可以直接调用 Groq,也可以通过 OpenRouter 路由到它。

编程助手和开发者工具。 Experiment 套餐上的 Mistral Codestral 提供每月 1B token 的额度,针对代码生成和重构进行了优化。

复杂推理任务。 通过 DeepSeek 试用额度使用的 DeepSeek R1 专为多步推理、数学问题求解和逻辑演绎而打造。

大批量批处理。 Cerebras 每天大约提供 1M token,足以应对在其他平台会触发速率限制封锁的批量数据清洗、摘要和离线工作负载。

一个 API key 即可获得最丰富的模型选择。 OpenRouter 通过一个兼容 OpenAI 的端点,为你提供来自多个提供商的 20+ 个免费模型,并在单个提供商限流时自动故障转移。

生产级,带故障转移。 充值 $10 的 OpenRouter 会将你在免费模型上的限额提升至每天 1,000 次请求,并在任何单个底层提供商性能下降时,为你提供跨提供商的自动故障转移。

隐私优先或欧盟合规。 Scaleway 提供欧洲托管,数据处理符合 GDPR。或者用 Ollama 在本地运行模型。

有几个注意事项值得坦诚说明。直接对接某个提供商,能让你获得该提供商完整的原生免费额度,以及任何提供商专属的 SDK 功能,比如 Google AI Studio 基于文件的 RAG,或 Mistral 更大的每月 token 配额。OpenRouter 路由到这些相同的提供商,因此其速度和上下文窗口与它们一致,但它自己的免费层有单独的请求上限,而且其统一端点不会暴露每一项原生功能。如果你的需求狭窄且明确,直接对接可能意味着更少的限制;如果你想要多样性、故障转移和单一集成,路由器更胜一筹。

快速上手:60 秒完成你的第一次免费 LLM API 调用

本指南中的大多数服务都使用兼容 OpenAI 的 API,这意味着只需替换 base URL 和 API key,同一段代码就能在所有这些服务上运行。以下是这一模式的示例,以 OpenRouter 作为主要示例。

使用 OpenRouter SDK(推荐):

from openrouter import OpenRouter

client = OpenRouter()

response = client.chat.send(
    model="meta-llama/llama-3.3-70b-instruct:free",
    messages=[{"role": "user", "content": "Explain rate limiting in one sentence."}],
)

print(response.choices[0].message.content)
import { OpenRouter } from '@openrouter/sdk';

const openRouter = new OpenRouter();

const response = await openRouter.chat.send({
  model: 'meta-llama/llama-3.3-70b-instruct:free',
  messages: [{ role: 'user', content: 'Explain rate limiting in one sentence.' }],
  stream: false,
});

console.log(response.choices[0].message.content);

或者通过 OpenAI SDK 替换 base URL(适用于所有兼容 OpenAI 的提供商):

curl https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "meta-llama/llama-3.3-70b-instruct:free",
    "messages": [{"role": "user", "content": "Explain rate limiting in one sentence."}]
  }'

使用 OpenRouter,你无需替换 base URL 就能访问不同的提供商。端点和 API key 保持不变,只需更改 model 字符串即可路由到其他地方。要在 1M 上下文模型或不同模型系列上运行相同的提示词,只需替换 slug:

# Llama 3.3 70B
model="meta-llama/llama-3.3-70b-instruct:free"

# Qwen3 Coder, 1M token context
model="qwen/qwen3-coder:free"

# OpenAI gpt-oss 120B
model="openai/gpt-oss-120b:free"

有些提供商在你直接调用时并不完全遵循 OpenAI API schema。例如,Google 的 Gemini 模型提供高达 1M tokens 的上下文,但直接集成需要使用 Google 的原生 SDK。OpenRouter 在单一端点背后将这些差异归一化,因此同一份代码可以通过 slug 访问它们。

免费额度用完后会发生什么

你在下午 2 点触及每日限额。你的应用停止响应。过渡路径取决于你最初使用的是哪项服务。

OpenRouter。添加一笔 $10 最低充值。这会将你在免费模型上的每日上限提升至 1,000 次请求。OpenRouter 按提供商的每 token 费率收费,外加 5.5% 的平台费,不额外加收提供商加价,因此付费使用的价格接近直接对接提供商,同时保留故障转移和单一 key 的优势。

Google AI Studio。 切换到按量付费的 Gemini 定价;Flash 档位价格低廉,Google 的定价页面列出了当前的每 token 费率。

Groq。 切换到 Groq 的付费按量付费定价,这会在同一个 OpenAI 兼容端点上提高速率限制。切换前请查看当前的每 token 费率。

Mistral。 Experiment 档位(免费,需选择加入数据训练)会以标准每 token 费率过渡到 Production 档位(付费,不进行数据训练)。

最具韧性的方案会结合多种策略,而不是依赖单一端点:

  1. 通过故障转移实现标准化。 在主、备两个 OpenAI 兼容提供商之间使用基础 URL 替换模式(例如,主用 OpenRouter,备用 Groq)。你的核心代码保持整洁,当触发速率限制时,应用会自动切换端点。
  2. 为专用能力做路由。 当任务需要非常长的上下文窗口时,使用 Google AI Studio 的原生 SDK 将该请求发送过去。这样就能利用 1M token 上下文窗口,而不必强迫你的整个技术栈去适配非标准 schema。
  3. 小额充值以求稳定。 向 OpenRouter 或类似网关添加 $10 的信用余额,以便在高峰时段获得稳定、不受限流的性能。
  4. 卸载到本地推理。 随着你的工作负载增长,使用 Ollama 将后台批处理或非实时任务转移到本地模型。

下面是一个实用的故障转移示例:

import os
from openai import OpenAI


def call_llm(prompt: str, max_tokens: int = 500):
    providers = [
        {
            "name": "OpenRouter",
            "base_url": "https://openrouter.ai/api/v1",
            "key": os.environ.get("OPENROUTER_API_KEY"),
            "model": "meta-llama/llama-3.3-70b-instruct:free",
        },
        {
            "name": "Groq",
            "base_url": "https://api.groq.com/openai/v1",
            "key": os.environ.get("GROQ_API_KEY"),
            "model": "llama-3.3-70b-versatile",
        },
    ]

    for provider in providers:
        if not provider["key"]:
            continue
        try:
            client = OpenAI(api_key=provider["key"], base_url=provider["base_url"])
            response = client.chat.completions.create(
                model=provider["model"],
                messages=[{"role": "user", "content": prompt}],
                max_tokens=max_tokens,
            )
            print(f"Success via {provider['name']}")
            return response
        except Exception as e:
            print(f"{provider['name']} failed: {e}")
            continue

    raise Exception("All providers failed")

最后给出一个坦诚的对比。如果你每月花费超过 $50,就按你的实际用量算一算直接使用提供商 API 的成本。聚合器带来了便利性和故障转移,而直接提供商在高用量下有时在纯成本上更胜一筹。

来源:OpenRouter:Announcements(RSS) · openrouter.ai