2026 免费 LLM API 横向对比:13 家平台的速率限制、模型与隐性成本
Free LLM APIs Compared: Rate Limits, Models, and Real Costs (2026)
OpenRouter 发布 2026 年免费 LLM API 对比,覆盖 13 家平台,指出 OpenRouter 提供 20+ 免费模型和单一 API key,Groq 的 LPU 以约 320 tokens 每秒运行 Llama 3.3 70B,Google AI Studio 支持 1M token 上下文。
原文横向对比 13 家免费 LLM API 的限额、上下文与数据训练政策,并给出按场景选型和 failover 的可迁移做法。
你正在做一个副业项目或早期应用,还不想为 LLM 调用付费。你搜索“free llm api”,结果被几十个声称免费的服务淹没。有些确实提供了真正的价值。另一些只给一点试用额度,一个下午就用完了。还有少数会在未事先披露的情况下,用你的提示词训练它们的下一个模型。
OpenRouter 在 70+ 家 LLM 提供商之间路由流量,每月处理 100 万亿 token。由于它位于这些提供商前面,它会路由到它们所服务的相同模型,包括最快和上下文最长的那些,这一点在你对比下面这些服务时值得记住。
简而言之
- 2026 年有 13 个平台提供可用的免费 LLM API 访问,其中包括几个用于文本推理的永久免费层。限制和取舍差异很大。
- OpenRouter 是一个很好的起点,有 20+ 个免费模型、一个 API key,且无需信用卡。
- 就原始速度而言,Groq 的 LPU 硬件运行 Llama 3.3 70B 可达约每秒 320 token(Artificial Analysis)。就长上下文而言,Google AI Studio 和几个开放模型可达 1M token。OpenRouter 会路由到两者,因此你可以通过一个 key 访问它们,也可以直接使用。
- 每个免费层都有隐藏成本。速率限制、数据训练选择加入、上下文窗口缩减和质量下降,都是这类服务的一部分。
- 尽早测试 2 或 3 个选项并实现故障转移。这比任何单一端点都能省去更多麻烦。
2026 年“免费 LLM API”到底意味着什么
免费 LLM 访问分为 3 个不同类别。“免费”一词被随意使用,这造成了混淆。
永久免费层让你无需信用卡或到期时间即可无限期访问。你只需要管理速率限制,别的不用管。
试用额度是临时营销优惠(1 到 30 美元),会在几周后过期,或要求绑定银行卡。它们适合一次性测试,不适合持续工作。
本地推理意味着下载开放权重模型,并使用 Ollama 或 vLLM 等工具在你自己的机器上运行。设置完成后没有按 token 计费,但硬件、电力和维护由你负责。
永久免费层(OpenRouter、Google AI Studio、Groq、Mistral、Cerebras)是你应该开始的地方。试用额度适合一次性评估。如果你有硬件,本地推理适合最大隐私和无限制用量。
免费 LLM API 提供商对比(2026)
此对比涵盖 13 个平台,包括永久免费层和试用额度服务,已根据 cheahjs/free-llm-api-resources 仓库(2026 年 3 月更新)以及截至 2026 年 4 月的提供商文档进行核实。
在下表中,RPM 是每分钟请求数,RPD 是每日上限,TPM 是以每分钟模型 token 数衡量的吞吐限制。
| 提供商 | 免费模型 | RPM | RPD / 每月限制 | 上下文窗口 | 兼容 OpenAI | 信用卡 | 数据训练 |
|---|---|---|---|---|---|---|---|
| OpenRouter | 20+(多提供商) | 20 | 50/天(充值 10 美元后 1,000/天) | 最高 1M | 是 | 否 | 否 |
| Google AI Studio | 8 个 Gemini/Gemma 变体 | 5–15 | 20–1,500/天 | 最高 1M | 部分 | 否 | 是(欧盟/英国/欧洲经济区以外) |
| Groq | Llama 3.3 70B、Mixtral 等 | 30 | 1,000/天 | 128K | 是 | 否 | 否 |
| Mistral | Codestral、Mistral Small/Large | 不定 | 约 10 亿 token/月 | 32K–256K | 是 | 否 | 是(Experiment 层) |
| Cerebras | Llama 3.3 70B 等 | 30 | 约 100 万 token/天 | 最高 1M | 是 | 否 | 否 |
| Cloudflare Workers AI | 20+ 个模型 | 高 | 约 10K neurons/天 | 2K–8K | 部分 | 否 | 否 |
| GitHub Models | GPT-4o、Claude 3.5 Sonnet、Llama、Phi | 15 | 150–1,000/天 | 8K–128K | 是 | 否 | 否 |
| Cohere | Command R+ | 10–20 | 约100/天 | 128K | 部分 | 否 | 否(仅限非商业用途) |
| Hugging Face | 100K+ 开源模型 | 不定 | 社区 / 限速 | 取决于模型 | 部分 | 否 | 否 |
| NVIDIA NIM | Nemotron、Llama 变体 | 高 | 约1,000/天 | 128K | 部分 | 否 | 否 |
| Chutes | 各种开源模型 | 不定 | 社区层级 | 取决于模型 | 是 | 否 | 否 |
| SambaNova | Llama 3.1 405B | 不定 | $5 试用额度 | 128K | 是 | 是 | 否 |
| Vercel AI Gateway | 多提供商(BYOK) | 不定 | 取决于提供商 | 不定 | 是 | 否 | 取决于后端 |
OpenRouter 在模型多样性和易用性上领先,而且由于它会路由到下方这些提供商,你可以用同一个密钥访问 Groq 的速度或 100 万上下文的模型。直接使用 Groq、Cerebras 或 Google AI Studio 则能获得该提供商完整的原生免费额度与 SDK 功能。没有哪种方案在所有维度上都胜出,因此将路由器与一两个直接集成搭配使用,往往是更具韧性的选择。
永久免费层级详解
OpenRouter(多样性)。 一个 API 密钥和一个 OpenAI 兼容端点,即可对来自不同家族的 20 多个免费模型进行基准测试。当你想要测试多个提供商又不想管理多个账户时,就用它。
Google AI Studio(上下文)。 处理长文本数据的强力选择。免费层级在 Gemini Flash 上支持高达 100 万 token 的上下文,且 Gemini 模型支持多模态输入(文本、图像、音频)。在标准聊天任务上部分兼容 OpenAI,但若要使用基于文件的 RAG 等高级功能,建议使用 Google 的原生 SDK。
Groq(速度)。 专用 LPU 硬件运行 Llama 3.3 70B 可达约每秒 320 token(Artificial Analysis)。该 API 完全兼容 OpenAI,因此非常适合语音代理、实时聊天以及其他对延迟敏感的用户体验。
Mistral(用量)。 Experiment 层级每月约 10 亿 token,是这里最慷慨的永久免费额度之一,但你必须选择加入数据训练才能使用。
Cerebras(吞吐量)。 在 Llama 3.3 70B 及其他模型上每天约 100 万 token。非常适合需要大量处理又不牺牲速度的批处理场景。
GitHub Models(前沿模型访问)。 通过基于 Azure 的 OpenAI 兼容端点免费访问 GPT-4o、Claude 3.5 Sonnet、Llama 和 Phi。需绑定 GitHub 账户。包含一个基于浏览器的演练场,可在集成前测试提示词。
Cloudflare Workers AI(边缘)。 20 多个模型,请求额度慷慨,非常适合边缘部署的推理。上下文窗口比大多数替代方案更小。
Cohere(RAG)。 试用 API 密钥可使用 Command R+,每天上限约 100 次请求,无需信用卡。严格限非商业用途。
注意:免费层级可能会使用你的提示词和响应来改进其产品。在欧盟/英国/欧洲经济区之外,Google 的政策对此表述最为明确。
提供试用额度的提供商
提供试用额度的提供商会在要求付费前提供 1 至 30 美元的评估预算,DeepSeek 是例外,提供 1000 万 token。这些优惠有时限或额度限制。适合一次性评估,不适合持续的免费使用。
- Fireworks($1 额度)。 在较小模型上足够进行几千次请求。适合对 Fireworks 托管的 Llama 和 Mixtral 变体进行基准测试。注册无需信用卡。
- Baseten($30 额度)。 本列表中最大方的试用额度。足以端到端地原型开发一个小型应用。额度用尽后需要信用卡。
- Nebius($1 额度)。 额度有限,但足以测试其托管的开放权重模型系列。
- SambaNova($5 额度)。 可访问 Llama 3.1 405B,这是任何免费层中可用的最大开放权重模型之一。注册时需要信用卡。
- DeepSeek(1000 万 token)。 一个慷慨的基于 token 的试用。DeepSeek R1 擅长多步推理、数学问题求解和逻辑演绎,因此对于评估推理密集型工作负载很有用。
- AI21($10 额度)。 可试用 Jamba 系列。如果你特别需要 AI21 的混合 SSM-Transformer 架构,这会很有用。
试用额度最好被视为评估预算。将真正的原型构建在永久免费层上,并使用试用额度来比较你以后可能会付费使用的特定模型。
速率限制并排对比
每分钟 20 次请求意味着每 3 秒一次请求。每天 1,000 次请求意味着大约每小时 40 次。这些是你所能构建内容的真实约束。
| 提供商 | 每分钟请求数 | 每天请求数 | 每分钟 token 数 | 最适合 |
|---|---|---|---|---|
| Groq | 30 | 1,000 | 高 | 实时应用、语音代理 |
| Cerebras | 30 | 约相当于每天 100 万 token | 高 | 批处理、吞吐量 |
| Mistral(Experiment) | 可变 | 约每月 10 亿 token | 可变 | 编码工作负载、高流量 |
| OpenRouter | 20 | 50(充值 $10 后为 1,000) | 可变 | 实验、跨模型路由 |
| GitHub Models | 15 | 150–1,000 | 可变 | 前沿模型访问 |
| Google AI Studio | 5–15 | 20–1,500 | 可变 | 长上下文分析 |
| Cohere | 10–20 | ~100 | 低 | RAG 原型开发(非商业) |
| NVIDIA NIM | 高 | ~1,000 | 可变 | NVIDIA 托管的推理 |
| Cloudflare Workers AI | 高 | 约每天 1 万神经元 | 可变 | 边缘部署 |
| Hugging Face | 可变 | 受社区速率限制 | 可变 | 开源模型探索 |
所有数据均已对照 cheahjs/free-llm-api-resources(2026 年 3 月更新)以及截至 2026 年 4 月的提供商文档进行核实。免费层的速率限制经常变化;在做出承诺前请核实当前数字。
Groq 和 Cerebras 在其免费层上提供高吞吐量。Google AI Studio 在较低请求量下提供高达 100 万 token 的上下文。OpenRouter 通过故障转移让你用一个密钥访问这些提供商。根据你的瓶颈是每个提供商的配额、速度还是上下文来选择,并记住你可以混合使用直接访问和路由访问。
免费层并不免费。成本从你的钱包转移到你的隐私、性能或可靠性上。有 4 个权衡最重要。
数据训练选择加入是最大的隐私问题。除非你位于欧盟、英国或欧洲经济区,否则 Google 会使用你的提示来改进其模型。Mistral 的 Experiment 层要求你选择加入训练,才能访问每月 10 亿 token 的配额。如果你处理的是专有代码、客户数据或任何机密内容,这些政策会带来合规风险,日后补救的成本比现在付费层的成本更高。
上下文窗口缩水会让开发者措手不及。一些提供商在免费端点上提供的上下文窗口比同一模型在付费方案上提供的更小,因此长对话会被截断,RAG 系统会丢失上下文,文档分析也可能中途失败。请检查你正在使用的那个具体免费端点的上下文长度,而不是模型的标称数字。
量化精度更低则更为隐蔽。为了控制成本,一些平台在免费层提供量化后的模型权重(例如 8 位或 4 位),而非全精度版本。较低的精度会降低复杂任务的输出质量,因此如果准确性很重要,请检查量化级别。OpenRouter 会列出每个端点的量化信息。
没有服务等级协议意味着零保障。免费层可能在没有预警的情况下收紧速率限制、在高峰时段增加延迟,或者出现完全宕机且没有任何补偿。对个人项目可以接受,对任何面向客户的东西都有风险。
IP 封锁和反滥用措施也很常见。许多平台会积极封锁 VPN、共享主机 IP 或数据中心 IP 段以防止滥用。如果你在某些环境中开发,可能会发现自己被拒之门外,直到你升级或更换服务。
对于敏感工作,更安全的默认选择是采用明确不训练政策的服务(OpenRouter、Groq、Cerebras),或者用 Ollama 在本地运行模型。
你应该使用哪个免费 LLM API?
不存在普遍最佳的免费 LLM API。正确的选择取决于你当前的主要限制。
长文档分析或研究。Google AI Studio 在 Gemini Flash 上提供的 100 万 token 上下文窗口可以处理整本书、大型代码库或长 PDF,而无需激进分块,并且 Gemini 还接受多模态输入(图像和音频)。通过 OpenRouter 也能获得免费的 100 万上下文模型(例如 Qwen3 Coder),因此你可以路由到其中一个,而不必直接集成 Google。
速度关键型应用(语音、实时聊天)。Groq 的专用 LPU 硬件运行 Llama 3.3 70B 时约为每秒 320 个 token(Artificial Analysis)。你可以直接调用 Groq,也可以通过 OpenRouter 路由到它。
编码助手和开发者工具。Experiment 层级的 Mistral Codestral 提供每月 10 亿 token 的额度,针对代码生成和重构进行了优化。如果你想在 agent 中使用免费模型,可以通过 OpenRouter 用免费模型设置 OpenClaw 或 在 Kilo Code 中运行免费模型。
复杂推理任务。通过 DeepSeek 试用额度使用的 DeepSeek R1 专为多步推理、数学问题求解和逻辑演绎而构建。
大批量处理。Cerebras 每天大约提供 100 万 token,足以进行批量数据清洗、摘要和离线工作负载,而这些在其他地方会触发速率限制封锁。
用一个 API 密钥获得最多的模型种类。OpenRouter 通过一个兼容 OpenAI 的端点,让你跨多个提供商使用 20 多个免费模型,并在个别提供商限流时自动故障转移。
具备故障转移的生产级方案。使用 OpenRouter 并充值 10 美元,可将免费模型的限制提升到每天 1,000 次请求,并在任何底层提供商性能下降时,自动在它们之间进行故障转移。
隐私优先或欧盟合规。 Scaleway 提供符合 GDPR 数据处理要求的欧洲托管服务。或者使用 Ollama 在本地运行模型。
有几点需要坦诚说明。直接对接某个提供商,你可以获得该提供商完整的原生免费额度以及任何提供商特有的 SDK 功能,比如 Google AI Studio 基于文件的 RAG 或 Mistral 更大的每月 token 配额。OpenRouter 会路由到这些相同的提供商,因此速度与上下文窗口一致,但它自己的免费层有单独的请求上限,而且统一端点不会暴露所有原生功能。如果你的需求狭窄且明确,直接对接可能意味着更少的限制;如果你想要多样性、故障转移和单一集成,路由器更胜一筹。
快速上手:60 秒完成你的第一次免费 LLM API 调用
本指南中的大多数服务都使用兼容 OpenAI 的 API,这意味着只需替换 base URL 和 API key,同一份代码就能在所有服务上运行。以下是使用 OpenRouter 作为主要示例的模式。
使用 OpenRouter SDK(推荐):
from openrouter import OpenRouter
client = OpenRouter()
response = client.chat.send(
model="meta-llama/llama-3.3-70b-instruct:free",
messages=[{"role": "user", "content": "Explain rate limiting in one sentence."}],
)
print(response.choices[0].message.content)import { OpenRouter } from '@openrouter/sdk';
const openRouter = new OpenRouter();
const response = await openRouter.chat.send({
model: 'meta-llama/llama-3.3-70b-instruct:free',
messages: [{ role: 'user', content: 'Explain rate limiting in one sentence.' }],
stream: false,
});
console.log(response.choices[0].message.content);或者通过替换 base URL 使用 OpenAI SDK(适用于所有兼容 OpenAI 的提供商):
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "meta-llama/llama-3.3-70b-instruct:free",
"messages": [{"role": "user", "content": "Explain rate limiting in one sentence."}]
}'使用 OpenRouter 时,你无需替换 base URL 就能访问不同的提供商。端点和 API key 保持不变,只需更改 model 字符串即可路由到其他地方。要在 1M 上下文的模型或不同模型系列上运行相同的提示词,只需替换 slug:
# Llama 3.3 70B
model="meta-llama/llama-3.3-70b-instruct:free"
# Qwen3 Coder, 1M token context
model="qwen/qwen3-coder:free"
# OpenAI gpt-oss 120B
model="openai/gpt-oss-120b:free"有些提供商在你直接调用时并不完全遵循 OpenAI API 模式。例如,Google 的 Gemini 模型提供高达 1M token 的上下文,但直接集成需要 Google 的原生 SDK。OpenRouter 将这些差异统一在一个端点之后,因此同一份代码可以通过 slug 访问它们。
免费额度用尽时会发生什么
你在下午 2 点触达每日限额。你的应用停止响应。过渡路径取决于你最初使用的是哪项服务。
OpenRouter。 添加 $10 最低充值。这会将你在免费模型上的每日上限提升至 1,000 次请求。OpenRouter 按提供商的每 token 费率收费,外加 5.5% 的平台费,不额外加收提供商加价,因此付费使用价格接近直接对接提供商,同时保留故障转移和单一 key 的优势。一旦你开始付费,如何在 OpenRouter 上获得最低成本的 LLM 推理 介绍了可降低账单的路由设置。
Google AI Studio。 切换到按量付费的 Gemini 定价;Flash 层级价格低廉,Google 的 定价页面 列出了当前的每 token 费率。
Groq。 转向 Groq 的付费按量 定价,这会在同一个兼容 OpenAI 的端点上提高速率限制。切换前请查看当前的每 token 费率。
Mistral。 Experiment 层级(免费,需选择加入数据训练)会过渡到 Production 层级(付费,不进行数据训练),按标准每 token 费率计费。
最具韧性的方案会结合多种策略,而不是依赖单一端点:
- 通过故障转移实现标准化。 在主提供商和备用兼容 OpenAI 的提供商之间使用 base URL 替换模式(例如,主用 OpenRouter,备用 Groq)。你的核心代码保持整洁,当触达速率限制时,应用会自动切换端点。
- 为专用算力规划路由。当任务需要超长上下文窗口时,使用 Google AI Studio 的原生 SDK 将请求发送过去。这样就能利用 100 万 token 的上下文窗口,而不必让整个技术栈去适配非标准 schema。
- 用微额资金保障稳定性。在 OpenRouter 或类似网关上充值 10 美元余额,以便在高峰时段获得稳定、不受限流的性能。
- 卸载到本地推理。随着工作负载增长,将后台批处理或非实时任务迁移到使用 Ollama 的本地模型上。
下面是一个实用的故障转移示例:
import os
from openai import OpenAI
def call_llm(prompt: str, max_tokens: int = 500):
providers = [
{
"name": "OpenRouter",
"base_url": "https://openrouter.ai/api/v1",
"key": os.environ.get("OPENROUTER_API_KEY"),
"model": "meta-llama/llama-3.3-70b-instruct:free",
},
{
"name": "Groq",
"base_url": "https://api.groq.com/openai/v1",
"key": os.environ.get("GROQ_API_KEY"),
"model": "llama-3.3-70b-versatile",
},
]
for provider in providers:
if not provider["key"]:
continue
try:
client = OpenAI(api_key=provider["key"], base_url=provider["base_url"])
response = client.chat.completions.create(
model=provider["model"],
messages=[{"role": "user", "content": prompt}],
max_tokens=max_tokens,
)
print(f"Success via {provider['name']}")
return response
except Exception as e:
print(f"{provider['name']} failed: {e}")
continue
raise Exception("All providers failed")最后做一个诚实的对比。如果你每月花费超过 50 美元,就按你的实际用量算一算直接使用提供商 API 的成本。聚合器带来了便利和故障转移能力,而在高用量下,直接提供商有时在纯成本上更胜一筹。
来源:OpenRouter:Announcements(RSS) · openrouter.ai