FreeLLMAPI:聚合 34 家免费 LLM 提供商,每月 74 亿 token,一个 OpenAI 兼容端点
FreeLLMAPI 是一个开源的免费 LLM API 聚合器,它将 34 家提供商的免费额度聚合到一个 OpenAI 兼容的 /v1 端点后面。每月总计约 74 亿 token 的推理容量,覆盖 474 个模型系列、635 个免费模型端点,从小而快的模型到能力相当不错的模型都有。
解决的问题
现在每个严肃的 AI 实验室都提供免费额度——每月几百万 token、每天几千次请求。但单独看,每个免费额度都只是个玩具。把它们堆在一起,就变成了每月约 74 亿 token 的可用推理容量。
问题在于手动堆叠它们非常痛苦:34 个不同的 SDK、34 个不同的速率限制、34 个请求可能失败的地方。FreeLLMAPI 把这一切折叠成一个 OpenAI 兼容端点。把任何 OpenAI 客户端库指向本地服务器,它就会透明地路由到当前可用的最佳模型。
核心功能
智能路由
FreeLLMAPI 的路由器会为每个请求选择最佳可用模型:
- 根据任务类型选择合适的模型(代码生成用代码模型,创意写作用大模型)
- 当一个提供商被速率限制时,自动故障转移到下一个提供商
- 跟踪每个密钥的使用量,确保不超过任何免费额度上限
加密密钥存储
所有 API 密钥都加密存储,不以明文形式保存在配置文件中。
自动目录更新
路由器从签名 feed 自动更新自己的模型目录:新的免费模型、额度变更、兼容性修复都会自动到达,不需要 git pull。
- 免费安装获取月度快照:模型加入 live feed 后 30 天到达免费用户
- 高级路由器获取实时更新:当天到达(freellmapi.co,$19/年)
多模态支持
除了聊天补全,还支持:
- Embedding 端点
- 图像生成端点
- 音频端点
- 自定义 OpenAI 兼容端点
支持的提供商
34 家免费 LLM 提供商,包括但不限于:
- Google Gemini(免费额度)
- Anthropic Claude(免费额度)
- OpenAI(免费额度)
- Mistral(免费额度)
- Cohere(免费额度)
- AI21(免费额度)
- Together AI(免费额度)
- Groq(免费额度)
- Fireworks AI(免费额度)
- OctoAI(免费额度)
- DeepSeek(免费额度)
- 以及更多...
完整目录包含 474 个模型系列、635 个免费端点,可以在 freellmapi.co 浏览。
兼容的客户端和编码 Agent
FreeLLMAPI 与任何 OpenAI 兼容的客户端库和编码 Agent 配合使用,包括:
- OpenAI Python SDK
- LangChain
- LlamaIndex
- AutoGen
- CrewAI
- Cursor
- Windsurf
- Continue.dev
- Aider
- Claude Code(通过兼容层)
- 任何支持
base_url配置的 OpenAI 客户端
快速开始
安装
# 克隆仓库
git clone https://github.com/tashfeenahmed/freellmapi.git
cd freellmapi
# 安装依赖
pip install -r requirements.txt
# 配置 API 密钥
python configure.py
# 启动服务器
python server.py
使用
配置完成后,服务器默认运行在 http://localhost:8000。把任何 OpenAI 客户端指向这个地址:
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:8000/v1",
api_key="free" # 任意字符串
)
response = client.chat.completions.create(
model="auto", # 自动选择最佳可用模型
messages=[{"role": "user", "content": "Hello, world!"}]
)
print(response.choices[0].message.content)
桌面应用
项目还提供了桌面应用,适合不熟悉命令行的用户。桌面应用提供图形界面配置 API 密钥、查看使用统计、管理模型路由。
架构设计
路由层
路由器是 FreeLLMAPI 的核心,负责:
- 接收 OpenAI 格式的请求
- 根据任务类型和模型可用性选择提供商
- 转换请求格式(不同提供商的 API 格式略有差异)
- 发送请求并处理响应
- 在失败时自动重试或故障转移
- 记录使用量
额度管理
每个提供商的免费额度都有不同的限制(RPM、TPM、每日额度、每月额度)。FreeLLMAPI 跟踪每个密钥的实时使用量,在接近上限时自动切换到其他提供商,确保请求不会因为额度耗尽而失败。
提示压缩
为了最大化免费额度的价值,FreeLLMAPI 内置了提示压缩功能,可以在发送请求前压缩上下文,减少 token 消耗。
局限性
- 免费额度可能变更:提供商可以随时更改免费额度政策
- 模型质量参差不齐:免费模型的质量通常不如付费模型
- 速率限制:即使聚合了 34 家,高并发场景下仍可能遇到速率限制
- 不保证 SLA:免费服务没有服务级别协议
- 数据隐私:请求会发送到第三方提供商,敏感数据需要自行评估
适用场景
- 个人开发者和学习者:零成本体验多种 LLM
- 原型开发:在产品早期阶段用免费额度验证想法
- 非关键任务:摘要、翻译、创意写作等不需要 100% 可靠性的任务
- 模型比较:在同一个端点上比较不同模型的输出
- 教育用途:学生和教师在教学中使用 AI 工具
总结
FreeLLMAPI 通过聚合 34 家提供商的免费额度,将分散的"玩具级"免费服务变成了每月 74 亿 token 的实用推理容量。智能路由、自动故障转移、额度管理和 OpenAI 兼容接口让使用变得简单透明。对于个人开发者、原型开发和非关键任务来说,这是一个零成本体验多种 LLM 的实用工具。
项目地址:https://github.com/tashfeenahmed/freellmapi