One API key for every
free

Unify 12 free-tier inference providers behind one gateway. OpenAI Chat Completions for Cursor and SDKs, Anthropic Messages for Claude Code — with effort-based routing, automatic failover, and usage analytics.

app.py
from openai import OpenAI

client = OpenAI(
    base_url="https://api.apikeychain.dev/v1",
    api_key="ak-•••••••••••••••",
)

resp = client.chat.completions.create(
    model="keychain-high",
    messages=[{"role": "user", "content": "Explain quantum tunneling."}],
)
print(resp.choices[0].message.content)

What could you build?

Routing intelligence everywhere you call a model

Point any OpenAI-compatible client at your keychain URL. Pick an effort tier and let the router handle the rest.

Route a chat through keychain-high
Point Claude Code at your keychain URL
Fail over when Groq rate-limits
Swap OpenAI base URL in one line
Track usage across every provider
Stream completions from any model

Routing across the best free-tier inference networks

Gemini logo
Gemini
10 free models
Groq logo
Groq
10 free models
Cerebras logo
Cerebras
5 free models
Mistral logo
Mistral
10 free models
DeepSeek logo
DeepSeek
2 free models
OpenRouter logo
OpenRouter
12 free models
Together logo
Together
3 free models
Cohere logo
Cohere
7 free models
NVIDIA NIM logo
NVIDIA NIM
3 free models
SambaNova logo
SambaNova
2 free models
Hugging Face logo
Hugging Face
3 free models
Cloudflare logo
Cloudflare
2 free models
Gemini logo
Gemini
10 free models
Groq logo
Groq
10 free models
Cerebras logo
Cerebras
5 free models
Mistral logo
Mistral
10 free models
DeepSeek logo
DeepSeek
2 free models
OpenRouter logo
OpenRouter
12 free models
Together logo
Together
3 free models
Cohere logo
Cohere
7 free models
NVIDIA NIM logo
NVIDIA NIM
3 free models
SambaNova logo
SambaNova
2 free models
Hugging Face logo
Hugging Face
3 free models
Cloudflare logo
Cloudflare
2 free models
12
Inference providers
69+
Free-tier models
3
Routing tiers
2
Client protocols

The platform

A control plane for free AI inference

Routing, failover, key management and observability — in one OpenAI-compatible gateway.

Effort-based routing

Pick fast, balanced, or best (`keychain-low` / `-medium` / `-high`). The router cascades through free models until one answers.

Claude Code ready

Native Anthropic Messages API with streaming, tools, and token counting — routed through your free-tier providers.

Automatic failover

A 429 or outage on one provider transparently rolls to the next.

Rate-limit cooldowns

Throttled providers are parked in a cooldown window until they recover.

Encrypted at rest

Every upstream provider key is sealed with authenticated encryption.

Unified keychain key

One revealable ak- key fronts everything. Bearer or x-api-key auth.

Bring your own models

Pin any model id into a tier, then reorder priority to taste.

Usage analytics

Per-model, per-provider request counts, token totals, and latency.

How it works

From twelve dashboards to one request

No SDK swaps, no per-provider glue. Point OpenAI or Anthropic clients at your keychain URL.

1

Connect your providers

Paste the free-tier keys you already have. They're encrypted the moment they arrive.

2

Pick an effort tier

Send `keychain-low`, `-medium`, or `-high` as the model — fast, balanced, or best free-tier cascades.

3

Ship — we handle the rest

Failover, cooldowns and retries happen server-side. You get a clean OpenAI response.

keychain-high
effort: high
1
gemini-2.5-pro
Gemini
429 · skip
2
deepseek-r1
DeepSeek
cooling · skip
3
llama-3.3-70b
Groq
served
1 request in2 skipped · 1 served

The catalog

Every free model, one key

All 69 free-tier models across 12 providers.

Gemini logo
Gemini
generativelanguage.googleapis.com
10 models

Google's multimodal flagship — fast 2.0 Flash, deep 2.5 Pro.

gemini-2.5-progemini-2.5-flashgemini-2.5-flash-litegemini-2.0-flashgemini-2.0-flash-litegemini-1.5-flashgemini-1.5-flash-8bgemma-3-27b-itgemma-3-12b-itgemma-3-4b-it
Groq logo
Groq
api.groq.com
10 models

LPU inference — Llama 3.3 70B at hundreds of tokens/sec.

llama-3.3-70b-versatilellama-3.1-8b-instantllama-3.2-3b-previewllama-3.2-1b-previewllama3-70b-8192llama3-8b-8192gemma2-9b-itqwen-2.5-32bdeepseek-r1-distill-llama-70bmixtral-8x7b-32768
Cerebras logo
Cerebras
api.cerebras.ai
5 models

Wafer-scale speed for Llama- and Qwen-class open models.

llama-3.3-70bllama3.1-8bllama-4-scout-17b-16e-instructqwen-3-32bdeepseek-r1-distill-llama-70b
Mistral logo
Mistral
api.mistral.ai
10 models

Efficient European frontier models, open-weight roots.

mistral-small-latestmistral-large-latestopen-mistral-nemoopen-mistral-7bopen-mixtral-8x7bopen-mixtral-8x22bpixtral-12bcodestral-latestministral-8b-latestministral-3b-latest
DeepSeek logo
DeepSeek
api.deepseek.com
2 models

Reasoning-first models that rival closed frontier labs.

deepseek-chatdeepseek-reasoner
OpenRouter logo
OpenRouter
openrouter.ai
12 models

A meta-gateway — dozens of free community models in one slot.

deepseek/deepseek-r1:freedeepseek/deepseek-chat:freemeta-llama/llama-3.3-70b-instruct:freegoogle/gemini-2.0-flash-exp:freeqwen/qwen-2.5-72b-instruct:freeqwen/qwq-32b:freemistralai/mistral-nemo:freemistralai/mistral-7b-instruct:freenvidia/llama-3.1-nemotron-70b-instruct:freenousresearch/hermes-3-llama-3.1-405b:freeopenai/gpt-oss-120b:freeopenai/gpt-oss-20b:free
Together logo
Together
api.together.xyz
3 models

Open-source model hosting at production scale.

meta-llama/Llama-3.3-70B-Instruct-Turbo-Freemeta-llama/Llama-Vision-Freedeepseek-ai/DeepSeek-R1-Distill-Llama-70B-free
Cohere logo
Cohere
api.cohere.ai
7 models

Enterprise-grade Command models, OpenAI-compatible.

command-r-pluscommand-rcommand-r7bcommand-lightcommand-nightlyaya-expanse-32baya-expanse-8b
NVIDIA NIM logo
NVIDIA NIM
integrate.api.nvidia.com
3 models

NVIDIA-hosted open models via the NIM OpenAI-compatible API.

meta/llama-3.1-8b-instructmeta/llama-3.3-70b-instructnvidia/llama-3.1-nemotron-70b-instruct
SambaNova logo
SambaNova
api.sambanova.ai
2 models

Enterprise-speed Llama inference on SambaNova Cloud.

Meta-Llama-3.1-8B-InstructMeta-Llama-3.3-70B-Instruct
Hugging Face logo
Hugging Face
router.huggingface.co
3 models

Open models via the Hugging Face inference router.

meta-llama/Meta-Llama-3.1-8B-Instructmeta-llama/Meta-Llama-3.3-70B-InstructQwen/Qwen2.5-7B-Instruct
Cloudflare logo
Cloudflare
api.cloudflare.com
2 models

Workers AI models on Cloudflare's global edge.

@cf/meta/llama-3.1-8b-instruct@cf/meta/llama-3.3-70b-instruct

Routing tiers

Fast, balanced, or best — all free

Tiers trade speed for capability across free models, not price. Reorder, disable, or extend any cascade from your dashboard.

Fast
keychain-low

Smallest, fastest free models — autocomplete, classification, and high-volume calls.

Cascade order
  • 1gemini-2.0-flash
  • 2groq/llama-3.1-8b-instant
  • 3cerebras/llama3.1-8b
  • 4nim/meta/llama-3.1-8b-instruct
  • 5sambanova/Meta-Llama-3.1-8B-Instruct
  • 6openrouter/nvidia/llama-nemotron-nano-9b-v2:free
  • 7openrouter/google/gemma-4-26b-a4b:free
  • 8openrouter/openai/gpt-oss-20b:free
Balanced
keychain-medium

Everyday free models — solid quality and speed for chat and agents.

Cascade order
  • 1gemini-2.0-flash
  • 2groq/llama-3.3-70b-versatile
  • 3mistral-small-latest
  • 4nim/meta/llama-3.3-70b-instruct
  • 5sambanova/Meta-Llama-3.3-70B-Instruct
  • 6openrouter/google/gemma-4-31b:free
  • 7openrouter/nvidia/nemotron-3-super:free
  • 8openrouter/openai/gpt-oss-120b:free
Best
keychain-high

Strongest free models — R1, Gemini 2.5 Pro, and Nemotron Ultra for hard problems.

Cascade order
  • 1gemini-2.5-pro
  • 2deepseek/deepseek-r1
  • 3groq/llama-3.3-70b-versatile
  • 4nim/nvidia/llama-3.1-nemotron-70b-instruct
  • 5openrouter/nvidia/nemotron-3-ultra:free
  • 6openrouter/poolside/laguna-m.1:free
  • 7openrouter/tngtech/deepseek-r1t2-chimera:free

Quickstart

If you can call OpenAI or Claude, you're already done

Swap the base URL and key. Chat Completions, Responses API, and Anthropic Messages all route through the same cascade.

  • Drop-in base URL & ak- key (Bearer or x-api-key)
  • Server-side routing & failover
  • Every call logged for analytics
before.py
# A different SDK + key per provider…
from google import genai
from groq import Groq
from mistralai import Mistral

g = genai.Client(api_key=GEMINI_KEY)
q = Groq(api_key=GROQ_KEY)
m = Mistral(api_key=MISTRAL_KEY)
# …and you hand-roll the failover.

Interested in seeing how API Keychain works for your stack?

Spin up your unified key in under a minute and route across every free-tier model from a single endpoint.