Where to actually run a model
117 services that will run a model for you, grouped by what they actually are. Read the category before the price: a router and a GPU cloud both look cheap and solve completely different problems.
Routers
One endpoint in front of many models, picking a host per request. This is the OpenRouter category.
| Service | Pricing model | Adds on top | Free tier | OpenAI-compatible | HQ |
|---|---|---|---|---|---|
| Subscription plus per-token | ~30% above list price | Yes | Yes | US | |
| Per call with a markup | 5.5% above list price | Yes | No | FR | |
| Upstream price plus a credit purchase fee; BYO-key supported | 0% on tokens; 5.5% ($0.80 min) on credit purchase; BYOK 5% above $25k/mo | Yes | Yes | US | |
| Markup on upstream tokens | 5% above list price | Yes | Yes | NL | |
| Upstream price, BYO-key supported | 0% - list price, including on bring-your-own-key | Yes | Yes | US |
Serverless inference
Host the weights themselves and bill per token. Where most open-model traffic actually runs.
| Service | Pricing model | Adds on top | Free tier | OpenAI-compatible | HQ |
|---|---|---|---|---|---|
| Per token | - | - | Yes | IL | |
| Per token | - | - | Yes | IL | |
| Per token | - | - | Yes | - | |
| Per token | - | - | Yes | SG | |
| Per token | - | - | Yes | US | |
| Per token | - | - | Yes | - | |
| Per token | - | - | Yes | US | |
| Per token | - | - | Yes | US | |
| Per token | - | - | Yes | US | |
| Per token | - | - | Yes | US | |
| Per token | - | - | Yes | CN | |
| Per token or per GPU-minute | None - sets its own prices | - | Yes | US | |
| Per token | - | - | Yes | - | |
| Per token, with paid tiers for higher limits | None - sets its own prices | Yes | Yes | US | |
| Per token | None - sets its own prices | Yes | Yes | US | |
| Per token | - | - | Yes | - | |
| Per token or per operation | None - sets its own prices | Yes | Yes | US | |
| Per token | - | - | Yes | US | |
| Neurons, with a free daily allocation | None - billed in neurons | Yes | Yes | US | |
| Per token | - | - | Yes | US | |
| Per token | - | - | Yes | - | |
| Per token | - | - | Yes | - | |
| Per token | - | - | Yes | - | |
| Per token | - | - | Yes | US | |
| Per token | - | - | Yes | - | |
| Per token, pay as you go | None - systematically undercuts list price | - | Yes | US | |
| Per token | - | - | Yes | CN | |
| Per token | - | - | Yes | ID | |
| Per token | None - sets its own prices | - | Yes | - | |
| Flat monthly subscription | Flat subscription instead of a margin | - | Yes | US | |
| Per token, plus per-GPU-hour for dedicated | None - sets its own prices | Yes | Yes | US | |
| Per token | - | - | Yes | - | |
| Per token or per GPU-hour | None - sets its own prices | Yes | Yes | US | |
| Per token | - | - | Yes | US | |
| Per token | None - sets its own prices | Yes | Yes | US | |
| Per token | - | - | Yes | US | |
| Per token | - | - | Yes | - | |
| Per token | - | - | Yes | SE | |
| Per token | - | - | Yes | - | |
| Per token | - | - | Yes | US | |
| Per token | - | - | Yes | - | |
| Per token | - | - | Yes | - | |
| Per token | - | - | Yes | US | |
| Per token | - | - | Yes | US | |
| Per token | - | - | Yes | US | |
| Per token | - | - | Yes | - | |
| Per token | - | - | Yes | - | |
| Per token | - | - | Yes | - | |
| Per token | - | - | Yes | US | |
| Per token | - | - | Yes | US | |
| Per token | - | - | Yes | SG | |
| Per token | - | - | Yes | FR | |
| Per token | - | - | Yes | US | |
| Per token | - | - | Yes | US | |
| Per token | - | - | Yes | SG | |
| Per token | - | - | Yes | US | |
| Per token | - | - | Yes | - | |
| Per token | None - sets its own prices | Yes | Yes | NL | |
| Per token | - | - | Yes | CN | |
| Per token | - | - | Yes | ES | |
| Per token | None - sets its own prices | Yes | Yes | US | |
| Per token | - | - | Yes | US | |
| Free locally, subscription in the cloud | None - subscription | Yes | Yes | - | |
| Per token | - | - | Yes | US | |
| Per token | - | - | Yes | US | |
| Per token | None - sets its own prices | - | Yes | US | |
| Per token | - | - | Yes | US | |
| Per token | - | - | Yes | US | |
| Per token | - | - | Yes | US | |
| Per token | - | - | Yes | - | |
| Per token | - | - | Yes | - | |
| Per token | - | - | Yes | - | |
| Per token | - | - | Yes | - | |
| Per token | - | - | Yes | - | |
| Per token | - | - | Yes | - | |
| Per second of compute, or per token on some models | None - billed for compute, not a token margin | Yes | No | US | |
| Per token | - | - | Yes | US | |
| Per token | - | - | Yes | US | |
| Per token | - | - | Yes | - | |
| Per token | None - sets its own prices | Yes | Yes | US | |
| Per token | - | - | Yes | SG | |
| Per token | None - sets its own prices | Yes | Yes | SG | |
| Per token | - | - | Yes | - | |
| Per token | - | - | Yes | - | |
| Per token | - | - | Yes | - | |
| Per token | - | - | Yes | CN | |
| Per token | - | - | Yes | US | |
| Per token | - | - | Yes | CN | |
| Per token | - | - | Yes | US | |
| Per token | - | - | Yes | - | |
| Per token, per model | None - sets its own prices | Yes | Yes | US | |
| Per token | - | - | Yes | - | |
| Subscription or per token | None - subscription | Yes | Yes | US | |
| Per token | - | - | Yes | - | |
| Per token | - | - | Yes | US | |
| Per token | - | - | Yes | US | |
| Per token | - | - | Yes | CN | |
| Per token | - | - | Yes | SG |
Hyperscaler clouds
Managed model services inside a hyperscaler, bought with existing cloud commitments.
| Service | Pricing model | Adds on top | Free tier | OpenAI-compatible | HQ |
|---|---|---|---|---|---|
| Per token, plus provisioned throughput | None - list price | - | No | US | |
| Per token, plus provisioned units | None - list price | - | Yes | US | |
| Per token or per DBU | None - list price | - | Yes | US | |
| Per token or per character | None - list price | - | No | US | |
| Per token, free tier then paid | None - list price | Yes | Yes | US |
GPU clouds
Rent the hardware and run your own server. Cheapest at scale, most work to operate.
| Service | Pricing model | Adds on top | Free tier | OpenAI-compatible | HQ |
|---|---|---|---|---|---|
| Per GPU-hour | None - undercuts list price | - | No | US | |
| Per token or per GPU-hour | None - sets its own prices | - | Yes | US | |
| Per token or per GPU-hour | None - GPU rental | Yes | Yes | US | |
| Per token or per GPU-hour | None - GPU rental | - | Yes | US | |
| Per second of GPU time | None - billed for compute, not tokens | Yes | No | US | |
| Per second of GPU time | None - billed for GPU time | - | No | US |
Proxies & observability
Sit in front of your own provider keys to add caching, logging, guardrails and spend limits.
SDKs & self-hosted
Libraries and self-hosted proxies that normalise provider APIs without taking a cut.
| Service | Pricing model | Adds on top | Free tier | OpenAI-compatible | HQ |
|---|---|---|---|---|---|
| Free and open source; paid enterprise tier | 0% - self-hosted, bring your own provider keys | Yes | Yes | US |
Some of these services have left the category
Unify, Kluster.ai, Predibase, Martian, Hyperbolic and Anyscale no longer offer what they are still widely recommended for. See what replaced each one.
Frequently asked
What is the difference between a provider and a gateway?
A provider trains and publishes a model's weights. A gateway serves those weights over an API. OpenAI is both. DeepSeek publishes weights that dozens of gateways serve, often at very different prices for identical output.
What are the main alternatives to OpenRouter?
Requesty, Vercel AI Gateway and AI/ML API compete most directly as routers. LiteLLM and Portkey solve the same problem without taking a token margin - you bring your own provider keys. Together, Fireworks, Groq, DeepInfra and Novita host open models directly and are usually cheaper per token, but cover fewer models. Note that several services still listed as OpenRouter alternatives elsewhere have left the category: Unify shut its router down, Kluster.ai is offline, Martian became an interpretability lab, and Hyperbolic pivoted to GPU rental.
Do gateways charge more than going direct?
The spread is wider than most people assume. Vercel AI Gateway adds 0% and passes through list price. OpenRouter also adds 0% on tokens, monetising through a 5.5% fee ($0.80 minimum) when you buy credits. Requesty adds 5%, Eden AI 5.5%, and AI/ML API roughly 30% over list. LiteLLM and Portkey take nothing on tokens at all because you bring your own keys. Serverless hosts set their own prices entirely and are frequently cheaper than the model's own lab for open-weight models.
Is a router worth it if it adds a fee?
Often, because the price spread between hosts of the same model is larger than any router's fee. The same open-weight model can vary more than tenfold in input price across the hosts serving it, so routing to the cheapest healthy endpoint usually saves more than the margin costs. Each model page lists every host side by side so you can check the spread yourself.