Skip to content
LLMs

Where to actually run a model

117 services that will run a model for you, grouped by what they actually are. Read the category before the price: a router and a GPU cloud both look cheap and solve completely different problems.

Routers

One endpoint in front of many models, picking a host per request. This is the OpenRouter category.

Routers
ServicePricing modelAdds on topFree tierOpenAI-compatibleHQ
Subscription plus per-token~30% above list priceYesYesUS
Per call with a markup5.5% above list priceYesNoFR
Upstream price plus a credit purchase fee; BYO-key supported0% on tokens; 5.5% ($0.80 min) on credit purchase; BYOK 5% above $25k/moYesYesUS
Markup on upstream tokens5% above list priceYesYesNL
Upstream price, BYO-key supported0% - list price, including on bring-your-own-keyYesYesUS

Serverless inference

Host the weights themselves and bill per token. Where most open-model traffic actually runs.

Serverless inference
ServicePricing modelAdds on topFree tierOpenAI-compatibleHQ
Per token--YesIL
Per token--YesIL
Per token--Yes-
Per token--YesSG
Per token--YesUS
Per token--Yes-
Per token--YesUS
Per token--YesUS
Per token--YesUS
Per token--YesUS
Per token--YesCN
Per token or per GPU-minuteNone - sets its own prices-YesUS
Per token--Yes-
Per token, with paid tiers for higher limitsNone - sets its own pricesYesYesUS
Per tokenNone - sets its own pricesYesYesUS
Per token--Yes-
Per token or per operationNone - sets its own pricesYesYesUS
Per token--YesUS
Neurons, with a free daily allocationNone - billed in neuronsYesYesUS
Per token--YesUS
Per token--Yes-
Per token--Yes-
Per token--Yes-
Per token--YesUS
Per token--Yes-
Per token, pay as you goNone - systematically undercuts list price-YesUS
Per token--YesCN
Per token--YesID
Per tokenNone - sets its own prices-Yes-
Flat monthly subscriptionFlat subscription instead of a margin-YesUS
Per token, plus per-GPU-hour for dedicatedNone - sets its own pricesYesYesUS
Per token--Yes-
Per token or per GPU-hourNone - sets its own pricesYesYesUS
Per token--YesUS
Per tokenNone - sets its own pricesYesYesUS
Per token--YesUS
Per token--Yes-
Per token--YesSE
Per token--Yes-
Per token--YesUS
Per token--Yes-
Per token--Yes-
Per token--YesUS
Per token--YesUS
Per token--YesUS
Per token--Yes-
Per token--Yes-
Per token--Yes-
Per token--YesUS
Per token--YesUS
Per token--YesSG
Per token--YesFR
Per token--YesUS
Per token--YesUS
Per token--YesSG
Per token--YesUS
Per token--Yes-
Per tokenNone - sets its own pricesYesYesNL
Per token--YesCN
Per token--YesES
Per tokenNone - sets its own pricesYesYesUS
Per token--YesUS
Free locally, subscription in the cloudNone - subscriptionYesYes-
Per token--YesUS
Per token--YesUS
Per tokenNone - sets its own prices-YesUS
Per token--YesUS
Per token--YesUS
Per token--YesUS
Per token--Yes-
Per token--Yes-
Per token--Yes-
Per token--Yes-
Per token--Yes-
Per token--Yes-
Per second of compute, or per token on some modelsNone - billed for compute, not a token marginYesNoUS
Per token--YesUS
Per token--YesUS
Per token--Yes-
Per tokenNone - sets its own pricesYesYesUS
Per token--YesSG
Per tokenNone - sets its own pricesYesYesSG
Per token--Yes-
Per token--Yes-
Per token--Yes-
Per token--YesCN
Per token--YesUS
Per token--YesCN
Per token--YesUS
Per token--Yes-
Per token, per modelNone - sets its own pricesYesYesUS
Per token--Yes-
Subscription or per tokenNone - subscriptionYesYesUS
Per token--Yes-
Per token--YesUS
Per token--YesUS
Per token--YesCN
Per token--YesSG

Hyperscaler clouds

Managed model services inside a hyperscaler, bought with existing cloud commitments.

Hyperscaler clouds
ServicePricing modelAdds on topFree tierOpenAI-compatibleHQ
Per token, plus provisioned throughputNone - list price-NoUS
Per token, plus provisioned unitsNone - list price-YesUS
Per token or per DBUNone - list price-YesUS
Per token or per characterNone - list price-NoUS
Per token, free tier then paidNone - list priceYesYesUS

GPU clouds

Rent the hardware and run your own server. Cheapest at scale, most work to operate.

GPU clouds
ServicePricing modelAdds on topFree tierOpenAI-compatibleHQ
Per GPU-hourNone - undercuts list price-NoUS
Per token or per GPU-hourNone - sets its own prices-YesUS
Per token or per GPU-hourNone - GPU rentalYesYesUS
Per token or per GPU-hourNone - GPU rental-YesUS
Per second of GPU timeNone - billed for compute, not tokensYesNoUS
Per second of GPU timeNone - billed for GPU time-NoUS

Proxies & observability

Sit in front of your own provider keys to add caching, logging, guardrails and spend limits.

Proxies & observability
ServicePricing modelAdds on topFree tierOpenAI-compatibleHQ
Per logged request, free tier then subscription0% on tokens - billed per logged requestYesYesUS
Per request, free tier then subscription0% on tokens - billed per requestYesYesUS

SDKs & self-hosted

Libraries and self-hosted proxies that normalise provider APIs without taking a cut.

SDKs & self-hosted
ServicePricing modelAdds on topFree tierOpenAI-compatibleHQ
Free and open source; paid enterprise tier0% - self-hosted, bring your own provider keysYesYesUS

Some of these services have left the category

Unify, Kluster.ai, Predibase, Martian, Hyperbolic and Anyscale no longer offer what they are still widely recommended for. See what replaced each one.

Frequently asked

What is the difference between a provider and a gateway?

A provider trains and publishes a model's weights. A gateway serves those weights over an API. OpenAI is both. DeepSeek publishes weights that dozens of gateways serve, often at very different prices for identical output.

What are the main alternatives to OpenRouter?

Requesty, Vercel AI Gateway and AI/ML API compete most directly as routers. LiteLLM and Portkey solve the same problem without taking a token margin - you bring your own provider keys. Together, Fireworks, Groq, DeepInfra and Novita host open models directly and are usually cheaper per token, but cover fewer models. Note that several services still listed as OpenRouter alternatives elsewhere have left the category: Unify shut its router down, Kluster.ai is offline, Martian became an interpretability lab, and Hyperbolic pivoted to GPU rental.

Do gateways charge more than going direct?

The spread is wider than most people assume. Vercel AI Gateway adds 0% and passes through list price. OpenRouter also adds 0% on tokens, monetising through a 5.5% fee ($0.80 minimum) when you buy credits. Requesty adds 5%, Eden AI 5.5%, and AI/ML API roughly 30% over list. LiteLLM and Portkey take nothing on tokens at all because you bring your own keys. Serverless hosts set their own prices entirely and are frequently cheaper than the model's own lab for open-weight models.

Is a router worth it if it adds a fee?

Often, because the price spread between hosts of the same model is larger than any router's fee. The same open-weight model can vary more than tenfold in input price across the hosts serving it, so routing to the cheapest healthy endpoint usually saves more than the margin costs. Each model page lists every host side by side so you can check the spread yourself.