Cheapest multimodal LLMs
Qwen: Qwen3.7 Flash is the cheapest option at $0.030 per million input tokens. Models that accept more than text and images - audio, video or documents - ranked by what the text tokens cost.
130 models qualify
Ranked by blended cost - input weighted 75%, output 25%.
| # | Model | Blended / 1M | Input / 1M | Output / 1M | Context | Capabilities |
|---|---|---|---|---|---|---|
| 1 | Auto Router (Beta) OpenRouter | $-1000000.0000 | $-1000000.0000 | $-1000000.0000 | 2M | ReasoningToolsVision |
| 2 | Auto Router OpenRouter | $-1000000.0000 | $-1000000.0000 | $-1000000.0000 | 2M | ReasoningToolsVision |
| 3 | Free | Free | Free | 256K | Free tierReasoningToolsVisionOpen weights | |
| 4 | Qwen3.7 Flash Qwen | $0.055 | $0.030 | $0.130 | 1M | ReasoningToolsVision |
| 5 | Ling 3.0 Flash VL inclusionAI | $0.090 | $0.060 | $0.180 | 131K | Free tierReasoningToolsVisionOpen weights |
| 6 | Reka Edge Reka AI | $0.100 | $0.100 | $0.100 | 16K | ToolsVisionOpen weights |
| 7 | Qwen3.5-9B Qwen | $0.112 | $0.100 | $0.150 | 262K | ReasoningToolsVisionOpen weights |
| 8 | Qwen3.5-Flash Qwen | $0.114 | $0.065 | $0.260 | 1M | ReasoningToolsVision |
| 9 | $0.125 | $0.100 | $0.200 | 1.0M | ReasoningToolsVision | |
| 10 | $0.125 | $0.100 | $0.200 | 1.0M | ReasoningToolsVision | |
| 11 | Seed 1.6 Flash ByteDance Seed | $0.131 | $0.075 | $0.300 | 262K | ReasoningToolsVision |
| 12 | GPT-5 Nano OpenAI | $0.137 | $0.050 | $0.400 | 400K | ReasoningToolsVision |
| 13 | Gemma 4 26B A4B | $0.143 | $0.090 | $0.300 | 262K | Free tierReasoningToolsVisionOpen weights |
| 14 | Voxtral Small 24B 2507 Mistral AI | $0.150 | $0.100 | $0.300 | 33K | ToolsOpen weights |
| 15 | Gemma 4 31B | $0.152 | $0.090 | $0.340 | 262K | Free tierReasoningToolsVisionOpen weights |
| 16 | Seed-2.0-Mini ByteDance Seed | $0.175 | $0.100 | $0.400 | 262K | ReasoningToolsVision |
| 17 | Gemini 2.5 Flash Lite | $0.175 | $0.100 | $0.400 | 1.0M | ReasoningToolsVision |
| 18 | GPT-4.1 Nano OpenAI | $0.175 | $0.100 | $0.400 | 1.0M | ToolsVision |
| 19 | MiMo-V2.5 Xiaomi | $0.175 | $0.140 | $0.280 | 1.1M | ReasoningToolsVisionOpen weights |
| 20 | Qwen3.8 Flash Qwen | $0.230 | $0.150 | $0.470 | 1M | ReasoningToolsVisionOpen weights |
| 21 | GLM 5.3 Flash Z.ai | $0.237 | $0.150 | $0.500 | 1.3M | ReasoningToolsVisionOpen weights |
| 22 | GPT-4o-mini OpenAI | $0.262 | $0.150 | $0.600 | 128K | ToolsVision |
| 23 | GPT-4o-mini (2024-07-18) OpenAI | $0.262 | $0.150 | $0.600 | 128K | ToolsVision |
| 24 | Qwen3.6 35B A3B Qwen | $0.300 | $0.100 | $0.900 | 262K | ReasoningToolsVisionOpen weights |
| 25 | Qwen3.6 Flash Qwen | $0.422 | $0.188 | $1.13 | 1M | ReasoningToolsVision |
Frequently asked
What is the cheapest LLM for multimodal input?
Qwen: Qwen3.7 Flash at $0.030 per million input tokens and $0.130 per million output tokens, with a 1M token context window.
How many models qualify for multimodal input?
130 of the 340 models tracked here meet the criteria for this list.
How much do prices vary within this category?
By roughly 4,800×, from Qwen3.7 Flash at the bottom to o1-pro at the top.