Models / Best of /fastest
Updated August 2026 · ranked from live data

Fastest hosted models

General-purpose text chat models only, ranked by the median measured provider throughput (tokens per second, 30-minute rolling window). Specialist and agentic routes are excluded; models need at least two measured endpoints so one outlier host cannot dominate.Right now the top pick is Trinity Large Thinking (181 tok/s median · 2 hosts).Every row links to full specs, hardware verdicts and provider pricing.

1Trinity Large ThinkingArcee AI181 tok/s median · 2 hosts399B$0.25 / $0.80per 1M · via Arcee AI2Grok 4.20xAI168 tok/s median · 2 hosts$1.25 / $2.50per 1M · via OpenRouter3Inkling SmallThinking Machines165 tok/s median · 2 hosts266B$0.50 / $1.20per 1M · via OpenRouter4Qwen3 Next 80B A3B ThinkingQwen163 tok/s median · 4 hosts81.3B / 3B$0.15 / $1.20per 1M · via OpenRouter5Nemotron 3 Nano 30B A3BNVIDIA155 tok/s median · 3 hosts31.6B / 3B$0.050 / $0.20per 1M · via Novita AI6GPT-4.1 NanoOpenAI147 tok/s median · 3 hosts$0.10 / $0.40per 1M · via OpenRouter7Qwen3 30B A3B Thinking 2507Qwen145 tok/s median · 2 hosts30.5B / 3B$0.13 / $1.56per 1M · via Alibaba Cloud8GPT-5.6 Terra ProOpenAI144 tok/s median · 3 hosts$1.00 / $6.00per 1M · via OpenRouter9Nova Micro 1.0Amazon143 tok/s median · 2 hosts$0.035 / $0.14per 1M · via OpenRouter10gpt-oss-120bOpenAI137 tok/s median · 19 hosts120B$0.037 / $0.17per 1M · via OpenRouter
More listsBest models for codingCheapest hosted modelsBest models that fit in 12 GB VRAMBest models for 24–32 GB VRAMLongest context windowsBest open-weight models