Models / Best of /local-12gb
Updated August 2026 · ranked from live data

Best models that fit in 12 GB VRAM

Open-weight models that fit a 12 GB card (RTX 3060/4070 class) at Q4 quantization with room for context, newest first.Right now the top pick is Granite 4.1 8B (~5.6 GB @ Q4).Every row links to full specs, hardware verdicts and provider pricing.

1Granite 4.1 8BIBM~5.6 GB @ Q48.8B$0.050 / $0.10per 1M · via OpenRouter2Reka EdgeReka AI~4.5 GB @ Q47.1B$0.10 / $0.10per 1M · via OpenRouter3Qwen3.5-9BQwen~6.1 GB @ Q49.7B$0.10 / $0.15per 1M · via OpenRouter4Ministral 3 8B 2512Mistral AI~5.6 GB @ Q48.9B$0.15 / $0.15per 1M · via Mistral AI5Ministral 3 14B 2512Mistral AI~8.8 GB @ Q413.9B$0.20 / $0.20per 1M · via OpenRouter6Ministral 3 3B 2512Mistral AI~2.4 GB @ Q43.8B$0.10 / $0.10per 1M · via OpenRouter7Qwen3 VL 8B InstructQwen~5.6 GB @ Q48.8B$0.12 / $0.46per 1M · via OpenRouter8Qwen3 VL 8B ThinkingQwen~5.6 GB @ Q48.8B$0.12 / $1.36per 1M · via Alibaba Cloud9Granite 4.0 MicroIBM~2 GB @ Q43.2B$0.017 / $0.11per 1M · via OpenRouter10Gemma 3n 4BGoogle~4.9 GB @ Q47.8B$0.060 / $0.12per 1M · via OpenRouter
More listsBest models for codingCheapest hosted modelsBest models for 24–32 GB VRAMLongest context windowsBest open-weight modelsFastest hosted models