-
vLLM settings for a pair of RTX 4090s: the flags I run for twelve local models, and why
· local-llm · vllm
-
The VRAM traps: why a 16GB model wouldn't load on a 48GB card
· local-llm · vllm
-
The broken rules of local LLM inference
· local-llm · vllm
-
Muse Glimmer 30B vs qwen: my day-one local benchmark on a dual RTX 4090 rig
· gpu · hardware
-
The best local coding setup isn't one model: how I route across Claude, Kimi and my own rig
· claude-code · local-llm
-
How to set up vLLM in Docker on Windows (WSL2): serve an open-weight model on your own GPU
· local-llm · vllm
-
Moving houtini-lm to vLLM: What I learned
· claude-code · mcp