-
vLLM settings for a pair of RTX 4090s: the flags I run for twelve local models, and why
· local-llm · vllm
-
The VRAM traps: why a 16GB model wouldn't load on a 48GB card
· local-llm · vllm
-
The broken rules of local LLM inference
· local-llm · vllm
-
The best local coding setup isn't one model: how I route across Claude, Kimi and my own rig
· claude-code · local-llm
-
How to set up vLLM in Docker on Windows (WSL2): serve an open-weight model on your own GPU
· local-llm · vllm
-
Moving houtini-lm to vLLM: What I learned
· claude-code · mcp
-
Best GPUs for Running Local LLMs (2026): VRAM, Bandwidth & Picks
· local-llm · gpu
-
How to set up LM Studio: GPU offload, developer mode and your first local model
· claude-code · local-llm