Local LLMs — full archive
46 daily briefings · 3 reviews.
$ ls local-llm/reviews/ # the step-back reads
- week Vulkan top_k radix select arrives for long rows
- week vLLM 0.28.0 lands with P2P weight sync, llama.cpp and partners broaden model reach
- month Speculative decoding consolidates across the stack as DeepSeek V4 lands
- Vulkan adds TQ1_0, Spark2.5 lands in llama.cpp
- vLLM closes scale-out multimodal handoff hole
- vLLM Fast Start maps weights zero-copy; GLMGA sampling capped
- Ollama enables speculative decoding under structured output, vLLM adds LoRA and fusion
- Error propagation hardened in ollama's MLX bindings, gemma4 gains multimodal support
- Ollama honors model generation defaults; llama.cpp and vLLM ship MoE performance fixes
- vLLM bounds validation errors, AutoRound FP8 arrives
- Vulkan top-k radix sort, HIP Q2_0 optimizations, and vLLM CUDA-graph memory fix
- llama.cpp Vulkan memory bloat fixed, vLLM deprecates PyAV
- OpenVINO backend lands Qwen3.5 on NPU, Whisper.cpp support
- LLAMA.CPP UNLEASHES QWEN3.8-FLASH-NEXT SUPPORT
- vLLM 0.28.0 LANDED WITH 584 COMMITS AND A KIMI-K3 PERFORMANCE PUSH
- OLLAMA'S MLX RUNNER NOW SPEAKS STRUCTURED OUTPUT
- OLLAMA BOLSTERS CLAUDE DESKTOP, VLLM HARDENS AUDIO PATHS
- VLLM'S P2P WEIGHT SYNC CUTS RL MOE TRANSFER COSTS
- SGLang Fixes Pixtral 500s as vLLM Cuts TTFT 25%
- SGLang ships v0.5.18 with 710 PRs and DeepSeek V4 FP4 auto-routing
- DeepSeek V4 fuses shared experts, as vLLM ships a security guard
- OLLAMA FIXES DEADLOCK THAT HUNG CHAT AND GENERATE
- LLAMA.CPP SHIPS BAILINGMOE3 SPEC-DECODING SUPPORT
- LLAMA.CPP SHIPS MODEL OPTIMIZATIONS WHILE VLLM AND SGLANG CHASE MEMORY AND SCHEDULING GAINS
- LLAMA.CPP OVERHAULS INFERENCE FLAGS, VLLM PATCHES DEEPSEEK SPARSE MLA
- QWEN3.8 LANDS IN OLLAMA WITH DEVELOPER INSTRUCTION SUPPORT
- OLLAMA LAUNCHES DEEPSEEK AND MUSE INTEGRATIONS WHILE VLLM SHIPS HARDWARE-AGNOSTIC MODELING
- OLLAMA PATCHES CRITICAL SSRF VULNERABILITY IN MANIFEST HANDLING
- OLLAMA CUTS REPEAT PENALTY BLOAT, LLAMA.CPP SHIPS POCKET-TTS SUPPORT
- OLLAMA PATCHES CRITICAL PARSER BUG, NEMOTRON 3 LANDS WITH SPECULATIVE DECODING
- OLLAMA SHIPS VISION SUPPORT ACROSS MLX AND QWEN3.5 AS LLAMA.CPP FIXES DISPATCH BUGS
- OLLAMA CUTS MODEL CONFIG BLOAT 100KB+ PER MODEL, LLAMA.CPP SHIPS TOOL ISOLATION AND CUDA FUSION GAINS
- OLLAMA SHIPS BLOCK-DIFFUSION SPECULATIVE DECODING, SGLANG LAUNCHES KIMI K3 DAY-0
- LLAMA.CPP HARDENS VULKAN STACK, VLLM CUTS ATTENTION LATENCY, SGLANG SCALES MLA
- OLLAMA FIXES KV CACHE CORRUPTION, LLAMA.CPP HARDENS FILE SEARCH, VLLM KILLS MOE LEGACY CODE
- OLLAMA FIXES RACE CONDITIONS AS LLAMA.CPP SHIPS BREAKING TTS CHANGES
- OLLAMA REWIRES OPENAI COMPATIBILITY, LLAMA.CPP HARDENS SAMPLING
- DEEPSEEK V4 INFERENCE GETS 50% SPEEDUP; LLAMA.CPP AND VLLM BOTH SHIPPING OPTIMIZED PATHS
- LLAMA.CPP SHIPS FOUR BUILDS IN 24 HOURS AS VLLM AND SGLANG RACE ON SEQUENCE PARALLELISM
- QWEN3.5 SPECULATIVE DECODING HITS 70% SPEEDUP ON LLAMA.CPP, OLLAMA ROUTES CLOUD MODELS
- LLAMA.CPP FIXES DATA CORRUPTION BUG, VLLM SHIPS CPU KERNEL OVERHAUL
- OLLAMA CLEANS UP LINT PIPELINE AS LLAMA.CPP ADDS SPECULATIVE DRAFTING FOR GLM-5.2
- OLLAMA RIPS OUT IMAGE GENERATION, LLAMA.CPP SHIPS SPECULATIVE DECODING
- OLLAMA REWRITES TUI PERFORMANCE LAYER AS LLAMA.CPP ARMS MEMORY TIERS
- LLAMA.CPP SHIPS MINIMAX-M3 SPARSE ATTENTION, VLLM UNLOCKS HETEROGENEOUS PREFILL-DECODE
- LLAMA.CPP LOCKS DOWN WASM, ADDS MCP STDIO, HEXAGON GETS IM2COL ACCELERATION
- OLLAMA LANDS LAGUNA SUPPORT AND CRUSHES MEMORY LEAKS WHILE SGLANG HITS V0.5.16 WITH CONFIDENCE-DRIVEN SPECULATIVE DECODING
- LLAMA.CPP SHIPS FIVE RELEASES IN 24 HOURS, FIXES SPECULATIVE DECODING ACROSS THE STACK
- OLLAMA AGENTS NOW IMPORT SKILLS FROM CODEX AND CLAUDE
Never miss a Local LLMs briefing.
Get Local LLMs's week in review every Monday - and security advisories the day they land. Free, unsubscribe in one click.
One click. Every Monday: what mattered across the projects you've been reading (or our AI picks) — security news same-day. You refine anytime. Choose specific journals · Read a sample issue →