RepoJournal
Local LLMs Local LLMs

Local LLMs — full archive

46 daily briefings · 3 reviews.

$ ls local-llm/reviews/ # the step-back reads

  1. week Vulkan top_k radix select arrives for long rows
  2. week vLLM 0.28.0 lands with P2P weight sync, llama.cpp and partners broaden model reach
  3. month Speculative decoding consolidates across the stack as DeepSeek V4 lands
  1. Vulkan adds TQ1_0, Spark2.5 lands in llama.cpp
  2. vLLM closes scale-out multimodal handoff hole
  3. vLLM Fast Start maps weights zero-copy; GLMGA sampling capped
  4. Ollama enables speculative decoding under structured output, vLLM adds LoRA and fusion
  5. Error propagation hardened in ollama's MLX bindings, gemma4 gains multimodal support
  6. Ollama honors model generation defaults; llama.cpp and vLLM ship MoE performance fixes
  7. vLLM bounds validation errors, AutoRound FP8 arrives
  8. Vulkan top-k radix sort, HIP Q2_0 optimizations, and vLLM CUDA-graph memory fix
  9. llama.cpp Vulkan memory bloat fixed, vLLM deprecates PyAV
  10. OpenVINO backend lands Qwen3.5 on NPU, Whisper.cpp support
  11. LLAMA.CPP UNLEASHES QWEN3.8-FLASH-NEXT SUPPORT
  12. vLLM 0.28.0 LANDED WITH 584 COMMITS AND A KIMI-K3 PERFORMANCE PUSH
  13. OLLAMA'S MLX RUNNER NOW SPEAKS STRUCTURED OUTPUT
  14. OLLAMA BOLSTERS CLAUDE DESKTOP, VLLM HARDENS AUDIO PATHS
  15. VLLM'S P2P WEIGHT SYNC CUTS RL MOE TRANSFER COSTS
  16. SGLang Fixes Pixtral 500s as vLLM Cuts TTFT 25%
  17. SGLang ships v0.5.18 with 710 PRs and DeepSeek V4 FP4 auto-routing
  18. DeepSeek V4 fuses shared experts, as vLLM ships a security guard
  19. OLLAMA FIXES DEADLOCK THAT HUNG CHAT AND GENERATE
  20. LLAMA.CPP SHIPS BAILINGMOE3 SPEC-DECODING SUPPORT
  21. LLAMA.CPP SHIPS MODEL OPTIMIZATIONS WHILE VLLM AND SGLANG CHASE MEMORY AND SCHEDULING GAINS
  22. LLAMA.CPP OVERHAULS INFERENCE FLAGS, VLLM PATCHES DEEPSEEK SPARSE MLA
  23. QWEN3.8 LANDS IN OLLAMA WITH DEVELOPER INSTRUCTION SUPPORT
  24. OLLAMA LAUNCHES DEEPSEEK AND MUSE INTEGRATIONS WHILE VLLM SHIPS HARDWARE-AGNOSTIC MODELING
  25. OLLAMA PATCHES CRITICAL SSRF VULNERABILITY IN MANIFEST HANDLING
  26. OLLAMA CUTS REPEAT PENALTY BLOAT, LLAMA.CPP SHIPS POCKET-TTS SUPPORT
  27. OLLAMA PATCHES CRITICAL PARSER BUG, NEMOTRON 3 LANDS WITH SPECULATIVE DECODING
  28. OLLAMA SHIPS VISION SUPPORT ACROSS MLX AND QWEN3.5 AS LLAMA.CPP FIXES DISPATCH BUGS
  29. OLLAMA CUTS MODEL CONFIG BLOAT 100KB+ PER MODEL, LLAMA.CPP SHIPS TOOL ISOLATION AND CUDA FUSION GAINS
  30. OLLAMA SHIPS BLOCK-DIFFUSION SPECULATIVE DECODING, SGLANG LAUNCHES KIMI K3 DAY-0
  31. LLAMA.CPP HARDENS VULKAN STACK, VLLM CUTS ATTENTION LATENCY, SGLANG SCALES MLA
  32. OLLAMA FIXES KV CACHE CORRUPTION, LLAMA.CPP HARDENS FILE SEARCH, VLLM KILLS MOE LEGACY CODE
  33. OLLAMA FIXES RACE CONDITIONS AS LLAMA.CPP SHIPS BREAKING TTS CHANGES
  34. OLLAMA REWIRES OPENAI COMPATIBILITY, LLAMA.CPP HARDENS SAMPLING
  35. DEEPSEEK V4 INFERENCE GETS 50% SPEEDUP; LLAMA.CPP AND VLLM BOTH SHIPPING OPTIMIZED PATHS
  36. LLAMA.CPP SHIPS FOUR BUILDS IN 24 HOURS AS VLLM AND SGLANG RACE ON SEQUENCE PARALLELISM
  37. QWEN3.5 SPECULATIVE DECODING HITS 70% SPEEDUP ON LLAMA.CPP, OLLAMA ROUTES CLOUD MODELS
  38. LLAMA.CPP FIXES DATA CORRUPTION BUG, VLLM SHIPS CPU KERNEL OVERHAUL
  39. OLLAMA CLEANS UP LINT PIPELINE AS LLAMA.CPP ADDS SPECULATIVE DRAFTING FOR GLM-5.2
  40. OLLAMA RIPS OUT IMAGE GENERATION, LLAMA.CPP SHIPS SPECULATIVE DECODING
  41. OLLAMA REWRITES TUI PERFORMANCE LAYER AS LLAMA.CPP ARMS MEMORY TIERS
  42. LLAMA.CPP SHIPS MINIMAX-M3 SPARSE ATTENTION, VLLM UNLOCKS HETEROGENEOUS PREFILL-DECODE
  43. LLAMA.CPP LOCKS DOWN WASM, ADDS MCP STDIO, HEXAGON GETS IM2COL ACCELERATION
  44. OLLAMA LANDS LAGUNA SUPPORT AND CRUSHES MEMORY LEAKS WHILE SGLANG HITS V0.5.16 WITH CONFIDENCE-DRIVEN SPECULATIVE DECODING
  45. LLAMA.CPP SHIPS FIVE RELEASES IN 24 HOURS, FIXES SPECULATIVE DECODING ACROSS THE STACK
  46. OLLAMA AGENTS NOW IMPORT SKILLS FROM CODEX AND CLAUDE

Never miss a Local LLMs briefing.

Get Local LLMs's week in review every Monday - and security advisories the day they land. Free, unsubscribe in one click.

One click. Every Monday: what mattered across the projects you've been reading (or our AI picks) — security news same-day. You refine anytime. Choose specific journals · Read a sample issue →