~ / blog / series / LLM 深水區
❯ ls ~/blog/series/llm-深水區
4 篇文章
- #日期標題
- 12026-04-15[LLM 深水區] 量化演算法在做什麼?從 Q4_K_M 到 TurboQuant 的三層拆解
Q4_K_M 用 4 bit 怎麼裝得下 14B 模型?答案不是「切掉 75%」,而是 K-quant 的 super-block 分組、TurboQuant 的隨機旋轉、跟 QJL 的 1-bit sign sketch 三層演算法。一篇講清楚機制,但不推公式。
- 22026-03-30[Benchmark] TurboQuant 實測:KV Cache 3-bit 壓縮,真的零損失?
Google TurboQuant 在 GX10 (GB10/SM121) 上的實測數據 — 3-bit KV cache 壓縮的真實壓縮率、Qwen2.5-3B 精度驗證、以及 Qwen3.5-35B 的 hybrid attention 架構為什麼讓事情變得複雜。
- 32026-07-22[LLM 深水區] 一張 24GB 顯卡最強的免費開源模型?我押 ThinkingCap-Qwen3.6-27B——想得少、跑得快、不拒答
一張 24GB 消費級顯卡(含改裝 2080 Ti 22G)想跑免費開源模型,我目前的第一名是 Huihui-ThinkingCap-Qwen3.6-27B-abliterated:Q4_K_S 約 16GB、思考少一半、開 MTP ~38 tok/s、不拒答、全 Apache-2.0。
- 42026-07-23[LLM 深水區] 自己做「層級量化」:只挑那幾張張量動手,把 GGUF 再榨 2.45 GiB
量化不是把整個模型砍成 4-bit。一個 GGUF 裡本來就混著 F16/Q4_K/Q6_K/F32 好幾種精度。這篇用 Laguna 的 attention 換 Q8 當例子,教你怎麼看每張張量的精度、只動該動的那幾張,還有 llama-quantize 的 tensor-type 陷阱。