~ / blog / series / 洋垃圾跑大模型
❯ ls ~/blog/series/洋垃圾跑大模型
5 篇文章
- #日期標題
- 12026-07-21[洋垃圾跑大模型 #1] 一台洋垃圾三張老卡,怎麼跑得動 119B 的大模型
一台約 5 萬台幣的二手 EPYC 伺服器,插三張改裝 2080 Ti 22G,共 66G 顯卡記憶體加 128G 一般記憶體。跑得動量化後的 119B 大模型,74 tok/s。想再往上跑 200B–300B、或想騰一張卡出來生圖,靠的是同一招:MoE 的 expert 大多時候在睡覺,把它們丟去便宜的大記憶體給 CPU 算,decode 只慢 2.4 倍。這篇講這招怎麼運作、代價多少(拿一顆小的 26B 先量給你看),還有一個多卡卸載必踩的坑:同一個卸載指令,單卡沒事、三卡直接 OOM。
- 22026-07-22[洋垃圾跑大模型 #2] 一張 22G 老卡跑 118B 的 coding 大模型:Poolside Laguna S 2.1 實戰
Poolside Laguna S 2.1 是 118B-A8B 的 MoE coding 模型。我把它塞進單張改裝 2080 Ti 22G,用 CPU/GPU 混合 offload + 配套 DFlash 投機解碼跑到 ~29 tok/s,還靠一招 attention 換 Q8 省約 2.45 GiB、decode 再快 7%。
- 32026-07-29[洋垃圾跑大模型 #3] 一張 22G 老卡跑 284B:DeepSeek-V4-Flash 比 DGX Spark 快 18%
DeepSeek-V4-Flash 是 284B 的 MoE。我把它塞進單張改裝 2080 Ti 22G,跑到 17.85 tok/s、262K context 只吃 16GB VRAM,還比跑同一顆模型的 DGX Spark 快約 18%。過程中我判斷錯了兩次,而且錯法不一樣。
- 42026-08-02[洋垃圾跑大模型 #4] 把前沿級開源模型搬進自己家:一張 22G 老卡跑 DeepSeek-V4-Flash-0731
DeepSeek 官方 0731 正式版,在好幾個 agentic 評測上跟閉源旗艦同級。這篇從下載 91GB 的 GGUF、設定成開機自動跑,一路寫到怎麼算你那張卡該搬幾層專家上 VRAM。
- 52026-08-18[洋垃圾跑大模型 #5] 一張 22G 老卡跑 Qwen3.8-27B:30 tok/s,還能一次寫出會動的 3D 場景
unsloth 的 Qwen3.8-27B-UD-Q4_K_XL 在一張改裝 2080 Ti 22G 上跑得動:16.7 GiB 權重、開到 128K context 還剩 1.7 GB、實測 30-31 tok/s。附一個它一次生成的體素庭園,可以直接開來玩。