[公告] 停更公告(8/8~8/21)

最近新模型如百花齊放,太棒了!但是因為blog主的膽囊也炸裂所以要休息一段時間才能再繼續分享。
哈嘍各位讀者,最近的開源大模型真的是太讓人興奮不已,又是完全版的deepseek v4 flash 、Qwen 3.8 ,MiniMax H3 有好多可以玩的東西,希望大家玩的愉快!
嗚嗚😭,我也好想和大家一起玩,不過因為個人膽囊結石發炎的關係,在醫院已經待了約一週了,雖然我很樂在其中,但是要一邊忍受痛苦一邊繼續研究。我只能說「臣妾做不到啊!」

(是做得到的的人才太變態了吧。 XD)
希望大家身體健康,也保持身體健康!
接著讀
- 2026-09-28[DGX Spark] 兩台 DGX Spark 跑 Qwen3.8-Flash-Next 從 51.9 到 72.0 tok/s:幅度最大的是補上自己常用的中文詞表
距離 #46 十六天,同一套 40 題重測:51.9 → 72.0 tok/s,評分沒掉。幅度最大的是拿自己常用的中文補進 MTP 草稿詞表,常用主題快 60%;多輪對話修好 prefix cache 對齊,第二輪從 3.30 秒變 0.23 秒。
- 2026-09-282080 Ti 沒有 FP4 也能跑 NVFP4:自己轉 Qwen3.8-27B,寫程式快 31%
2080 Ti 沒有 FP4 硬體,FastLLM 在 kernel 裡解包 NVFP4 照樣變快:自己把 Qwen3.8-27B BF16 轉成 NVFP4,寫程式 151.7 tok/s(FP8 116.1),四條請求同時跑合計 297,140 題 131/128。附轉換腳本與三顆 NVFP4 的比較。
- 2026-09-28雙 2080 Ti FastLLM 升級:寫程式快 16%、兩人同時用,長請求不再擋人
兩張改裝 2080 Ti 22G 的 FastLLM + DFlash2 換成自編的上游最新版:寫程式 116.1 tok/s(同組題目原本 100.3),兩個請求同時跑,長請求讀 prompt 時短請求 1.1 秒開始回。附編譯步驟、啟動指令和兩個上游 PR。
- 2026-09-21特化的啟動器 FastLLM + DFlash2,居然可以在魔改的 2080 Ti 雙卡跑出 100+ tok/s!
兩張改裝 2080 Ti 22G 用 FastLLM 跑 Qwen3.8-27B FP8,掛上 DFlash2 草稿模型:寫程式 153.8 tok/s、數學 134.9,散文 53.1。262K context、看圖、prefix cache 都在。附完整啟動指令和四個會卡住你的設定。
不想錯過新文章?
訂閱我確保不漏接!
隨時一鍵退訂。