~/ai-muninn
搜尋
⌘K
blog
github
EN
~ / blog
/
tag / mtp
❯
grep -r "#mtp" ~/blog
10 篇文章
日期
閱讀
標題
2026-07-29
20m
[洋垃圾跑大模型 #3] 一張 22G 老卡跑 284B:DeepSeek-V4-Flash 比 DGX Spark 快 18%
#deepseek-v4-flash
#moe
#洋垃圾
#2080-ti
2026-07-22
11m
[LLM 深水區] 一張 24GB 顯卡最強的免費開源模型?我押 ThinkingCap-Qwen3.6-27B——想得少、跑得快、不拒答
#qwen3.6
#thinkingcap
#abliterated
#在地模型
2026-07-07
7m
DGX Spark 2026 現況:哪些還能跑、哪些已經過時、我現在會怎麼配
#dgx-spark
#gb10
#gemma-4
#vllm
2026-07-06
10m
[本地 LLM] V4-Flash 的 depth-1 MTP:agent 回合 +9%、散文 −4%——推測解碼要看工作型態決定開不開
#dgx-spark
#gb10
#deepseek-v4-flash
#speculative-decoding
2026-06-25
12m
[趣味競賽 進階 #4] 量化 draft cache 反而更慢:Qwen MTP 投機解碼的反直覺實測(f16 比 q4 快 34%)
#mtp
#投機解碼
#本地-llm
#qwen3
2026-06-01
9m
[Benchmark] NVFP4 W4A4 在 DGX Spark 上超車 FP8:拔掉 enforce-eager,MoE 從 23 衝到 67 tok/s
#nvfp4
#w4a4
#fp8
#dgx-spark
2026-05-14
5m
在 DGX Spark 上 30 行 docker 拿 +34%:huihui Gemma 4 FP8 + vanilla MTP n=1 部署 recipe
#gemma-4
#abliteration
#mtp
#speculative-decoding
2026-05-09
13m
想用 MTP 加速 abliterated Gemma 4?vanilla draft 對不上被改過的 body
#gemma-4
#abliteration
#mtp
#speculative-decoding
2026-05-06
11m
火箭起飛:Gemma 4 在 DGX Spark 跑出 670 tok/s 總吞吐(單流 108 tok/s)
#gemma-4
#mtp
#speculative-decoding
#vllm
2026-04-28
14m
[llm-compressor] 自量化 abliterated 35B FP8 on DGX Spark:4 次 OOM、3 個 prefix bug、最終 51 tok/s
#dgx-spark
#gb10
#sm121
#llm-compressor
← 回到所有文章