~/ai-muninn
搜尋
⌘K
blog
github
EN
~ / blog
/
tag / qwen3
❯
grep -r "#qwen3" ~/blog
7 篇文章
日期
閱讀
標題
2026-07-03
13m
[趣味競賽 進階 #8] 為什麼 30 tok/s 體感比 14 還慢:TTFT 才是你真正感覺到的速度
#本地-llm
#ai-agent
#ttft
#llama.cpp
2026-06-27
12m
[趣味競賽 進階 #6] 工具定義稅:還沒開口,就先吃掉 17K token——而且每次重算都重來一遍
#本地-llm
#ai-agent
#context
#llama.cpp
2026-06-26
9m
[趣味競賽 進階 #5] 別讓助理每次都重讀整本對話:KV cache 存硬碟,回神快 7 倍
#本地-llm
#llama.cpp
#kv-cache
#ttft
2026-06-25
12m
[趣味競賽 進階 #4] 量化 draft cache 反而更慢:Qwen MTP 投機解碼的反直覺實測(f16 比 q4 快 34%)
#mtp
#投機解碼
#本地-llm
#qwen3
2026-06-24
14m
[趣味競賽 進階 #3] 我把 context 開滿 256K,它載入成功——然後在真實對話裡 crash:一張 22G 改裝卡的 VRAM 偵探故事
#本地-llm
#llama.cpp
#qwen3
#vram
2026-06-23
14m
[趣味競賽 進階 #2] 我把 100 tok/s 換成 30:快的 Gemma 12B 做完事就走人,慢的 Qwen 27B 才肯收尾
#本地-llm
#ai-agent
#qwen3
#gemma
2026-06-22
11m
[趣味競賽 進階 #1] 老將漢升(GTX 970)退場,天水的麒麟兒(RTX 2080Ti 22G)登場:NT$11k 改裝卡養一顆 27B agent
#rtx-2080-ti
#改裝顯卡
#本地-llm
#ai-agent
← 回到所有文章