~/ai-muninn
search
⌘K
blog
github
中
~ / blog
/
tag / qwen3
❯
grep -r "#qwen3" ~/blog
7 matches
date
read
title
2026-07-03
14m
[Just for Fun — Advanced] I Doubled My Agent's Decode Speed and It Got Slower: TTFT Is the Number You Actually Feel
#local-llm
#ai-agent
#ttft
#llama.cpp
2026-06-27
14m
[Just for Fun — Advanced] The Tool-Definition Tax: 17K Tokens Before I Say a Word, Re-Billed on Every Cache Miss
#local-llm
#ai-agent
#context
#llama.cpp
2026-06-26
11m
[Just for Fun — Advanced] llama.cpp won't persist KV cache to disk — so I put a 60-line proxy in front of it (7× faster restore)
#local-llm
#llama.cpp
#kv-cache
#ttft
2026-06-25
14m
[Just for Fun — Advanced] Quantizing the Draft Cache Backfired — A Counterintuitive Look at Qwen MTP (f16 ran 34% faster than q4)
#mtp
#speculative-decoding
#local-llm
#qwen3
2026-06-24
16m
[Just for Fun — Advanced] I Maxed Context to 256K, It Loaded Fine — Then Crashed in Real Use: A VRAM Detective Story on a 22GB Frankencard
#local-llm
#llama.cpp
#qwen3
#vram
2026-06-23
16m
[Just for Fun — Advanced] I Gave Up 100 tok/s for 30 — Fast Isn't the Same as Useful
#local-llm
#ai-agent
#qwen3
#gemma
2026-06-22
12m
[Just for Fun — Advanced] I Scored a 22GB-Modded 2080 Ti for ~$340 All-In — Just Enough to Keep a 27B Agent Running at Home
#rtx-2080-ti
#gpu-mod
#local-llm
#ai-agent
← back to all posts