~/ai-muninn
搜尋
⌘K
blog
github
EN
~ / blog
/
tag / gguf
❯
grep -r "#gguf" ~/blog
5 篇文章
日期
閱讀
標題
2026-08-30
15m
[Benchmark] GLM-5.3-Flash 塞進一台 DGX Spark:108.72 GB、15.5 tok/s、視覺能用
#glm-5.3-flash
#dgx-spark
#llama.cpp
#gguf
2026-08-20
13m
[趣味競賽 進階 #12] 為什麼你的 4-bit 模型在 2080 Ti 上快不起來?——拆開 .so 才發現這代卡只有兩種齒輪
#2080-ti
#turing
#quantization
#gguf
2026-08-18
6m
[洋垃圾跑大模型 #5] 一張 22G 老卡跑 Qwen3.8-27B:30 tok/s,還能一次寫出會動的 3D 場景
#qwen3.8
#unsloth
#洋垃圾
#2080-ti
2026-07-23
11m
[LLM 深水區] 自己做「層級量化」:只挑那幾張張量動手,把 GGUF 再榨 2.45 GiB
#量化
#quantization
#gguf
#llama.cpp
2026-04-10
11m
[LLM 101 #4] 什麼是量化?Q4、Q8、FP16 到底差在哪
#llm
#量化
#ollama
#入門
← 回到所有文章