~ /home/coolthor
ai-muninn
AI 基礎設施、LLM 部署與自主 Agent 的研究筆記。那些花了太長時間才搞懂的事,寫下來讓你不用重踩。
❯ whoami
在家跑各種本地模型 — LLM、生圖、生影片,然後把搞懂的東西寫下來
把模型量化成 FP8 / NVFP4 丟上 Hugging Face — 真的有人在跑
用 AI Agent 建造期權交易基礎設施
踩到的 spec-decode bug 自己修一修,進了 vLLM 的 speculators
偶爾也會上架 iOS App
❯ open ~/tools/model-anatomy
模型解剖室 →
展開 Qwen 與 DeepSeek 的 3D 結構,看見權重分區、Attention、MoE 與資料流。點選區塊就能讀懂用途與參數量。
❯ cat ~/blog/從這裡開始
從這裡開始
第一次來?從這幾篇入坑剛好
- 2026-06-04[Agent 入門 #1] AI 助理跟 ChatGPT 差在哪?一個回答你,一個用你的工具幫你做事
你平常用 ChatGPT 多半是問一句它答一句。自己養的 AI 助理(agent)則能用你自己的工具把事做完、跑在你這邊、接你天天在用的軟體。從 0 打造自己助理的第一課。
- 2026-06-05[Agent 入門 #4] Hermes Agent Desktop 桌面版安裝教學:手把手下載、裝好你的第一個 AI 助理
Hermes Agent Desktop(桌面版)下載 + 安裝教學。不用碰終端機:到官網下載桌面版、第一次打開自動裝好相依套件、用 ChatGPT 帳號登入,十幾分鐘就有一個你自己的 AI 助理在跑。
- 2026-06-12[地端 LLM #1] 第一次跑 Q2 就以為模型變笨了 —— 284B DeepSeek-V4-Flash 在 128GB 桌機,真兇是 parser 不認 DSML
DeepSeek-V4-Flash 是 284B 的 frontier 模型。我用 antirez 的 ds4 引擎 + 非對稱 Q2 在單台 GB10 跑起來,15.6 tok/s。本來以為 2-bit 量化讓它假裝呼叫工具,結果真兇是 runtime 沒接 DSML parser。
- 2026-06-11[Benchmark #2] Qwen3.5-122B 在 DGX Spark 加速 100%!
Qwen3.5-122B-A10B 在 128GB 的 DGX Spark 上,vLLM 怎麼調都卡在 17 tok/s 的 GDN 牆,連 merge 進去的加速 PR 都沒用。我換掉 vLLM、改用 Atlas 引擎跑同一顆解禁 NVFP4 權重,直接翻到 33.9 tok/s(開 MTP 36.5,約 2×)—— 加速 100%,解禁行為原封不動。真正的出口不在量化工具箱裡。
❯ cat ~/blog/概念
概念與方法 (Concepts)
給想理解 AI 怎麼運作的人
- 2026-07-21[Agent 進階 #18] 給你的 Hermes 做一次設定健檢:五個沒人細講、但你一定會撞的雷
第 13 篇說助理發瘋八成是「車子」壞了不是「引擎」笨。這篇就給你那張健檢表:context_length 設錯層會無聲提早壓縮、Qwen 沒關 thinking 慢 10 倍、MCP 工具接了卻全部失敗、sib 跑的模型跟你以為的不一樣。五個真實設定雷,每個都附一條你可以丟給 agent 自己跑的檢查跟修法。
- 2026-07-01[Agent 進階 #17] Hermes 的 /learn:讓一隻本地 27B 把「做過的事」自己寫成可重用技能
Hermes 有個叫 /learn 的指令,能把『你做過的事』自動整理成一份可重用技能(一份 SKILL.md)。這篇我把它接上自己的艦隊實測:派一張 Kanban 卡,讓一隻跑在改裝 2080 Ti 上的本地 27B 模型,3 分鐘把一次遊戲開發蒸餾成一份合格技能——還挖到兩個文件沒講清楚、實作才會踩到的細節:斜線指令 vs 派工、技能到底存哪。白話講 /learn 是什麼、怎麼用、以及它的真實限制。
- 2026-06-29[Agent 進階 #16] 同一份規格,丟給三隻分身各寫一個俄羅斯方塊:Hermes 看板派工實測
養了一群分身之後,我把同一份「做個俄羅斯方塊」的規格——就一句話、細節啥都沒講——一隻分身發一張卡,讓三隻各自一次寫完一個網頁俄羅斯方塊。我一行遊戲碼都沒碰,只負責發布。結果蹦出個意外驚喜:靠 Hermes 這套外框加一顆我自己在家調、跑在改裝 2080Ti 上的小模型,居然一次就把我沒要求的 ghost、wall-kick 都補上了。成品點開就能玩。
- 2026-06-24[Agent 進階 #15] 在手機上看你養的一群 AI 在做什麼:Muninn 加了看板
Hermes 有內建看板,但你在手機上只看得到 Telegram 的純文字。Muninn 這次直接把那塊看板搬上手機:Running / Blocked / Done 分欄、誰在跑什麼、哪張卡被擋下來,一眼看完。零後端、純 P2P。
- 2026-06-23[Agent 進階 #14] 出門也能跟家裡的助理說話:Muninn + iroh,5G 直連,不靠雲端
Hermes 裝好了,但出門就失聯——用 LINE 接太麻煩,沒有你自己的介面。Muninn 是專為 Hermes 設計的 iOS app:跟助理說一句話、手機掃 QR,5G 就能直連家裡,中間不經過任何第三方伺服器。
❯ cat ~/blog/實戰
實戰紀錄 (Field Notes)
給在跑模型、踩過坑的人
- 2026-09-21特化的啟動器 FastLLM + DFlash2,居然可以在魔改的 2080 Ti 雙卡跑出 100+ tok/s!
兩張改裝 2080 Ti 22G 用 FastLLM 跑 Qwen3.8-27B FP8,掛上 DFlash2 草稿模型:寫程式 153.8 tok/s、數學 134.9,散文 53.1。262K context、看圖、prefix cache 都在。附完整啟動指令和四個會卡住你的設定。
- 2026-09-21什麼!?Qwen3.8 27B 居然被壓到 5.9GB,跑起來能力居然有無損模型的 98.2%
PrismML 的 Ternary Bonsai 2 把 Qwen3.8-27B 壓成三值權重,官方說 5.9GB 保留 FP16 的 98.2% 能力。我在一張改裝 2080 Ti 22G 上跑同一組權重的 7.2GB 版:140 題拿 130,兩張卡跑 Q8_0 是 131。附編譯、啟動指令,以及為什麼最小那包反而最慢。
- 2026-09-20[LLM Deep Dive #6] 量化實驗室:什麼是量化、怎麼量化、為什麼會有損失
做了一個可以點的量化實驗室。選格式、追一個權重走完四步,看誤差在哪一步生出來——包括兩個我做之前沒搞懂的來源。
- 2026-09-16[LLM Deep Dive #5] 一個可以點開的模型解剖室:Qwen3、Flash-Next、DeepSeek 內部長什麼樣
點開立方體、展開 48 層、進到單層看功能分區。四個真實模型的官方 config 釘死版本,資料流真的不一樣。這篇講這個網站給你看什麼、怎麼用它讀一個模型。
- 2026-09-14[DGX Spark #48] 兩次整機斷電的受控復現:指紋、修法,以及我們最後為什麼把修法關掉
跑 MiniMax-H3 影片生成時,DGX Spark 兩次整台斷電,連 log 都來不及寫。這篇是儀器就位之後怎麼重現它、鎖頻 2200 MHz 怎麼修好、以及為什麼我們後來又把鎖頻關掉。
❯ ls ~/blog/series
依系列瀏覽
每條主線,分組好了