~ /home/coolthor
ai-muninn
AI 基礎設施、LLM 部署與自主 Agent 的研究筆記。那些花了太長時間才搞懂的事,寫下來讓你不用重踩。
❯ whoami
在家跑各種本地模型 — LLM、生圖、生影片,然後把搞懂的東西寫下來
把模型量化成 FP8 / NVFP4 丟上 Hugging Face — 真的有人在跑
用 AI Agent 建造期權交易基礎設施
踩到的 spec-decode bug 自己修一修,進了 vLLM 的 speculators
偶爾也會上架 iOS App
❯ cat ~/blog/從這裡開始
從這裡開始
第一次來?從這幾篇入坑剛好
- 2026-06-04[Agent 入門 #1] AI 助理跟 ChatGPT 差在哪?一個回答你,一個用你的工具幫你做事
你平常用 ChatGPT 多半是問一句它答一句。自己養的 AI 助理(agent)則能用你自己的工具把事做完、跑在你這邊、接你天天在用的軟體。從 0 打造自己助理的第一課。
- 2026-06-05[Agent 入門 #4] Hermes Agent Desktop 桌面版安裝教學:手把手下載、裝好你的第一個 AI 助理
Hermes Agent Desktop(桌面版)下載 + 安裝教學。不用碰終端機:到官網下載桌面版、第一次打開自動裝好相依套件、用 ChatGPT 帳號登入,十幾分鐘就有一個你自己的 AI 助理在跑。
- 2026-06-12[地端 LLM #1] 第一次跑 Q2 就以為模型變笨了 —— 284B DeepSeek-V4-Flash 在 128GB 桌機,真兇是 parser 不認 DSML
DeepSeek-V4-Flash 是 284B 的 frontier 模型。我用 antirez 的 ds4 引擎 + 非對稱 Q2 在單台 GB10 跑起來,15.6 tok/s。本來以為 2-bit 量化讓它假裝呼叫工具,結果真兇是 runtime 沒接 DSML parser。
- 2026-06-11[Benchmark #2] Qwen3.5-122B 在 DGX Spark 加速 100%!
Qwen3.5-122B-A10B 在 128GB 的 DGX Spark 上,vLLM 怎麼調都卡在 17 tok/s 的 GDN 牆,連 merge 進去的加速 PR 都沒用。我換掉 vLLM、改用 Atlas 引擎跑同一顆解禁 NVFP4 權重,直接翻到 33.9 tok/s(開 MTP 36.5,約 2×)—— 加速 100%,解禁行為原封不動。真正的出口不在量化工具箱裡。
❯ cat ~/blog/概念
概念與方法 (Concepts)
給想理解 AI 怎麼運作的人
- 2026-07-21[Agent 進階 #18] 給你的 Hermes 做一次設定健檢:五個沒人細講、但你一定會撞的雷
第 13 篇說助理發瘋八成是「車子」壞了不是「引擎」笨。這篇就給你那張健檢表:context_length 設錯層會無聲提早壓縮、Qwen 沒關 thinking 慢 10 倍、MCP 工具接了卻全部失敗、sib 跑的模型跟你以為的不一樣。五個真實設定雷,每個都附一條你可以丟給 agent 自己跑的檢查跟修法。
- 2026-07-01[Agent 進階 #17] Hermes 的 /learn:讓一隻本地 27B 把「做過的事」自己寫成可重用技能
Hermes 有個叫 /learn 的指令,能把『你做過的事』自動整理成一份可重用技能(一份 SKILL.md)。這篇我把它接上自己的艦隊實測:派一張 Kanban 卡,讓一隻跑在改裝 2080 Ti 上的本地 27B 模型,3 分鐘把一次遊戲開發蒸餾成一份合格技能——還挖到兩個文件沒講清楚、實作才會踩到的細節:斜線指令 vs 派工、技能到底存哪。白話講 /learn 是什麼、怎麼用、以及它的真實限制。
- 2026-06-29[Agent 進階 #16] 同一份規格,丟給三隻分身各寫一個俄羅斯方塊:Hermes 看板派工實測
養了一群分身之後,我把同一份「做個俄羅斯方塊」的規格——就一句話、細節啥都沒講——一隻分身發一張卡,讓三隻各自一次寫完一個網頁俄羅斯方塊。我一行遊戲碼都沒碰,只負責發布。結果蹦出個意外驚喜:靠 Hermes 這套外框加一顆我自己在家調、跑在改裝 2080Ti 上的小模型,居然一次就把我沒要求的 ghost、wall-kick 都補上了。成品點開就能玩。
- 2026-06-24[Agent 進階 #15] 在手機上看你養的一群 AI 在做什麼:Muninn 加了看板
Hermes 有內建看板,但你在手機上只看得到 Telegram 的純文字。Muninn 這次直接把那塊看板搬上手機:Running / Blocked / Done 分欄、誰在跑什麼、哪張卡被擋下來,一眼看完。零後端、純 P2P。
- 2026-06-23[Agent 進階 #14] 出門也能跟家裡的助理說話:Muninn + iroh,5G 直連,不靠雲端
Hermes 裝好了,但出門就失聯——用 LINE 接太麻煩,沒有你自己的介面。Muninn 是專為 Hermes 設計的 iOS app:跟助理說一句話、手機掃 QR,5G 就能直連家裡,中間不經過任何第三方伺服器。
❯ cat ~/blog/實戰
實戰紀錄 (Field Notes)
給在跑模型、踩過坑的人
- 2026-08-07[Benchmark #41] 在 DGX Spark 上跑 MiniMax-H3!可惜現在沒辦法用 NVIDIA VSR 放大
從零把 33B 影音同步模型跑在 GB10 上。哪些參數非設不可、時間到底花在哪、為什麼 NVIDIA 自家的放大器在這台裝不上,以及換成 4.3 MB 的開源 SPAN 之後省了 22%。
- 2026-08-06[趣味競賽 進階 #11] 什麼?2080 Ti 居然跑得動 MiniMax-H3,還生得出 1080p 有聲影片
四個檔案在磁碟上 38 GiB,而卡只有 22 GiB。一張 2018 年的改裝 2080 Ti 22G(sm_75)照樣跑出 15 秒 1080p 有聲片。完整配置、實測速度與畫質,最後才是一路怎麼試出來的。
- 2026-08-06[Benchmark #2] 625 秒砍到 314 秒,快了整整一倍:MiniMax-H3 在 RTX 5090 上該開的三個開關
同一支 15 秒 1080p 有聲影片,出片時間對半砍,畫面沒有變差。步數 20 改 14、SageAttention 2.2.0、放大器換成 RTX Video Super Resolution,三個開關各省多少、怎麼開、坑在哪。
- 2026-08-04[Benchmark #1] 一張 5090 跑會說話的 33B 影片模型:MiniMax-H3 從下載到生出第一支片
MiniMax-H3 影音同步生成新手教學。完整版 115 GiB 要四張卡,量化後 31.7 GiB 一張 RTX 5090 就夠。要下載哪些檔、放哪、怎麼設、提示詞怎麼寫。
- 2026-08-02[DeepSeek-V4-Flash #11] 把前沿級開源模型搬進自己家:在 DGX Spark 上把 0731 跑起來
DGX Spark 的統一記憶體讓 284B 的安裝簡單很多——不用分堆、不用調 offload。實測 17.5–17.9 tok/s、256K context;同一份 GGUF 只比一張二手 2080 Ti 快 7%。
❯ ls ~/blog/series
依系列瀏覽
每條主線,分組好了