<?xml version="1.0" encoding="utf-8"?>
<rss version="2.0">
    <channel>
        <title>ai-muninn 技術筆記</title>
        <link>https://ai-muninn.com/zh-TW/blog</link>
        <description>AI 推理基礎設施踩坑記錄：DGX Spark、vLLM、本地 AI Agent。</description>
        <lastBuildDate>Sun, 06 Sep 2026 11:48:49 GMT</lastBuildDate>
        <docs>https://validator.w3.org/feed/docs/rss2.html</docs>
        <generator>https://github.com/jpmonette/feed</generator>
        <language>zh-TW</language>
        <copyright>2026 coolthor</copyright>
        <item>
            <title><![CDATA[[Benchmark] Qwen3.8-Flash-Next NVFP4 在 DGX Spark 跑 41.7 tok/s,比 llama.cpp 快 78%]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/qwen38-flash-next-nvfp4-dgx-spark-vllm-recipe</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/qwen38-flash-next-nvfp4-dgx-spark-vllm-recipe</guid>
            <pubDate>Sun, 06 Sep 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[NVIDIA 官方 NVFP4 checkpoint + vLLM nightly + 九個掛上去的 overlay 檔，一台 DGX Spark 上 40 題中位 41.7 tok/s、散文 27.4、程式 45，比同機 llama.cpp 席位快 78%。附完整參數與我估錯一次的紀錄。]]></description>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>vLLM</category>
            <category>NVFP4</category>
            <category>MTP</category>
            <category>Qwen3.8</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] MiniMax-H3 在 RTX 5090 上的加速組態:換成 cu130 省 32%，注意力 kernel 只值 3%]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/minimax-h3-rtx5090-config-stack</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/minimax-h3-rtx5090-config-stack</guid>
            <pubDate>Thu, 03 Sep 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[同一張 5090、同樣 14 步、同樣品質設定，六個加速組態各值幾 %。原生 768p 的 15 秒片從 OOM 變成 8.6 分鐘。chunk 參數切越細越快、torch 換成 cu130 省 32%，而 SageAttention 跟 Sol-Attn 這兩個單看 kernel 快 4 倍的東西，端到端只值 2-3%。]]></description>
            <category>MiniMax-H3</category>
            <category>RTX 5090</category>
            <category>ComfyUI</category>
            <category>NVFP4</category>
            <category>影片生成</category>
        </item>
        <item>
            <title><![CDATA[[Dev Workflow] AI 味不在破折號，在結構:一篇論文教我怎麼檢查自己的文章]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/ai-slop-is-structural</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/ai-slop-is-structural</guid>
            <pubDate>Mon, 31 Aug 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[StoryScope 完全不看文風，只看敘事結構，93.2% macro-F1 就分得出人寫的與 AI 寫的。我拿它的五個問題掃自己已發布的文章，同一個教訓被抓到講了四次。]]></description>
            <category>AI writing</category>
            <category>blog workflow</category>
            <category>Claude Code</category>
            <category>skill</category>
            <category>StoryScope</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] MiniMax-H3 十個效果 embedding 實測:放在提示詞開頭會靜默失效]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/minimax-h3-effect-embeddings-rtx5090</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/minimax-h3-effect-embeddings-rtx5090</guid>
            <pubDate>Mon, 31 Aug 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[RTX 5090 一張卡跑完 MiniMax-H3 的十個效果 embedding。最大的坑是位置:放在提示詞開頭會靜默失效，畫面卻照樣會變，所以「產物不一樣」不能當生效證據。它們也不是關鍵字，是 50 到 142 個預先編好的向量。附十支實測影片與速查表。]]></description>
            <category>MiniMax-H3</category>
            <category>ComfyUI</category>
            <category>RTX 5090</category>
            <category>影片生成</category>
            <category>embedding</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] GLM-5.3-Flash 塞進一台 DGX Spark:108.72 GB、15.5 tok/s、視覺能用]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/glm53-flash-one-dgx-spark</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/glm53-flash-one-dgx-spark</guid>
            <pubDate>Sun, 30 Aug 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[單台 DGX Spark(121 GB 統一記憶體)跑 GLM-5.3-Flash 的完整配方:量化怎麼選、CUDA toolkit 為什麼只能是 13.0、中文為什麼比英文快、以及原生視覺跟投機解碼為什麼現在不能一起開。]]></description>
            <category>GLM-5.3-Flash</category>
            <category>DGX Spark</category>
            <category>llama.cpp</category>
            <category>GGUF</category>
            <category>多模態</category>
        </item>
        <item>
            <title><![CDATA[[DGX Spark] 1770 億參數 + 262K context 一起開：Spark 上不用二選一]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/qwen4exp-dgx-spark-262k-no-tradeoff</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/qwen4exp-dgx-spark-262k-no-tradeoff</guid>
            <pubDate>Fri, 28 Aug 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Qwen3.8-Flash-Next 在單台 DGX Spark 上跑 UD-Q4_K_XL，原生 262,144 context 全開，改檔案 76.65 tok/s。完整設定、四格速度、記憶體怎麼分配。]]></description>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>llama.cpp</category>
            <category>MoE</category>
            <category>long context</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] 1770 億參數塞進三張二手 2080 Ti：改檔案快 3.5 倍，寫散文一點都沒快]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/qwen4exp-177b-three-2080ti</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/qwen4exp-177b-three-2080ti</guid>
            <pubDate>Fri, 28 Aug 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Qwen3.8-Flash-Next（176.94B）跑在三張改裝 2080 Ti 上：128K context 拿到 23.14 tok/s，開 ngram 投機解碼後改檔案衝到 77.56。附三種量化在相同條件下的對照。]]></description>
            <category>llama.cpp</category>
            <category>2080 Ti</category>
            <category>MoE</category>
            <category>speculative decoding</category>
            <category>quantization</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] DGX Spark 跑 Qwen3.8-27B 到 65 tok/s:無投機只有 12.3，差別全在草稿預算]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-bandwidth-ceiling-85-percent</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-bandwidth-ceiling-85-percent</guid>
            <pubDate>Sun, 23 Aug 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[GB10 的頻寬 273 GB/s、語言主幹 18.77 GB，每個 token 都要整份讀過，上限 14.54 tok/s。實測無投機 12.32，吃掉 85%，換 kernel 撈不回來。投機解碼把它拉到 5.28 倍，而關鍵不是換方法，是把草稿預算從 8 調到 12。]]></description>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>SM121</category>
            <category>NVFP4</category>
            <category>Qwen3.8-27B</category>
            <category>SGLang</category>
            <category>speculative decoding</category>
            <category>DFlash2</category>
            <category>DSpark</category>
            <category>MTP</category>
            <category>memory bandwidth</category>
            <category>benchmark</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] 我把 2080 Ti 的 NCCL 修好了，然後發現它沒快多少]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/nccl-2080ti-stub-library-fix</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/nccl-2080ti-stub-library-fix</guid>
            <pubDate>Sun, 23 Aug 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Ubuntu 的 libnccl2 跟 CUDA 13 驅動不相容，自編 NCCL 2.31.2 修好之後，prefill 的 PCIe 流量掉了 99%——而速度幾乎沒動。那個看起來很糟的 fallback，其實沒讓你付多少代價。]]></description>
            <category>NCCL</category>
            <category>llama.cpp</category>
            <category>tensor parallel</category>
            <category>2080 Ti</category>
            <category>CUDA</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] 讀者問雙卡 AllReduce 吃多少 PCIe:只佔 8%,因為搬得少、跑得勤]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/pcie-allreduce-dual-2080ti</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/pcie-allreduce-dual-2080ti</guid>
            <pubDate>Sun, 23 Aug 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[有人來信要我在跑雙 2080 Ti tensor parallel 時開 nvidia-smi dmon -s t 看 PCIe 頻寬。實測 AllReduce 吐字時只用掉不到 1%、prefill 約 6.6%，最忙的一格是 8%——瓶頸不是頻寬是延遲。]]></description>
            <category>llama.cpp</category>
            <category>tensor parallel</category>
            <category>PCIe</category>
            <category>NVLink</category>
            <category>2080 Ti</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] 1080p 不是不支援，是要跑三個半小時:H3 生《神鵰》重逢，用參考圖把楊過鎖回來]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/minimax-h3-rtx5090-character-lock</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/minimax-h3-rtx5090-character-lock</guid>
            <pubDate>Sun, 23 Aug 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[拿 MiniMax-H3 生一段有角色的影片，踩到三件事:非原生解析度會掉下效能懸崖、遠景人臉必糊、以及「鬢邊白髮」在模型眼裡是年齡不是身分。最後靠 z-image 生參考圖走 h3-r2v,121.4 秒把楊過鎖回來。]]></description>
            <category>MiniMax-H3</category>
            <category>RTX 5090</category>
            <category>z-image</category>
            <category>character consistency</category>
            <category>ComfyUI</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] 兩張改裝 2080 Ti 玩 tensor parallel,Qwen3.8-27B 衝到 59.6 tok/s]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/qwen38-dual-2080ti-tensor-parallel</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/qwen38-dual-2080ti-tensor-parallel</guid>
            <pubDate>Sat, 22 Aug 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[兩張改裝 2080 Ti 22G 用 llama.cpp 的 tensor parallel 接上 Qwen3.8-27B，配 MTP 投機解碼從單卡 37.1 tok/s 衝到雙卡 59.632 tok/s，還能開到 262K context。內含現在正式在跑的組態、三個上游踩坑，和雙 5060 Ti 社群數字的對照。]]></description>
            <category>llama.cpp</category>
            <category>tensor parallel</category>
            <category>2080 Ti</category>
            <category>Qwen3.8</category>
            <category>MTP</category>
        </item>
        <item>
            <title><![CDATA[[AI Agent] 從 41 分鐘到 73 秒:一張小工單的病理解剖]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/agent-ticket-41min-to-73s</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/agent-ticket-41min-to-73s</guid>
            <pubDate>Fri, 21 Aug 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[派給 Codex CLI 的小工單常常一跑就是 40 分鐘起跳。這篇拆開近兩週 41 個執行紀錄，量出「牆鐘時間≈工具呼叫次數×14.3 秒」的公式，揪出 41 分鐘裡機器真正做事只有 4.4 分鐘，再用四刀把同型工單壓到 73 秒。]]></description>
            <category>AI Agent</category>
            <category>Claude Code</category>
            <category>Codex</category>
            <category>派工</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] 換一個檔案、改一個數字,2080 Ti 上的 27B 免費快 15%]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/chat-template-kv-mtp-free-speedup</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/chat-template-kv-mtp-free-speedup</guid>
            <pubDate>Fri, 21 Aug 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Qwen3.8-27B 在 2080 Ti 的免費加速實測:修復版 chat template 讓 KV 快取命中 94.5%,MTP 草稿深度 2 開到 4 讓 decode 從 41.6 到 47.6 tok/s。附完整驗證方法。]]></description>
            <category>llama.cpp</category>
            <category>chat template</category>
            <category>KV cache</category>
            <category>MTP</category>
            <category>speculative decoding</category>
            <category>2080 Ti</category>
            <category>Qwen3.8</category>
        </item>
        <item>
            <title><![CDATA[[趣味競賽 進階 #12] 為什麼你的 4-bit 模型在 2080 Ti 上快不起來?——拆開 .so 才發現這代卡只有兩種齒輪]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/why-4bit-isnt-faster-on-2080ti</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/why-4bit-isnt-faster-on-2080ti</guid>
            <pubDate>Thu, 20 Aug 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[為什麼 GGUF 量化後檔案變小，tok/s 卻沒變快?拆開 CUDA 後端 .so 才看懂:Turing(sm_75)的整數 tensor core 只有 s4×s4 跟 s8×s8 兩種同寬組合，4-bit 權重配 fp16 activation 這格在任何架構都不存在。GGUF、AWQ、Marlin 全靠反量化撐過去。]]></description>
            <category>2080 Ti</category>
            <category>Turing</category>
            <category>quantization</category>
            <category>GGUF</category>
            <category>AWQ</category>
            <category>Marlin</category>
            <category>INT8</category>
            <category>W4A8</category>
            <category>benchmark</category>
        </item>
        <item>
            <title><![CDATA[[洋垃圾跑大模型 #5] 一張 22G 老卡跑 Qwen3.8-27B:30 tok/s，還能一次寫出會動的 3D 場景]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/qwen38-27b-ud-on-one-2080ti</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/qwen38-27b-ud-on-one-2080ti</guid>
            <pubDate>Tue, 18 Aug 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[unsloth 的 Qwen3.8-27B-UD-Q4_K_XL 在一張改裝 2080 Ti 22G 上跑得動:16.7 GiB 權重、開到 128K context 還剩 1.7 GB、實測 30-31 tok/s。附一個它一次生成的體素庭園，可以直接開來玩。]]></description>
            <category>Qwen3.8</category>
            <category>unsloth</category>
            <category>洋垃圾</category>
            <category>2080 Ti</category>
            <category>llama.cpp</category>
            <category>GGUF</category>
            <category>本地模型</category>
            <category>MTP</category>
            <category>手把手</category>
        </item>
        <item>
            <title><![CDATA[[公告] 停更公告(8/8～8/21)]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/back-after-acute-cholecystitis</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/back-after-acute-cholecystitis</guid>
            <pubDate>Sat, 15 Aug 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[最近新模型如百花齊放，太棒了！但是因為blog主的膽囊也炸裂所以要休息一段時間才能再繼續分享。]]></description>
            <category>公告</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] 在 DGX Spark 上跑 MiniMax-H3!可惜現在沒辦法用 NVIDIA VSR 放大]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-minimax-h3-span-upscaler</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-minimax-h3-span-upscaler</guid>
            <pubDate>Fri, 07 Aug 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[從零把 33B 影音同步模型跑在 GB10 上。哪些參數非設不可、時間到底花在哪、為什麼 NVIDIA 自家的放大器在這台裝不上，以及換成 4.3 MB 的開源 SPAN 之後省了 22%。]]></description>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>MiniMax-H3</category>
            <category>ComfyUI</category>
            <category>SPAN</category>
            <category>aarch64</category>
            <category>SageAttention</category>
        </item>
        <item>
            <title><![CDATA[[趣味競賽 進階 #11] 什麼?2080 Ti 居然跑得動 MiniMax-H3,還生得出 1080p 有聲影片]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/minimax-h3-on-modded-2080ti-22gb</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/minimax-h3-on-modded-2080ti-22gb</guid>
            <pubDate>Thu, 06 Aug 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[四個檔案在磁碟上 38 GiB，而卡只有 22 GiB。一張 2018 年的改裝 2080 Ti 22G(sm_75)照樣跑出 15 秒 1080p 有聲片。完整配置、實測速度與畫質，最後才是一路怎麼試出來的。]]></description>
            <category>2080 Ti</category>
            <category>Turing</category>
            <category>MiniMax-H3</category>
            <category>ComfyUI</category>
            <category>SageAttention</category>
            <category>quantization</category>
            <category>benchmark</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] 625 秒砍到 314 秒,快了整整一倍:MiniMax-H3 在 RTX 5090 上該開的三個開關]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/minimax-h3-rtx5090-speedup-vsr</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/minimax-h3-rtx5090-speedup-vsr</guid>
            <pubDate>Thu, 06 Aug 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[同一支 15 秒 1080p 有聲影片，出片時間對半砍，畫面沒有變差。步數 20 改 14、SageAttention 2.2.0、放大器換成 RTX Video Super Resolution，三個開關各省多少、怎麼開、坑在哪。]]></description>
            <category>MiniMax-H3</category>
            <category>RTX 5090</category>
            <category>ComfyUI</category>
            <category>RTX Video Super Resolution</category>
            <category>SageAttention</category>
            <category>Real-ESRGAN</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] 一張 5090 跑會說話的 33B 影片模型:MiniMax-H3 從下載到生出第一支片]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/minimax-h3-nvfp4-rtx5090</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/minimax-h3-nvfp4-rtx5090</guid>
            <pubDate>Tue, 04 Aug 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[MiniMax-H3 影音同步生成新手教學。完整版 115 GiB 要四張卡，量化後 31.7 GiB 一張 RTX 5090 就夠。要下載哪些檔、放哪、怎麼設、提示詞怎麼寫。]]></description>
            <category>MiniMax-H3</category>
            <category>NVFP4</category>
            <category>RTX 5090</category>
            <category>ComfyUI</category>
            <category>text-to-video</category>
            <category>量化</category>
        </item>
        <item>
            <title><![CDATA[[DeepSeek-V4-Flash] 把前沿級開源模型搬進自己家:在 DGX Spark 上把 0731 跑起來]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/ds4-0731-on-dgx-spark-howto</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/ds4-0731-on-dgx-spark-howto</guid>
            <pubDate>Sun, 02 Aug 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[DGX Spark 的統一記憶體讓 284B 的安裝簡單很多——不用分堆、不用調 offload。實測 17.5–17.9 tok/s、256K context;同一份 GGUF 只比一張二手 2080 Ti 快 7%。]]></description>
            <category>DeepSeek-V4-Flash</category>
            <category>0731</category>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>llama.cpp</category>
            <category>CUDA</category>
            <category>統一記憶體</category>
            <category>本地模型</category>
            <category>手把手</category>
        </item>
        <item>
            <title><![CDATA[[洋垃圾跑大模型 #4] 把前沿級開源模型搬進自己家:一張 22G 老卡跑 DeepSeek-V4-Flash-0731]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/ds4-0731-on-one-2080ti-howto</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/ds4-0731-on-one-2080ti-howto</guid>
            <pubDate>Sun, 02 Aug 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[DeepSeek 官方 0731 正式版，在好幾個 agentic 評測上跟閉源旗艦同級。這篇從下載 91GB 的 GGUF、設定成開機自動跑，一路寫到怎麼算你那張卡該搬幾層專家上 VRAM。]]></description>
            <category>DeepSeek-V4-Flash</category>
            <category>0731</category>
            <category>MoE</category>
            <category>洋垃圾</category>
            <category>2080 Ti</category>
            <category>llama.cpp</category>
            <category>expert offload</category>
            <category>本地模型</category>
            <category>手把手</category>
        </item>
        <item>
            <title><![CDATA[[Dev Workflow] Skill 裡的檢查完全寫對了,但它一次都沒跑過]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/ai-tic-check-that-never-ran</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/ai-tic-check-that-never-ran</guid>
            <pubDate>Wed, 29 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[一篇技術文五關全過,唯一的人類讀者一句話就命中:同一個句型在稿子裡出現了五次。查下去發現該抓的規則白紙黑字寫在 skill 裡、內容也對,但它標著「人工掃」——沒有指令、沒有 exit code、擋不住任何東西,所以從來沒運作過。門檻怎麼用五篇舊文校準、兩次真實攔截、以及一個機械檢查永遠抓不到的變體。]]></description>
            <category>AI 寫作</category>
            <category>去 AI 味</category>
            <category>寫作管線</category>
            <category>品質把關</category>
            <category>Claude Code</category>
        </item>
        <item>
            <title><![CDATA[[洋垃圾跑大模型 #3] 一張 22G 老卡跑 284B:DeepSeek-V4-Flash 比 DGX Spark 快 18%]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/deepseek-v4-flash-284b-on-one-2080ti</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/deepseek-v4-flash-284b-on-one-2080ti</guid>
            <pubDate>Wed, 29 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[DeepSeek-V4-Flash 是 284B 的 MoE。我把它塞進單張改裝 2080 Ti 22G,跑到 17.85 tok/s、262K context 只吃 16GB VRAM,還比跑同一顆模型的 DGX Spark 快約 18%。過程中我判斷錯了兩次,而且錯法不一樣。]]></description>
            <category>DeepSeek-V4-Flash</category>
            <category>MoE</category>
            <category>洋垃圾</category>
            <category>2080 Ti</category>
            <category>llama.cpp</category>
            <category>DGX Spark</category>
            <category>MTP</category>
            <category>expert offload</category>
            <category>本地模型</category>
        </item>
        <item>
            <title><![CDATA[[Dev Workflow] agent 把自己講錯的話存進了長期記憶——連 /new 都殺不掉]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/agent-memory-self-poisoning</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/agent-memory-self-poisoning</guid>
            <pubDate>Mon, 27 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[一個有長期記憶的 AI agent，把自己答錯的結論自動寫進記憶，之後每個新對話都翻出來當事實。/new 清不掉，因為幻覺住進了記憶層。五回合探針加三刀解毒的完整病歷。]]></description>
            <category>AI agent</category>
            <category>agent memory</category>
            <category>Hermes</category>
            <category>AI 記憶</category>
            <category>RAG</category>
        </item>
        <item>
            <title><![CDATA[[DeepSeek-V4-Flash] 上次那個白賺的引擎升級,後來 OOM 討債:我為什麼把光羽換回舊版]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/hikari-ds4-oom-rollback</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/hikari-ds4-oom-rollback</guid>
            <pubDate>Sat, 25 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Entrpi 把 decode 從 14-16 拉到 20,代價是把權重存了第二份 78.71G artifacts、塞爆 128G 的 DGX Spark。大 context 一來就 OOM。我讀原始碼、實測、最後換回舊引擎。]]></description>
            <category>DeepSeek-V4-Flash</category>
            <category>DGX Spark</category>
            <category>ds4</category>
            <category>OOM</category>
            <category>Entrpi</category>
            <category>KV cache</category>
            <category>benchmark</category>
        </item>
        <item>
            <title><![CDATA[[LLM 深水區] 自己做「層級量化」：只挑那幾張張量動手，把 GGUF 再榨 2.45 GiB]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/layer-aware-gguf-quantization</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/layer-aware-gguf-quantization</guid>
            <pubDate>Thu, 23 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[量化不是把整個模型砍成 4-bit。一個 GGUF 裡本來就混著 F16／Q4_K／Q6_K／F32 好幾種精度。這篇用 Laguna 的 attention 換 Q8 當例子，教你怎麼看每張張量的精度、只動該動的那幾張，還有 llama-quantize 的 tensor-type 陷阱。]]></description>
            <category>量化</category>
            <category>quantization</category>
            <category>GGUF</category>
            <category>llama.cpp</category>
            <category>llama-quantize</category>
            <category>tensor-type</category>
            <category>混合精度</category>
            <category>Laguna</category>
            <category>LLM Deep Dive</category>
        </item>
        <item>
            <title><![CDATA[[LLM 深水區] 一張 24GB 顯卡最強的免費開源模型？我押 ThinkingCap-Qwen3.6-27B——想得少、跑得快、不拒答]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/thinkingcap-qwen36-27b-local-brain</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/thinkingcap-qwen36-27b-local-brain</guid>
            <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[一張 24GB 消費級顯卡（含改裝 2080 Ti 22G）想跑免費開源模型，我目前的第一名是 Huihui-ThinkingCap-Qwen3.6-27B-abliterated：Q4_K_S 約 16GB、思考少一半、開 MTP ~38 tok/s、不拒答、全 Apache-2.0。]]></description>
            <category>Qwen3.6</category>
            <category>ThinkingCap</category>
            <category>abliterated</category>
            <category>在地模型</category>
            <category>local LLM</category>
            <category>llama.cpp</category>
            <category>2080 Ti</category>
            <category>efficient thinking</category>
            <category>MTP</category>
        </item>
        <item>
            <title><![CDATA[[洋垃圾跑大模型 #2] 一張 22G 老卡跑 118B 的 coding 大模型:Poolside Laguna S 2.1 實戰]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/laguna-118b-moe-on-one-2080ti</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/laguna-118b-moe-on-one-2080ti</guid>
            <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Poolside Laguna S 2.1 是 118B-A8B 的 MoE coding 模型。我把它塞進單張改裝 2080 Ti 22G，用 CPU/GPU 混合 offload + 配套 DFlash 投機解碼跑到 ~29 tok/s，還靠一招 attention 換 Q8 省約 2.45 GiB、decode 再快 7%。]]></description>
            <category>Laguna</category>
            <category>Poolside</category>
            <category>MoE</category>
            <category>洋垃圾</category>
            <category>2080 Ti</category>
            <category>llama.cpp</category>
            <category>DFlash</category>
            <category>speculative decoding</category>
            <category>本地模型</category>
        </item>
        <item>
            <title><![CDATA[[Agent 進階 #18] 給你的 Hermes 做一次設定健檢:五個沒人細講、但你一定會撞的雷]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/hermes-config-gotchas</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/hermes-config-gotchas</guid>
            <pubDate>Tue, 21 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[第 13 篇說助理發瘋八成是「車子」壞了不是「引擎」笨。這篇就給你那張健檢表:context_length 設錯層會無聲提早壓縮、Qwen 沒關 thinking 慢 10 倍、MCP 工具接了卻全部失敗、sib 跑的模型跟你以為的不一樣。五個真實設定雷,每個都附一條你可以丟給 agent 自己跑的檢查跟修法。]]></description>
            <category>AI 助理</category>
            <category>AI agent</category>
            <category>Hermes</category>
            <category>設定</category>
            <category>config</category>
            <category>除錯</category>
            <category>進階</category>
        </item>
        <item>
            <title><![CDATA[[DeepSeek-V4-Flash] 一句好奇,單台 DGX Spark 上白賺半代引擎升級——ds4 換 Entrpi]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/ds4-entrpi-engine-swap</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/ds4-entrpi-engine-swap</guid>
            <pubDate>Tue, 21 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[我只是問 Codex『這個 ds4 repo 有沒有針對單台 GX10 的強化』,結果一個下午,我那台在跑正職的 DGX Spark 就換了引擎(antirez/ds4 的 Blackwell fork,Entrpi)。同一顆 abliterated 模型、什麼都沒換,decode 從 14-16 提到 20、讀 prompt 快約一倍。沿路還實測收掉三個真問題:投機解碼在 abliterated 上為什麼反而更慢、disk-KV 是不是在省記憶體、managed KV 是不是 swap。]]></description>
            <category>DeepSeek-V4-Flash</category>
            <category>DGX Spark</category>
            <category>ds4</category>
            <category>speculative decoding</category>
            <category>KV cache</category>
            <category>benchmark</category>
        </item>
        <item>
            <title><![CDATA[[洋垃圾跑大模型 #1] 一台洋垃圾三張老卡,怎麼跑得動 119B 的大模型]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/run-119b-moe-on-3x-2080ti</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/run-119b-moe-on-3x-2080ti</guid>
            <pubDate>Tue, 21 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[一台約 5 萬台幣的二手 EPYC 伺服器,插三張改裝 2080 Ti 22G,共 66G 顯卡記憶體加 128G 一般記憶體。跑得動量化後的 119B 大模型,74 tok/s。想再往上跑 200B–300B、或想騰一張卡出來生圖,靠的是同一招:MoE 的 expert 大多時候在睡覺,把它們丟去便宜的大記憶體給 CPU 算,decode 只慢 2.4 倍。這篇講這招怎麼運作、代價多少(拿一顆小的 26B 先量給你看),還有一個多卡卸載必踩的坑:同一個卸載指令,單卡沒事、三卡直接 OOM。]]></description>
            <category>llama.cpp</category>
            <category>MoE</category>
            <category>expert offload</category>
            <category>2080 Ti</category>
            <category>EPYC</category>
            <category>quantization</category>
            <category>benchmark</category>
        </item>
        <item>
            <title><![CDATA[[趣味競賽 進階 #10] 同一張 2080 Ti,一台生圖慢 3.4 倍——兇手是啟動 log 裡一行 dtype fallback]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/2080ti-turing-fp32-fallback</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/2080ti-turing-fp32-fallback</guid>
            <pubDate>Sat, 18 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[兩台機器裝的是同一張改裝 2080 Ti 22G,一台生 Z-Image 暖機 median 46.08s,另一台一樣的卡只要 ~9.5s。當天記錄上的結論很硬:46s 就是這張卡的天花板——GPU 全程 100%、模型常駐、卡也對。但我記得另一台一樣的卡跑過 10 秒(那筆沒進知識庫),一查發現數據沒騙人、只是漏了一塊。真兇不是矽晶片,是 ComfyUI 啟動 log 裡一行精度 fallback:Turing 沒有 bf16 tensor core,ComfyUI 為了保精度把權重留在 fp32,算得慢 3.4 倍。這篇是把兇手從『100% GPU 看起來就是天花板』這個舒服答案裡挖出來的偵探故事——外加兩個誠實提醒:這個旗標不省 VRAM、對影片模型也完全沒用。]]></description>
            <category>2080 Ti</category>
            <category>Turing</category>
            <category>ComfyUI</category>
            <category>Z-Image</category>
            <category>quantization</category>
            <category>GPU</category>
            <category>benchmark</category>
            <category>dev workflow</category>
        </item>
        <item>
            <title><![CDATA[[Dev Workflow] 幫 AI agent 的 skill 減肥:193 個塞爆 2% 預算,砍到剩 7 個]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/slimming-the-agent-skill-budget</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/slimming-the-agent-skill-budget</guid>
            <pubDate>Fri, 17 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[AI Workflow 系列第 15 篇。某天早上我讀 codex 紀錄,滑到一行:skill 描述被剪短,才塞得進 2% 的 context 預算。我共用的 root 累到 193 個 skill,全載進去撐爆上限,每條描述都被截斷——我天天在用的,被剪掉是為了替我從不碰的一百多個騰位子。這篇講怎麼用 per-agent allowlist(不是刪)砍到 7 個、薄殼配深引擎壓低每個 skill 的載入成本,再用一個閘門加稽核加可逆退場區守住,不讓它肥回去。]]></description>
            <category>Dev Workflow</category>
            <category>AI agent</category>
            <category>Claude Code</category>
            <category>Codex</category>
            <category>skills</category>
            <category>context engineering</category>
            <category>governance</category>
        </item>
        <item>
            <title><![CDATA[[Dev Workflow] 一群 AI 交接工作卻不用重講:原來是同一套系統的兩條軸]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/how-ai-agents-collaborate-without-re-explaining</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/how-ai-agents-collaborate-without-re-explaining</guid>
            <pubDate>Thu, 16 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[這是 AI Workflow 系列裡『兩軸合流』這一段的收尾。回頭看整段路,前面六篇其實在蓋同一套系統的兩條軸:持久知識(我知道什麼,長效、要用再查)和即時狀態(我現在做到哪,易逝、隨時寫)。這篇講清楚兩條軸為什麼互不代替、怎麼匯流到『多 AI 交接』、又受同一套哲學管——以及那條讓一群不完全信任的模型還能安全協作的中心律:沒有收據就不信。]]></description>
            <category>Dev Workflow</category>
            <category>AI agent</category>
            <category>multi-agent</category>
            <category>handoff</category>
            <category>knowledge base</category>
            <category>Claude Code</category>
            <category>Codex</category>
            <category>governance</category>
        </item>
        <item>
            <title><![CDATA[[Dev Workflow] 搜尋找得到,卻要每個 session 重推一遍:幫 AI 記憶加一層蒸餾層]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/why-agent-memory-needs-a-distilled-layer</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/why-agent-memory-needs-a-distilled-layer</guid>
            <pubDate>Wed, 15 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[我拿一批 markdown 檔當 AI 的長期記憶,在檢索(搜尋加知識圖譜)之上再疊一層蒸餾層。檢索撈回的是原始材料,每個 session、每個 agent 都得重讀重推一遍;蒸餾層把定案結論冶煉一次、存成一檔一個 claim,之後直接取用。這篇講清楚這層是什麼、為什麼它的目的是『少解釋一次』而不是『逼大家講一樣』、以及我怎麼學會真的去信它。]]></description>
            <category>Dev Workflow</category>
            <category>AI agent</category>
            <category>memory</category>
            <category>knowledge base</category>
            <category>distillation</category>
            <category>RAG</category>
            <category>Claude Code</category>
            <category>governance</category>
        </item>
        <item>
            <title><![CDATA[[Dev Workflow] 搜尋找得到筆記、卻連不起來:幫 AI 記憶加一張知識圖譜]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/from-markdown-search-to-knowledge-graph</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/from-markdown-search-to-knowledge-graph</guid>
            <pubDate>Tue, 14 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[我拿大約 600 篇 markdown 檔當 AI 的長期記憶,分成三層:檔案本身是唯一的真相源、一個搜尋引擎讓它們找得到、一張知識圖譜用概念把它們連起來。這篇先講清楚這個設計、每一層為什麼存在、換來什麼好處,最後才講我建它時走錯的那幾條路。]]></description>
            <category>Dev Workflow</category>
            <category>knowledge graph</category>
            <category>AI agent</category>
            <category>memory</category>
            <category>qmd</category>
            <category>musubi</category>
            <category>Claude Code</category>
            <category>RAG</category>
        </item>
        <item>
            <title><![CDATA[[Dev Workflow] 退役 AI agent 的記憶系統:doctrine 跟 runtime 漂開時的三個暗坑]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/retiring-ai-agent-memory-system</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/retiring-ai-agent-memory-system</guid>
            <pubDate>Sun, 12 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[退役一個 AI agent 的舊記憶系統,看起來只是半小時的雜活,結果連踩三個暗坑:退役的資料夾其實是現役鏡像、doctrine 說有的備份根本不存在、hub-and-spoke 拓撲讓你從單台機器只看得到半張圖。根源都同一個——白紙寫的 doctrine 早跟實際在跑的 runtime 漂開了。]]></description>
            <category>AI agent</category>
            <category>knowledge base</category>
            <category>memory</category>
            <category>dev workflow</category>
            <category>Syncthing</category>
            <category>governance</category>
        </item>
        <item>
            <title><![CDATA[[Dev Workflow] 交辦 AI 工程任務:交出去的單位是一張工單檔,不是一段對話]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dispatch-tickets-not-conversations</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dispatch-tickets-not-conversations</guid>
            <pubDate>Sun, 12 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[交辦 AI 工程任務,交出去的不是一段對話,是一張工單檔。這篇講我怎麼把任務寫成自足工單(目標/步驟/機器可驗收/紅線)、detached 背景派工給 Codex、用三個 flag 和一個看門狗擋掉永久卡死,以及為什麼收到完工報告不等於做完——報告是 claim,驗收重跑才是 evidence。]]></description>
            <category>Codex</category>
            <category>Claude Code</category>
            <category>AI agent</category>
            <category>dev workflow</category>
            <category>delegation</category>
            <category>orchestration</category>
        </item>
        <item>
            <title><![CDATA[[Dev Workflow] 額度斷在半路:讓 Claude Code 跟 Codex 交接任務的 handoff 協議]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/claude-code-codex-handoff-protocol</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/claude-code-codex-handoff-protocol</guid>
            <pubDate>Sat, 11 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[額度斷在任務半路,蒸發的不是知識庫,是這個任務的 live state:做到哪、排除了哪些死路、下一步跑哪個命令。這篇講我怎麼把 state 外部化成一個 handoff 檔,讓 Claude Code 跟 Codex 經 symlink 讀寫同一份、互相接手彼此做一半的活——以及用 hook 上鎖時踩到、又修掉的一個 false-takeover bug。]]></description>
            <category>Claude Code</category>
            <category>Codex</category>
            <category>AI agent</category>
            <category>dev workflow</category>
            <category>handoff</category>
            <category>hooks</category>
        </item>
        <item>
            <title><![CDATA[[趣味競賽 進階 #9] 0xc0000409:當我的 AI 服務靜默暴斃,而 log 把死因吃掉了]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/0xc0000409-crash-detective-2080ti</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/0xc0000409-crash-detective-2080ti</guid>
            <pubDate>Fri, 10 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[一台 headless Windows AI 主機上的本地腦,偶發在真實負載下無聲無息地死掉:client 吃到短暫 503,服務自己又活回來,應用程式 log 一片空白。最氣的是真兇不是模型本身,是我自己——重啟前 log 把 crash 當下那行死因截掉了。這篇是把死因從『被自己的 log 掩埋』裡挖出來的偵察故事:為什麼會自我重啟的服務最會掩埋自己的死因、為什麼要先看 OS 層的 Event Log、以及 0xc0000409 到底是什麼。誠實在先:根因我還沒 100% 確認,這是還在查的紀錄,不是結案報告。]]></description>
            <category>本地 LLM</category>
            <category>llama.cpp</category>
            <category>Windows</category>
            <category>crash 偵察</category>
            <category>可觀測性</category>
            <category>0xc0000409</category>
        </item>
        <item>
            <title><![CDATA[[本地 LLM] 怎麼判斷一個被吹爆的 LLM 優化,搬到你機器上是不是真的:讀原始碼、找天花板、跑一個實驗]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-deepseek-v4-flash-evaluating-optimization-claims</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-deepseek-v4-flash-evaluating-optimization-claims</guid>
            <pubDate>Fri, 10 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[本地 LLM 圈到處是被吹爆的優化——外掛 sparse-KV 壓縮器、「省 90% 記憶體」。多數搬到你自己的模型上就垮了。三個很便宜的動作判斷哪些是真的:讀原始碼、找真正的天花板、跑一個能定生死的實驗,全部拿 DeepSeek-V4-Flash 上那次 FlashMemory 調查來對照。]]></description>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>DeepSeek-V4-Flash</category>
            <category>methodology</category>
            <category>本地 LLM</category>
            <category>verification</category>
        </item>
        <item>
            <title><![CDATA[Hermes agent 桌面版完整指南:自架 AI 助理,ChatGPT OAuth 免 API key、Mac/Windows、可換本地模型]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/hermes-agent-complete-guide</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/hermes-agent-complete-guide</guid>
            <pubDate>Fri, 10 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Hermes agent 桌面版自架完整指南:用現有 ChatGPT OAuth 免 API key 當大腦,Mac、Windows 都能裝,接 Telegram、LINE 手機遙控,還能換成本地模型完全自主——一頁把整套帶你走完。]]></description>
            <category>Hermes</category>
            <category>AI agent</category>
            <category>自架</category>
            <category>ChatGPT OAuth</category>
            <category>Telegram</category>
            <category>本地 LLM</category>
            <category>MCP</category>
        </item>
        <item>
            <title><![CDATA[[本地 LLM] 我把 FlashMemory 重訓到自己的 Q2 build 上,它還是改善不了 V4-Flash 的 native lightning indexer]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-deepseek-v4-flash-flashmemory-vs-native-indexer</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-deepseek-v4-flash-flashmemory-vs-native-indexer</guid>
            <pubDate>Thu, 09 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[DeepSeek-V4-Flash 本來就有一套 native lightning indexer,追真實 attention 追到 93–96%。FlashMemory 會先把候選 chunk 篩小一圈,但直接拿來用跟亂猜沒兩樣;我重訓到自己的 Q2 build 上,也只爬到 89–92%。GB10 上 NO-GO。]]></description>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>DeepSeek-V4-Flash</category>
            <category>KV cache</category>
            <category>sparse attention</category>
            <category>ds4</category>
            <category>本地 LLM</category>
        </item>
        <item>
            <title><![CDATA[DGX Spark 2026 現況:哪些還能跑、哪些已經過時、我現在會怎麼配]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-2026-current-guide</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-2026-current-guide</guid>
            <pubDate>Tue, 07 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[DGX Spark 2026 年中現況整理:現在該用 vLLM、官方 Gemma 4 NVFP4 權重、MTP、長 context 多模態,以及仍然會咬人的坑。]]></description>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>Gemma 4</category>
            <category>vLLM</category>
            <category>NVFP4</category>
            <category>MTP</category>
            <category>Ollama</category>
            <category>local LLM</category>
            <category>2026 guide</category>
        </item>
        <item>
            <title><![CDATA[[地端 LLM] 284B 塞得進 128GB、長 context 還跑得動:DeepSeek-V4-Flash 打的是 KV cache,不是參數量]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-deepseek-v4-flash-architecture</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-deepseek-v4-flash-architecture</guid>
            <pubDate>Tue, 07 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[DeepSeek-V4-Flash 是 284B 的 MoE,長 context 還能在 128GB 的 GB10 上跑得動,靠的不是權重小,是它天生就在打 KV cache:混合式 attention(SWA + CSA + HCA)把 KV 壓到 64K 只剩 871MiB;lightning indexer 挑的是壓過的 entry、一步只讀幾百列。這篇拆 ds4 的實作,順便講為什麼你沒辦法再靠量化 KV 省記憶體。]]></description>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>DeepSeek-V4-Flash</category>
            <category>KV cache</category>
            <category>sparse attention</category>
            <category>ds4</category>
            <category>本地 LLM</category>
        </item>
        <item>
            <title><![CDATA[怎麼在自己的桌機跑一個 AI Agent：ChatGPT OAuth、Telegram、LINE、本地模型]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/run-ai-agent-from-your-desktop</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/run-ai-agent-from-your-desktop</guid>
            <pubDate>Tue, 07 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[想自架 AI agent，先別鑽進單篇教學。這篇把地圖攤開：桌面身體、ChatGPT OAuth 大腦、Telegram/LINE 通道、工具和本地模型。]]></description>
            <category>AI agent</category>
            <category>self-hosted</category>
            <category>ChatGPT OAuth</category>
            <category>openclaw</category>
            <category>Hermes</category>
            <category>Telegram</category>
            <category>LINE</category>
            <category>local LLM</category>
        </item>
        <item>
            <title><![CDATA[[本地 LLM] V4-Flash 的 depth-1 MTP:agent 回合 +9%、散文 −4%——推測解碼要看工作型態決定開不開]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-deepseek-v4-flash-mtp-workload-asymmetry</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-deepseek-v4-flash-mtp-workload-asymmetry</guid>
            <pubDate>Mon, 06 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[推測解碼常被當成免費加速,但在 bandwidth-bound 的 GB10 上,它其實是個會變負的取捨。depth-1 MTP 在 DeepSeek-V4-Flash 上無損,但看工作型態:agent 回合 +9.4%、程式碼 +6.5%,散文 −3.6%、中文閒聊 −3.7%。正負號跟著接受率走,因為這裡的吐字卡在驗證(108ms 驗證 vs 4ms 草稿)。不是全域開關,看工作型態開。]]></description>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>DeepSeek-V4-Flash</category>
            <category>speculative decoding</category>
            <category>MTP</category>
            <category>ds4</category>
            <category>本地 LLM</category>
        </item>
        <item>
            <title><![CDATA[[本地 LLM] 養了一個月,我的 284B agent 悄悄不再快取——ds4 的 evict 風暴,跟每輪重付的 prefill]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-deepseek-v4-flash-kv-evict-storm</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-deepseek-v4-flash-kv-evict-storm</guid>
            <pubDate>Sun, 05 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Part 2 誇的『快取命中就順』hot path,一個月重度 agent 用下來悄悄失效。ds4 的 disk-KV cache 在 GB10 上被兩件事餓死:預算填滿的 evict 風暴,加上 tool-call 那輪根本沒存 checkpoint。一段 14K token 的對話只認得 268 個字,剩下整段重 prefill。這篇拆 log 指紋、上游 PR #489、跟一張證明機制修好的 A/B 驗收。]]></description>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>DeepSeek-V4-Flash</category>
            <category>KV cache</category>
            <category>ds4</category>
            <category>本地 LLM</category>
            <category>prefill</category>
            <category>agent</category>
        </item>
        <item>
            <title><![CDATA[[趣味競賽 進階 #8] 為什麼 30 tok/s 體感比 14 還慢:TTFT 才是你真正感覺到的速度]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/why-30-toks-feels-slower-than-14-ttft</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/why-30-toks-feels-slower-than-14-ttft</guid>
            <pubDate>Fri, 03 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[我把家裡那顆 agent 腦的 decode 從別台的 14 tok/s 換成這台 30,結果它感覺更慢。tok/s 這個數字我盯了一年,原來它量的是「吐字多快」,不是「多久才開始吐」。在一顆 hybrid 模型上,一次 cache miss 就把整段 prompt 從頭重算——同一台機、同一顆腦,暖機 2.6 秒、冷掉 216 秒。這篇用 Hina 自己的 log 講:為什麼該盯的是 TTFT。]]></description>
            <category>本地 LLM</category>
            <category>AI agent</category>
            <category>TTFT</category>
            <category>llama.cpp</category>
            <category>Qwen3</category>
            <category>KV cache</category>
        </item>
        <item>
            <title><![CDATA[[趣味競賽 進階 #7] 在慢腦上開漸進式串流,我把自己撞進了 Telegram 的 flood control]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/telegram-streaming-flood-control-slow-llm</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/telegram-streaming-flood-control-slow-llm</guid>
            <pubDate>Thu, 02 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[我想讓慢吞吞的本地 agent 少一點等待焦慮,於是開了 Telegram 的「逐字浮現」串流——每隔幾百毫秒就改寫一次訊息。結果一個一百多秒的回應發出上百次編輯請求,正面撞進 Telegram 的 flood control,被罰等兩百多秒,整個 bot 卡死,連最終答案都送不出去。這篇講一個短而毒的教訓:慢模型不該開漸進式串流,一次性送最終答案反而穩。附 log 實證。]]></description>
            <category>本地 LLM</category>
            <category>AI agent</category>
            <category>Telegram</category>
            <category>streaming</category>
            <category>rate limit</category>
            <category>llama.cpp</category>
        </item>
        <item>
            <title><![CDATA[[Agent 進階 #17] Hermes 的 /learn:讓一隻本地 27B 把「做過的事」自己寫成可重用技能]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/hermes-learn-self-authored-skills</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/hermes-learn-self-authored-skills</guid>
            <pubDate>Wed, 01 Jul 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Hermes 有個叫 /learn 的指令,能把『你做過的事』自動整理成一份可重用技能(一份 SKILL.md)。這篇我把它接上自己的艦隊實測:派一張 Kanban 卡,讓一隻跑在改裝 2080 Ti 上的本地 27B 模型,3 分鐘把一次遊戲開發蒸餾成一份合格技能——還挖到兩個文件沒講清楚、實作才會踩到的細節:斜線指令 vs 派工、技能到底存哪。白話講 /learn 是什麼、怎麼用、以及它的真實限制。]]></description>
            <category>AI 助理</category>
            <category>AI agent</category>
            <category>Hermes</category>
            <category>skills</category>
            <category>/learn</category>
            <category>本地模型</category>
            <category>Kanban</category>
            <category>進階</category>
        </item>
        <item>
            <title><![CDATA[[Agent 進階 #16] 同一份規格,丟給三隻分身各寫一個俄羅斯方塊:Hermes 看板派工實測]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/hermes-project-three-sibs-tetris</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/hermes-project-three-sibs-tetris</guid>
            <pubDate>Mon, 29 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[養了一群分身之後,我把同一份「做個俄羅斯方塊」的規格——就一句話、細節啥都沒講——一隻分身發一張卡,讓三隻各自一次寫完一個網頁俄羅斯方塊。我一行遊戲碼都沒碰,只負責發布。結果蹦出個意外驚喜:靠 Hermes 這套外框加一顆我自己在家調、跑在改裝 2080Ti 上的小模型,居然一次就把我沒要求的 ghost、wall-kick 都補上了。成品點開就能玩。]]></description>
            <category>AI 助理</category>
            <category>AI agent</category>
            <category>Hermes</category>
            <category>派工</category>
            <category>Kanban</category>
            <category>看板</category>
            <category>地端模型</category>
            <category>俄羅斯方塊</category>
        </item>
        <item>
            <title><![CDATA[[Troubleshooting] HuggingFace 下載卡在 0 bytes:Xet、Windows、ai-toolkit 依賴地獄]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/huggingface-download-stuck-zero-bytes-windows-ai-toolkit</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/huggingface-download-stuck-zero-bytes-windows-ai-toolkit</guid>
            <pubDate>Mon, 29 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[在 Windows + RTX 5090 上用 ai-toolkit 訓練,真正開跑前先踩了三個坑:Python 3.13 依賴地獄、HuggingFace 下載卡 0 bytes、ssh 斷線把訓練殺了。每個都是「錯誤訊息指東、真兇在西」,逐個拆診斷跟解法。]]></description>
            <category>Troubleshooting</category>
            <category>HuggingFace</category>
            <category>Windows</category>
            <category>ai-toolkit</category>
            <category>RTX 5090</category>
        </item>
        <item>
            <title><![CDATA[[LoRA] 角色 LoRA 控制盤:畫風、寫實、身分怎麼調]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/character-lora-control-panel-wan22</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/character-lora-control-panel-wan22</guid>
            <pubDate>Sun, 28 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[訓練好角色 LoRA 之後,怎麼精準控制畫風與身分?lightning 為什麼抹平風格、什麼時候用全步數、風格 LoRA 怎麼疊、為什麼光靠觸發字綁不住外觀——一篇講清楚每個旋鈕。]]></description>
            <category>LoRA</category>
            <category>Wan 2.2</category>
            <category>ComfyUI</category>
            <category>AI 角色</category>
            <category>本地生成</category>
        </item>
        <item>
            <title><![CDATA[[趣味競賽 進階 #6] 工具定義稅:還沒開口,就先吃掉 17K token——而且每次重算都重來一遍]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/tool-definition-tax-17k-context-economics</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/tool-definition-tax-17k-context-economics</guid>
            <pubDate>Sat, 27 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[我數了一下家裡那個 AI 助理每次回話前的開銷:還沒開始處理我輸入的文字,就先吃掉約 23K token,其中 17K 只是『工具的使用說明書』。更慘的是它是 hybrid 模型,快取一沒命中就把這 17K 從頭重算——一個對話回合可能重算十幾次。這篇講一個被嚴重低估的成本:模型開口前的「打底開銷」。解法不是砍工具,是像技能那樣『用到才載』。]]></description>
            <category>本地 LLM</category>
            <category>AI agent</category>
            <category>context</category>
            <category>llama.cpp</category>
            <category>Qwen3</category>
            <category>tool calling</category>
        </item>
        <item>
            <title><![CDATA[[趣味競賽 進階 #5] 別讓助理每次都重讀整本對話:KV cache 存硬碟,回神快 7 倍]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/kv-cache-disk-restore-7x</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/kv-cache-disk-restore-7x</guid>
            <pubDate>Fri, 26 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[對話一長,每傳一句它都要把整段重讀一遍(re-prefill)才回你——重開、被擠掉快取後尤其痛。stock llama.cpp 沒內建把 KV cache 存硬碟(feature 被官方標 not planned),我用一支 60 行的 proxy 騙它做到:restore 比重算快 7×(5K 對話 9.9 秒→1.4 秒)。附:機制、proxy 設計、和為什麼我目前還沒上線它。]]></description>
            <category>本地 LLM</category>
            <category>llama.cpp</category>
            <category>KV cache</category>
            <category>TTFT</category>
            <category>Qwen3</category>
            <category>prefill</category>
        </item>
        <item>
            <title><![CDATA[[趣味競賽 進階 #4] 量化 draft cache 反而更慢:Qwen MTP 投機解碼的反直覺實測(f16 比 q4 快 34%)]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/mtp-quantized-draft-cache-backfires</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/mtp-quantized-draft-cache-backfires</guid>
            <pubDate>Thu, 25 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[主 KV 我量化成 q4 省記憶體,很合理。那 MTP 的 draft cache 順手也量一下吧——它只是個小草稿,直覺穩賺。測下去打臉:q4 draft cache 29.6 tok/s,不量化的 f16 反而 39.7,還更省記憶體。draft cache 是少數「量化淨虧」的地方。附:量化為什麼會同時拉低速度、acceptance 跟省不到記憶體的三重損失。]]></description>
            <category>MTP</category>
            <category>投機解碼</category>
            <category>本地 LLM</category>
            <category>Qwen3</category>
            <category>llama.cpp</category>
            <category>KV cache</category>
        </item>
        <item>
            <title><![CDATA[[Agent 進階 #15] 在手機上看你養的一群 AI 在做什麼：Muninn 加了看板]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/muninn-kanban-board</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/muninn-kanban-board</guid>
            <pubDate>Wed, 24 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Hermes 有內建看板，但你在手機上只看得到 Telegram 的純文字。Muninn 這次直接把那塊看板搬上手機：Running / Blocked / Done 分欄、誰在跑什麼、哪張卡被擋下來，一眼看完。零後端、純 P2P。]]></description>
            <category>AI 助理</category>
            <category>AI agent</category>
            <category>Hermes</category>
            <category>Muninn</category>
            <category>Kanban</category>
            <category>看板</category>
            <category>iOS</category>
            <category>手機</category>
        </item>
        <item>
            <title><![CDATA[[趣味競賽 進階 #3] 我把 context 開滿 256K,它載入成功——然後在真實對話裡 crash:一張 22G 改裝卡的 VRAM 偵探故事]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/context-vs-vram-256k-oom-2080ti</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/context-vs-vram-256k-oom-2080ti</guid>
            <pubDate>Wed, 24 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[模型卡片寫 n_ctx_train=262144。22G 的卡。27B 的 Q4 權重才 15.7GB。算盤一打:開滿 256K 啊,還剩好幾 GB。-c 262144 啟動,載入成功、沒報錯。跑幾輪對話就 503、服務自己重啟。日誌沒有漂亮的 out of memory,只有一行 0xc0000409。free VRAM 一看只剩 170 MiB——剩下的 GB 去哪了?這篇是把它查到底的偵探故事:我原本賴給 context checkpoint,讀了 llama.cpp 原始碼才發現它其實住系統 RAM、真正吃 VRAM 的是 KV cache;free-VRAM 對 context 是非線性的,而真正穩的甜蜜點不是 256K,是 128K。]]></description>
            <category>本地 LLM</category>
            <category>llama.cpp</category>
            <category>Qwen3</category>
            <category>VRAM</category>
            <category>context window</category>
            <category>KV cache</category>
        </item>
        <item>
            <title><![CDATA[[Agent 進階 #14] 出門也能跟家裡的助理說話：Muninn + iroh，5G 直連，不靠雲端]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/hermes-muninn-phone-bridge</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/hermes-muninn-phone-bridge</guid>
            <pubDate>Tue, 23 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Hermes 裝好了，但出門就失聯——用 LINE 接太麻煩，沒有你自己的介面。Muninn 是專為 Hermes 設計的 iOS app：跟助理說一句話、手機掃 QR，5G 就能直連家裡，中間不經過任何第三方伺服器。]]></description>
            <category>AI 助理</category>
            <category>AI agent</category>
            <category>Hermes</category>
            <category>iroh</category>
            <category>P2P</category>
            <category>iOS</category>
            <category>手機</category>
            <category>bridge</category>
        </item>
        <item>
            <title><![CDATA[[趣味競賽 進階 #2] 我把 100 tok/s 換成 30:快的 Gemma 12B 做完事就走人,慢的 Qwen 27B 才肯收尾]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/gemma-12b-vs-qwen-27b-agentic-discipline</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/gemma-12b-vs-qwen-27b-agentic-discipline</guid>
            <pubDate>Tue, 23 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[選本地模型我也是先看 tok/s。Gemma 12B 跑 90-100、爽到飛起,可是掛上 kanban 工作板,它做完內容就「結束」,從不回頭把卡標完成。換成慢三倍的 Qwen 27B,board 反而開始乖。這篇講一個反直覺的選擇:當腦要持續守一套程序,吞吐量根本不是該看的數字。附:連我查 log 都差點被 grep 騙。]]></description>
            <category>本地 LLM</category>
            <category>AI agent</category>
            <category>Qwen3</category>
            <category>Gemma</category>
            <category>llama.cpp</category>
            <category>kanban</category>
        </item>
        <item>
            <title><![CDATA[[Agent 進階 #13] 助理開始發瘋？先別怪它笨——八成是「車子」壞了，不是「引擎」壞了]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/hermes-harness-debugging</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/hermes-harness-debugging</guid>
            <pubDate>Mon, 22 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[AI 助理鬼打牆、亂跑、卡住、答非所問，你的第一反應通常是「這模型真笨」。但根據我自己一路 debug 的經驗，八成不是模型的問題，而是它外面那一圈（工具、設定、記憶）出了狀況。模型是引擎，外面那一圈是車子——車子開不動，常常不是引擎壞，是輪胎沒氣、油路堵了。]]></description>
            <category>AI 助理</category>
            <category>AI agent</category>
            <category>Hermes</category>
            <category>除錯</category>
            <category>debug</category>
            <category>harness</category>
            <category>進階</category>
        </item>
        <item>
            <title><![CDATA[[趣味競賽 進階 #1] 老將漢升(GTX 970)退場,天水的麒麟兒(RTX 2080Ti 22G)登場:NT$11k 改裝卡養一顆 27B agent]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/modded-2080ti-22gb-local-agent</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/modded-2080ti-22gb-local-agent</guid>
            <pubDate>Mon, 22 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[GTX 970 那系列結尾我說「想在老卡上掛 agent,但 E2B 太小」。與其買新卡,我去二手市場撈了一張改裝 22G 的 2080 Ti——淘寶標價 ¥2079、到手含海運雜費約 NT$11,000——剛好夠把一顆常駐 27B 的 agent 腦養在家裡那台廉價老桌機上。這篇講用合理價錢挖到剛好夠用的好料的爽,跟它背後的工程。]]></description>
            <category>RTX 2080 Ti</category>
            <category>改裝顯卡</category>
            <category>本地 LLM</category>
            <category>AI agent</category>
            <category>llama.cpp</category>
            <category>Qwen3</category>
        </item>
        <item>
            <title><![CDATA[在 abliterated DeepSeek-V4 上做 Directional Steering:同一把刀,疊起來會打架]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-deepseek-v4-directional-steering</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-deepseek-v4-directional-steering</guid>
            <pubDate>Sun, 21 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[ds4 引擎內建 directional steering — 推理當下推一個方向向量改變模型行為,數學上就是 abliteration 的連續可逆版。我在 GB10/CUDA 上跑通了(官方工具其實偏 Metal,但 CUDA 的 activation dump 也能觸發),抽了一條 verbosity 向量。結果:在 abliterated Q2 上 gradient 非單調、正向 scale 直接崩成標題碎片 —— 兩刀同源,疊起來互相打架。]]></description>
            <category>DeepSeek V4</category>
            <category>directional steering</category>
            <category>activation steering</category>
            <category>abliteration</category>
            <category>representation engineering</category>
            <category>ds4</category>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>CUDA</category>
            <category>control vectors</category>
        </item>
        <item>
            <title><![CDATA[[Agent 進階 #12] 裝完之後然後呢？給你的助理一雙手——接上你自己的工具]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/hermes-connect-your-tools</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/hermes-connect-your-tools</guid>
            <pubDate>Sat, 20 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[助理裝好了，但它現在只會講話——只有一張嘴。這篇帶你給它一雙手：接上工具，讓它真的去查你的資料夾、跑你的指令、打你自己寫的小服務。重點概念叫 MCP，就是工具的『萬用插座』標準，插上去助理就會用。整套跑在你自己這邊、接的是你自己的東西。]]></description>
            <category>AI 助理</category>
            <category>AI agent</category>
            <category>Hermes</category>
            <category>MCP</category>
            <category>工具</category>
            <category>自動化</category>
            <category>新手入門</category>
        </item>
        <item>
            <title><![CDATA[[Agent 進階 #11] 把助理的腦換成你家機器上的：從雲端 ChatGPT 換成本地模型]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/hermes-local-brain</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/hermes-local-brain</guid>
            <pubDate>Fri, 19 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[前面我們用 ChatGPT 當助理的大腦。這篇做一件更狠的事——把那顆腦從雲端換成跑在你自己機器上的本地模型（例如 ds4）。賣點是「腦」這塊整套自主：推論不靠雲端、你跟它講的話不出門、不限額、全在你手上。代價也誠實講：本地腦通常較慢（ds4 實測約 10 tok/s），而且要一台夠力的機器。換腦不換身體，Hermes 這副身體完全不動。]]></description>
            <category>AI 助理</category>
            <category>AI agent</category>
            <category>Hermes</category>
            <category>本地模型</category>
            <category>隱私</category>
            <category>自主</category>
            <category>ds4</category>
        </item>
        <item>
            <title><![CDATA[[LoRA] 在 RTX 5090 訓練自己的 AI 角色:一張圖到能跑的角色]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/train-character-lora-wan22-rtx5090</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/train-character-lora-wan22-rtx5090</guid>
            <pubDate>Thu, 18 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[用一張參考圖,在自己的 5090 上訓練一顆 Wan 2.2 角色 LoRA,之後純文字就能叫出同一個人——換衣服、換場景、換畫風、甚至生成影片,免付雲端費用。]]></description>
            <category>LoRA</category>
            <category>Wan 2.2</category>
            <category>RTX 5090</category>
            <category>AI 角色</category>
            <category>本地生成</category>
        </item>
        <item>
            <title><![CDATA[[Agent 進階 #10] 一個人養一群助理：每個分身有自己的桌子、自己的腦、自己的記憶]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/hermes-multiple-sibs</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/hermes-multiple-sibs</guid>
            <pubDate>Wed, 17 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[一個助理用熟了，想再養第二、第三個？Hermes 讓每個分身有自己獨立的家（設定、記憶、個性），可以各跑不同模型、各管不同任務。這篇用白話講為什麼要分身、怎麼分，以及我實際養的那幾隻。誠實說：一般人一個就夠，這是想玩才需要的進階玩法。]]></description>
            <category>AI 助理</category>
            <category>AI agent</category>
            <category>Hermes</category>
            <category>多分身</category>
            <category>進階</category>
        </item>
        <item>
            <title><![CDATA[[Agent 進階 #9] 讓你的 AI 助理看得到、聽得到：幫文字腦接上眼睛跟耳朵]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/hermes-agent-vision-voice</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/hermes-agent-vision-voice</guid>
            <pubDate>Tue, 16 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[你的 AI 助理只會讀文字？這篇教你幫它接上眼睛跟耳朵——丟一張圖它看得懂、傳一段語音它聽得懂。做法不是換更貴的大模型，是外掛一顆會看圖的小模型當感知小幫手。Hermes 原生 auxiliary.vision + 內建 faster-whisper，端到端實測。]]></description>
            <category>AI 助理</category>
            <category>AI agent</category>
            <category>Hermes</category>
            <category>多模態</category>
            <category>vision</category>
            <category>語音</category>
            <category>faster-whisper</category>
            <category>本地模型</category>
        </item>
        <item>
            <title><![CDATA[[Agent 入門 #8] 不想搞 LINE？接 Telegram 其實更簡單]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/connect-hermes-to-telegram</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/connect-hermes-to-telegram</guid>
            <pubDate>Mon, 15 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[前面那套 LINE 要先開門（ngrok）、再去後台設 webhook，步驟不少。這篇給你更輕的選擇：Telegram。跟一個官方機器人對話就能建好你的 bot、拿到一把鑰匙，填進 Hermes 就通——不用對外網址、不用 webhook。]]></description>
            <category>AI 助理</category>
            <category>AI agent</category>
            <category>Hermes</category>
            <category>Telegram</category>
            <category>新手入門</category>
            <category>教學</category>
        </item>
        <item>
            <title><![CDATA[[趣味競賽] 用一張 GTX 970 架部落格 RAG 客服：不裝 torch、不用向量資料庫、不碰 LangChain]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/gtx-970-blog-rag-bot</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/gtx-970-blog-rag-bot</guid>
            <pubDate>Sun, 14 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[幫部落格做一個 RAG 客服 bot，跑在一張 2014 年的 GTX 970 加一個約 600MB 的 embedding 模型。embedding 走 llama.cpp 在 CPU 上跑、檢索用 numpy 暴力算 3,475 條 chunk、護欄靠嵌入分數閘、對外走 Cloudflare Tunnel。]]></description>
            <category>Gemma 4</category>
            <category>GTX 970</category>
            <category>RAG</category>
            <category>llama.cpp</category>
            <category>Cloudflare Tunnel</category>
        </item>
        <item>
            <title><![CDATA[[趣味競賽] 在 GTX 970 上，Flash Attention 讓長 context 的 decode 接近翻倍（24.3 → 42.5 tok/s）]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/gtx-970-gemma4-e2b-kv-cache-flash-attention</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/gtx-970-gemma4-e2b-kv-cache-flash-attention</guid>
            <pubDate>Sun, 14 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[在沒有 tensor core 的 Maxwell GTX 970 上跑 Gemma 4 E2B，開 Flash Attention 讓長 context 的 decode 接近翻倍（24.3 → 42.5 tok/s），還省了約 430MB VRAM；而 q8 KV cache 幾乎沒省到記憶體、還拖慢 decode。一般的 KV cache 常識整個翻過來。]]></description>
            <category>Gemma 4</category>
            <category>GTX 970</category>
            <category>Flash Attention</category>
            <category>KV cache</category>
            <category>llama.cpp</category>
        </item>
        <item>
            <title><![CDATA[[vLLM] DiffusionGemma 26B NVFP4 上 DGX Spark:158 tok/s,但 diffusion 的 tok/s 會騙你]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-diffusiongemma-nvfp4-vllm</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-diffusiongemma-nvfp4-vllm</guid>
            <pubDate>Sat, 13 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[DiffusionGemma 26B-A4B 用官方現成 image 就能在 128GB DGX Spark 上跑 vLLM,不用等 PR、不用 cherry-pick。NVFP4 單條 158 tok/s、四條同時 257。但單一個 tok/s 數字會騙人:diffusion 的速度取決於 256 token 的畫布有沒有填滿。]]></description>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>DiffusionGemma</category>
            <category>diffusion LLM</category>
            <category>NVFP4</category>
            <category>vLLM</category>
            <category>local LLM</category>
        </item>
        <item>
            <title><![CDATA[[地端 LLM] 權重就是正義:284B 砍到 2-bit,還是比塞得下的小模型強]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-deepseek-v4-flash-284b-q2-quality</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-deepseek-v4-flash-284b-q2-quality</guid>
            <pubDate>Fri, 12 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[把 DeepSeek-V4-Flash(284B)壓到非對稱 Q2 才塞進 128GB 小盒子。聽起來像自殺式量化,但它只砍 routed experts、把高精度留在該留的層。實際當 agent 跑 280 輪零退化——權重夠大,2-bit 也壓不垮。]]></description>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>DeepSeek-V4-Flash</category>
            <category>量化</category>
            <category>Q2</category>
            <category>非對稱量化</category>
            <category>本地模型</category>
            <category>ds4</category>
        </item>
        <item>
            <title><![CDATA[[地端 LLM] 把 15 tok/s 的 284B 當每天的 agent 大腦:DeepSeek-V4-Flash 怎麼設才舒服]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-deepseek-v4-flash-context-memory-engineering</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-deepseek-v4-flash-context-memory-engineering</guid>
            <pubDate>Fri, 12 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[一顆 284B、只有 15 tok/s 的模型,要拿來當每天的 agent 大腦,得先做點準備才用得舒服。server 跟 agent 框架兩邊各一組設定:--no-mmap 冷啟砍到 57 秒、KV disk cache 省一半 prefill、context_length 沒設對整個 session 會炸。]]></description>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>DeepSeek-V4-Flash</category>
            <category>KV cache</category>
            <category>context</category>
            <category>記憶體</category>
            <category>ds4</category>
            <category>本地模型</category>
        </item>
        <item>
            <title><![CDATA[[地端 LLM] 第一次跑 Q2 就以為模型變笨了 —— 284B DeepSeek-V4-Flash 在 128GB 桌機,真兇是 parser 不認 DSML]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-deepseek-v4-flash-284b-ds4-engine</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-deepseek-v4-flash-284b-ds4-engine</guid>
            <pubDate>Fri, 12 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[DeepSeek-V4-Flash 是 284B 的 frontier 模型。我用 antirez 的 ds4 引擎 + 非對稱 Q2 在單台 GB10 跑起來,15.6 tok/s。本來以為 2-bit 量化讓它假裝呼叫工具,結果真兇是 runtime 沒接 DSML parser。]]></description>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>DeepSeek-V4-Flash</category>
            <category>ds4</category>
            <category>量化</category>
            <category>Q2</category>
            <category>tool-call</category>
            <category>DSML</category>
            <category>本地模型</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] Qwen3.5-122B 在 DGX Spark 加速 100%!]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-qwen3-122b-vllm-to-atlas-2x</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-qwen3-122b-vllm-to-atlas-2x</guid>
            <pubDate>Thu, 11 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Qwen3.5-122B-A10B 在 128GB 的 DGX Spark 上,vLLM 怎麼調都卡在 17 tok/s 的 GDN 牆,連 merge 進去的加速 PR 都沒用。我換掉 vLLM、改用 Atlas 引擎跑同一顆解禁 NVFP4 權重,直接翻到 33.9 tok/s(開 MTP 36.5,約 2×)—— 加速 100%,解禁行為原封不動。真正的出口不在量化工具箱裡。]]></description>
            <category>Qwen3.5</category>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>GDN</category>
            <category>vLLM</category>
            <category>Atlas</category>
            <category>NVFP4</category>
            <category>Benchmark</category>
            <category>SM121</category>
        </item>
        <item>
            <title><![CDATA[[趣味競賽] 把 GTX 970 變語音助手：Gemma 4 E2B 多模態 + Piper TTS，端到端 2.8 秒]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/gtx-970-gemma4-e2b-voice-assistant</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/gtx-970-gemma4-e2b-voice-assistant</guid>
            <pubDate>Tue, 09 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[一張 2014 年的 GTX 970 跑 Gemma 4 E2B（看圖 + 聽聲音）再接上 Piper TTS——一個會看、會聽、會說、會寫 code 的完整離線語音助手。端到端約 2.8 秒，硬體約 NT$500。]]></description>
            <category>Gemma 4</category>
            <category>GTX 970</category>
            <category>multimodal</category>
            <category>Piper TTS</category>
            <category>voice assistant</category>
        </item>
        <item>
            <title><![CDATA[[趣味競賽] GTX 970 跑 Gemma 4 E2B：最大的量化檔反而最快（47.6 tok/s）]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/gtx-970-gemma4-e2b-quantization-benchmark</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/gtx-970-gemma4-e2b-quantization-benchmark</guid>
            <pubDate>Tue, 09 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[在 2014 年的 GTX 970 上跑 Gemma 4 E2B 四種量化。3.2GB 的 QAT Q4_0 反而比 2.9GB 的 Q2_K 快（47.6 vs 32.8 tok/s）——因為沒有 tensor core 的 Maxwell 老卡卡在解量化，不是卡頻寬。]]></description>
            <category>Gemma 4</category>
            <category>quantization</category>
            <category>GTX 970</category>
            <category>llama.cpp</category>
            <category>benchmark</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] NVFP4 量化砍繁中比砍英文兇兩倍：gemma-4-12B 實測]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-nvfp4-quant-tax-chinese-vs-english</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-nvfp4-quant-tax-chinese-vs-english</guid>
            <pubDate>Fri, 05 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[我在 DGX Spark 上把 gemma-4-12B 量化成 BF16 / FP8 / NVFP4 weight-only，分別測英文 MMLU 跟繁中 TMMLU+。FP8 兩邊都近無損；NVFP4 繁中掉 6 分、英文只掉 3 分。]]></description>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>Gemma 4</category>
            <category>NVFP4</category>
            <category>FP8</category>
            <category>quantization</category>
            <category>MMLU</category>
            <category>TMMLU+</category>
            <category>繁體中文</category>
            <category>benchmark</category>
        </item>
        <item>
            <title><![CDATA[[Agent 入門 #7] 讓助理自己跑任務：每天自動研究、主動傳 LINE 給你]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/hermes-autonomous-daily-line</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/hermes-autonomous-daily-line</guid>
            <pubDate>Fri, 05 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[系列最後一步，也最有感：設一個會自己跑的任務。用一句白話交代，它每天自動上網研究你關心的事、整理成重點，主動傳 LINE 來找你。設完關電腦，隔天早上它自己叮你。]]></description>
            <category>AI 助理</category>
            <category>AI agent</category>
            <category>Hermes</category>
            <category>LINE</category>
            <category>自動化</category>
            <category>排程</category>
            <category>新手入門</category>
        </item>
        <item>
            <title><![CDATA[[Agent 入門 #6] 接上 LINE：從手機就能使喚你的助理]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/connect-hermes-to-line</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/connect-hermes-to-line</guid>
            <pubDate>Fri, 05 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[門開好了，這篇把助理接上 LINE。你做只有本人能做的事（登入 LINE 後台、複製兩把鑰匙、掃 QR 加好友），技術設定交給 Hermes。接完從手機傳一句話，它就回你。]]></description>
            <category>AI 助理</category>
            <category>AI agent</category>
            <category>Hermes</category>
            <category>LINE</category>
            <category>新手入門</category>
            <category>教學</category>
        </item>
        <item>
            <title><![CDATA[[Agent 入門 #5] 幫你的電腦開一扇對外的門：用 ngrok 讓 LINE 找得到它]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/ngrok-tunnel-for-line</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/ngrok-tunnel-for-line</guid>
            <pubDate>Fri, 05 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[要讓助理接 LINE，得先讓外面的 LINE 伺服器連得到你家裡的電腦。這篇用 ngrok 幫電腦開一扇固定的對外門，一行指令、免費、不用自己有網域，重開機也不會斷。]]></description>
            <category>AI 助理</category>
            <category>AI agent</category>
            <category>Hermes</category>
            <category>ngrok</category>
            <category>LINE</category>
            <category>新手入門</category>
        </item>
        <item>
            <title><![CDATA[[Agent 入門 #4] Hermes Agent Desktop 桌面版安裝教學：手把手下載、裝好你的第一個 AI 助理]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/install-hermes-desktop</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/install-hermes-desktop</guid>
            <pubDate>Fri, 05 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Hermes Agent Desktop（桌面版）下載 + 安裝教學。不用碰終端機：到官網下載桌面版、第一次打開自動裝好相依套件、用 ChatGPT 帳號登入，十幾分鐘就有一個你自己的 AI 助理在跑。]]></description>
            <category>AI 助理</category>
            <category>AI agent</category>
            <category>Hermes</category>
            <category>ChatGPT</category>
            <category>新手入門</category>
            <category>教學</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] Gemma 4 12B omni 上 DGX Spark:weight-only NVFP4 贏 W4A4,還保住多模態]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-gemma4-12b-omni-nvfp4-weight-only</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-gemma4-12b-omni-nvfp4-weight-only</guid>
            <pubDate>Thu, 04 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[我在 DGX Spark GB10 上量化 Google 新的 omni Gemma 4 12B。weight-only NVFP4 只要 7.7GB、跑 24.9 tok/s,而且圖片/語音/影片都還能用 —— 全 W4A4 反而沒比較快,還把多模態弄壞。]]></description>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>Gemma 4</category>
            <category>NVFP4</category>
            <category>FP8</category>
            <category>quantization</category>
            <category>vLLM</category>
            <category>omni</category>
            <category>multimodal</category>
            <category>benchmark</category>
        </item>
        <item>
            <title><![CDATA[[Agent 入門 #3] 我們的固定組合：ChatGPT 當大腦、Hermes 當身體]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/ai-brain-hermes-body</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/ai-brain-hermes-body</guid>
            <pubDate>Thu, 04 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[一個 AI 助理＝大腦＋身體。大腦直接用你的 ChatGPT、身體用 Hermes，固定一套不用挑。這篇講為什麼這樣配，還有動手裝之前要準備什麼。]]></description>
            <category>AI 助理</category>
            <category>AI agent</category>
            <category>Hermes</category>
            <category>ChatGPT</category>
            <category>新手入門</category>
        </item>
        <item>
            <title><![CDATA[[Agent 入門 #2] 什麼是 agent 框架？為什麼別自己寫程式，直接用現成的就好]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/what-is-an-agent-framework</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/what-is-an-agent-framework</guid>
            <pubDate>Thu, 04 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[想要自己的 AI 助理，你不用從零寫程式。agent 框架已經把麻煩事整包做好，裝起來就能用。這篇講為什麼別自己拼，直接用現成的 Hermes。]]></description>
            <category>AI 助理</category>
            <category>AI agent</category>
            <category>Hermes</category>
            <category>新手入門</category>
        </item>
        <item>
            <title><![CDATA[[Agent 入門 #1] AI 助理跟 ChatGPT 差在哪？一個回答你，一個用你的工具幫你做事]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/ai-agent-vs-chatbot</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/ai-agent-vs-chatbot</guid>
            <pubDate>Thu, 04 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[你平常用 ChatGPT 多半是問一句它答一句。自己養的 AI 助理（agent）則能用你自己的工具把事做完、跑在你這邊、接你天天在用的軟體。從 0 打造自己助理的第一課。]]></description>
            <category>AI 助理</category>
            <category>AI agent</category>
            <category>ChatGPT</category>
            <category>新手入門</category>
        </item>
        <item>
            <title><![CDATA[[AI Agent] 本機 agent 生圖一直發瘋,問題在工具不在模型]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-agent-harness-not-weights</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-agent-harness-not-weights</guid>
            <pubDate>Tue, 02 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[本機 35B agent 生圖生影片一直亂試,我差點跑去微調它。動手前先讀 tool-call log:格式 0% 出錯。模型沒問題,是一個壞掉的 ComfyUI 工具逼它即興。解法是一個乾淨的 ACI skill,不是微調。]]></description>
            <category>AI Agent</category>
            <category>ACI</category>
            <category>harness</category>
            <category>ComfyUI</category>
            <category>DGX Spark</category>
            <category>Qwen3.6</category>
            <category>tool design</category>
            <category>Hermes</category>
            <category>本機 LLM</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] NVFP4 把影片模型砍小三分之一,速度卻一點沒快——因為 diffusion 是 compute-bound]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-sulphur-nvfp4-video</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-sulphur-nvfp4-video</guid>
            <pubDate>Mon, 01 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[NVFP4 把蒸餾版 Sulphur 2(LTX-2.3)影片模型從 29 砍到 19.5 GB,在 GB10 DGX Spark 上畫質速度都沒掉。影片 diffusion 是 compute-bound,跟 LLM decode 剛好相反。]]></description>
            <category>NVFP4</category>
            <category>Sulphur 2</category>
            <category>LTX-2.3</category>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>video generation</category>
            <category>ComfyUI</category>
            <category>quantization</category>
            <category>diffusion</category>
            <category>benchmark</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] NVFP4 W4A4 在 DGX Spark 上超車 FP8:拔掉 enforce-eager,MoE 從 23 衝到 67 tok/s]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-nvfp4-w4a4-moe-cudagraph</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-nvfp4-w4a4-moe-cudagraph</guid>
            <pubDate>Mon, 01 Jun 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[GB10 上 NVFP4 W4A4 拔掉 --enforce-eager 後從 23 衝到 67 tok/s,贏 FP8 29% 還省 16GB。Part 32 說 cudagraph 沒用——那只對 dense,MoE 完全相反。]]></description>
            <category>NVFP4</category>
            <category>W4A4</category>
            <category>FP8</category>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>SM121</category>
            <category>vLLM</category>
            <category>MoE</category>
            <category>CUDA graph</category>
            <category>MTP</category>
            <category>benchmark</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] NVFP4 在 DGX Spark 比 FP8 快 1.5 倍——但贏在壓縮，不是那顆 FP4 運算單元]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-nvfp4-compression-not-compute</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-nvfp4-compression-not-compute</guid>
            <pubDate>Sat, 30 May 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[GB10 DGX Spark 上，純 dense 模型單流 decode，NVFP4 比 FP8 快約 1.5 倍。但快的是頻寬（權重檔變小），不是 FP4 tensor core——最快那條路根本沒碰它。]]></description>
            <category>NVFP4</category>
            <category>FP8</category>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>SM121</category>
            <category>vLLM</category>
            <category>benchmark</category>
            <category>量化</category>
            <category>記憶體頻寬</category>
        </item>
        <item>
            <title><![CDATA[[AI 會做事了] AI 像你一樣控制電腦 — 從聊天機器到動手做事，這兩年發生了什麼]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/ai-can-act-from-chat-to-clicks</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/ai-can-act-from-chat-to-clicks</guid>
            <pubDate>Wed, 27 May 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[ChatGPT 剛紅那會兒，AI 是「丟字給你、你照做」。這兩年，它開始能查、能讀、能點滑鼠 — 從聊天機器變成會動手的東西。這篇整理這條演進過程，跟它為什麼重要。]]></description>
            <category>AI</category>
            <category>AI Agent</category>
            <category>Computer Use</category>
            <category>入門</category>
            <category>ChatGPT</category>
            <category>Claude</category>
        </item>
        <item>
            <title><![CDATA[[LLM 101 #7] 怎麼看出 AI 在胡說？三個訊號讓你提早警覺]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/llm-101-spot-ai-hallucination</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/llm-101-spot-ai-hallucination</guid>
            <pubDate>Sat, 23 May 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[AI 自信地給你錯答案，語氣跟講真話一樣。三個訊號讓你提早警覺 — 數字超出範圍、細節太精確、重複問會跳號 — 加我自己被 ChatGPT 騙的真實案例。]]></description>
            <category>LLM</category>
            <category>幻覺</category>
            <category>入門</category>
            <category>驗證</category>
            <category>ChatGPT</category>
        </item>
        <item>
            <title><![CDATA[Round 2 EAGLE-3 retrain 沒打破天花板 — 60 小時訓練的 null result + 教訓]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-eagle3-round2-null-result</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-eagle3-round2-null-result</guid>
            <pubDate>Thu, 21 May 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Round 1 在 chat workload 上沒有 2× speedup 後,Round 2 加 30K 中文 instruction data + huihui body 重生 response,訓練 41 小時。結果:Round 2 B drafter chat EN 45 tok/s / ZH 29 tok/s,跟 v1 基本相同,**遠輸 vanilla MTP n=4 的 EN 53 / ZH 45**。確認 EAGLE-3 small head 對上 abliterated body 的架構天花板,more data 救不了。順帶找到 vLLM Gemma 4 preview image(`gemma4-0505-arm64-cu130`,內部 build `0.20.2rc1.dev49+g9b4e83934`)在 long-run extract_hidden_states 的 scheduler deadlock(三次踩到 + watchdog 補完)。]]></description>
            <category>Gemma 4</category>
            <category>abliteration</category>
            <category>EAGLE-3</category>
            <category>speculative decoding</category>
            <category>vLLM</category>
            <category>speculators</category>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>FP8</category>
            <category>huihui-ai</category>
            <category>fine-tune</category>
            <category>benchmark</category>
            <category>null result</category>
        </item>
        <item>
            <title><![CDATA[[Claude Code] 規則我會跳過，hook 我跳不過 — 我替自己裝了一個發文閘]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/claude-code-publish-gate-hook</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/claude-code-publish-gate-hook</guid>
            <pubDate>Tue, 19 May 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[我有一條「發文前要查證」的規則,還是寫了三次說錯。問題不在規則,在它放在哪一層。這篇講我怎麼把它從 skill 升級成 hook — 一段守在「按下送出」那一刻的小程式,沒查證連嘗試都不准。]]></description>
            <category>Claude Code</category>
            <category>hooks</category>
            <category>skills</category>
            <category>驗證</category>
            <category>AI 自我改造</category>
            <category>publish gate</category>
            <category>git commit</category>
            <category>AI Workflow</category>
        </item>
        <item>
            <title><![CDATA[Fine-tune EAGLE-3 drafter 在 abliterated Gemma 4 上 — Round 1 拉平 acceptance 曲線(+ 一個 measurement lesson)]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-eagle3-finetune-abliterated-round1</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-eagle3-finetune-abliterated-round1</guid>
            <pubDate>Sat, 16 May 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[在 DGX Spark GB10 上把 RedHatAI EAGLE-3 drafter fine-tune 對齊 huihui Gemma 4 26B-A4B abliterated FP8 body 的 distribution。1 epoch / 50k Magpie samples / 11h 訓練。Inference bench(raw `/v1/completions`)pos 3 acceptance 從 vanilla 的 20.5% → 72.7%、n=4 throughput 從 50 → 100.36 tok/s aggregate。**後續 paired bench 發現原 throughput 比較 baseline 跟 retrain 用了不同 endpoint(chat vs raw)— production chat workload 上 retrain drafter 的真實提升遠小於 2×,詳見文首 endpoint correction**。Part 28 證實的「abliterated body deep speculation acceptance 散開」這個機制觀察仍成立。順帶找到 Speculators upstream create_empty_sample dtype bug + Phase 0 整理 6 個社群 prior art。]]></description>
            <category>Gemma 4</category>
            <category>abliteration</category>
            <category>EAGLE-3</category>
            <category>speculative decoding</category>
            <category>vLLM</category>
            <category>speculators</category>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>FP8</category>
            <category>huihui-ai</category>
            <category>fine-tune</category>
            <category>benchmark</category>
        </item>
        <item>
            <title><![CDATA[在 DGX Spark 上 30 行 docker 拿 +34%:huihui Gemma 4 FP8 + vanilla MTP n=1 部署 recipe]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-huihui-gemma4-mtp-n1-recipe</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-huihui-gemma4-mtp-n1-recipe</guid>
            <pubDate>Thu, 14 May 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Part 28 是 mechanism,這篇是 recipe:abliterated Gemma 4 26B-A4B FP8 跑在 GB10 上,搭官方 vanilla draft 開 num_speculative_tokens=1,baseline 39.3 → 52.6 tok/s (+34%),不用重訓 drafter。30 行 docker run + bind-mount PR #41745 head 的 gemma4_mtp.py 就能拿到。包含 sanity check 跟什麼時候 n=1 不夠用的判斷。]]></description>
            <category>Gemma 4</category>
            <category>abliteration</category>
            <category>MTP</category>
            <category>speculative decoding</category>
            <category>vLLM</category>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>FP8</category>
            <category>huihui-ai</category>
            <category>deployment</category>
            <category>recipe</category>
        </item>
        <item>
            <title><![CDATA[想用 MTP 加速 abliterated Gemma 4?vanilla draft 對不上被改過的 body]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-huihui-gemma4-fp8-mtp-34pct</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-huihui-gemma4-fp8-mtp-34pct</guid>
            <pubDate>Sat, 09 May 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[自量化 huihui Gemma 4 26B-A4B abliterated 成 FP8 ship 上 HF。完整 n=1..4 sweep 後發現:abliterated body 跟 vanilla baseline 完全一樣快,n=1 上 MTP 加成也一樣;但 n=4 deep speculation 上 huihui 因為 per-position decay 陡(每 step 22pp)而被 vanilla 拉開兩倍。Tax 的真實樣貌是 conditional on num_speculative_tokens,不是固定百分比。]]></description>
            <category>Gemma 4</category>
            <category>abliteration</category>
            <category>MTP</category>
            <category>speculative decoding</category>
            <category>vLLM</category>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>FP8</category>
            <category>huihui-ai</category>
            <category>benchmark</category>
        </item>
        <item>
            <title><![CDATA[火箭起飛:Gemma 4 在 DGX Spark 跑出 670 tok/s 總吞吐(單流 108 tok/s)]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-gemma4-mtp-108-toks</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-gemma4-mtp-108-toks</guid>
            <pubDate>Wed, 06 May 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Google 2026-05-05 發 Multi-Token Prediction drafter,vLLM PR 同日開、官方 preview docker 同日有。DGX Spark 上實測 Gemma 4 26B-A4B-it FP8 + MTP γ=4:單流 108 tok/s(2.66× baseline)、8 路並行 674 tok/s 總吞吐。一個沒寫進文件的雷:drafter 不能配 base model,要配 -it。]]></description>
            <category>Gemma 4</category>
            <category>MTP</category>
            <category>speculative decoding</category>
            <category>vLLM</category>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>SM121</category>
            <category>FP8</category>
            <category>NVFP4</category>
            <category>benchmark</category>
            <category>Gemma 4 26B-A4B</category>
        </item>
        <item>
            <title><![CDATA[[Skill] 我的繁中不夠台 — zhtw-mcp 掃 72 篇文章修了 128 處陸用詞]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/zhtw-mcp-calque-blindspot-sweep</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/zhtw-mcp-calque-blindspot-sweep</guid>
            <pubDate>Tue, 05 May 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[sysprog21/zhtw-mcp 把繁中規則編譯成執行檔。掃 ai-muninn 全部 72 篇繁中文章三輪修了 128 處陸用詞,但真正的收穫不是修了多少 — 是發現我的盲點不是「不知道台灣怎麼說」,是「碰到陸用詞時預設不會主動懷疑」。]]></description>
            <category>zh-TW</category>
            <category>AI Workflow</category>
            <category>檢查工具</category>
            <category>skills</category>
            <category>calque</category>
            <category>localization</category>
            <category>zhtw-mcp</category>
            <category>sysprog21</category>
            <category>writing pipeline</category>
            <category>繁中</category>
            <category>Claude Code</category>
        </item>
        <item>
            <title><![CDATA[[實戰] Z-Image Turbo 教戰守則:換配置會崩品質嗎?LPIPS + CLIPScore 雙軸驗證]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/zimage-turbo-quality-lpips-clipscore</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/zimage-turbo-quality-lpips-clipscore</guid>
            <pubDate>Mon, 04 May 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Z-Image Turbo 量化版會不會崩品質?LPIPS(perceptual 距離 vs BF16)+ CLIPScore(image-text 對齊)雙軸跑 6 prompt × 4 config × 3 seed = 72 sample。結論:NVFP4 跟 BF16 圖長得不一樣,但這個 N=72 sample 沒測到任何量化 config 的 prompt fidelity regression — 4 個 config CLIPScore 都在 ±std 0.04 內,差距比 noise 小一個數量級。]]></description>
            <category>Z-Image</category>
            <category>ComfyUI</category>
            <category>NVFP4</category>
            <category>FP8</category>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>image gen</category>
            <category>benchmark</category>
            <category>quantization</category>
            <category>LPIPS</category>
            <category>CLIPScore</category>
            <category>quality</category>
            <category>Z-Image Turbo</category>
        </item>
        <item>
            <title><![CDATA[[實戰] Z-Image Turbo 教戰守則:6 種配置怎麼選,1.37× 加速 + 44% 省 RAM]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-zimage-turbo-nvfp4-bench</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-zimage-turbo-nvfp4-bench</guid>
            <pubDate>Mon, 04 May 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[DGX Spark GB10 上 Z-Image Turbo 6 種量化組合(BF16 / FP8 cast 標準 / FP8 cast fast / FP8 scaled Kijai / NVFP4 / NVFP4+FP8 encoder)實測。N=10 隔離 GPU 測,NVFP4 5.50s warm 比 BF16 7.55s 快 1.37×,FP8 三條 path 全比 BF16 慢。模型工作集 RSS 從 BF16 20.6 GB 降到 NVFP4+FP8 11.5 GB(省 44%)。]]></description>
            <category>Z-Image</category>
            <category>ComfyUI</category>
            <category>NVFP4</category>
            <category>FP8</category>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>SM121</category>
            <category>image gen</category>
            <category>benchmark</category>
            <category>量化</category>
            <category>Z-Image Turbo</category>
        </item>
        <item>
            <title><![CDATA[[AI 速成 #5] AI 答案是不是亂編？三招 30 秒驗證]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/ai-ask-right-express-verify-ai-answer</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/ai-ask-right-express-verify-ai-answer</guid>
            <pubDate>Sun, 03 May 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[AI 一樣自信地給你對的答案跟編的答案，分不出來。三招 30 秒驗：具體事實 Google 一次、叫 AI 補連結點開看、換家問或開臨時聊天。]]></description>
            <category>AI</category>
            <category>ChatGPT</category>
            <category>Gemini</category>
            <category>Claude</category>
            <category>幻覺</category>
            <category>驗證</category>
            <category>AI 怎麼問</category>
        </item>
        <item>
            <title><![CDATA[[vLLM] DGX Spark 跑英文影片：Nemotron Omni 多模態實戰]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-nemotron-omni-multimodal-video</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-nemotron-omni-multimodal-video</guid>
            <pubDate>Fri, 01 May 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[同一台 DGX Spark，這次不拚速度，改拚「看完英文影片講給我聽」。3 分鐘 Karpathy 演講 89 秒處理完，5 萬 4 千 prompt token，逐字稿和畫面內容都對。記錄兩個踩過的雷：use_audio_in_video flag 放錯位置會幻覺音訊、b12x patch 過的 image 在 Omni 上會吐 NaN。]]></description>
            <category>Nemotron Omni</category>
            <category>multimodal</category>
            <category>vLLM</category>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>影片理解</category>
            <category>Parakeet</category>
            <category>音訊轉錄</category>
            <category>Nemotron 3 Nano Omni</category>
            <category>Nemotron 3 Nano Omni 30B-A3B</category>
        </item>
        <item>
            <title><![CDATA[[vLLM] DGX Spark 跑 Nemotron 3 Nano NVFP4：74.75 tok/s，比公開值快 11.5%]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-nemotron-3-nano-w4a16-74-toks</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-nemotron-3-nano-w4a16-74-toks</guid>
            <pubDate>Fri, 01 May 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[十天前我說 NVFP4 在 DGX Spark 上是個坑、FP8 比較快。今天同一台機器跑 Nemotron 3 Nano W4A16 飆到 74.75 tok/s，連我自己之前的 FP8 hack 紀錄一起踩過去。這篇講 4 層 patch、quant variant 怎麼選、跟記憶體頻寬天花板的算法。]]></description>
            <category>Nemotron 3</category>
            <category>NVFP4</category>
            <category>vLLM</category>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>SM121</category>
            <category>MoE</category>
            <category>W4A16</category>
            <category>b12x</category>
            <category>benchmark</category>
            <category>Nemotron 3 Nano</category>
            <category>Nemotron 3 Nano 30B-A3B</category>
        </item>
        <item>
            <title><![CDATA[[AI 速成 #3] ChatGPT、Claude、Gemini 30 秒選好你該用哪個]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/ai-ask-right-express-pick-ai-30s</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/ai-ask-right-express-pick-ai-30s</guid>
            <pubDate>Fri, 01 May 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[三個主流 AI 各自有強項，選錯就是用錯工具。一句話分辨：第一次接觸選 ChatGPT、要寫長文選 Claude、用 Google 服務多選 Gemini。文末有對照表跟快速決策流程。]]></description>
            <category>AI</category>
            <category>ChatGPT</category>
            <category>Claude</category>
            <category>Gemini</category>
            <category>入門</category>
            <category>AI 怎麼問</category>
        </item>
        <item>
            <title><![CDATA[Vercel Edge Requests 1M/1M 爆了，原因是一行 cache header]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/vercel-edge-requests-must-revalidate-trap</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/vercel-edge-requests-must-revalidate-trap</guid>
            <pubDate>Thu, 30 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[ai-muninn 這個月 Vercel Edge Requests 用滿 1M/1M，免費額度被擋。原因不是流量，不是 bot，是 Next.js 預設讓 /public/* 回 must-revalidate，連 cache HIT 都算 edge request。修法只有 3 行 config，但本月扣掉的配額拿不回來。]]></description>
            <category>Vercel</category>
            <category>Next.js</category>
            <category>Performance</category>
            <category>Cache-Control</category>
            <category>Edge Network</category>
            <category>建站</category>
            <category>踩坑</category>
            <category>AEO</category>
        </item>
        <item>
            <title><![CDATA[[AI 速成 #2] 跟 AI 講話的 3 個開場白，答案直接更貼需求]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/ai-ask-right-express-3-openers</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/ai-ask-right-express-3-openers</guid>
            <pubDate>Wed, 29 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[AI 第一句問得不好，後面追多少都是補洞。三個開場白：角色扮演、講清情境、講最終目標——任選一個用，AI 回答品質會明顯差很多。文末有 copy-paste prompt 範本。]]></description>
            <category>AI</category>
            <category>ChatGPT</category>
            <category>Prompt</category>
            <category>入門</category>
            <category>AI 怎麼問</category>
        </item>
        <item>
            <title><![CDATA[[llm-compressor] 自量化 abliterated 35B FP8 on DGX Spark：4 次 OOM、3 個 prefix bug、最終 51 tok/s]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-abliterated-fp8-uma-quantization</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-abliterated-fp8-uma-quantization</guid>
            <pubDate>Tue, 28 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[把 huihui-ai 的 Qwen3.6-35B-A3B abliterated BF16 量化成 FP8，部署到 DGX Spark GB10。從 4 次 OOM 到 1.68× over BF16 的完整旅程：UMA 物理上限、save_pretrained 的 50GB shard 陷阱、語言模型 prefix bug、MTP speculative decoding，以及為什麼第一個成功的版本根本沒做 FP8 cast。]]></description>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>SM121</category>
            <category>llm-compressor</category>
            <category>FP8</category>
            <category>FP8_DYNAMIC</category>
            <category>abliteration</category>
            <category>Qwen 3.6</category>
            <category>MoE</category>
            <category>UMA</category>
            <category>OOM</category>
            <category>MTP</category>
            <category>speculative-decoding</category>
            <category>quantization</category>
            <category>Qwen 3.6 35B-A3B</category>
        </item>
        <item>
            <title><![CDATA[[SWE-bench] Qwen 3.6 35B 檢討考卷:155 題答錯,76% 是「找對檔案、改錯邏輯」]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/swe-bench-qwen36-failure-modes</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/swe-bench-qwen36-failure-modes</guid>
            <pubDate>Mon, 27 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Qwen 3.6 35B-A3B 在 SWE-bench Lite 拿 48.33%(145/300),貼近 SWE-agent + Claude 3.7 Sonnet。但剩下的 155 題告訴你模型還差什麼:76% 是「找對檔案、改錯邏輯」。Gemma 4 26B 同一套 scaffold 拿 38.67% — 9.66% 落差大概率來自不同失敗類型的比例不同。]]></description>
            <category>SWE-bench</category>
            <category>Qwen 3.6</category>
            <category>Gemma 4</category>
            <category>failure analysis</category>
            <category>open-source models</category>
            <category>scaffold</category>
            <category>DGX Spark</category>
            <category>wrong_logic</category>
            <category>Qwen 3.6 35B-A3B</category>
        </item>
        <item>
            <title><![CDATA[[AI 速成 #4] 不知道用 AI 做什麼？問自己這 5 件事]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/ai-ask-right-express-find-needs</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/ai-ask-right-express-find-needs</guid>
            <pubDate>Mon, 27 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[打開 ChatGPT 不知道從哪開始？需求不是天生就知道，是被找出來的。從每週重複的事、最常 Google 的問題、一直拖的事、看不懂的東西、卡住的下一步，五個角度幫你挖出 AI 真正能幫你的場景。]]></description>
            <category>AI</category>
            <category>ChatGPT</category>
            <category>入門</category>
            <category>AI 怎麼問</category>
            <category>找需求</category>
            <category>工作流</category>
        </item>
        <item>
            <title><![CDATA[[AI 速成 #1] 三個問題，讓 ChatGPT 給你完美解答]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/ai-ask-right-express-3-questions</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/ai-ask-right-express-3-questions</guid>
            <pubDate>Mon, 27 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[ChatGPT 第一次回答不夠好不要放棄。再追三句話：「澄清問題」、「補充情境」、「指定格式」——80% 場景用這個套路就解決。文末有可以直接抄的 prompt。]]></description>
            <category>AI</category>
            <category>ChatGPT</category>
            <category>Prompt</category>
            <category>入門</category>
            <category>AI 怎麼問</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] Qwen 3.6 35B 做了 abliteration 之後：繁中總分掉 1.85 分，信託實務掉 7.7 分]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/tmmluplus-qwen-abliterated-cost</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/tmmluplus-qwen-abliterated-cost</guid>
            <pubDate>Sun, 26 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[把 huihui-ai 的 abliterated Qwen 3.6 35B 丟進 Part 21 同一套 TMMLU+ 測下去。總分從 75.07% 掉到 73.22%。代價分布不平均：規範性題目（信託 −7.7、行政法 −7.1）失血最重，純邏輯反而略好。台語也變更差——abliteration 解不了資料缺乏。]]></description>
            <category>TMMLU+</category>
            <category>abliteration</category>
            <category>繁體中文</category>
            <category>Qwen 3.6</category>
            <category>uncensored</category>
            <category>huihui-ai</category>
            <category>DGX Spark</category>
            <category>vLLM</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] 繁中 LLM 實測：Qwen 3.6 35B 在 TMMLU+ 51 個子科目全勝 Gemma 4 26B]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/tmmluplus-qwen-vs-gemma-traditional-chinese</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/tmmluplus-qwen-vs-gemma-traditional-chinese</guid>
            <pubDate>Sat, 25 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[同一台 DGX Spark、同一套 harness、同樣 22,690 題。Qwen 3.6 35B-A3B 拿到 75.07%，Gemma 4 26B-A4B 拿到 46.30%。Qwen 在 51 個子科目上一個都沒輸——連我原本以為 Gemma 會贏的台灣題目都沒贏。]]></description>
            <category>TMMLU+</category>
            <category>繁體中文</category>
            <category>Qwen 3.6</category>
            <category>Gemma 4</category>
            <category>benchmark</category>
            <category>DGX Spark</category>
            <category>vLLM</category>
            <category>lm-evaluation-harness</category>
            <category>台灣</category>
        </item>
        <item>
            <title><![CDATA[[實作] 用 Triton 讓 NVFP4 在 GB10 上快 17%：FP8 Tensor Core 繞路攻略]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-nvfp4-fp8-triton-patch</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-nvfp4-fp8-triton-patch</guid>
            <pubDate>Wed, 22 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Part 19 證明 NVFP4 在 DGX Spark 上是陷阱。這篇直接動手：寫 Triton kernel 把 NVFP4 轉成 FP8，餵 FP8 tensor core。從 40.8 提升到 47.6 tok/s，附完整程式碼。]]></description>
            <category>NVFP4</category>
            <category>FP8</category>
            <category>Triton</category>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>SM121</category>
            <category>vLLM</category>
            <category>Qwen 3.6</category>
            <category>Qwen 3.6 35B-A3B</category>
            <category>kernel</category>
            <category>量化</category>
            <category>tensor core</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] NVFP4 在 GB10 上是陷阱：FP8 快 32%（vLLM + SGLang 雙引擎實測）]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-nvfp4-trap-gb10-fp8-wins</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-nvfp4-trap-gb10-fp8-wins</guid>
            <pubDate>Tue, 21 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[NVFP4 理論上更快——位元更少、頻寬更省。但在 DGX Spark 的 GB10 (SM121) 上反而慢 32%。根因：缺硬體指令。vLLM 和 SGLang 雙引擎驗證。]]></description>
            <category>NVFP4</category>
            <category>FP8</category>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>SM121</category>
            <category>vLLM</category>
            <category>SGLang</category>
            <category>Qwen 3.6</category>
            <category>Qwen 3.6 35B-A3B</category>
            <category>benchmark</category>
            <category>量化</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] 同 Scaffold、三個模型：SWE-bench Lite 16% → 38% → 48%]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/swe-bench-scaffold-transfers-three-models</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/swe-bench-scaffold-transfers-three-models</guid>
            <pubDate>Mon, 20 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[一套 scaffold（backticks + edit-tool + budget prompt），三個模型（Gemma 4 E4B、Gemma 4 26B、Qwen 3.6 35B），跑之間零程式碼改動。Qwen 3.6 拿到 48.33%——超越 SWE-agent + Claude 3.7 Sonnet。Scaffold 是固定成本，模型是變數。]]></description>
            <category>SWE-bench</category>
            <category>Gemma 4</category>
            <category>Qwen 3.6</category>
            <category>scaffold</category>
            <category>mini-swe-agent</category>
            <category>vLLM</category>
            <category>DGX Spark</category>
            <category>benchmark</category>
            <category>開源模型</category>
            <category>Gemma 4 26B-A4B</category>
            <category>Qwen 3.6 35B-A3B</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] 26B 地端模型在 SWE-bench Lite 拿到 38.67% — 差 Claude 3.5 Sonnet 系統 0.33%]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/swe-bench-lite-gemma4-26b-38-percent</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/swe-bench-lite-gemma4-26b-38-percent</guid>
            <pubDate>Fri, 17 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Gemma 4 26B-A4B FP8 在 SWE-bench Lite 解了 116/300 題，全球排名 #16。跑在 DGX Spark 上，零 API 費。差距在 scaffold 設計，不是模型大小。]]></description>
            <category>SWE-bench</category>
            <category>Gemma 4</category>
            <category>mini-swe-agent</category>
            <category>vLLM</category>
            <category>DGX Spark</category>
            <category>benchmark</category>
            <category>開源模型</category>
            <category>scaffold</category>
            <category>edit-tool</category>
            <category>Gemma 4 26B-A4B</category>
        </item>
        <item>
            <title><![CDATA[[LLM 101 #6] 為什麼要在自己電腦跑 AI？不是更便宜的 ChatGPT，是完全不同的工具]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/llm-101-why-run-ai-locally</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/llm-101-why-run-ai-locally</guid>
            <pubDate>Fri, 17 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[本地 AI 不是便宜版 ChatGPT。它是知識萃取器、私有程式碼助手、離線工具。月電費 NT$41 vs ChatGPT Plus NT$640 — 但便宜不等於好用。這篇教你什麼時候該用哪一種。]]></description>
            <category>LLM</category>
            <category>本地 AI</category>
            <category>Ollama</category>
            <category>入門</category>
            <category>隱私</category>
            <category>成本</category>
        </item>
        <item>
            <title><![CDATA[[AI 怎麼問 #7] AI 做不好哪些事？2026 年用 ChatGPT / Claude 前必須知道的四個地雷]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/ai-ask-right-what-ai-does-poorly</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/ai-ask-right-what-ai-does-poorly</guid>
            <pubDate>Thu, 16 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[AI 很強，但在 2026 年還是有四個地方會踩雷：幻覺、資料過時、記性不好、隱私外洩。寫這篇文章時我自己就被 Gemini 幻覺擺了兩次。]]></description>
            <category>AI</category>
            <category>幻覺</category>
            <category>ChatGPT</category>
            <category>Claude</category>
            <category>隱私</category>
            <category>入門</category>
        </item>
        <item>
            <title><![CDATA[[AI Agent] Gemma 4 26B 跑通 SWE-bench Lite 單題：兩天 28 次 run，2 次真的算數]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-gemma4-swe-bench-scaffold-engineering</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-gemma4-swe-bench-scaffold-engineering</guid>
            <pubDate>Wed, 15 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[在 GX10 用 mini-swe-agent + vLLM 跑 SWE-bench Lite 單題，從假成功的 doc 一路修到 Gemma 4 38 步乾淨 submit 正確 patch 的 scaffold engineering 紀錄。]]></description>
            <category>SWE-bench</category>
            <category>mini-swe-agent</category>
            <category>Gemma 4</category>
            <category>vLLM</category>
            <category>agent scaffold</category>
            <category>GX10</category>
            <category>Gemma 4 26B-A4B</category>
        </item>
        <item>
            <title><![CDATA[[LLM 深水區] 量化演算法在做什麼？從 Q4_K_M 到 TurboQuant 的三層拆解]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/llm-deep-dive-quantization-algorithms</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/llm-deep-dive-quantization-algorithms</guid>
            <pubDate>Wed, 15 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Q4_K_M 用 4 bit 怎麼裝得下 14B 模型？答案不是「切掉 75%」，而是 K-quant 的 super-block 分組、TurboQuant 的隨機旋轉、跟 QJL 的 1-bit sign sketch 三層演算法。一篇講清楚機制，但不推公式。]]></description>
            <category>LLM</category>
            <category>量化</category>
            <category>Quantization</category>
            <category>K-quant</category>
            <category>TurboQuant</category>
            <category>PolarQuant</category>
            <category>QJL</category>
            <category>演算法</category>
        </item>
        <item>
            <title><![CDATA[[AI 怎麼問 #6] 追問的藝術 — 第一個答案太淺怎麼辦]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/ai-ask-right-follow-up-questions</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/ai-ask-right-follow-up-questions</guid>
            <pubDate>Tue, 14 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[AI 給你的第一個答案只是草稿。學會五種追問技巧 — 加限制條件、要比較、讓 AI 反問你 — 同一個問題的答案品質天差地遠。]]></description>
            <category>AI</category>
            <category>對話技巧</category>
            <category>追問</category>
            <category>入門</category>
            <category>工作效率</category>
        </item>
        <item>
            <title><![CDATA[[LLM 101 #5] Context Window — AI 一次能讀多少字？]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/llm-101-context-window</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/llm-101-context-window</guid>
            <pubDate>Tue, 14 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[AI 聊到一半就忘記你說過的話？不是它壞了，是它的書桌滿了。這篇解釋什麼是 context window、為什麼對話太長會出問題、怎麼避開這個限制。]]></description>
            <category>LLM</category>
            <category>Context Window</category>
            <category>入門</category>
            <category>科普</category>
            <category>Token</category>
            <category>AI 記憶</category>
        </item>
        <item>
            <title><![CDATA[[AI Agent] Gemma 4 從 40 次失敗到 9 步修好 Bug — 只換了一個東西]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/swe-bench-local-models-framework-matters</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/swe-bench-local-models-framework-matters</guid>
            <pubDate>Mon, 13 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[可行性測試：開源模型能免費在本地跑 SWE-Bench 嗎？Gemma 4 26B 在 OpenHands 上失敗（40+ 錯誤），但在 SWE-agent 上 9 步修好測試 bug。同一個模型，差別在 action 格式。]]></description>
            <category>SWE-Bench</category>
            <category>Gemma 4</category>
            <category>Qwen 3.5</category>
            <category>OpenHands</category>
            <category>SWE-agent</category>
            <category>vLLM</category>
            <category>DGX Spark</category>
            <category>Tool Calling</category>
            <category>AI Agent</category>
            <category>Gemma 4 26B-A4B</category>
            <category>Qwen 3.5 35B</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] Gemma 4 全家桶 on DGX Spark — 哪個版本適合你？]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-gemma4-complete-guide</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-gemma4-complete-guide</guid>
            <pubDate>Mon, 13 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Gemma 4 E2B / E4B / 26B MoE / 31B Dense 在 DGX Spark、RTX 5090、MacBook Pro 上的完整對照表。一張表看完速度、記憶體、量化格式。附選擇建議。]]></description>
            <category>Gemma 4</category>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>benchmark</category>
            <category>MoE</category>
            <category>NVFP4</category>
            <category>vLLM</category>
            <category>Ollama</category>
            <category>DGX Spark 值得買嗎</category>
            <category>DGX Spark vs RTX 5090</category>
            <category>DGX Spark 最佳模型 2026</category>
        </item>
        <item>
            <title><![CDATA[Claude Code Token 燒太快？8 招讓你的 Session 撐 10 倍久]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dev-workflow-token-burn-rate</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dev-workflow-token-burn-rate</guid>
            <pubDate>Mon, 13 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[剛開始用 Claude Code，context window 一直滿。這篇解釋 token 花去哪、哪些浪費了、怎麼讓 Claude 更精準地找資料而不是暴力讀檔。]]></description>
            <category>Claude Code</category>
            <category>tokens</category>
            <category>context window</category>
            <category>新手</category>
            <category>tips</category>
            <category>MCP</category>
            <category>CLAUDE.md</category>
            <category>QMD</category>
            <category>knowledge graph</category>
            <category>musubi</category>
            <category>AI 省 token</category>
            <category>save tokens</category>
        </item>
        <item>
            <title><![CDATA[[AI 怎麼問 #5] 在你動手做之前，先問：這東西已經有人做了嗎？]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/ai-ask-right-does-it-exist</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/ai-ask-right-does-it-exist</guid>
            <pubDate>Mon, 13 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[你問 AI 的第一個問題不該是「幫我做 X」，而是「有沒有已經能做 X 的工具？」這篇教你怎麼用 AI 當研究助手 — 找工具、比較方案、確認它還活著。]]></description>
            <category>AI</category>
            <category>工具推薦</category>
            <category>工作效率</category>
            <category>入門</category>
            <category>研究</category>
        </item>
        <item>
            <title><![CDATA[[Claude Code] 讓 Claude 自己幫你瘦身 — 打造 /slim 設定檔健檢 Skill]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/claude-code-slim-self-audit-skill</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/claude-code-slim-self-audit-skill</guid>
            <pubDate>Mon, 13 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[CLAUDE.md 和 MEMORY.md 會默默長大，直到每個 turn 吃掉 10K+ tokens。我做了一個 /slim skill 讓 Claude 自己診斷和修復膨脹 — 這是完整做法。]]></description>
            <category>Claude Code</category>
            <category>tokens</category>
            <category>context window</category>
            <category>skills</category>
            <category>CLAUDE.md</category>
            <category>MEMORY.md</category>
            <category>設定優化</category>
            <category>自我診斷</category>
            <category>QMD</category>
            <category>AI Workflow</category>
        </item>
        <item>
            <title><![CDATA[[DGX Spark] 從開箱到跑起來：完整部署指南]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-deployment-guide</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-deployment-guide</guid>
            <pubDate>Mon, 13 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[從密封箱到跑出第一個 LLM 的所有步驟。硬體檢查、Ollama 快速上手、vLLM 正式部署、模型選擇、5 個會浪費你整天的坑。]]></description>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>GX10</category>
            <category>vLLM</category>
            <category>Ollama</category>
            <category>deployment</category>
            <category>Blackwell</category>
            <category>SM121</category>
            <category>DGX Spark 值得買嗎</category>
            <category>DGX Spark 設定 2026</category>
            <category>DGX Spark vs RTX 5090</category>
            <category>Gemma 4</category>
            <category>Gemma 4 26B-A4B</category>
        </item>
        <item>
            <title><![CDATA[[AI 怎麼問 #4] 為什麼你覺得 AI 沒用？答案機器 vs 協作工具]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/ai-ask-right-why-ai-feels-useless</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/ai-ask-right-why-ai-feels-useless</guid>
            <pubDate>Sat, 11 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[同一個 AI，同樣的問題，結果卻完全不同。覺得 ChatGPT 改變人生的人和覺得它沒用的人，其實在做兩件完全不同的事 — 差別只在一個心態轉換。]]></description>
            <category>AI</category>
            <category>ChatGPT</category>
            <category>提問技巧</category>
            <category>入門</category>
            <category>工作流程</category>
            <category>心態</category>
        </item>
        <item>
            <title><![CDATA[[LLM 101 #4] 什麼是量化？Q4、Q8、FP16 到底差在哪]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/llm-101-what-is-quantization</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/llm-101-what-is-quantization</guid>
            <pubDate>Fri, 10 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Q4_K_M、Q8_0、FP16 — 同一個模型有十幾種版本，名字看起來像亂碼。這篇告訴你量化到底在做什麼、為什麼不會把模型搞壞、以及你該下載哪一個版本。]]></description>
            <category>LLM</category>
            <category>量化</category>
            <category>Ollama</category>
            <category>入門</category>
            <category>科普</category>
            <category>Q4_K_M</category>
            <category>GGUF</category>
        </item>
        <item>
            <title><![CDATA[[AI 怎麼問 #3] 你不知道自己需要什麼 — 讓 AI 幫你挖出來]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/ai-ask-right-find-your-needs</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/ai-ask-right-find-your-needs</guid>
            <pubDate>Fri, 10 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[大部分人不是不會用 AI，是不知道自己工作裡哪些事可以交給 AI。這篇教你用一個簡單的方法，讓 AI 幫你找出每天重複做卻沒意識到的事情。]]></description>
            <category>AI</category>
            <category>工作效率</category>
            <category>入門</category>
            <category>工作流程</category>
        </item>
        <item>
            <title><![CDATA[[LLM 101 #3] 那麼多模型，到底該下載哪一個？]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/llm-101-how-to-choose-a-model</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/llm-101-how-to-choose-a-model</guid>
            <pubDate>Fri, 10 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Gemma、Llama、Qwen、Mistral — 模型清單看得眼花撩亂。這篇用買車的邏輯教你怎麼從大小、速度、品質三個維度選到適合你的 AI 模型。]]></description>
            <category>LLM</category>
            <category>模型選擇</category>
            <category>Ollama</category>
            <category>入門</category>
            <category>科普</category>
            <category>Gemma</category>
            <category>Llama</category>
            <category>Qwen</category>
        </item>
        <item>
            <title><![CDATA[[AI 怎麼問 #2] 打開 AI 之後，你的第一句話該怎麼說？]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/ai-ask-right-first-message</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/ai-ask-right-first-message</guid>
            <pubDate>Thu, 09 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[AI 不是 Google，你不是在搜尋，你在對話。這篇教你打開 ChatGPT 之後該怎麼開口、五個立刻能試的任務、和回答不滿意時怎麼調整。]]></description>
            <category>AI</category>
            <category>ChatGPT</category>
            <category>入門</category>
            <category>對話技巧</category>
        </item>
        <item>
            <title><![CDATA[[AI 怎麼問 #1] 2026 年，你可以用的 AI 有哪些？]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/ai-ask-right-which-ai-to-use-2026</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/ai-ask-right-which-ai-to-use-2026</guid>
            <pubDate>Thu, 09 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[ChatGPT、Claude、Gemini — 三個你現在就能用的 AI 助手。這篇用最白話的方式介紹它們各自的強項、價錢、和怎麼開始，幫你選到適合自己的那一個。]]></description>
            <category>AI</category>
            <category>ChatGPT</category>
            <category>Claude</category>
            <category>Gemini</category>
            <category>入門</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] 拯救 Gemma 4 31B：在 32GB MacBook Pro 上從 1.5 加速到 12.8 tok/s]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-gemma4-31b-rescue-mbp-32gb</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-gemma4-31b-rescue-mbp-32gb</guid>
            <pubDate>Wed, 08 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Gemma 4 31B 在 MBP M1 Max 上用 Ollama 只有 1.5 tok/s（swap）。解法：降 context window（9 tok/s）或用 oMLX（12.8 tok/s）。真正的兇手是 KV cache 分配，不是模型大小。]]></description>
            <category>Gemma 4</category>
            <category>31B</category>
            <category>M1 Max</category>
            <category>Ollama</category>
            <category>oMLX</category>
            <category>swap</category>
            <category>KV cache</category>
            <category>TurboQuant</category>
            <category>Apple Silicon</category>
            <category>memory management</category>
            <category>Gemma 4 31B</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] 4 台機器、4 個模型、1 個答案：記憶體決定一切]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-gemma4-4-machines-4-models-bandwidth</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-gemma4-4-machines-4-models-bandwidth</guid>
            <pubDate>Wed, 08 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Gemma 4 E2B 到 31B 在 RTX 5090、M1 Max、DGX Spark、M4 上用 Ollama 完整測試。E2B 在 5090 上 310 tok/s。31B 在 MBP 上 1.5 tok/s — swap 殺死一切。記憶體容量 > 頻寬速度。]]></description>
            <category>Gemma 4</category>
            <category>RTX 5090</category>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>M1 Max</category>
            <category>M4</category>
            <category>Ollama</category>
            <category>benchmark</category>
            <category>memory bandwidth</category>
            <category>swap</category>
            <category>E2B</category>
            <category>E4B</category>
            <category>26B</category>
            <category>31B</category>
        </item>
        <item>
            <title><![CDATA[[LLM 101 #2] Dense、MoE、PLE、SSM — 四種 AI 模型架構，一次搞懂]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/llm-101-dense-moe-ple-ssm-architectures</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/llm-101-dense-moe-ple-ssm-architectures</guid>
            <pubDate>Wed, 08 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Dense 是全員出動，MoE 是專家輪班，PLE 是每層樓有自己的櫃台，SSM 是速讀高手。用零技術門檻解釋四種主流 AI 模型架構的差別，幫你看懂規格表。]]></description>
            <category>Dense</category>
            <category>MoE</category>
            <category>PLE</category>
            <category>SSM</category>
            <category>Mamba</category>
            <category>LLM</category>
            <category>模型架構</category>
            <category>入門</category>
            <category>科普</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] Gemma 4 E2B vs E4B：三台機器實測，記憶體頻寬決定一切]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-gemma4-e2b-vs-e4b-ollama-3-machines</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-gemma4-e2b-vs-e4b-ollama-3-machines</guid>
            <pubDate>Tue, 07 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Gemma 4 E2B 在 M1 Max 跑到 81 tok/s，比 E4B 快 44-82%。三台機器、相同方法論、每輪獨立 prompt，排除 Ollama 快取干擾後的真實數據。]]></description>
            <category>Gemma 4</category>
            <category>E2B</category>
            <category>E4B</category>
            <category>Ollama</category>
            <category>benchmark</category>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>M1 Max</category>
            <category>M4</category>
            <category>Apple Silicon</category>
            <category>記憶體頻寬</category>
            <category>Gemma 4 E2B</category>
            <category>Gemma 4 E4B</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] 從 19 到 50 tok/s：我們搶先做了全球首個 Gemma 4 E4B NVFP4 量化]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-gemma4-e4b-nvfp4-50-toks</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-gemma4-e4b-nvfp4-50-toks</guid>
            <pubDate>Tue, 07 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Gemma 4 E4B NVFP4A16 在 DGX Spark 上跑 49.9 tok/s — 比 BF16 快 2.6 倍。HuggingFace 上第一個 NVFP4 checkpoint。PLE 架構解析、FP8 vs NVFP4、以及差點讓我們放棄的 llm-compressor 版本地獄。]]></description>
            <category>Gemma 4</category>
            <category>E4B</category>
            <category>NVFP4</category>
            <category>FP8</category>
            <category>vLLM</category>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>quantization</category>
            <category>llm-compressor</category>
            <category>PLE</category>
            <category>HuggingFace</category>
            <category>Gemma 4 E4B</category>
        </item>
        <item>
            <title><![CDATA[[LLM 101 #1] Ollama vs vLLM：在自己電腦跑 AI 的兩條路]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/llm-101-ollama-vs-vllm</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/llm-101-ollama-vs-vllm</guid>
            <pubDate>Tue, 07 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Ollama 像微波爐，vLLM 像專業烤箱。兩個都能在你的電腦上跑 AI 模型，但適合的場景完全不同。這篇用零技術門檻的方式解釋差別、優缺點、和怎麼選。]]></description>
            <category>Ollama</category>
            <category>vLLM</category>
            <category>LLM</category>
            <category>本地部署</category>
            <category>入門</category>
            <category>科普</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] Gemma 4 31B Dense 跑在 DGX Spark：7 tok/s 和頻寬之牆]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-gemma4-31b-dense-7-toks</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-gemma4-31b-dense-7-toks</guid>
            <pubDate>Sun, 05 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Gemma 4 31B-IT NVFP4 在 GB10 上只有 7.0 tok/s — 273 GB/s 頻寬是天花板。算術預測 4.4 tok/s，NVFP4 壓縮多了 60% 但逃不出牆。請選 MoE。]]></description>
            <category>Gemma 4</category>
            <category>NVFP4</category>
            <category>vLLM</category>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>SM121</category>
            <category>dense</category>
            <category>benchmark</category>
            <category>bandwidth</category>
            <category>Gemma 4 31B</category>
            <category>Gemma 4 31B-IT</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] 同模型 vLLM vs Ollama：為什麼 GB10 上差 30%]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-vllm-vs-ollama-same-model</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-vllm-vs-ollama-same-model</guid>
            <pubDate>Sun, 05 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[同一個 Gemma 4 26B-A4B、同一張 GPU，vLLM NVFP4 跑 52 tok/s，Ollama Q4_K_M 只有 40。根因：Marlin kernel、CUDA graphs，以及 Ollama 靜默的 CPU/GPU split 陷阱。]]></description>
            <category>vLLM</category>
            <category>Ollama</category>
            <category>benchmark</category>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>Gemma 4</category>
            <category>NVFP4</category>
            <category>inference</category>
            <category>Gemma 4 26B-A4B</category>
        </item>
        <item>
            <title><![CDATA[[vLLM] Gemma 4 26B-A4B NVFP4 跑在 DGX Spark：52 tok/s，模型只佔 16 GB]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-gemma4-26b-nvfp4-52-toks</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-gemma4-26b-nvfp4-52-toks</guid>
            <pubDate>Sun, 05 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[在 GB10 上用 vLLM 0.19 部署 Gemma 4 26B-A4B MoE NVFP4 — 52 tok/s decode、16.5 GB 模型、82 GB KV cache 可用。包含 Phase 0 決策過程和完整踩坑記錄。]]></description>
            <category>Gemma 4</category>
            <category>NVFP4</category>
            <category>vLLM</category>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>SM121</category>
            <category>MoE</category>
            <category>benchmark</category>
            <category>Gemma 4 26B-A4B</category>
        </item>
        <item>
            <title><![CDATA[[DGX Spark] 過熱、100W 功耗上限、30W 安全模式 — 完整診斷指南]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-30w-power-safety-mode</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-30w-power-safety-mode</guid>
            <pubDate>Thu, 02 Apr 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[DGX Spark 的供電和過熱問題在 Carmack 批評後引爆社群。這篇整理三種不同症狀的診斷方法：30W PD controller 缺陷（需 RMA）、100W 功耗上限（散熱降頻）、5W driver bug（可修）。一個指令 30 秒確認。]]></description>
            <category>GX10</category>
            <category>GB10</category>
            <category>DGX Spark</category>
            <category>power delivery</category>
            <category>vLLM</category>
            <category>hardware</category>
            <category>overheating</category>
            <category>100W</category>
            <category>Carmack</category>
            <category>Gemma 4</category>
            <category>Gemma 4 26B-A4B</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] TurboQuant 實測：KV Cache 3-bit 壓縮，真的零損失？]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/turboquant-kv-cache-benchmark-gx10</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/turboquant-kv-cache-benchmark-gx10</guid>
            <pubDate>Mon, 30 Mar 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Google TurboQuant 在 GX10 (GB10/SM121) 上的實測數據 — 3-bit KV cache 壓縮的真實壓縮率、Qwen2.5-3B 精度驗證、以及 Qwen3.5-35B 的 hybrid attention 架構為什麼讓事情變得複雜。]]></description>
            <category>TurboQuant</category>
            <category>KV Cache</category>
            <category>Quantization</category>
            <category>vLLM</category>
            <category>Benchmark</category>
            <category>Qwen3.5</category>
            <category>GX10</category>
            <category>SM121</category>
        </item>
        <item>
            <title><![CDATA[[AI Agent] openclaw + ChatGPT OAuth：不買 API 額度也能用 GPT-5.4]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/openclaw-chatgpt-oauth-gpt54-no-api-key</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/openclaw-chatgpt-oauth-gpt54-no-api-key</guid>
            <pubDate>Tue, 24 Mar 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[openclaw 2026.3.13 加入了 OpenAI OAuth 登入。一行指令讓你的 agent 用 ChatGPT Plus 訂閱取得 GPT-5.4 的 100 萬 token context，不需要另外買 API credits。]]></description>
            <category>openclaw</category>
            <category>GPT-5.4</category>
            <category>ChatGPT</category>
            <category>OAuth</category>
            <category>AI agent</category>
        </item>
        <item>
            <title><![CDATA[[AI Agent] NemoClaw 不靠雲端：把 Nemotron 換成本地 Ollama 模型]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/nemoclaw-local-inference-ollama</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/nemoclaw-local-inference-ollama</guid>
            <pubDate>Tue, 24 Mar 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[怎麼把 NemoClaw 的推理後端指向本地 Ollama 或 vLLM endpoint。Config 位置、模型替換，以及雲端消失後 OpenShell 仍然在做什麼。]]></description>
            <category>NemoClaw</category>
            <category>OpenClaw</category>
            <category>OpenShell</category>
            <category>Ollama</category>
            <category>vLLM</category>
            <category>AI Agent</category>
            <category>NVIDIA</category>
            <category>GX10</category>
            <category>Local Inference</category>
        </item>
        <item>
            <title><![CDATA[NemoClaw 安裝踩坑：官方文件沒寫的 4 個必修修正]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/nemoclaw-install-gx10-from-scratch</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/nemoclaw-install-gx10-from-scratch</guid>
            <pubDate>Mon, 23 Mar 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[NemoClaw 在 DGX Spark 上直接裝會失敗。這篇整理了 4 個官方文件沒提的修正（Node 升級、npm link、OpenShell tar.gz、cgroupns），30 分鐘跑起第一個 AI Agent。]]></description>
            <category>NemoClaw</category>
            <category>OpenClaw</category>
            <category>OpenShell</category>
            <category>AI Agent</category>
            <category>NVIDIA</category>
            <category>DGX Spark</category>
            <category>GX10</category>
            <category>GB10</category>
        </item>
        <item>
            <title><![CDATA[NemoClaw 是什麼？NVIDIA 一鍵 AI Agent 框架完整解析]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/nemoclaw-what-it-is-why-it-exists</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/nemoclaw-what-it-is-why-it-exists</guid>
            <pubDate>Mon, 23 Mar 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[NemoClaw = OpenClaw + OpenShell + NVIDIA Agent Toolkit 三合一。這篇講清楚它解決什麼問題、架構怎麼運作、值不值得在 DGX Spark 上裝。]]></description>
            <category>NemoClaw</category>
            <category>OpenClaw</category>
            <category>OpenShell</category>
            <category>AI Agent</category>
            <category>NVIDIA</category>
            <category>DGX Spark</category>
            <category>GX10</category>
        </item>
        <item>
            <title><![CDATA[[AI Agent] openclaw 用 Telegram Bot API 9.5 sendMessageDraft 做即時串流]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/openclaw-telegram-sendmessagedraft-streaming</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/openclaw-telegram-sendmessagedraft-streaming</guid>
            <pubDate>Sat, 21 Mar 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[把 editMessageText 輪詢換成 sendMessageDraft，實現真正的動態串流輸出。patch 方式、thinking block 過濾、以及私訊裡的 optional chaining 坑。]]></description>
            <category>openclaw</category>
            <category>Telegram</category>
            <category>streaming</category>
            <category>Bot API</category>
            <category>GLM</category>
        </item>
        <item>
            <title><![CDATA[[AI Agent] openclaw 接上 131K Context：max_tokens 變負數的那一刻]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/openclaw-context-budget-negative-maxtokens</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/openclaw-context-budget-negative-maxtokens</guid>
            <pubDate>Sat, 21 Mar 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[openclaw 串接 gpt-oss-120B，第一條訊息就收到 400 max_tokens must be at least 1, got -1292。Context budget 的數學、config key 的坑、以及修法。]]></description>
            <category>openclaw</category>
            <category>context window</category>
            <category>vLLM</category>
            <category>gpt-oss</category>
            <category>configuration</category>
        </item>
        <item>
            <title><![CDATA[[vLLM] GB10 上的 FP8 KV Cache：為什麼輸出會在 500 Token 後崩成重複迴圈]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-fp8-kvcache-repetition</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-fp8-kvcache-repetition</guid>
            <pubDate>Sat, 21 Mar 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[vLLM serve script 加了 --kv-cache-dtype fp8，GB10 上輸出在約 500 token 後退化成重複字。根本原因：沒有 calibration data，q_scale 預設 1.0。]]></description>
            <category>vLLM</category>
            <category>FP8</category>
            <category>KV cache</category>
            <category>GB10</category>
            <category>DGX Spark</category>
            <category>quantization</category>
            <category>SM121</category>
            <category>Qwen 3.5</category>
            <category>Qwen 3.5 35B</category>
        </item>
        <item>
            <title><![CDATA[[Claude Code] claude-agent-sdk vs subprocess：中間 Turn 為什麼消失了]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/claude-code-agent-sdk-orchestrator</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/claude-code-agent-sdk-orchestrator</guid>
            <pubDate>Sat, 21 Mar 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[用 claude -p subprocess 建 multi-agent orchestrator，發現中間 turn 全被靜默丟棄。SDK 遷移、session resume、並行執行、以及 setting_sources 的影響。]]></description>
            <category>Claude Code</category>
            <category>claude-agent-sdk</category>
            <category>multi-agent</category>
            <category>orchestrator</category>
            <category>Python</category>
            <category>asyncio</category>
        </item>
        <item>
            <title><![CDATA[[AI Agent] openclaw：Bot 突然消失了 — Tailscale、IPv6、和一個 Node.js 的安靜陷阱]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/openclaw-telegram-ipv6-tailscale-silent-bot</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/openclaw-telegram-ipv6-tailscale-silent-bot</guid>
            <pubDate>Thu, 19 Mar 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[Bot process 跑著、token 有效、訊息有收到。但沒有任何回應。四個錯誤假設、一張路由表，還有一個大多數人不知道的 Node.js 行為。]]></description>
            <category>Node.js</category>
            <category>Tailscale</category>
            <category>IPv6</category>
            <category>undici</category>
            <category>Happy Eyeballs</category>
            <category>Telegram</category>
            <category>Debugging</category>
            <category>Networking</category>
        </item>
        <item>
            <title><![CDATA[[vLLM] 在 DGX Spark 上跑 120B 模型到 60 tok/s——零 API 成本、六個坑]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/part2-gpt-oss-120b-serve-script</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/part2-gpt-oss-120b-serve-script</guid>
            <pubDate>Thu, 19 Mar 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[怎麼讓 gpt-oss-120B 在 DGX Spark（GB10、SM121）上以 vLLM 跑到 60 tok/s。目標是讓 openclaw agent 用本地 120B 模型，零 API 費用。路上有六個坑，其中一個靜默失效的環境變數比其他五個加起來還難找。]]></description>
            <category>DGX Spark</category>
            <category>SM121</category>
            <category>vLLM</category>
            <category>gpt-oss</category>
            <category>MXFP4</category>
            <category>Blackwell</category>
            <category>LLM Serving</category>
        </item>
        <item>
            <title><![CDATA[[vLLM] Qwen3.5-122B 跑起來了。但只有 14 tok/s。]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/part2-qwen-122b-14-toks-gdn-kernel-gap</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/part2-qwen-122b-14-toks-gdn-kernel-gap</guid>
            <pubDate>Thu, 19 Mar 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[修完四個 SM121 NVFP4 bug 之後，Qwen3.5-122B 能跑、輸出正確。然後你看了速度：14 tok/s。沒有 flag 能修它。為什麼——以及在等什麼。]]></description>
            <category>DGX Spark</category>
            <category>SM121</category>
            <category>Qwen3.5-122B</category>
            <category>vLLM</category>
            <category>NVFP4</category>
            <category>Marlin</category>
            <category>GDN</category>
            <category>LLM Serving</category>
        </item>
        <item>
            <title><![CDATA[[AI Agent] openclaw：Agent 卡住的時候，叫 CLI 來幫]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/openclaw-callhelp-spawning-cli-from-agent-loop</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/openclaw-callhelp-spawning-cli-from-agent-loop</guid>
            <pubDate>Wed, 18 Mar 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[怎麼在本地 agent loop 裡掛上 callhelp tool，讓它在推理途中 spawn Codex CLI。一個必設的 permission flag，還有為什麼 Claude quota 是我自己的。]]></description>
            <category>AI Agent</category>
            <category>openclaw</category>
            <category>Codex</category>
            <category>LLM</category>
            <category>Agent Tools</category>
            <category>Local AI</category>
        </item>
        <item>
            <title><![CDATA[[vLLM] 為什麼你的 DGX Spark 只會輸出「!!!!!」：SM121 上的 NVFP4 除錯記錄]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/part1-why-your-dgx-spark-says-exclamation-marks</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/part1-why-your-dgx-spark-says-exclamation-marks</guid>
            <pubDate>Tue, 17 Mar 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[CUTLASS FP4 kernel 是針對 SM120（GB200）編譯的。在 SM121（GB10，DGX Spark）上它會靜默執行，但輸出垃圾。完整除錯過程——4 個 bug、row-identical 失敗特徵，以及有效的修正方案。]]></description>
            <category>DGX Spark</category>
            <category>SM121</category>
            <category>vLLM</category>
            <category>NVFP4</category>
            <category>MXFP4</category>
            <category>Blackwell</category>
            <category>CUDA</category>
            <category>LLM Serving</category>
        </item>
        <item>
            <title><![CDATA[[AI Agent] Codex-Executor 模式：讓 Agent Session 保持輕量]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/openclaw-codex-executor-agent-architecture</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/openclaw-codex-executor-agent-architecture</guid>
            <pubDate>Mon, 16 Mar 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[為什麼我們停止讓 OpenClaw agent 直接編排多步驟任務，改成派生 Codex subprocess。這個模式讓 agent context 保持輕量、任務執行更可靠。]]></description>
            <category>AI Agent</category>
            <category>Claude Code</category>
            <category>Codex</category>
            <category>Agent Architecture</category>
            <category>OpenClaw</category>
        </item>
        <item>
            <title><![CDATA[[vLLM] 單顆 GB10 跑 Nemotron-3-Super-120B：一天的除錯記錄]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-nemotron-120b-vllm</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-nemotron-120b-vllm</guid>
            <pubDate>Fri, 13 Mar 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[在 ASUS GX10（SM121，128GB）上跑 NVIDIA Nemotron-3-Super-120B-NVFP4。四個 SM121 專屬坑、一個沒有任何作用的環境變數，以及最終可用的 docker 指令。]]></description>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>SM121</category>
            <category>Nemotron</category>
            <category>vLLM</category>
            <category>NVFP4</category>
            <category>Blackwell</category>
            <category>LLM Serving</category>
            <category>Nemotron 3 Super</category>
            <category>Nemotron 3 Super 120B</category>
        </item>
        <item>
            <title><![CDATA[[vLLM] Ollama 的 KEEP_ALIVE 在偷吃你的 vLLM 記憶體空間]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/openclaw-ollama-vllm-gpu-conflict</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/openclaw-ollama-vllm-gpu-conflict</guid>
            <pubDate>Sat, 07 Mar 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[128GB 統一記憶體的機器 vLLM 重啟時 OOM。原因：Ollama KEEP_ALIVE=2h 把 19-51GB 壓在 GPU 上。診斷指令、手動 unload 方式、以及為什麼要把 KEEP_ALIVE 改成 0。]]></description>
            <category>vLLM</category>
            <category>Ollama</category>
            <category>GPU Memory</category>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>LLM Serving</category>
        </item>
        <item>
            <title><![CDATA[[vLLM] SSM 模型不能加 --enable-chunked-prefill]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/openclaw-chunked-prefill-ssm-trap</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/openclaw-chunked-prefill-ssm-trap</guid>
            <pubDate>Fri, 06 Mar 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[把 --enable-chunked-prefill 加到 Qwen3.5-35B（SSM+MoE hybrid）上，吞吐量從 47 tok/s 掉到 5.7 tok/s。解釋為什麼 SSM 遞迴架構和 chunked prefill 根本不相容。]]></description>
            <category>vLLM</category>
            <category>SSM</category>
            <category>Qwen</category>
            <category>DGX Spark</category>
            <category>LLM Serving</category>
            <category>Performance</category>
        </item>
        <item>
            <title><![CDATA[[vLLM] Qwen3.5-35B 跑到 47 tok/s：從 Ollama 遷移到 vLLM]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-vllm-qwen35-setup</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-vllm-qwen35-setup</guid>
            <pubDate>Thu, 05 Mar 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[TTFT 從幾秒降到 0.12s。DGX Spark GB10 上 Qwen3.5-35B 從 Ollama 換到 vLLM 的實戰筆記，含六個坑：SSM + chunked prefill 陷阱、記憶體衝突、docker 重啟順序。]]></description>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>vLLM</category>
            <category>Ollama</category>
            <category>Qwen 3.5</category>
            <category>Docker</category>
            <category>Blackwell</category>
            <category>AI Agent</category>
            <category>Qwen 3.5 35B</category>
        </item>
        <item>
            <title><![CDATA[[AI Agent] 零 API 成本：用 DGX Spark + Mac Mini 跑 OpenClaw]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/openclaw-dgx-spark-local-ai-agent</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/openclaw-dgx-spark-local-ai-agent</guid>
            <pubDate>Thu, 05 Mar 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[完整的本地 AI Agent 架構：Mac Mini M4 當長駐 gateway，GX10 跑推理，Telegram 當介面。不需要訂閱，不需要雲端 API。六個部署心得。]]></description>
            <category>OpenClaw</category>
            <category>AI Agent</category>
            <category>DGX Spark</category>
            <category>Mac Mini</category>
            <category>Self-Hosted</category>
            <category>Ollama</category>
            <category>SearXNG</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] 純 MoE vs SSM Hybrid：Context Decay 與為什麼 Agent 要在乎]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/openclaw-moe-ssm-context-decay</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/openclaw-moe-ssm-context-decay</guid>
            <pubDate>Sun, 01 Mar 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[GLM-4.7-Flash 短 context 57.8 tok/s，但 8K 時掉到 42 tok/s。Qwen3.5-35B SSM hybrid：短 56 tok/s，8K 仍 56 tok/s。為什麼有長 system prompt 的 agent 應該在乎這個差距。]]></description>
            <category>Benchmark</category>
            <category>SSM</category>
            <category>MoE</category>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>LLM Serving</category>
            <category>AI Agents</category>
        </item>
        <item>
            <title><![CDATA[[Dev Workflow] 讓兩個 AI 吵架。它們不同意的地方才是重點。]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/claude-code-debate-system</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/claude-code-debate-system</guid>
            <pubDate>Thu, 26 Feb 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[一個 /debate 指令讓 Codex CLI 和 Gemini CLI 對同一份程式碼互相辯論。訓練資料不同、盲點不同——它們的分歧通常是最有用的輸出。]]></description>
            <category>Dev Workflow</category>
            <category>Claude Code</category>
            <category>Gemini</category>
            <category>Codex</category>
            <category>Multi-AI</category>
            <category>Code Review</category>
        </item>
        <item>
            <title><![CDATA[[Claude Code] 用 Claude Code 測 iOS App：context 用量砍 81%]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/claude-code-ios-testing-bpstracker</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/claude-code-ios-testing-bpstracker</guid>
            <pubDate>Thu, 26 Feb 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[把截圖導向的 iOS 測試改成 ui_describe_all 優先，BPS Tracker 測試的 context 用量從 81,290 KB 降到 15,215 KB。外加 Fastlane 整合：截圖、App Store 上傳全自動。]]></description>
            <category>Claude Code</category>
            <category>iOS</category>
            <category>Swift</category>
            <category>Testing</category>
            <category>Fastlane</category>
            <category>BPS Tracker</category>
        </item>
        <item>
            <title><![CDATA[[AI Agent] OpenClaw Config 熱重載：不需要重啟]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/openclaw-config-hot-reload</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/openclaw-config-hot-reload</guid>
            <pubDate>Wed, 25 Feb 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[花了好幾週每次改設定都重啟 gateway。後來才發現有 file watcher。哪些東西可以立即熱重載、哪些還是要重啟、還有怎麼區分 auth 失敗和短暫網路錯誤。]]></description>
            <category>AI Agent</category>
            <category>OpenClaw</category>
            <category>Configuration</category>
            <category>Developer Workflow</category>
        </item>
        <item>
            <title><![CDATA[[Claude Code] 我寫了 MANDATORY。AI 還是沒跑。]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/claude-code-mandatory-instructions</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/claude-code-mandatory-instructions</guid>
            <pubDate>Thu, 19 Feb 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[設定檔裡標了 MANDATORY 的規則，同一個 session 裡被跳過了兩次。這篇解釋三個架構原因為什麼強調沒用，以及三個真正有效的系統設計解法。]]></description>
            <category>Claude Code</category>
            <category>AI Agents</category>
            <category>Prompt Engineering</category>
            <category>Systems Design</category>
            <category>Developer Workflow</category>
        </item>
        <item>
            <title><![CDATA[[Benchmark] DGX Spark 跑 8 個模型：找出最適合 AI Agent 的組合]]></title>
            <link>https://ai-muninn.com/zh-TW/blog/dgx-spark-ollama-benchmark-8-models</link>
            <guid isPermaLink="false">https://ai-muninn.com/zh-TW/blog/dgx-spark-ollama-benchmark-8-models</guid>
            <pubDate>Thu, 19 Feb 2026 00:00:00 GMT</pubDate>
            <description><![CDATA[在 NVIDIA GB10（128GB 統一記憶體）上，用 7 個任務類別評測 8 個本地 LLM。量化的意外結論、一個連 JSON 都出錯的 120B 模型，以及把整個 token budget 用來思考的 thinking model。]]></description>
            <category>DGX Spark</category>
            <category>GB10</category>
            <category>Ollama</category>
            <category>Benchmark</category>
            <category>LLM</category>
            <category>AI Agent</category>
            <category>Blackwell</category>
        </item>
    </channel>
</rss>