[公告] 停更公告(8/8~8/21)

最近新模型如百花齊放,太棒了!但是因為blog主的膽囊也炸裂所以要休息一段時間才能再繼續分享。
哈嘍各位讀者,最近的開源大模型真的是太讓人興奮不已,又是完全版的deepseek v4 flash 、Qwen 3.8 ,MiniMax H3 有好多可以玩的東西,希望大家玩的愉快!
嗚嗚😭,我也好想和大家一起玩,不過因為個人膽囊結石發炎的關係,在醫院已經待了約一週了,雖然我很樂在其中,但是要一邊忍受痛苦一邊繼續研究。我只能說「臣妾做不到啊!」

(是做得到的的人才太變態了吧。 XD)
希望大家身體健康,也保持身體健康!
接著讀
- 2026-09-06[Benchmark] Qwen3.8-Flash-Next NVFP4 在 DGX Spark 跑 41.7 tok/s,比 llama.cpp 快 78%
NVIDIA 官方 NVFP4 checkpoint + vLLM nightly + 九個掛上去的 overlay 檔,一台 DGX Spark 上 40 題中位 41.7 tok/s、散文 27.4、程式 45,比同機 llama.cpp 席位快 78%。附完整參數與我估錯一次的紀錄。
- 2026-09-03[Benchmark] MiniMax-H3 在 RTX 5090 上的加速組態:換成 cu130 省 32%,注意力 kernel 只值 3%
同一張 5090、同樣 14 步、同樣品質設定,六個加速組態各值幾 %。原生 768p 的 15 秒片從 OOM 變成 8.6 分鐘。chunk 參數切越細越快、torch 換成 cu130 省 32%,而 SageAttention 跟 Sol-Attn 這兩個單看 kernel 快 4 倍的東西,端到端只值 2-3%。
- 2026-08-31[Dev Workflow] AI 味不在破折號,在結構:一篇論文教我怎麼檢查自己的文章
StoryScope 完全不看文風,只看敘事結構,93.2% macro-F1 就分得出人寫的與 AI 寫的。我拿它的五個問題掃自己已發布的文章,同一個教訓被抓到講了四次。
- 2026-08-31[Benchmark] MiniMax-H3 十個效果 embedding 實測:放在提示詞開頭會靜默失效
RTX 5090 一張卡跑完 MiniMax-H3 的十個效果 embedding。最大的坑是位置:放在提示詞開頭會靜默失效,畫面卻照樣會變,所以「產物不一樣」不能當生效證據。它們也不是關鍵字,是 50 到 142 個預先編好的向量。附十支實測影片與速查表。
不想錯過新文章?
訂閱我確保不漏接!
隨時一鍵退訂。