~/blog/kandinsky-6-pro-lip-sync-rtx-5090

[Benchmark] Kandinsky 6.0 Pro 對嘴實測:英文台詞一字不差,中文還差點意思(RTX 5090)

❯ cat --toc

TL;DR

Kandinsky 6.0 是 10 月 6 日開源的影音模型,一次生出 5 秒影片和 44 kHz 聲音,畫面裡的人會照你寫的台詞對嘴。我在 RTX 5090 跑 29B 的 Pro 蒸餾版:英文台詞 Whisper 轉回來逐字正確,只有自造詞 Muninn 被聽錯;中文聽得懂,但帶外國口音、錯幾個字。順手轉了一份 NVFP4,一支片 141.5 秒,畫面跟原版幾乎一樣,權重放在 Hugging Face。

Kandinsky 6.0 Pro 對嘴實測資訊卡:一次生出 5 秒影片加聲音,RTX 5090 一支 141.5 秒,NVFP4 版 60.3 GB 到 20.1 GB,中文聽得懂、帶點外國口音

短片版:Kandinsky 6.0 Pro 講中文和英文台詞


前言

10 月 6 日看到 Kandinsky 6.0 開源的消息,我就簡單測了一下。吸引我的是它會對嘴:你在提示詞裡寫一句台詞,它生出來的影片裡,人物會開口把那句話講出來,嘴型跟聲音一起出來,不用另外配音再對嘴。

我最想知道兩件事:台詞講得準不準,以及一張 RTX 5090 跑一支要等多久。測的過程中順手把 Pro 轉成了 NVFP4(一種 4 位元的壓縮格式,檔案小很多,RTX 5090 可以直接拿來算),省下不少時間,權重也放上 Hugging Face,給後面想跑的人用。

Kandinsky 6.0 是什麼:一次生出畫面、聲音和嘴型

Kandinsky 6.0 是 Kandinsky Lab 在 2026-10-06 開源的模型,MIT 授權。有兩種大小:Lite 3B、Pro 29B。兩個都是一次生 5 秒影片,連同 44 kHz 的聲音,可以從文字生,也可以給一張圖加文字生。另外有一顆超解析模型,可以把畫面放大到 1920×1080。

它跟一般影片模型不一樣的地方,是畫面和聲音在同一個模型裡一起生。模型裡有兩條線,一條處理畫面、一條處理聲音,兩條線在生成過程中一直互相參考,嘴巴張開的時間點才會對上聲音。官方的論文拿它跟 Kling 2.6、Veo 3.1 Fast、MiniMax H3 等模型做人工評比,論文特別強調它講話的表現不輸這些模型;勝率數字我沒從 PDF 核對到,這裡不引用。

台詞的寫法很直接:在畫面描述裡把要講的話用 <S> 和 <E> 包起來,聲音另外一欄描述是誰在講、什麼語氣、背景有什麼聲音。我這次用的畫面描述是這樣:

Medium close-up of a beautiful young Chinese woman in traditional Hanfu, pale blue silk with
embroidered sleeves, hair in an elegant bun with a jade hairpin, standing in a quiet classical
garden courtyard with a wooden pavilion behind her. The camera is static. She looks straight
into the camera, smiles gently and says: <S>Welcome to AI Muninn. Here's today's AI news.<E>
Soft afternoon light, photorealistic, shallow depth of field.

聲音欄:

A clear, warm young female voice speaking English at a calm pace, quiet garden ambience with soft birdsong.

中文那一發,只把 <S> 裡換成「歡迎來到 AI Muninn,今天帶你看最新的 AI 消息。」,聲音欄的 English 換成 Mandarin Chinese,其他都一樣。

英文台詞一字不差,中文聽得懂、帶點口音

台詞準不準,我用 Whisper(OpenAI 開源的語音轉文字模型,用 large-v3-turbo 這個版本)把生出來的聲音轉成文字,跟原本寫的台詞比。嘴型對得好不好 Whisper 量不到,那部分是我自己看片的判斷:英文那幾支,嘴型跟聲音的時間點很自然,看起來就是她在講話。

先看英文。Pro 蒸餾版原版(bf16,也就是官方發布的 16 位元原始精度)和我轉的 NVFP4 版都轉回「Welcome to AI Muninn. Here's today's AI news.」,只有 Muninn 這個自造的字被聽成 Munnin 或 Manin,其他字都對。

Pro 蒸餾版 NVFP4,英文台詞,seed 42(預設靜音,開聲音聽)

中文是另一個樣子。聽起來像一個中文講得不錯的外國人,意思聽得懂,有口音,有幾個字咬不準:

版本台詞(寫的)Whisper 轉回來
Pro bf16歡迎來到 AI Muninn,今天帶你看最新的 AI 消息。欢迎来到AI慕您,请演带您看最起的AI消息
Pro NVFP4同上欢迎来到AI母您,今天带你看最起的AI消息

這張表看右邊那欄:「歡迎來到 AI」都對,「最新」兩版都被聽成「最起」。NVFP4 那發「今天帶你看」比原版準,但每種只跑一發,這不能拿來說量化讓中文變好,同一個設定換個 seed 就可能反過來。Whisper 輸出的是簡體,是轉寫工具的預設,跟模型無關。

Pro 蒸餾版 NVFP4,中文台詞,seed 42(預設靜音,開聲音聽)

論文寫訓練資料的描述是俄文和英文雙語,強化學習階段的提示詞也是俄文、英文各一半機率,整篇沒提到中文。它還是講得出聽得懂的中文,但要拿來做中文旁白或中文角色,現在還差點意思。

在 RTX 5090 上跑起來要準備的東西

我的環境是 RTX 5090(32 GB)、61.6 GB 記憶體、Windows。我用 ComfyUI 跑,它是一個開源的介面,把模型的每個步驟做成方塊(節點),連起來就能生圖、生影片;Kandinsky 官方有出一套自己的節點。

準備工作就是四件事:新版的 ComfyUI、官方節點、模型檔、一個加速套件。照順序來:

  1. ComfyUI 0.38.0 以上。 官方節點寫明要 0.38.0+。我平常跑 MiniMax-H3 的那份 ComfyUI 是 0.37,裝著一整套 H3 節點,所以我另外用 git worktree 開了一份 0.38.2,配一個獨立的 Python 環境,兩邊互不影響。
  2. 官方節點 kandinsky6。 ComfyUI Manager 搜 kandinsky6 安裝,或是把 kandinsky-6 repo 裡的 comfyui/ 複製到 custom_nodes/kandinsky6/。
  3. 模型檔。 工作流裡有 Download models 按鈕,會自動下載;要手動的話,官方節點 README 有一張表,列出每個檔放在哪個資料夾。核心是 Pro 蒸餾版本體(60.3 GB)、兩個文字編碼器(Qwen2.5-VL 7B、CLIP-L)、HunyuanVideo 的影像 VAE、MMAudio 的聲音 VAE 和 BigVGAN 聲碼器。
  4. SageAttention。 加速套件,讓模型裡最花時間的那一段(attention)算得比較快,裝了之後 ComfyUI 會自動用。我第一輪沒裝,同一支片從 277 秒變 206.7 秒,差很多,建議一開始就裝。

取樣參數照官方建議:Pro 蒸餾版用 10 步、CFG 1.0、聲音 VAE 的 scaling 0.417。沒蒸餾的一般版要 50 步、CFG 5.0,慢很多。

官方工作流預設會先用 Qwen3.5 把你的短提示詞擴寫成一大段,再丟給模型。我是自己寫完整的英文描述,所以把擴寫關掉,直接送。我用的是自己寫的 API 版工作流,節點和上面的設定都一樣,解析度 864×480、121 格(24 fps,約 5 秒)、seed 42。

一支片要多久:bf16 是 206.7 秒,NVFP4 是 141.5 秒

RTX 5090 跑 Kandinsky 6.0 Pro 蒸餾版一支 5 秒片的耗時:bf16 沒開 SageAttention 277.2 和 277.0 秒,bf16 加 SageAttention 206.7 秒,NVFP4 加 SageAttention 三發 131.4、141.5、151.5 秒
每一發都從送出工作算到存檔,含載入模型。NVFP4 那三發,兩發是英文台詞(seed 42 和 seed 7)、一發是中文台詞

所有時間都是從送出工作算到影片存好,包含載入模型。速度我只拿同一顆 Pro 蒸餾版的原版和 NVFP4 版互相比:同一句英文台詞、同一個 seed 42、都開 SageAttention,bf16 是 206.7 秒,NVFP4 是 141.5 秒。最上面那條 277 秒是我還沒裝 SageAttention 時的 bf16,留著當參考。

60.3 GB 的 bf16 原版放不進 32 GB 的顯卡,但照樣跑得動:ComfyUI 0.38 會把權重分批搬進顯卡,算到哪搬到哪。log 裡那行 57486MB Staged 就是它在做這件事。代價是每次都要花時間搬權重。

轉成 NVFP4 之後檔案剩 20.1 GB,要搬的權重少很多。我一共跑了三發 NVFP4:英文 seed 42 是 141.5 秒、中文 seed 42 是 131.4 秒、英文 seed 7 是 151.5 秒,台詞和 seed 不同,時間落在 131.4 到 151.5 秒之間。

順手轉了一份 NVFP4,畫面幾乎一樣

NVFP4 是 NVIDIA 新一代顯卡支援的 4 位元格式,權重存得更小,RTX 5090 可以直接算。我測的時候發現 bf16 每次都要搬 60 GB 權重,就先轉一份 NVFP4 再繼續測,轉檔本身花了 59 秒。

同一句英文台詞、同一個 seed,原版和 NVFP4 版放在一起:

同一個 seed 的兩組聯絡表:上面是 bf16 原版,下面是 NVFP4 版,構圖、服裝、背景庭院幾乎一樣,嘴巴張開的時間點一致,臉部細節略有不同
每列五格,按時間排。上兩列是 bf16,下兩列是 NVFP4

構圖、服裝、背景、嘴巴張開的時間點幾乎一樣,臉的細節有一點差別,畫面沒有變髒。之前我轉 Qwen-Image 2.1 的 NVFP4,畫面會偏髒,這次沒有。

檔案放在 coolthor/Kandinsky-6.0-Pro-distill-5s-NVFP4。ComfyUI 0.38.2 原生就能載入,節點不用改:把檔案放進 models/diffusion_models/,在 Load Diffusion Model 節點選它,其他設定照舊。在我之前,Hugging Face 上已經有 kabachuha 轉的 int8 版(要搭配 ComfyUI PR #16825),NVFP4、fp8、GGUF 版我在 10-08 查的時候還沒看到有人放。

Lite 版:英文可以,中文會走樣

Lite 只有 3B,我也試了一下。官方節點目前擋掉 Lite 的蒸餾版,所以我跑的是一般版 50 步(沒開 SageAttention),一支片 488.7 到 498.7 秒。

Lite 的英文台詞也是對的。中文就真的走樣了,Whisper 轉回來是「微信来就爱一门呢 今天大家试试AAI什么系」,聽不出原本那句話。

Lite 一般版,中文台詞(預設靜音,開聲音聽)

要做對嘴影片,我會直接用 Pro 蒸餾版。

進階:踩過的坑與 NVFP4 轉檔紀錄

不讀這節不影響使用。這裡是給想重現、或是要把整篇丟給 AI 幫你排錯的人看的。

官方節點要 ComfyUI 0.38,我另開一份環境

官方節點要 0.38.0 以上,直接把我那份 0.37.0 升級,有可能把 H3 那套節點弄壞,所以用 worktree 另開:

git -C C:\Users\coolt\ComfyUI fetch --tags origin
git -C C:\Users\coolt\ComfyUI worktree add --detach C:\Users\coolt\ComfyUI-k6 v0.38.2
# 獨立 venv,torch 用 cu130
python -m venv C:\Users\coolt\venv-k6
C:\Users\coolt\venv-k6\Scripts\python.exe -m pip install torch==2.13.0 torchvision torchaudio --index-url https://download.pytorch.org/whl/cu130
git clone --depth 1 https://github.com/kandinskylab/kandinsky-6 C:\Users\coolt\k6-src
Copy-Item -Recurse C:\Users\coolt\k6-src\comfyui C:\Users\coolt\ComfyUI-k6\custom_nodes\kandinsky6

新的那份開在 8189 port,舊的 8188 照常跑。要拆掉的話 git worktree remove 加刪掉 venv 就乾淨了。

官方節點擋掉 Lite 蒸餾版

想試 Lite 蒸餾版時,節點直接報錯。原因寫在官方節點的 register.py:

Distilled K6 Lite checkpoints are not supported.

所以 Lite 我只能跑一般版 50 步、CFG 5.0、聲音 scaling 0.5302。這是節點的限制,不是模型壞掉。

Windows 上 pip 下大檔卡死

在 5090 那台 Windows 上,pip 從 PyPI 下載大的 wheel 兩次卡在 0 bytes 不動,同一台機器用 curl 下載正常。我改用 uv 安裝,SageAttention 用離線的 wheel:

uv pip install --python C:\Users\coolt\venv-k6\Scripts\python.exe `
  sageattention-2.2.0+cu130torch2.10.0andhigher.post6-cp310-abi3-win_amd64.whl triton-windows==3.7.1.post27

裝完用一小段程式確認能跑:

import torch, sageattention
q = torch.randn(1, 8, 256, 128, dtype=torch.float16, device="cuda")
print(sageattention.sageattn(q, q, q).shape)

第一輪慢,主因之一是漏裝 SageAttention

第一輪 bf16 兩發都是 277 秒(277.2、277.0),裝上 SageAttention 後同一個設定是 206.7 秒,省了 70 秒。

我還有一發 NVFP4 的 smoke test 是 211.9 秒,當時有沒有已經裝好 SageAttention 我沒記下來,所以沒放進上面的圖。

NVFP4 怎麼轉的

工具是 Comfy-Org/comfy-quants 的量化工具,我用的是 kabachuha 加上 Kandinsky 6 支援的 kand6 分支,commit 4b96626。設定檔:

model:
  family: kandinsky6
  dtype: bf16
  components:
    transformer: quantize
    text_encoder: keep_bf16
    vae: keep_bf16
    audio_vae: keep_bf16
quant:
  algorithm: nvfp4
  target_dtype: nvfp4
  scale:
    granularity: block
    axis: in_features
    method: amax
  rounding: nearest_even
  modules:
    include:
      - "visual_transformer_blocks.*"
      - "video_text_transformer_blocks.*"
      - "audio_text_transformer_blocks.*"
    exclude:
      - "visual_transformer_blocks.0.*"
      - "visual_transformer_blocks.1.*"
      - "visual_transformer_blocks.58.*"
      - "visual_transformer_blocks.59.*"
  fallback:
    on_error: keep_bf16

量化的是三組 transformer block 裡的 Linear 層,共 1,840 個(畫面 1,792、影片文字 24、聲音文字 24)。畫面那組頭尾各兩個 block(0、1、58、59)留 bf16,這是照 LTX-2 官方 NVFP4 版的做法:第一層和最後幾層對精度比較敏感。norm 和 bias 原樣複製。

結果:

項目數字
來源60,344,993,576 bytes,4,471 個 tensor
輸出20,094,169,424 bytes(18.71 GiB),9,991 個 tensor
量化的 Linear1,840 個,每個多一組 weight_scale 和 weight_scale_2
轉檔時間59.26 秒
轉檔 process 的記憶體峰值49.33 GiB(Windows working set)

exporter 是一張一張 tensor 從硬碟讀(safe_open(..., device="cpu")),不會先把 60 GB 整份讀進記憶體,所以 61.6 GB 的機器轉得動。

第一次轉到最後 save_file 時失敗,原因是 venv 沒裝 NumPy,沒有產生輸出檔;用 uv 補裝 NumPy 後第二次成功。

輸出檔的 key 名稱跟 ComfyUI 官方節點用的一樣,不用轉換。smoke test 的影片 ffprobe 出來是 121 格畫面加 44,100 Hz 聲音,ComfyUI log 顯示用的是原生的 nvfp4 混合精度運算。

常見問題

Kandinsky 6.0 Pro 可以講中文台詞嗎?
可以講,聽得懂,但還不太自然。我寫「歡迎來到 AI Muninn,今天帶你看最新的 AI 消息。」,Whisper 轉回來是「欢迎来到AI慕您,请演带您看最起的AI消息」,帶外國口音、錯幾個字。論文寫訓練資料的描述是俄文和英文雙語,整篇沒有提到中文。英文台詞同一套設定逐字正確。
RTX 5090 跑 Kandinsky 6.0 Pro 生一支 5 秒影片要多久?
864×480、121 格、Pro 蒸餾版 10 步,含載入模型:bf16 原版沒開 SageAttention 是 277 秒,開了是 206.7 秒;換成 NVFP4 版加 SageAttention,三發是 131.4、141.5、151.5 秒。
32 GB 的 RTX 5090 放得下 60 GB 的 Kandinsky 6.0 Pro 嗎?
放不下也跑得動。ComfyUI 0.38 會把權重分批搬進顯卡,邊跑邊搬,bf16 原版一支片 206.7 秒(開 SageAttention)。轉成 NVFP4 後檔案是 20.1 GB,一支片 141.5 秒。
Kandinsky 6.0 的台詞要怎麼寫?
台詞寫在畫面描述裡,用 <S> 和 <E> 包起來,例如 says: <S>Welcome to AI Muninn.<E>;聲音那一欄另外描述說話的人和背景音。官方 ComfyUI 工作流預設會先用 Qwen3.5 把短提示詞擴寫,自己寫完整描述的話可以把它關掉。

接著讀

不想錯過新文章?

訂閱我確保不漏接!

隨時一鍵退訂。