MiniMax H3 到底是什麼?先用人話理解
最近很多人在討論 MiniMax H3,甚至有人說:
一張 16GB 顯卡,就能在自己電腦裡跑出有畫面、有聲音的 AI 影片。
聽起來很誇張,因為過去這類高品質 AI 影片,通常只能在大型公司的雲端平台使用。你必須上傳圖片、輸入文字、等待伺服器處理,而且每生成一次都可能要付費。
但 MiniMax H3 出現後,事情開始改變。
最簡單的理解方式是:
MiniMax H3 就像把導演、攝影師、動畫師、配音員和音效師,放進同一個 AI 模型裡。
以前要做一支 AI 影片,可能要經過很多步驟:
- 先生成圖片
- 再把圖片變成影片
- 再產生人物說話的聲音
- 再做嘴型同步
- 再補環境音效
- 最後進剪輯軟體把全部東西組合起來
中間任何一個環節出問題,整支影片就可能看起來不自然。
例如:
- 人物嘴巴在動,但聲音對不上
- 畫面裡杯子掉到地上,卻沒有聲音
- 人物明明在跑步,腳步聲卻慢半拍
- 同一個角色換一個鏡頭後,臉就變了
- 商品在影片裡越動越變形
MiniMax H3 想解決的,就是這種「每一段都由不同工具處理,最後硬拼在一起」的問題。
它希望從一開始,就同時思考:
- 畫面要怎麼動
- 人物要說什麼
- 嘴型怎麼配合
- 場景裡應該出現什麼聲音
- 角色和商品要如何保持一致
所以它不只是「把圖片變成影片」,而是更接近:
給 AI 一份導演需求,它直接幫你完成一小段有畫面、有動作、有對話、有聲音的影片。
H3 真正特別的是「控制權」
用一個比較容易理解的比喻。
Seedance 2.5 像高級影片製作公司
你把需求、商品照片、角色圖片、參考影片和音訊交給它。
它的設備更完整,工作人員也安排好了,可以:
- 幫你做 30 秒影片
- 處理多鏡頭故事
- 維持角色一致
- 修改指定片段
- 延長影片
- 製作比較完整的成片
但整個製作過程是在對方公司裡完成。
你看不到真正的機器,也不能改造機器。你能操作的,是平台願意開放給你的功能。
MiniMax H3 像把引擎和部分設備賣給你
目前 H3 的成片功能不一定比 Seedance 2.5 多,影片也比較短。
但你可以:
- 把權重下載到自己的電腦
- 在 ComfyUI 本機執行
- 不透過 MiniMax API 生成 768p 影片
- 自己換量化版本
- 修改取樣方式
- 控制顯存卸載
- 製作專用工作流
- 進一步微調模型
- 將它接入公司的自動化系統
MiniMax 官方釋出的不只是一個網站入口,而是 H3-Base 的實際模型權重;ComfyUI 也已經提供原生本機工作流。
這就是兩者最根本的差別:
Seedance 2.5 給你更強的服務;H3 給你比較多的模型所有權與改造權。
它和之前的 AI 影片工具有什麼不同?
假設你想製作一支咖啡廣告。
你可以準備:
- 一張咖啡杯的商品照片
- 一張模特兒的照片
- 一段你喜歡的運鏡影片
- 一段旁白聲音
- 一句文字要求
例如:
女生早晨拿起咖啡,陽光從窗戶照進來,鏡頭慢慢靠近,女生說:「今天,也要從一杯好咖啡開始。」
傳統做法可能需要分別處理人物、商品、運鏡、旁白、嘴型和音效。
MiniMax H3 的方向,則是讓你把這些素材一起交給模型,讓它理解:
- 這個人要長什麼樣
- 咖啡杯不能變形
- 鏡頭要怎麼移動
- 聲音要用什麼節奏
- 人物什麼時候開口
- 畫面和聲音要如何配合
這就是為什麼很多 ComfyUI 使用者開始注意它。
因為 ComfyUI 本來就是一個可以把圖片、文字、影片、音訊,用節點連接起來的工具。MiniMax H3 剛好也是一個很適合接收多種素材的模型。
兩者放在一起,就像:
ComfyUI 是攝影棚的控制台,MiniMax H3 是攝影棚裡的新型全能製作團隊。
MiniMax H3 改變了什麼遊戲規則?
它真正改變的,不只是畫質。
而是讓 AI 影片製作從:
使用很多不同工具,做完後再組合
開始變成:
把完整需求和參考素材交給一個模型,讓它一起生成
這件事帶來了四個很重要的改變。
第一個改變:影片和聲音可以一起生成
以前多數 AI 影片模型主要只負責畫面。
影片生成完之後,你還要另外處理:
- 配音
- 音樂
- 環境聲
- 嘴型同步
- 音畫對齊
MiniMax H3 則把聲音也放進影片生成流程裡。
也就是說,它在決定人物如何動的同時,也能一起決定:
- 人物什麼時候說話
- 說話的節奏
- 動作發生時應該出現什麼聲音
- 畫面和聲音如何對齊
可以把它理解成:
以前是先拍默片,再請人補聲音;現在是拍攝時,畫面和聲音一起完成。
這不代表它每一次都能做到完美,但工作流程確實簡化很多。
第二個改變:你不只可以用文字控制,還可以直接拿素材給它看
過去很多 AI 模型主要依靠文字提示。
你必須很努力地描述:
- 角色長相
- 商品造型
- 場景風格
- 鏡頭運動
- 人物動作
但文字很容易產生誤解。
例如你寫:
高級、簡約、有精品感的產品廣告。
每個模型對「高級」和「精品感」的理解都可能不同。
MiniMax H3 的其中一個重要方向,是讓你直接提供參考素材。
例如:
- 這張圖是主角
- 這張圖是商品
- 這段影片是我要的動作
- 這段聲音是我要的語氣
- 這張照片是場景風格
這樣就不需要全部靠文字猜。
對一般人來說,可以把它理解成:
與其一直向 AI 形容你想要的東西,不如直接拿範例給它看。
這對商品廣告、品牌角色、虛擬人物和短劇特別重要。
第三個改變:原本只能在大公司雲端跑的模型,現在可以放進自己的工作流程
以前品質比較好的 AI 影片模型,大多是封閉式服務。
你只能到官方網站使用:
- 不能看到模型本身
- 不能修改運作方式
- 不能自己加入特殊功能
- 不能自由接進公司內部流程
- 每次生成都依賴平台
- 平台改價格或限制,你只能接受
MiniMax H3 開放模型權重後,開發者就可以把它放進自己的工具裡。
例如:
- 放進 ComfyUI
- 製作自己的工作流
- 加入其他模型
- 自己設計節點
- 使用不同的量化版本
- 訓練自己的 LoRA
- 批次生成影片
- 接進企業內部系統
所以它不只是多了一個 AI 影片網站。
它更像是:
有人把一套原本只能租用的影片製作機器,開放成可以放進自己工廠裡使用。
第四個改變:消費級電腦也開始有機會跑大型影片模型
這是大家最驚訝的地方。
MiniMax H3 本身其實非常大,並不是一個真正只有 16GB 的小模型。
但現在透過幾種技術,可以讓它在 16GB 顯卡上勉強完成生成:
- 模型壓縮
- 降低權重精度
- 把部分模型暫時放到電腦記憶體
- 不需要的部分先卸載
- 一小部分、一小部分地處理
- 將影片分段解碼
這就像你要搬一間倉庫的貨物。
顯卡記憶體是貨車,整個模型是倉庫。
16GB 顯卡的貨車,當然不可能一次裝完整間倉庫的貨。
但你可以:
- 先載一批貨
- 運到目的地
- 卸下來
- 再回去載下一批
最後還是可以完成工作,只是會比使用大型貨車慢很多。
所以「16GB 顯卡可以跑 MiniMax H3」真正的意思不是:
整個模型只有 16GB。
而是:
模型可以分批進入顯卡,讓顯卡在任何一個時間點,都不要超過 16GB。
為什麼有人用 5070 16GB 就可以跑?
這裡也要先澄清一個常見說法。
一般桌機版的 RTX 5070 通常是 12GB,16GB 的版本多半是在說 RTX 5070 Ti。
但不論是 5070 Ti 16GB,還是其他 16GB 顯卡,它能跑 MiniMax H3,都不是因為模型很小。
而是因為 ComfyUI 會幫忙管理記憶體。
簡化後的執行方式大概像這樣:
先讀懂文字和參考圖片
↓
把理解結果暫時保存
↓
卸載剛剛使用的模型
↓
載入影片生成模型
↓
開始生成影片
↓
卸載影片生成模型
↓
載入影片與聲音解碼器
↓
輸出最後結果
這些模型不是全部同時塞進顯卡。
而是輪流進場。
就像一間很小的攝影棚,沒有辦法讓所有工作人員同時站在裡面,所以:
- 編劇先進來完成腳本
- 編劇離開
- 攝影團隊再進來拍攝
- 攝影團隊離開
- 剪輯和音效團隊最後進來
雖然空間小,但只要安排好進場順序,還是能把影片做完。
代價就是速度比較慢。
所以 16GB 顯卡能跑,實際體驗是什麼?
「能跑」和「跑得舒服」是兩件不同的事。
16GB 顯卡通常代表:
- 可以成功開始生成
- 可以製作較短的影片
- 可以使用較低記憶體版本
- 需要不少系統記憶體
- 模型會在記憶體和顯卡之間頻繁搬動
- 生成時間可能比較長
- 解析度越高,等待越久
- 影片秒數越長,負擔越大
- 同時放很多參考素材,也會增加壓力
因此,網路上有人說:
我的 16GB 顯卡可以跑 H3。
這句話可能是真的。
但它不一定代表:
- 可以快速生成
- 可以直接跑 2K
- 可以一次做十五秒長片
- 可以同時放很多參考影片
- 可以邊生成邊做其他工作
- 所有設定都能開到最高
比較準確的說法應該是:
16GB 顯卡讓一般人有機會在本機使用 H3,但通常要用速度換記憶體。
為什麼最近很多 ComfyUI 專案開始使用 MiniMax H3?
因為它剛好符合 ComfyUI 使用者最需要的幾件事。
第一,它可以直接放進節點工作流
ComfyUI 最強的地方,是可以把不同素材像積木一樣連接。
例如:
人物照片 ───┐
商品照片 ───┤
動作影片 ───┼→ MiniMax H3 → 完整影音
參考聲音 ───┤
文字要求 ───┘
這種使用方式比只在網站上輸入一句文字,更適合進階創作者。
第二,一套模型可以處理更多工作
過去可能需要分別安裝:
- 圖生影片模型
- 角色一致性模型
- 動作控制模型
- 嘴型同步工具
- 語音工具
- 音效工具
現在 MiniMax H3 有機會把其中幾個步驟合併。
它不一定完全取代所有專業工具,但可以讓工作流變得更短、更容易管理。
第三,開發者可以自己改
只要模型能在本地使用,社群就會很快開始做各種優化,例如:
- 更省顯存的版本
- 更快的版本
- 四步生成版本
- LoRA 支援
- 多顯卡支援
- 更好的聲音同步
- 更方便的參考圖節點
- 商品一致性工作流
- 短劇工作流
- 廣告影片工作流
所以最近看到很多 H3 專案,部分原因不是它已經完美,而是它提供了很大的改造空間。
一句話總結 MiniMax H3
MiniMax H3 最值得注意的地方,不只是「畫質很好」。
而是它把過去分散在很多工具裡的工作,開始放進同一個模型:
它可以同時理解文字、圖片、影片和聲音,並且一起生成有畫面、有動作、有對話、有音效的影片。
再加上模型可以放進 ComfyUI,並透過量化與記憶體卸載,在 16GB 顯卡上運行,才會造成最近這一波關注。
所以它真正改變的遊戲規則是:
過去一般人只能租用大型公司的 AI 影片服務;現在一般創作者開始有機會,把接近前沿等級的影音生成能力,放進自己的電腦和工作流程裡。
後面再接原本的「H3 有哪些版本」、「FL2VA 與 Ref2VA 差異」、「模型檔案大小」和「技術原理」,讀者就會比較容易跟得上。
先把名稱與版本拆清楚
截至 2026 年 8 月 7 日,官方名稱是 MiniMax H3。它不是「Hailuo 2.3 的小改版」,而是 MiniMax 影片生成產品線的新一代架構。H3 在 7 月 31 日發布,並於 8 月 3 日開放模型權重;ComfyUI 核心支援也幾乎同步合併,所以你最近突然看到大量 H3 workflow,並不是錯覺。(Minimax)
官方目前的命名可以分成三個層次:
一、產品世代
- Hailuo 01
- Hailuo 02
- Hailuo 2.3/2.3 Fast:上一代 API 模型
- MiniMax H3:目前最新一代
所以社群有時會稱它為「Hailuo 3」,但官方正式名稱仍是 MiniMax H3。(ComfyUI Newsletters)
二、目前開放權重的兩個 H3-Base checkpoint
| 版本 | 主要用途 | 輸入方式 |
|---|---|---|
| H3-Base-FL2VA | 文字轉影片、圖生影片、首尾幀控制 | 0 張圖是 T2V;1 張可作首幀或尾幀;2 張是首尾幀 |
| H3-Base-Ref2VA | 多參考圖、多參考影片、音訊參考 | 最多 9 張圖、3 段影片、3 段音訊,混合總數最多 12 個檔案 |
其中 VA 指的是 Video + Audio。H3 不是先生成影片,再另外跑配音或音效,而是在同一個生成過程中共同預測影像與立體聲音訊。官方輸出規格包含約 4~15 秒、24 FPS、32 kHz stereo audio,並支援多種比例與對話語言。(Hugging Face)
三、完整商業版 H3 系統其實有三個模組
| 模組 | 功能 | 是否已完整開放 |
|---|---|---|
| H3-Context-IR | 理解文字、圖片、影片、音訊,整理成模型較容易執行的上下文 | 否,目前由 MiniMax 雲端服務處理 |
| H3-Base | 生成約 768p 的影片與音訊 | 是,FL2VA/Ref2VA 已開放 |
| H3-Regenerate-2K | 根據原始上下文與 768p 結果重新生成 2K,而非單純超解析 | 否,目前未開放權重 |
這點很重要:你在本機 ComfyUI 跑到的是 H3-Base,不是完整的 MiniMax 雲端 H3 pipeline。 本機可以嘗試更高解析度,但它不等於官方的 Context-IR 加 Regenerate-2K 流程。(Hugging Face)
H3 真正改變了哪些遊戲規則?
1. 從「影片模型」變成「多模態場景模擬器」
過去常見工作流程是:
圖片模型 → 圖生影片 → 嘴型同步 → TTS → 音效 → 背景音樂 → 剪輯合成
H3 的設計則比較接近:
文字+圖片+影片+音訊參考 → 統一理解 → 同時生成影片與聲音
H3 把文字、參考圖、參考影片、音訊、影片 latent 包進同一條 sequence,再透過一個 33B dense single-stream H3-Omni-Transformer 共同生成影音。這讓「角色動作、嘴型、環境聲、對話節奏」有機會在同一個時間軸上被協調,而不是由五六個模型事後拼接。(Hugging Face)
這是它最重要的規則改變:音訊不再只是影片生成完成後的附加層,而是生成內容本身的一部分。
2. 參考素材變成真正的控制語言
Ref2VA 不只是「上傳一張角色圖片」。它可以同時接收:
- 人物外觀參考
- 商品外型參考
- 場景或美術風格
- 另一段影片的運動方式
- 語音、節奏或聲音參考
這代表創作者不必把所有要求硬塞進 prompt,可以直接用素材告訴模型:
角色長這樣、產品長這樣、攝影機這樣動、聲音是這種節奏。
對廣告、商品展示、虛擬人物、短劇和 MV workflow 特別重要,因為它降低了純文字 prompt 的不確定性。(Hugging Face)
3. 接近前沿品質的影音模型,第一次真正進入本機工作流
H3 核心權重可以下載、量化、剪枝、建立 LoRA、修改 sampler、做自訂節點。這與只能透過 API 呼叫的封閉模型不同。
截至 2026 年 8 月 7 日,Artificial Analysis 的盲測排名中,H3 在文生影片與圖生影片均屬於表現最前面的開放權重模型,在帶音訊的影片編輯項目也位居整體前列。排名會持續變動,但至少說明 H3 並不是只有「開放」而畫質明顯落後的模型。(Artificial Analysis)
4. 2K 不再只是事後放大
H3-Regenerate-2K 的概念不是傳統:
768p 影片 → 超解析放大 → 2K
而是:
原始文字與所有參考素材+768p 生成結果 → 再生成一次 2K
因此第二階段仍然能重新理解文字、商品、角色和場景,而不是只對像素做銳化。不過這個官方模組目前尚未開放,所以本機 workflow 與官方雲端的 2K 結果仍應分開看待。(Hugging Face)
為什麼 16GB 顯卡也能跑?
首先要修正一個常見稱呼:
桌機版 RTX 5070 是 12GB;
RTX 5070 Ti 才是 16GB。
因此你看到的「5070 16GB」,大多實際上是 RTX 5070 Ti 16GB。(NVIDIA)
更重要的是:16GB 可以完成推理,不代表整套模型只有 16GB,也不代表模型全部同時放在顯存。
原始模型其實非常大
H3 本機 pipeline 的主要檔案大致如下:
| 部件 | 完整精度版本 | 低記憶體版本 |
|---|---|---|
| H3 Transformer | BF16 約 66.3GB | Pruned INT8/FP8 約 21GB |
| Qwen3-VL-32B 文字與多模態編碼器 | BF16 約 51.5GB | NVFP4 AWQ 約 15.7GB |
| Video VAE | 約 5.21GB | 約 5.21GB |
| Audio VAE | 約 0.605GB | 約 0.605GB |
| 合計 | 約 123.6GB | 約 42.5GB |
也就是說,最小的官方 ComfyUI 組合仍然約 42.5GB,遠大於 16GB。(Hugging Face)
之所以能跑,靠的是四層優化
1. 把約 40% 的調制參數預先計算
H3 的 33B Transformer 中,大約有 13B 參數位於 AdaLN 調制分支。推理時,這些輸出可以預先計算成 curve table,不必讓全部 13B 參數常駐模型。
因此 ComfyUI 提供了 pruned 版本:
- 原始 BF16 Transformer:約 66.3GB
- Pruned BF16:約 40.2GB
- Pruned INT8/FP8:約 21GB
這不是普通的「隨便砍掉 40% 權重」,而是利用 H3 本身的架構特性,把推理時可預先計算的部分換成查表。MiniMax 模型卡與 ComfyUI 都明確說明了這個設計。(Hugging Face)
2. 權重量化
ComfyUI 目前已提供多種包裝:
- BF16
- INT8 ConvRot
- Pruned BF16
- Pruned INT8 ConvRot
- Pruned FP8 Scaled
- Qwen3-VL NVFP4 AWQ
所以大家口中的「H3 版本很多」,許多其實不是不同能力的模型,而是同一個 checkpoint 的不同精度與記憶體配置。(Hugging Face)
3. 分階段載入,而不是所有模型一起進顯存
實際執行大致是:
Prompt/參考素材
↓
載入 Qwen3-VL encoder
↓
轉成 conditioning embeddings
↓
卸載或部分卸載 encoder
↓
載入/串流 H3 Transformer 進行採樣
↓
卸載 Transformer
↓
載入 Video VAE/Audio VAE 解碼
因此:
- 15.7GB 的文字編碼器不必和 21GB Transformer 永久同時存在。
- 不使用的模型可以移到系統 RAM。
- Transformer 不一定完整放入 VRAM,可以逐 block 在 RAM 與 VRAM 之間搬移。
- VAE 解碼採用 spatial tiling 與 temporal chunking,避免一次解碼整段高解析影片。
ComfyUI 將這套機制稱為動態 VRAM offloading,並表示最低甚至可在 RTX 3060 等級顯卡上啟動;但顯存越少,RAM 和 VRAM 之間搬運越頻繁。(ComfyUI Newsletters)
4. 用速度換記憶體
這是最容易被影片標題省略的部分。
「16GB 能跑」通常代表:
- 可以完成生成
- 可能需要大量系統 RAM
- 會頻繁 CPU offload
- PCIe 傳輸成為瓶頸
- 生成時間通常以分鐘計,而不是即時
- 解析度、影片秒數和 frame 數提高後,速度與記憶體需求會快速增加
所以 5070 Ti 16GB 跑一段較短的 768p 影片,和流暢跑 15 秒、2K、多參考影音,是完全不同的概念。
一張 16GB 卡能執行 H3,真正含義是:
模型的 peak VRAM 被控制在 16GB 左右,而不是整個 42.5GB pipeline 被塞進 16GB。
為什麼最近大量 ComfyUI 專案開始採用 H3?
1. MiniMax 開放權重與 ComfyUI 原生支援同時發生
H3 權重在 2026 年 8 月 3 日開放,ComfyUI core 的 H3 支援也在同一天合併。它不是靠一個半成品 community wrapper 勉強執行,而是直接進入核心架構,包括:
- H3 模型載入
- 音訊與影片共同採樣
- H3 專用 VAE
- Qwen3-VL encoder
- INT8 fused kernel
- Pruned AdaLN table
- 官方 workflow 範例
因此節點作者不必每人重新寫一套底層模型載入器。(Minimax)
2. 一個模型可以取代原本多條 workflow
過去 ComfyUI 影片專案可能要串接:
- 圖生影片模型
- identity reference
- 動作 transfer
- lipsync
- TTS
- Foley/SFX
- 音訊混合
- 影片後製
H3 原生同時處理影音後,許多工作流可以被縮短。它不一定在每一項都勝過專用模型,但整體的一致性與可維護性更高。
對 ComfyUI 作者而言,這代表一個 H3 workflow 可以延伸成:
- 商品廣告
- 角色短劇
- 有聲 AI 動畫
- 音樂視覺
- 動作參考影片
- 首尾幀轉場
- 多角色 reference
- 影片重新演繹
而不必維護五六套完全不同的模型鏈。
3. H3 的輸入形式非常適合 node graph
ComfyUI 最擅長的就是把不同素材接成節點,而 H3-Ref2VA 剛好允許圖片、影片和音訊混合輸入。
因此工作流很容易被視覺化成:
角色參考圖 ─┐
商品參考圖 ─┤
動作影片 ───┼→ H3 Ref2VA → 影音結果
語音參考 ───┤
文字指令 ───┘
這比「全部要求寫進一個超長 prompt」更符合 ComfyUI 使用者的操作習慣。
4. 它提供了極大的社群優化空間
模型開放後短短幾天,社群便開始出現:
- 4-step Turbo LoRA
- H3 LoRA 載入與轉換工具
- Dual-clock video/audio sampler
- 音訊修復與同步節點
- 更低精度量化版本
- 多 GPU 與 CPU offload workflow
例如部分社群 Turbo LoRA 嘗試把原本約二十步的生成壓縮到四步;另外也有人開發 video 與 audio 使用不同噪聲時鐘的 dual-clock sampler,以減少低步數時的音訊雜訊。不過這些屬於非常早期的第三方實驗,不能直接視為官方品質保證。(GitHub)
5. 本地部署讓大量反覆測試變得可行
影片工作流通常不是生成一次,而是反覆修改:
- Seed
- Prompt
- 首尾幀
- 角色參考
- 動作影片
- 音效
- LoRA
- Sampler
- CFG
- 長度與解析度
API 每次都要排隊、上傳素材與計費;本地 H3 即使比較慢,對大量測試、批次製作、內部素材、隱私內容和自訂模型仍有吸引力。
目前最容易被誤解的四件事
「16GB 可以跑」不等於「H3 是 16GB 模型」
最小常用組合約 42.5GB,只是透過量化、分階段載入、RAM offload 和 tiled VAE,把峰值顯存壓低。
「ComfyUI 可以設 2K」不等於「本機擁有官方 H3-Regenerate-2K」
官方 2K regeneration 模組目前沒有開放。直接提高本機採樣解析度,和官方的 in-context 2K regeneration 不是同一條 pipeline。(Hugging Face)
「開放權重」不完全等於傳統開源軟體
H3 使用的是 MiniMax H3 Community License,不是一般 OSI 開源授權。條款目前列出美國、歐盟、英國與南韓等排除區域,年營收超過 2,000 萬美元的商業組織也需要另外取得授權。台灣目前未被明列於排除區域,但商用前仍應依最新版條款確認。(Hugging Face)
「四步 Turbo」不等於官方完整品質
Turbo LoRA、低位元量化、極低步數和激進 offload 都可能交換速度、穩定度、音訊品質或細節。展示影片能成功,不代表每一種輸入、長度和解析度都同樣穩定。
最后的總結
MiniMax H3 真正重要的地方,不只是「又有一個畫質更好的影片模型」,而是它把這幾件事同時湊齊了:
前沿等級畫面+原生影音共同生成+多模態參考控制+開放權重+ComfyUI 原生支援+消費級顯卡可透過 offload 執行。
所以它目前更像是 ComfyUI 影音領域的一個新「底層平台」,而不只是另一個 T2V checkpoint。
5070 Ti 16GB 能跑,是記憶體工程的勝利;大量專案開始採用,則是因為 H3 把原本分散在影片、語音、音效、嘴型、reference 和 editing 的多條工作流,第一次有機會收進同一套可程式化、本地可修改的模型架構裡。
留言
張貼留言