跳到主要內容

MiniMax H3 到底厲害在哪裡,到底是什麼? 懶人包從應用到技術看這篇就夠啦

MiniMax H3 到底是什麼?先用人話理解

最近很多人在討論 MiniMax H3,甚至有人說:

一張 16GB 顯卡,就能在自己電腦裡跑出有畫面、有聲音的 AI 影片。

聽起來很誇張,因為過去這類高品質 AI 影片,通常只能在大型公司的雲端平台使用。你必須上傳圖片、輸入文字、等待伺服器處理,而且每生成一次都可能要付費。

但 MiniMax H3 出現後,事情開始改變。

最簡單的理解方式是:

MiniMax H3 就像把導演、攝影師、動畫師、配音員和音效師,放進同一個 AI 模型裡。

以前要做一支 AI 影片,可能要經過很多步驟:

  1. 先生成圖片
  2. 再把圖片變成影片
  3. 再產生人物說話的聲音
  4. 再做嘴型同步
  5. 再補環境音效
  6. 最後進剪輯軟體把全部東西組合起來

中間任何一個環節出問題,整支影片就可能看起來不自然。

例如:

  • 人物嘴巴在動,但聲音對不上
  • 畫面裡杯子掉到地上,卻沒有聲音
  • 人物明明在跑步,腳步聲卻慢半拍
  • 同一個角色換一個鏡頭後,臉就變了
  • 商品在影片裡越動越變形

MiniMax H3 想解決的,就是這種「每一段都由不同工具處理,最後硬拼在一起」的問題。

它希望從一開始,就同時思考:

  • 畫面要怎麼動
  • 人物要說什麼
  • 嘴型怎麼配合
  • 場景裡應該出現什麼聲音
  • 角色和商品要如何保持一致

所以它不只是「把圖片變成影片」,而是更接近:

給 AI 一份導演需求,它直接幫你完成一小段有畫面、有動作、有對話、有聲音的影片。




H3 真正特別的是「控制權」

用一個比較容易理解的比喻。

Seedance 2.5 像高級影片製作公司

你把需求、商品照片、角色圖片、參考影片和音訊交給它。

它的設備更完整,工作人員也安排好了,可以:

  • 幫你做 30 秒影片
  • 處理多鏡頭故事
  • 維持角色一致
  • 修改指定片段
  • 延長影片
  • 製作比較完整的成片

但整個製作過程是在對方公司裡完成。

你看不到真正的機器,也不能改造機器。你能操作的,是平台願意開放給你的功能。

MiniMax H3 像把引擎和部分設備賣給你

目前 H3 的成片功能不一定比 Seedance 2.5 多,影片也比較短。

但你可以:

  • 把權重下載到自己的電腦
  • 在 ComfyUI 本機執行
  • 不透過 MiniMax API 生成 768p 影片
  • 自己換量化版本
  • 修改取樣方式
  • 控制顯存卸載
  • 製作專用工作流
  • 進一步微調模型
  • 將它接入公司的自動化系統

MiniMax 官方釋出的不只是一個網站入口,而是 H3-Base 的實際模型權重;ComfyUI 也已經提供原生本機工作流。

這就是兩者最根本的差別:

Seedance 2.5 給你更強的服務;H3 給你比較多的模型所有權與改造權。

它和之前的 AI 影片工具有什麼不同?

假設你想製作一支咖啡廣告。

你可以準備:

  • 一張咖啡杯的商品照片
  • 一張模特兒的照片
  • 一段你喜歡的運鏡影片
  • 一段旁白聲音
  • 一句文字要求

例如:

女生早晨拿起咖啡,陽光從窗戶照進來,鏡頭慢慢靠近,女生說:「今天,也要從一杯好咖啡開始。」

傳統做法可能需要分別處理人物、商品、運鏡、旁白、嘴型和音效。

MiniMax H3 的方向,則是讓你把這些素材一起交給模型,讓它理解:

  • 這個人要長什麼樣
  • 咖啡杯不能變形
  • 鏡頭要怎麼移動
  • 聲音要用什麼節奏
  • 人物什麼時候開口
  • 畫面和聲音要如何配合

這就是為什麼很多 ComfyUI 使用者開始注意它。

因為 ComfyUI 本來就是一個可以把圖片、文字、影片、音訊,用節點連接起來的工具。MiniMax H3 剛好也是一個很適合接收多種素材的模型。

兩者放在一起,就像:

ComfyUI 是攝影棚的控制台,MiniMax H3 是攝影棚裡的新型全能製作團隊。


MiniMax H3 改變了什麼遊戲規則?

它真正改變的,不只是畫質。

而是讓 AI 影片製作從:

使用很多不同工具,做完後再組合

開始變成:

把完整需求和參考素材交給一個模型,讓它一起生成

這件事帶來了四個很重要的改變。

第一個改變:影片和聲音可以一起生成

以前多數 AI 影片模型主要只負責畫面。

影片生成完之後,你還要另外處理:

  • 配音
  • 音樂
  • 環境聲
  • 嘴型同步
  • 音畫對齊

MiniMax H3 則把聲音也放進影片生成流程裡。

也就是說,它在決定人物如何動的同時,也能一起決定:

  • 人物什麼時候說話
  • 說話的節奏
  • 動作發生時應該出現什麼聲音
  • 畫面和聲音如何對齊

可以把它理解成:

以前是先拍默片,再請人補聲音;現在是拍攝時,畫面和聲音一起完成。

這不代表它每一次都能做到完美,但工作流程確實簡化很多。


第二個改變:你不只可以用文字控制,還可以直接拿素材給它看

過去很多 AI 模型主要依靠文字提示。

你必須很努力地描述:

  • 角色長相
  • 商品造型
  • 場景風格
  • 鏡頭運動
  • 人物動作

但文字很容易產生誤解。

例如你寫:

高級、簡約、有精品感的產品廣告。

每個模型對「高級」和「精品感」的理解都可能不同。

MiniMax H3 的其中一個重要方向,是讓你直接提供參考素材。

例如:

  • 這張圖是主角
  • 這張圖是商品
  • 這段影片是我要的動作
  • 這段聲音是我要的語氣
  • 這張照片是場景風格

這樣就不需要全部靠文字猜。

對一般人來說,可以把它理解成:

與其一直向 AI 形容你想要的東西,不如直接拿範例給它看。

這對商品廣告、品牌角色、虛擬人物和短劇特別重要。


第三個改變:原本只能在大公司雲端跑的模型,現在可以放進自己的工作流程

以前品質比較好的 AI 影片模型,大多是封閉式服務。

你只能到官方網站使用:

  • 不能看到模型本身
  • 不能修改運作方式
  • 不能自己加入特殊功能
  • 不能自由接進公司內部流程
  • 每次生成都依賴平台
  • 平台改價格或限制,你只能接受

MiniMax H3 開放模型權重後,開發者就可以把它放進自己的工具裡。

例如:

  • 放進 ComfyUI
  • 製作自己的工作流
  • 加入其他模型
  • 自己設計節點
  • 使用不同的量化版本
  • 訓練自己的 LoRA
  • 批次生成影片
  • 接進企業內部系統

所以它不只是多了一個 AI 影片網站。

它更像是:

有人把一套原本只能租用的影片製作機器,開放成可以放進自己工廠裡使用。


第四個改變:消費級電腦也開始有機會跑大型影片模型

這是大家最驚訝的地方。

MiniMax H3 本身其實非常大,並不是一個真正只有 16GB 的小模型。

但現在透過幾種技術,可以讓它在 16GB 顯卡上勉強完成生成:

  • 模型壓縮
  • 降低權重精度
  • 把部分模型暫時放到電腦記憶體
  • 不需要的部分先卸載
  • 一小部分、一小部分地處理
  • 將影片分段解碼

這就像你要搬一間倉庫的貨物。

顯卡記憶體是貨車,整個模型是倉庫。

16GB 顯卡的貨車,當然不可能一次裝完整間倉庫的貨。

但你可以:

  1. 先載一批貨
  2. 運到目的地
  3. 卸下來
  4. 再回去載下一批

最後還是可以完成工作,只是會比使用大型貨車慢很多。

所以「16GB 顯卡可以跑 MiniMax H3」真正的意思不是:

整個模型只有 16GB。

而是:

模型可以分批進入顯卡,讓顯卡在任何一個時間點,都不要超過 16GB。


為什麼有人用 5070 16GB 就可以跑?

這裡也要先澄清一個常見說法。

一般桌機版的 RTX 5070 通常是 12GB,16GB 的版本多半是在說 RTX 5070 Ti。

但不論是 5070 Ti 16GB,還是其他 16GB 顯卡,它能跑 MiniMax H3,都不是因為模型很小。

而是因為 ComfyUI 會幫忙管理記憶體。

簡化後的執行方式大概像這樣:

先讀懂文字和參考圖片
        ↓
把理解結果暫時保存
        ↓
卸載剛剛使用的模型
        ↓
載入影片生成模型
        ↓
開始生成影片
        ↓
卸載影片生成模型
        ↓
載入影片與聲音解碼器
        ↓
輸出最後結果

這些模型不是全部同時塞進顯卡。

而是輪流進場。

就像一間很小的攝影棚,沒有辦法讓所有工作人員同時站在裡面,所以:

  • 編劇先進來完成腳本
  • 編劇離開
  • 攝影團隊再進來拍攝
  • 攝影團隊離開
  • 剪輯和音效團隊最後進來

雖然空間小,但只要安排好進場順序,還是能把影片做完。

代價就是速度比較慢。


所以 16GB 顯卡能跑,實際體驗是什麼?

「能跑」和「跑得舒服」是兩件不同的事。

16GB 顯卡通常代表:

  • 可以成功開始生成
  • 可以製作較短的影片
  • 可以使用較低記憶體版本
  • 需要不少系統記憶體
  • 模型會在記憶體和顯卡之間頻繁搬動
  • 生成時間可能比較長
  • 解析度越高,等待越久
  • 影片秒數越長,負擔越大
  • 同時放很多參考素材,也會增加壓力

因此,網路上有人說:

我的 16GB 顯卡可以跑 H3。

這句話可能是真的。

但它不一定代表:

  • 可以快速生成
  • 可以直接跑 2K
  • 可以一次做十五秒長片
  • 可以同時放很多參考影片
  • 可以邊生成邊做其他工作
  • 所有設定都能開到最高

比較準確的說法應該是:

16GB 顯卡讓一般人有機會在本機使用 H3,但通常要用速度換記憶體。


為什麼最近很多 ComfyUI 專案開始使用 MiniMax H3?

因為它剛好符合 ComfyUI 使用者最需要的幾件事。

第一,它可以直接放進節點工作流

ComfyUI 最強的地方,是可以把不同素材像積木一樣連接。

例如:

人物照片 ───┐
商品照片 ───┤
動作影片 ───┼→ MiniMax H3 → 完整影音
參考聲音 ───┤
文字要求 ───┘

這種使用方式比只在網站上輸入一句文字,更適合進階創作者。


第二,一套模型可以處理更多工作

過去可能需要分別安裝:

  • 圖生影片模型
  • 角色一致性模型
  • 動作控制模型
  • 嘴型同步工具
  • 語音工具
  • 音效工具

現在 MiniMax H3 有機會把其中幾個步驟合併。

它不一定完全取代所有專業工具,但可以讓工作流變得更短、更容易管理。


第三,開發者可以自己改

只要模型能在本地使用,社群就會很快開始做各種優化,例如:

  • 更省顯存的版本
  • 更快的版本
  • 四步生成版本
  • LoRA 支援
  • 多顯卡支援
  • 更好的聲音同步
  • 更方便的參考圖節點
  • 商品一致性工作流
  • 短劇工作流
  • 廣告影片工作流

所以最近看到很多 H3 專案,部分原因不是它已經完美,而是它提供了很大的改造空間。


一句話總結 MiniMax H3

MiniMax H3 最值得注意的地方,不只是「畫質很好」。

而是它把過去分散在很多工具裡的工作,開始放進同一個模型:

它可以同時理解文字、圖片、影片和聲音,並且一起生成有畫面、有動作、有對話、有音效的影片。

再加上模型可以放進 ComfyUI,並透過量化與記憶體卸載,在 16GB 顯卡上運行,才會造成最近這一波關注。

所以它真正改變的遊戲規則是:

過去一般人只能租用大型公司的 AI 影片服務;現在一般創作者開始有機會,把接近前沿等級的影音生成能力,放進自己的電腦和工作流程裡。

後面再接原本的「H3 有哪些版本」、「FL2VA 與 Ref2VA 差異」、「模型檔案大小」和「技術原理」,讀者就會比較容易跟得上。

先把名稱與版本拆清楚

截至 2026 年 8 月 7 日,官方名稱是 MiniMax H3。它不是「Hailuo 2.3 的小改版」,而是 MiniMax 影片生成產品線的新一代架構。H3 在 7 月 31 日發布,並於 8 月 3 日開放模型權重;ComfyUI 核心支援也幾乎同步合併,所以你最近突然看到大量 H3 workflow,並不是錯覺。(Minimax)

官方目前的命名可以分成三個層次:

一、產品世代

  • Hailuo 01
  • Hailuo 02
  • Hailuo 2.3/2.3 Fast:上一代 API 模型
  • MiniMax H3:目前最新一代

所以社群有時會稱它為「Hailuo 3」,但官方正式名稱仍是 MiniMax H3。(ComfyUI Newsletters)

二、目前開放權重的兩個 H3-Base checkpoint

版本 主要用途 輸入方式
H3-Base-FL2VA 文字轉影片、圖生影片、首尾幀控制 0 張圖是 T2V;1 張可作首幀或尾幀;2 張是首尾幀
H3-Base-Ref2VA 多參考圖、多參考影片、音訊參考 最多 9 張圖、3 段影片、3 段音訊,混合總數最多 12 個檔案

其中 VA 指的是 Video + Audio。H3 不是先生成影片,再另外跑配音或音效,而是在同一個生成過程中共同預測影像與立體聲音訊。官方輸出規格包含約 4~15 秒、24 FPS、32 kHz stereo audio,並支援多種比例與對話語言。(Hugging Face)

三、完整商業版 H3 系統其實有三個模組

模組 功能 是否已完整開放
H3-Context-IR 理解文字、圖片、影片、音訊,整理成模型較容易執行的上下文 否,目前由 MiniMax 雲端服務處理
H3-Base 生成約 768p 的影片與音訊 是,FL2VA/Ref2VA 已開放
H3-Regenerate-2K 根據原始上下文與 768p 結果重新生成 2K,而非單純超解析 否,目前未開放權重

這點很重要:你在本機 ComfyUI 跑到的是 H3-Base,不是完整的 MiniMax 雲端 H3 pipeline。 本機可以嘗試更高解析度,但它不等於官方的 Context-IR 加 Regenerate-2K 流程。(Hugging Face)


H3 真正改變了哪些遊戲規則?

1. 從「影片模型」變成「多模態場景模擬器」

過去常見工作流程是:

圖片模型 → 圖生影片 → 嘴型同步 → TTS → 音效 → 背景音樂 → 剪輯合成

H3 的設計則比較接近:

文字+圖片+影片+音訊參考 → 統一理解 → 同時生成影片與聲音

H3 把文字、參考圖、參考影片、音訊、影片 latent 包進同一條 sequence,再透過一個 33B dense single-stream H3-Omni-Transformer 共同生成影音。這讓「角色動作、嘴型、環境聲、對話節奏」有機會在同一個時間軸上被協調,而不是由五六個模型事後拼接。(Hugging Face)

這是它最重要的規則改變:音訊不再只是影片生成完成後的附加層,而是生成內容本身的一部分。

2. 參考素材變成真正的控制語言

Ref2VA 不只是「上傳一張角色圖片」。它可以同時接收:

  • 人物外觀參考
  • 商品外型參考
  • 場景或美術風格
  • 另一段影片的運動方式
  • 語音、節奏或聲音參考

這代表創作者不必把所有要求硬塞進 prompt,可以直接用素材告訴模型:

角色長這樣、產品長這樣、攝影機這樣動、聲音是這種節奏。

對廣告、商品展示、虛擬人物、短劇和 MV workflow 特別重要,因為它降低了純文字 prompt 的不確定性。(Hugging Face)

3. 接近前沿品質的影音模型,第一次真正進入本機工作流

H3 核心權重可以下載、量化、剪枝、建立 LoRA、修改 sampler、做自訂節點。這與只能透過 API 呼叫的封閉模型不同。

截至 2026 年 8 月 7 日,Artificial Analysis 的盲測排名中,H3 在文生影片與圖生影片均屬於表現最前面的開放權重模型,在帶音訊的影片編輯項目也位居整體前列。排名會持續變動,但至少說明 H3 並不是只有「開放」而畫質明顯落後的模型。(Artificial Analysis)

4. 2K 不再只是事後放大

H3-Regenerate-2K 的概念不是傳統:

768p 影片 → 超解析放大 → 2K

而是:

原始文字與所有參考素材+768p 生成結果 → 再生成一次 2K

因此第二階段仍然能重新理解文字、商品、角色和場景,而不是只對像素做銳化。不過這個官方模組目前尚未開放,所以本機 workflow 與官方雲端的 2K 結果仍應分開看待。(Hugging Face)


為什麼 16GB 顯卡也能跑?

首先要修正一個常見稱呼:

桌機版 RTX 5070 是 12GB
RTX 5070 Ti 才是 16GB

因此你看到的「5070 16GB」,大多實際上是 RTX 5070 Ti 16GB。(NVIDIA)

更重要的是:16GB 可以完成推理,不代表整套模型只有 16GB,也不代表模型全部同時放在顯存。

原始模型其實非常大

H3 本機 pipeline 的主要檔案大致如下:

部件 完整精度版本 低記憶體版本
H3 Transformer BF16 約 66.3GB Pruned INT8/FP8 約 21GB
Qwen3-VL-32B 文字與多模態編碼器 BF16 約 51.5GB NVFP4 AWQ 約 15.7GB
Video VAE 約 5.21GB 約 5.21GB
Audio VAE 約 0.605GB 約 0.605GB
合計 約 123.6GB 約 42.5GB

也就是說,最小的官方 ComfyUI 組合仍然約 42.5GB,遠大於 16GB。(Hugging Face)

之所以能跑,靠的是四層優化

1. 把約 40% 的調制參數預先計算

H3 的 33B Transformer 中,大約有 13B 參數位於 AdaLN 調制分支。推理時,這些輸出可以預先計算成 curve table,不必讓全部 13B 參數常駐模型。

因此 ComfyUI 提供了 pruned 版本:

  • 原始 BF16 Transformer:約 66.3GB
  • Pruned BF16:約 40.2GB
  • Pruned INT8/FP8:約 21GB

這不是普通的「隨便砍掉 40% 權重」,而是利用 H3 本身的架構特性,把推理時可預先計算的部分換成查表。MiniMax 模型卡與 ComfyUI 都明確說明了這個設計。(Hugging Face)

2. 權重量化

ComfyUI 目前已提供多種包裝:

  • BF16
  • INT8 ConvRot
  • Pruned BF16
  • Pruned INT8 ConvRot
  • Pruned FP8 Scaled
  • Qwen3-VL NVFP4 AWQ

所以大家口中的「H3 版本很多」,許多其實不是不同能力的模型,而是同一個 checkpoint 的不同精度與記憶體配置。(Hugging Face)

3. 分階段載入,而不是所有模型一起進顯存

實際執行大致是:

Prompt/參考素材
        ↓
載入 Qwen3-VL encoder
        ↓
轉成 conditioning embeddings
        ↓
卸載或部分卸載 encoder
        ↓
載入/串流 H3 Transformer 進行採樣
        ↓
卸載 Transformer
        ↓
載入 Video VAE/Audio VAE 解碼

因此:

  • 15.7GB 的文字編碼器不必和 21GB Transformer 永久同時存在。
  • 不使用的模型可以移到系統 RAM。
  • Transformer 不一定完整放入 VRAM,可以逐 block 在 RAM 與 VRAM 之間搬移。
  • VAE 解碼採用 spatial tiling 與 temporal chunking,避免一次解碼整段高解析影片。

ComfyUI 將這套機制稱為動態 VRAM offloading,並表示最低甚至可在 RTX 3060 等級顯卡上啟動;但顯存越少,RAM 和 VRAM 之間搬運越頻繁。(ComfyUI Newsletters)

4. 用速度換記憶體

這是最容易被影片標題省略的部分。

「16GB 能跑」通常代表:

  • 可以完成生成
  • 可能需要大量系統 RAM
  • 會頻繁 CPU offload
  • PCIe 傳輸成為瓶頸
  • 生成時間通常以分鐘計,而不是即時
  • 解析度、影片秒數和 frame 數提高後,速度與記憶體需求會快速增加

所以 5070 Ti 16GB 跑一段較短的 768p 影片,和流暢跑 15 秒、2K、多參考影音,是完全不同的概念。

一張 16GB 卡能執行 H3,真正含義是:

模型的 peak VRAM 被控制在 16GB 左右,而不是整個 42.5GB pipeline 被塞進 16GB。


為什麼最近大量 ComfyUI 專案開始採用 H3?

1. MiniMax 開放權重與 ComfyUI 原生支援同時發生

H3 權重在 2026 年 8 月 3 日開放,ComfyUI core 的 H3 支援也在同一天合併。它不是靠一個半成品 community wrapper 勉強執行,而是直接進入核心架構,包括:

  • H3 模型載入
  • 音訊與影片共同採樣
  • H3 專用 VAE
  • Qwen3-VL encoder
  • INT8 fused kernel
  • Pruned AdaLN table
  • 官方 workflow 範例

因此節點作者不必每人重新寫一套底層模型載入器。(Minimax)

2. 一個模型可以取代原本多條 workflow

過去 ComfyUI 影片專案可能要串接:

  • 圖生影片模型
  • identity reference
  • 動作 transfer
  • lipsync
  • TTS
  • Foley/SFX
  • 音訊混合
  • 影片後製

H3 原生同時處理影音後,許多工作流可以被縮短。它不一定在每一項都勝過專用模型,但整體的一致性與可維護性更高。

對 ComfyUI 作者而言,這代表一個 H3 workflow 可以延伸成:

  • 商品廣告
  • 角色短劇
  • 有聲 AI 動畫
  • 音樂視覺
  • 動作參考影片
  • 首尾幀轉場
  • 多角色 reference
  • 影片重新演繹

而不必維護五六套完全不同的模型鏈。

3. H3 的輸入形式非常適合 node graph

ComfyUI 最擅長的就是把不同素材接成節點,而 H3-Ref2VA 剛好允許圖片、影片和音訊混合輸入。

因此工作流很容易被視覺化成:

角色參考圖 ─┐
商品參考圖 ─┤
動作影片 ───┼→ H3 Ref2VA → 影音結果
語音參考 ───┤
文字指令 ───┘

這比「全部要求寫進一個超長 prompt」更符合 ComfyUI 使用者的操作習慣。

4. 它提供了極大的社群優化空間

模型開放後短短幾天,社群便開始出現:

  • 4-step Turbo LoRA
  • H3 LoRA 載入與轉換工具
  • Dual-clock video/audio sampler
  • 音訊修復與同步節點
  • 更低精度量化版本
  • 多 GPU 與 CPU offload workflow

例如部分社群 Turbo LoRA 嘗試把原本約二十步的生成壓縮到四步;另外也有人開發 video 與 audio 使用不同噪聲時鐘的 dual-clock sampler,以減少低步數時的音訊雜訊。不過這些屬於非常早期的第三方實驗,不能直接視為官方品質保證。(GitHub)

5. 本地部署讓大量反覆測試變得可行

影片工作流通常不是生成一次,而是反覆修改:

  • Seed
  • Prompt
  • 首尾幀
  • 角色參考
  • 動作影片
  • 音效
  • LoRA
  • Sampler
  • CFG
  • 長度與解析度

API 每次都要排隊、上傳素材與計費;本地 H3 即使比較慢,對大量測試、批次製作、內部素材、隱私內容和自訂模型仍有吸引力。


目前最容易被誤解的四件事

「16GB 可以跑」不等於「H3 是 16GB 模型」

最小常用組合約 42.5GB,只是透過量化、分階段載入、RAM offload 和 tiled VAE,把峰值顯存壓低。

「ComfyUI 可以設 2K」不等於「本機擁有官方 H3-Regenerate-2K」

官方 2K regeneration 模組目前沒有開放。直接提高本機採樣解析度,和官方的 in-context 2K regeneration 不是同一條 pipeline。(Hugging Face)

「開放權重」不完全等於傳統開源軟體

H3 使用的是 MiniMax H3 Community License,不是一般 OSI 開源授權。條款目前列出美國、歐盟、英國與南韓等排除區域,年營收超過 2,000 萬美元的商業組織也需要另外取得授權。台灣目前未被明列於排除區域,但商用前仍應依最新版條款確認。(Hugging Face)

「四步 Turbo」不等於官方完整品質

Turbo LoRA、低位元量化、極低步數和激進 offload 都可能交換速度、穩定度、音訊品質或細節。展示影片能成功,不代表每一種輸入、長度和解析度都同樣穩定。


最后的總結

MiniMax H3 真正重要的地方,不只是「又有一個畫質更好的影片模型」,而是它把這幾件事同時湊齊了:

前沿等級畫面+原生影音共同生成+多模態參考控制+開放權重+ComfyUI 原生支援+消費級顯卡可透過 offload 執行。

所以它目前更像是 ComfyUI 影音領域的一個新「底層平台」,而不只是另一個 T2V checkpoint。

5070 Ti 16GB 能跑,是記憶體工程的勝利;大量專案開始採用,則是因為 H3 把原本分散在影片、語音、音效、嘴型、reference 和 editing 的多條工作流,第一次有機會收進同一套可程式化、本地可修改的模型架構裡。

留言

這個網誌中的熱門文章

[CSS] z-index 在不同瀏覽器繼承問題

今天會討論到這個課題,是因為要實做一個Popup dialog,所以我們希望的結果如下圖。 可是在IE7 卻發生了這樣的情況。 Popup不論怎麼設定z-index都無法浮在最上層,我們看一下html架構發生什麼事情。

[教學] 快快樂樂刪除CodeIgniter index.php

預設的CI網址預設都設定為index.php同一層級,因此所有的程式都必須指定index.php導向才能開始,例如 http://localhost/ci/index.php/welcome/test http://localhost/ci/welcome/test 本文將說明如何將惱人的index.php消除,還你一個漂亮的URL。 設定開始: 接下來說明如何使用rewrite方式將惱人的index.php去除。 rewrite不清楚的人,煩請先自行google 首先要先確定Apache的 mod_rewrite 有 開啟 ,如果沒有開啟請設定好之後重新啟動apache。 接著,在根目錄底下建立一個新檔案,檔名為 .htaccess ,裡面程式碼如下: <IfModule mod_rewrite.c> RewriteEngine On RewriteBase / RewriteCond %{REQUEST_FILENAME} !-f RewriteCond %{REQUEST_FILENAME} !-d RewriteRule ^(.*)$ index.php/$1 [L] </IfModule> 接著到 application/config/config.php ,開啟檔案修改 $config['index_page'] = ""; 注意: /index.php/$1 要根據你目錄,例如 http://localhost/index.php ,網站根目錄為 /ci/index.php 則要寫成 /ci/index.php/$1 接著至CI目錄下,尋找 config\config.php , 修改一下裡面的檔案,修改如下: $config['index_page'] = ""; 存檔後,如此一來大功告成。 參考資料 官方網站說明

[教學] Mojito 安裝與入門,install mojito for beginner.

mojito ,最近終於從 YDN 對外公開此專案,這個套件主要用於解決前端多重裝置及瀏覽器端的問題,後端服務採取 node.js ,因此使用上必定要先準備以下幾個元素 準備素材 c++ complier git Node.js > 0.4.x NPM > 1.0.x 安裝方式 git clone git://github.com/yahoo/mojito.git cd mojito/source sudo npm install -g . npm install . 以上四個簡單的步驟,就可以把 mojito module 完整安裝到服務器上,接著就可以開始進入 mojito 的世界 使用方式 mojito 提供了完整的 command line 給開發者使用,接著先建立一個基本 hello world 專案,跟著以下步驟完成第一個專案。首先建立一個 mojito application, mojito create app hello cd hello 切換到目錄之後,再接著建立自己的 mojit,這邊的 mojit 就像是一個應用(application)可能會包含許多個獨立網站體,擁有獨立架構的 MVC ,包含內部設定等,詳細資料可以參考官方的 說明 ,建立 mojit mojito create mojit HelloMojit 輸入指令後,會看到顯示結果如下, creating mojit called 'HelloMojit' (using "default" archetype) ✔ mojit: HelloMojit created! ✔ mojito done. 接著修改 application.json 這個 mojit 設定檔案,讓剛才新建立的 hellp application 指定底下有一個 mojit -> HelloMojit ,讓應用可以去執行 mojit controller ,修改如下, [ { "settings": [ "master" ], "appPort": 8666, "specs": { ...