Seednce瞬間不香了!無設備雲端MiniMax-H3 視頻生成一條龍實操全記錄
整理版優先睇
MiniMax-H3 一條龍部署攻略:本地 4090 或雲端 5090 都可行,用 Grok 自動化 ComfyUI 最爽
MiniMax-H3 係一個開源視頻生成模型,最近喺 AI 界引起好大迴響,因為佢唔單止效果勁,仲開放權重,令一般用家都有機會喺自己電腦度跑。作者親身實測,用 RTX 4090(24GB)加 64GB RAM 配置,生成一段 6 秒鐘視頻大約需要 184 秒,證明消費級硬件其實都夠玩。佢主要想解決嘅問題係:點樣可以唔使買貴價雲服務,都可以用得到呢個模型?於是佢寫低咗一條龍部署筆記,涵蓋本地 Windows 同雲端 Linux 兩種方案。
本地方案以 ComfyUI 加量化權重為主軸,由安裝環境、下載四個模型文件、放入正確目錄,到啟動服務同用 API 提交任務,步驟寫得好詳細。特別要留意,安裝 PyTorch 時要揀啱 CUDA 版本,否則會行 CPU 版慢到喊;下載權重時亦要記得放啱 ComfyUI/models 嘅子目錄。雲端方案就示範租用 autodl 嘅 RTX 5090,透過夸克網盤掛載權重,再喺瀏覽器訪問 ComfyUI 界面。整體結論係:無論你有冇 GPU,只要跟住呢篇步驟行,都可以成功跑起 MiniMax-H3,而且唔使手動拗節點,因為可以用 Grok 自動化 API 嚟出片。
作者特別強調,以前學 ComfyUI 好花時間,但而家有 Grok 呢類 Code Agent,直接叫佢幫手寫 API 請求就得,真正實現 prompt-to-video。實測用 1344×768、24 steps 設定,雲端 …
- 結論:MiniMax-H3 喺消費級硬件上可以流暢生成視頻,RTX 4090 只需約 184 秒(6秒片),唔使再羨慕高階卡。
- 方法:本地用 ComfyUI + 量化權重,跟住官方步驟下載四個模型文件,放到指定目錄,啟動服務即可。
- 差異:雲端 RTX 5090 每步約 61 秒,一條 20-25 分鐘,速度明顯慢過本地,但係勝在冇硬件限制,適合冇卡嘅用家。
- 啟發:用 Grok 呢類 Code Agent 可以自動化 ComfyUI API,唔需要自己拗節點,AI 幫你搞掂工作流。
- 可行動點:想慳時間可以直接參考呢篇筆記,照抄命令;冇 GPU 就租 autodl,配合夸克網盤掛載權重,幾分鐘起好環境。
MiniMax-H3 ComfyUI 官方工作流模板
包含文生視頻(t2v)、圖生視頻(i2v)、角色生視頻(r2v)等模板,下載後放入 ComfyUI/user/default/workflows
MiniMax-H3 官方 Comfy-Org 權重倉庫
四款量化權重(DiT、text encoder、video VAE、audio VAE)由呢度下載
效果同提示詞參考(飛書文檔)
作者分享更多視頻效果同提示詞示範
MiniMax-H3 開源:消費級顯卡都玩得起
MiniMax-H3 係一個開源視頻生成模型,最近話題度好高。作者親身喺自己部機實測,硬件配置係 RTX 4090(24GB)加 64GB RAM,成功生成一段 6 秒鐘視頻,大約需要 184 秒。
消費級顯卡(RTX 4090)已經可以流暢跑 MiniMax-H3,唔使再羨慕專業級 GPU。
作者想解決嘅問題,就係點樣令冇頂級硬件嘅人都可以用到呢個模型。佢試咗兩種方案:本地 ComfyUI 部署同雲端租賃。
本地方案:ComfyUI + MiniMax-H3 量化權重,成本低但步驟多;雲端方案:租 autodl RTX 5090,慳硬件但收費。
整體嚟講,跟住作者嘅筆記,無論有冇 GPU 都可以成功起動,而且仲可以用 Grok 自動化工作流,唔使慢慢學 ComfyUI。
本地 Windows 部署:由零到出片
第一步係準備環境:Windows 機、Python/Miniconda、Git、NVIDIA 驅動,如果 GitHub 唔穩陣最好開代理。之後開一個資料夾,git clone ComfyUI。
mkdir AI
cd D:\AI
git clone --depth 1 https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
python -m venv venv
call venv\Scripts\activate.bat
python -m pip install -U pip
python -m pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu128
python -m pip install -r requirements.txt
安裝後一定要驗證 torch.cuda.is_available() 係 True,否則裝咗 CPU 版會慢到喊。
第二步下載四款模型權重,包括 DiT、文字編碼器、視頻 VAE 同音頻 VAE,加埋約 43GB。可以用以下指令逐個下載,記住放啱目錄。
- diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors(約 21GB)
- text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors(約 16GB)
- vae/minimax_h3_video_vae_fp16.safetensors(約 5.2GB)
- vae/minimax_h3_audio_vae_fp32.safetensors(約 0.6GB)
權重文件要放喺 ComfyUI/models 嘅對應子目錄(diffusion_models、text_encoders、vae),放錯咗會 load 唔到。
第三步攞官方工作流模板。
工作流模板要放喺 ComfyUI/user/default/workflows,揀啱文生視頻(t2v)或者圖生視頻(i2v)嘅 json。
第四步啟動 ComfyUI,用 --listen 0.0.0.0 可以畀局域網其他機訪問。
cd D:\AI\ComfyUI
call venv\Scripts\activate.bat
python main.py --listen 0.0.0.0 --port 8188
Grok 呢類 Code Agent 可以幫你自動化 API,唔使自己學 ComfyUI 節點。
最後用 POST /prompt 提交任務,輪詢 /history 攞結果,輸出檔案會喺 output/api_test 目錄。
雲端部署:冇 GPU 都照玩
如果手頭冇 GPU,可以租 autodl 嘅雲服務,作者揀咗 RTX 5090,喺控制枱攞 SSH 登入資訊。
ssh -p 端口號 root@connect.xxx.seetacloud.com
最麻煩嘅係掛載權重,官方建議用公網網盤。作者用夸克網盤,先喺本機將四個 safetensors 傳上去,然後喺 autodl AutoPanel 授權,再下載到 /root/autodl-tmp。
- 喺夸克網盤上傳四個權重文件
- 實例開機 → AutoPanel → 公網網盤 → 設定獨立密碼
- 網頁登入夸克 → F12 → Network → 複製 Cookie 填入 AutoPanel
- 喺網盤揀文件下載,固定到 /root/autodl-tmp
- 用 ln -sfn 將模型目錄鏈到 ComfyUI/models
獨立密碼同登入密碼唔同,唔見咗要重新授權,記住要好小心保存。
之後啟動雲端 ComfyUI,喺控制枱開自定義服務攞外網地址,就可以用 Grok 自動化工作流。
雲端 RTX 5090 以 1344×768、24 steps 實測,每步約 61 秒,一條片要 20-25 分鐘。
自動化同實測效果:Grok 幫你慳時間
作者特別提到,用 Grok 做 Code Agent,可以直接叫佢寫 API 請求,唔使手動喺 ComfyUI 界面上拗嚟拗去。
用 Grok 自動化 ComfyUI API,真正實現 prompt-to-video,慳返大量學習時間。
API 提交方式好簡單,主要有以下幾個 endpoint:
- POST /prompt — 提交工作流
- GET /history/{prompt_id} — 輪詢結果
- GET /queue — 睇排隊狀態
- GET /system_stats — 系統狀態
API 跑完唔會將預覽釘喺工作流節點,要自己去 output 目錄攞片,例如 output/api_test/minimax_h3_00001_.mp4。
實測效果方面,作者提供咗一個飛書文檔,入面有更多視頻示範同提示詞參考。

MiniMax-H3 呢個開源影片模型,用本地消費級顯示卡就可以部署嚟用。
以我部機嘅配置為例,GPU係RTX 4090,24GB,內存是 64GB記憶體,生成一個6秒鐘嘅影片大概要花184秒左右。
本地部署用嘅方案係ComfyUI加MiniMax-H3量化版。
以下係本地部署同雲端使用嘅筆記步驟:
環境準備(Windows)
Python / Miniconda
Git
NVIDIA 驅動(支持 CUDA)
可選:本機代理(如 127.0.0.1:7890),GitHub/HF 不穩時用步驟1:安裝ComfyUID:
mkdir AI
cd D:\AI
git clone --depth 1 https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
python -m venv venv
call venv\Scripts\activate.bat
python -m pip install -U pip
python -m pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu128
python -m pip install -r requirements.txt注意,如果之前裝咗 requirements.txt,可能會裝成 CPU版嘅torch。
一定要確認:
python -c "import torch; print(torch.__version__, torch.cuda.is_available())"應該會見到類似:2.x.x+cu128 True。
步驟2:下載4個官方Comfy權重
倉庫地址:
https://huggingface.co/Comfy-Org/MiniMax-H3
目錄結構:
ComfyUI/models/
├── diffusion_models/
│ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
├── text_encoders/
│ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
└── vae/
├── minimax_h3_video_vae_fp16.safetensors
└── minimax_h3_audio_vae_fp32.safetensors喺PowerShell/CMD度,按需要改代理。
curl -L --http1.1 --ssl-no-revoke --retry 50 --retry-delay 5 -C - ^
-o D:\AI\ComfyUI\models\diffusion_models\minimax_h3_fl2va_pruned_int8_convrot.safetensors ^
https://huggingface.co/Comfy-Org/MiniMax-H3/resolve/main/diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors另外3個檔案都係同理,淨係改URL同儲存路徑。
完整嘅4個URL:
# DiT ~21GB
.../diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors
# 文本編碼器 ~16GB
.../text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
# 視頻 VAE ~5.2GB
.../vae/minimax_h3_video_vae_fp16.safetensors
# 音頻 VAE ~0.6GB
.../vae/minimax_h3_audio_vae_fp32.safetensors步驟3:工作流:
官方模板(文字生成影片):
- •
video_minimax_h3_t2v.json(都可以下載I2V/R2V版本)
放到:
ComfyUI/user/default/workflows/參考地址:
https://github.com/Comfy-Org/workflow_templates
步驟4:啟動ComfyUI。
cd D:\AI\ComfyUI
call venv\Scripts\activate.bat
python main.py --listen 0.0.0.0 --port 8188步驟5:用
有咗Grok呢個Code Agent,我哋根本唔使去學ComfyUI,可以自動化嘅話就要行API。
提交方式
POST http://127.0.0.1:8188/prompt
Content-Type: application/json輪詢:
GET /history/{prompt_id}
GET /queue
GET /system_statsAPI跑完不會將預覽釘喺而家打開嘅工作流節點上面。
檔案喺磁碟嘅路徑位置:
D:\AI\ComfyUI\output\api_test\minimax_h3_00001_.mp4 ← API 前綴
D:\AI\ComfyUI\output\video\MiniMax_H3_00001_.mp4 ← UI 模板前綴
D:\AI\ComfyUI\output\video\MiniMax_H3_00002_.mp4--listen 0.0.0.0 後,局域網可直接:http://192.168.x.x:8188/system_stats
http://192.168.x.x:8188/prompt雲端RTX 5090部署
手上冇GPU設備嘅話,可以揀租用線上服務商,我用嘅係autodl,揀嘅配置如下:

喺控制枱面板攞登入資料。

控制枱俾嘅命令類似:
ssh -p 端口號 root@connect.xxx.seetacloud.com用Grok嚟連接。

掛載權重呢part會比較麻煩,官方推薦使用公網網盤。
步驟如下:
1.把本機將4個safetensors傳去夸克,地址,如果你未下載,可以用下面條連結下載權重同:
https://pan.quark.cn/s/3e3f4b5897b0
2. 實例開機 → 快捷工具 AutoPanel → 公網網盤


5. 喺網盤揀中檔案 → 下載 → 固定到 /root/autodl-tmp
mkdir -p /root/autodl-tmp/models/{diffusion_models,text_encoders,vae}
# 按實際下載位置 mv 到對應子目錄
ln -sfn /root/autodl-tmp/models/diffusion_models /root/ComfyUI/models/diffusion_models
ln -sfn /root/autodl-tmp/models/text_encoders /root/ComfyUI/models/text_encoders
ln -sfn /root/autodl-tmp/models/vae /root/ComfyUI/models/vae- 7.啓啟動雲端Comfy
cd /root/ComfyUI # 或你的新版本路徑
source /root/miniconda3/bin/activate
python main.py --listen 0.0.0.0 --port 60068. 外網訪問,去控制面板撳自定義服務。

攞到外網嘅訪問地址。

之後用Grok嚟自動創建ComfyUI嘅工作流編排就得喇。
實測效果。以1344×768、24 steps為例,大約61秒/步,單條大約20至25分鐘。
好多影片效果同提示詞可以參考呢度:
https://vrfi1sk8a0.feishu.cn/wiki/FIWjwgL33ipnkekzk30crmKUnIh

MiniMax-H3 的開源視頻模型本地的消費級顯卡就可以部署使用。
以我的配置為例,GPU為RTX 4090 ,24GB,內存是 64GB生成一個6 秒鐘視頻大概需要花費 184 秒左右。
本地部署採用的方案是ComfyUI + MiniMax-H3 量化。
以下是本地部署和雲端使用的筆記步驟:
環境準備(Windows)
Python / Miniconda
Git
NVIDIA 驅動(支持 CUDA)
可選:本機代理(如 127.0.0.1:7890),GitHub/HF 不穩時用Step 1:安裝 ComfyUID:
mkdir AI
cd D:\AI
git clone --depth 1 https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
python -m venv venv
call venv\Scripts\activate.bat
python -m pip install -U pip
python -m pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu128
python -m pip install -r requirements.txt注意若先裝了 requirements.txt,可能裝成 CPU 版 torch。
務必確認:
python -c "import torch; print(torch.__version__, torch.cuda.is_available())"應看到類似:2.x.x+cu128 True。
Step 2:下載 4 個官方 Comfy 權重
倉庫地址:
https://huggingface.co/Comfy-Org/MiniMax-H3
目錄結構:
ComfyUI/models/
├── diffusion_models/
│ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
├── text_encoders/
│ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
└── vae/
├── minimax_h3_video_vae_fp16.safetensors
└── minimax_h3_audio_vae_fp32.safetensorsPowerShell / CMD,按需改代理
curl -L --http1.1 --ssl-no-revoke --retry 50 --retry-delay 5 -C - ^
-o D:\AI\ComfyUI\models\diffusion_models\minimax_h3_fl2va_pruned_int8_convrot.safetensors ^
https://huggingface.co/Comfy-Org/MiniMax-H3/resolve/main/diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors另外 3 個文件同理,只改 URL 和保存路徑。
完整四個 URL:
# DiT ~21GB
.../diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors
# 文本編碼器 ~16GB
.../text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
# 視頻 VAE ~5.2GB
.../vae/minimax_h3_video_vae_fp16.safetensors
# 音頻 VAE ~0.6GB
.../vae/minimax_h3_audio_vae_fp32.safetensorsStep3 工作流:
官方模板(文生視頻):
- •
video_minimax_h3_t2v.json(也可下 I2V / R2V)
放到:
ComfyUI/user/default/workflows/參考地址:
https://github.com/Comfy-Org/workflow_templates
Step4 啓動ComfyUI。
cd D:\AI\ComfyUI
call venv\Scripts\activate.bat
python main.py --listen 0.0.0.0 --port 8188Step 5:使用
有了Grok這個Code Agent,我們根本不需要去學習ComfyUI,可以自動化要走 API。
提交方式
POST http://127.0.0.1:8188/prompt
Content-Type: application/json輪詢:
GET /history/{prompt_id}
GET /queue
GET /system_statsAPI 跑完不會把預覽釘在當前打開的工作流節點上。
文件在磁盤路徑位置:
D:\AI\ComfyUI\output\api_test\minimax_h3_00001_.mp4 ← API 前綴
D:\AI\ComfyUI\output\video\MiniMax_H3_00001_.mp4 ← UI 模板前綴
D:\AI\ComfyUI\output\video\MiniMax_H3_00002_.mp4--listen 0.0.0.0 後,局域網可直接:http://192.168.x.x:8188/system_stats
http://192.168.x.x:8188/prompt雲端 RTX 5090 部署
手頭上沒有GPU設備的,可以選擇租用線上的服務商,我用的是autodl,選擇的配置如下:

在控制枱面板獲取登錄信息。

控制枱給的命令類似:
ssh -p 端口號 root@connect.xxx.seetacloud.com使用Grok進行連接。

掛載權重這塊會比較麻煩,官方推薦使用公網網盤。
步驟如下:
1.把本機把 4 個 safetensors 傳到夸克,地址,如果你沒有下載 可以使用下面的連結下載權重和:
https://pan.quark.cn/s/3e3f4b5897b0
2. 實例開機 → 快捷工具 AutoPanel → 公網網盤


5. 在網盤選中文件 → 下載 → 固定到 /root/autodl-tmp
mkdir -p /root/autodl-tmp/models/{diffusion_models,text_encoders,vae}
# 按實際下載位置 mv 到對應子目錄
ln -sfn /root/autodl-tmp/models/diffusion_models /root/ComfyUI/models/diffusion_models
ln -sfn /root/autodl-tmp/models/text_encoders /root/ComfyUI/models/text_encoders
ln -sfn /root/autodl-tmp/models/vae /root/ComfyUI/models/vae- 7.啓動雲端 Comfy
cd /root/ComfyUI # 或你的新版本路徑
source /root/miniconda3/bin/activate
python main.py --listen 0.0.0.0 --port 60068. 外網訪問,來到控制面板 點擊自定義服務。

獲取到外網的訪問地址。

之後使用Grok來自動創建ComfyUI的工作流編排就可以了。
實測效果。以1344×768,24 steps 為例,約 61 秒/步,單條約 20–25 分鐘。
很多視頻效果和提示詞可以參照這裏:
https://vrfi1sk8a0.feishu.cn/wiki/FIWjwgL33ipnkekzk30crmKUnIh