MiniMax H3 Open Weights Released – Supports Up to 12 Multimodal Reference Files in One Context

10 Aug 2026

【MiniMax上週公開MiniMax H3,最接近SeeDance的本地AI影片生成】

MiniMax上週公開 MiniMax H3-Base weights(約33B參數 Omni-Transformer)並同步在 Hugging Face 上架, ComfyUI 即日原生支援.
H3可同時處理文字、圖像、影片與音訊, 最多參考12個檔案作為統一上下文.
例如可參考某段影片的鏡頭運鏡、指定圖像中的人物,再配合另一段音訊的歌聲,一併生成帶原生stereo音訊的短片.
輸出時長為4至15秒(24 FPS), 本地開放版本主要支援短邊768px解析度, 2K則需透過官方API的H3-Regenerate-2K模組實現.
model weights已上架Hugging Face(MiniMaxAI/MiniMax-H3) ComfyUI亦於同日加入原生node支援. 包括ImageToVideo與ReferenceToVideo等 . 模型架構為33B參數的Omni-Transformer, 並配備專用Visual VAE與Audio VAE.
授權方面, MiniMax H3 Community License排除美國、歐盟、英國及韓國的本地使用, 香港地區不受限制. 年收入低於2000萬美元可免費商用. 但產品介面必須清楚標示「MiniMax H3」

Spread the love