Reed's News
← 返回精选

MiniMax H3 支持 ComfyUI:开源权重、原生音频与 2K 视频

AI 51 vblanco 2026/8/3 1447 字 原文 ↗

开源全模态视频模型:支持真实立体声与2K输出,经ComfyUI深度优化,可在3060本地运行

MiniMax H3今日正式发布并开放权重,今早已实现ComfyUI原生支持,发布即适配。

作为新一代开源视频模型,它支持以文本、图像、视频或音频为输入,生成带真实立体声的视频片段,分辨率最高达2K,时长最长15秒。这是MiniMax继"海洛01""海洛02"后的第三代视频模型,也是该公司首款开源权重的视频模型。

核心特性

  • 文本生成视频:仅需输入提示词即可生成
  • 图像生成视频:让静态画面动起来
  • 首尾帧控制:可指定开头帧、结尾帧或同时指定两者,由模型自动补全中间内容
  • 参考生成视频:提供参考图像、视频或音频,将主体、动作或声音元素融入生成片段

输出规格最高可达2K分辨率、15秒时长。音频与视频同步生成,原生支持立体声,而非后期拼接添加。

多模态语境理解

这是MiniMax的核心优势,也是该模型能将五项独立任务整合为一的关键。实际创作很少仅依赖单一模态,H3可同时接收图像、音频、视频输入,并结合提示词理清各元素间的关联。只需描述输入素材与目标镜头的关系,模型即可自动完成跨模态协同工作。

原生立体声输出

音频生成是模型的原生功能,而非后期处理环节,所有输出音频均为立体声。

编辑与动作迁移

动作迁移对图像创作尤为重要:可通过参考视频提供镜头运动、人物表演、剪辑节奏等动作元素,而主体与风格则来自其他素材。结合原地编辑功能,即可实现镜头的反复迭代优化。

生成示例

美式漫画粗线风格,红与蓝黑配色,夜晚都市场景。严格参考<Picture 2>和<Picture 1>作为关键帧,完全沿用<Audio 1>音频。
镜头1:俯视屋顶上的小超人——红披风随风飘动,双手叉腰,满脸雀斑带着桀骜笑容直视镜头。镜头缓缓向他推进,他同步念出台词,画面逐字弹出漫画风格字幕,与语音精准同步:"准备好"——"见识"——"你的"——"造物主"。字幕为粗犷锯齿状白色字体,配粗黑描边与红色阴影,呈不规则倾斜角度,最终三个单词堆叠悬浮在他与镜头之间的空中。
转场:镜头剧烈甩动离开屋顶,悬浮的字幕随运动轨迹被抹成拖影——
镜头2:低角度仰视巨型黑色机甲怪兽,它正耸立在城市天际线后方,仰头发出震耳欲聋的咆哮。怪兽血盆大口露出尖牙,红眼睛与胸口核心发出刺眼强光,头部电弧闪烁;咆哮的冲击波震落墙面灰尘、震碎窗户玻璃,漫画风格速度线与墨点随声波冲击四散飞溅。怪兽在咆哮峰值时向镜头逼近,定格咆哮画面。
科技产品编辑风格影片。参考<Picture 1>中的透明游戏鼠标,置于纯黑摄影棚环境,搭配深色哑光反光台面,采用蓝橙双色氛围光勾勒轮廓,阴影向纯黑背景自然过渡。整体色调偏暗,以电光蓝与琥珀色为点缀。突出材质细节:鼠标内部发光金属微元件与光滑亚克力折射效果。场景环境全程保持一致。
镜头1:画面从<Picture 1>的初始状态开始,鼠标沉稳放置在深色台面上;蓝橙灯光缓慢增强,光线透过透明亚克力外壳形成丰富折射,镜头缓慢匀速推进,展现内部精密电路。
镜头2:切换至滚轮与内部多层微元件的极端微距侧拍镜头;镜头沿侧面平稳滑动,一束暖橙色强光扫过金属纹理,与深蓝色环境光形成鲜明对比。
镜头3:低角度美感镜头:鼠标在深色反光台面上空数厘米处无重力悬浮,缓慢精准地旋转;双色灯光在光滑透明边缘形成柔和光晕,随后逐渐暗化为简洁轮廓。
音频:低沉脉动的低音环境音、清脆的机械按键声、镜头切换时的玻璃质感扫动音效,以及逐渐增强后归于近乎寂静的电子音浪。
高端时尚编辑风格影片全程采用奢华慢动作,背景为柔和渐变的摄影棚天空。
音乐与音效:融合太鼓、日本筝与现代低音的电影配乐贯穿始终
镜头1:她身旁的面具已破碎——呈<Picture 2>中的悬浮碎片形态,每一块金缮修复的碎片都悬浮在空中缓慢旋转,碎片间的金线纹路黯淡无光,等待激活。她转头看向面具。
镜头2:重组启动,能量爆发——金线纹路骤然亮起,熔金般的光弧如焊火般在碎片间跳跃,碎片开始逐一拼接,速度由慢至快,每一次拼接都迸发出金色光芒,熔金液滴飞溅而出,周围的液态丝带随冲击波震颤——直至最后一块碎片归位,面具完全复原,金缮纹路通体闪耀。
镜头3:<Picture 3>中的金色巨龙呈S形大幅飞入画面——红色琉璃鹿角率先出现,龙身盘绕在她与面具周围,鳞片反射金色光芒,龙尾拖动深红色液体形成螺旋轨迹。
镜头4:巨龙飞过之后,面具如被磁力牵引般飞速直线划过空气,精准戴在她脸上——佩戴瞬间金光迸发,金缮纹路从面具边缘延伸至她颈部,再蔓延到日落色外套上,刺绣图案逐一点亮。
镜头5:她缓缓落下,轻盈地踩在深色液面上,摆出标准武士姿势定格,如同时尚大片画面——巨龙盘绕在她肩后,两种液体在她周围向上盘旋形成双螺旋结构。镜头定格,呈现海报式静态画面。
参考图像:<Picture 1>、<Picture 2>、<Picture 3>
鱼眼镜头风格产品广告,夏日高饱和光线,<Picture 1>中的女子身穿黄色雨衣,蹲在丛林瀑布旁,手持彩虹渐变汽水罐对准镜头,罐身凝露滴落。
音乐: upbeat热带浩室舞曲贯穿全程——强劲底鼓、明亮钢片琴、温暖贝斯律动。
镜头1:鱼眼英雄镜头——女子直视镜头时,背景逐帧弹出醒目的粗体大字,每字对应一个节拍:"保持" 然后 "补水"。白色方块字体占据整个画面,随鱼眼镜头产生弧度变形,位于女子身后、瀑布前方。她伸出另一只手勾住拉环。
转场:拉环特写——拉环打开时发出清脆的"咔哒-嘶嘶"声,同步鱼眼镜头光圈收缩至黑屏,如同眨眼。
镜头2:光圈重新打开,切换至新视角——汽水罐位于前景,被鱼眼镜头极度放大扭曲;女子微笑着将罐中液体倒在地上,水滴失重般四散飞溅,阳光透过水流折射出彩虹,瀑布在背景中虚化。
转场:她放下罐子,一颗大水滴向镜头坠落,逐渐填满整个画面——
镜头3:透过水滴切换至最终全景镜头:彩虹汽水罐竖直漂浮在绿松石色的水潭中,标签正对镜头,在水雾中轻轻晃动,瀑布在后方轰鸣;水面上倒映着"STAY COMFY"的字样,闪烁微光。定格产品英雄画面。
整体风格明快愉悦、质感高端,所有镜头均保留鱼眼畸变效果。

针对ComfyUI本地推理优化

为让H3在消费级硬件上流畅运行,我们进行了大量机器学习工程优化。研究发现,模型中约占总参数40%的调制权重可被裁剪,替换为功能等效的查找表,在完全不损失输出质量的前提下,大幅降低内存占用。

在此基础上,模型权重采用精准高效的int8 convrot量化技术,配合自定义内核进一步减少推理时的峰值显存占用。

优化后,最小模型变体的总内存占用降低66%,从全精度下的123.6 GB降至42.5 GB。结合动态显存卸载技术,这款新一代2K视频模型可在RTX 3060等消费级GPU上实现本地运行。

快速上手

  • 将ComfyUI更新至最新版本——0.30.0及以上,或直接使用Comfy Cloud
  • 下载下方工作流模板,或在模板库中查找
  • 按照工作流中的说明下载模型,并保存至指定模型目录
  • 编写提示词,连接帧或参考输入素材,即可开始运行

模型权重:🤗 Comfy-Org/MiniMax-H3

尽情创作!