9月,稀宇科技把H3视频生成模型的权重搬上了HuggingFace,这件事对普通创作者的意义一句话就能说清:过去做一条带声音的AI视频,要么按条给官方API付费,要么买几万块的专业卡;现在一张4000元级的游戏卡就能稳定出片。更关键的是配套生态迅速跟上——ComfyUI原生支持,社区把量化、加速、工作流全套铺开。模型支持输出4到15秒、24fps、短边768p起步最高2K的视频,画幅从21:9到9:16横竖通吃,且音频是原生生成的:对话、音效、音乐和画面在同一次生成里同步出炉,32kHz立体声直接封进MP4,做带台词的短剧镜头,省掉的是整条配音对轨流程。
二、参考输入宽到能锁角色H3给创作者最实用的能力是参考输入:最多9张图、3段视频、3段音频可以混着喂,角色长相、风格、运镜、声音都能锁定。对做系列内容的人,这意味着主角不用每条视频重新抽卡,人物一致性这道AI视频的老大难被大幅缓解。权重在MiniMaxAI/MiniMax-H3仓库开放下载,ComfyUI升到0.30.0就能在模板库里直接调用文生视频、图生视频、参考生视频三个官方工作流,模型文件从Comfy-Org/MiniMax-H3仓库拉取。2K那个再生模块官方暂未开源,走API验证,本地目前主战场是768p。
三、社区把门槛打到16GB官方原版权重40GB往上,消费级显卡跑不动,这是开源第一周的现状。但社区跟进极快:按显存对号入座,24GB卡(4090/3090)走剪枝版INT8约19.5GB,16GB卡(4060Ti/4070)用GGUF量化Q4_K_M约10.6GB、约19GB靠卸载也能跑,8GB卡有DiffSynth-Studio NF4路径约16GB慢但能跑。Mac Apple Silicon也有社区实现Metal原生速度。RTX4060Ti 16GB上,预热后约35分钟出一条5秒480p视频——一个晚上能出一批素材,已经是可以当生产工具用的节奏。
四、加速项目把推理压到秒级围绕H3的加速项目密集冒头,方向高度统一:把推理步数压下去、把硬件门槛降下来。FastH3由FastVideo、NuvaLab和NVIDIA合作,做4步蒸馏,已能在DGX Spark和Apple Silicon上运行;Sol-H3来自NVIDIA SANA团队,在8张B300上报告15秒768p加音频热推理耗时6.6秒(不含模型加载与编码);LightX2V提供4步和8步两档TurboLoRA并配套工作流,把速度和质量的取舍权交回用户。需要提醒的是,加速插件别全开,TE-Speed社区实测文字乱、结构失真已弃用,只开SageAttention是无损的,TurboLoRA压到4步以下快运动画面和音轨会劣化,6到8步才稳。模型开源只是把门槛拆了,真正的钱在"帮别人过门槛"这一侧——教程、工作流模板、部署陪跑,正成为新的小生意。