要点速览
- 2026 年 8 月 3 日,MiniMax 开源了通用多模态视频生成模型 H3 的权重,ComfyUI 当天合入原生支持,社区在 48 小时内把本地生成速度提升了一倍。
- H3 把文字、图片、视频、音频放进同一个上下文里理解和生成,画面与声音在同一个模型里同步产出,口型、音效、环境音天然对齐,单条最长 15 秒。
- 开源的只是负责生成的 768p 主干模型;负责理解素材的 Context-IR 和负责 2K 高清输出的 Regenerate-2K 留在云端只卖 API——开源做生态,云端做变现。
- 官方 API 的 2K 档价格约为字节跳动 Seedance 2.5 的十二分之一,AI 视频的试错成本第一次被打到了电费级别。
- 生成成本雪崩之后,稀缺资源从算力换成了注意力:内容形式每升级一次,注意力就重新分配一次,而这样的窗口期不会一直开着。
2026 年 8 月 3 日,中国 AI 公司 MiniMax 把新一代视频生成模型 H3 的权重放到了网上,任何人都可以下载、部署、修改。当天,开源视频工作流社区 ComfyUI 合入了对它的原生支持,多家芯片厂商和推理框架同步宣布适配;48 小时之内,社区拿出的一批加速方案把本地生成速度提了一倍。有重度玩家的显卡从权重落地那一刻起就没有停过——通宵抽卡跑了 37 条片子,没有一条重复,也没有一条废片。
“抽卡”是 AI 生成圈的行话:同一个提示词反复生成、从随机结果里挑可用素材,像抽卡牌游戏一样看运气。过去两年,这个动作是有明码标价的,而且不便宜——每一次不满意的重来,都是账单上真实的一行。H3 改变的正是这一行。
要理解这次开源为什么值得专门讲,需要把三层事情拆开:这个模型本身做对了什么,MiniMax 把哪些东西送了出去、哪些留在手里,以及成本雪崩之后,竞争的焦点会挪到哪里。
一个模型,把五个工种揉成了一件事
过去的视频生成模型有个共同的毛病:你得按它的规矩来。文生视频一个入口,图生视频一个入口,想要配音得再接语音合成,想要音效还得另找工具,复杂一点的需求就要把好几个模型串成工作流。每个模型只干一件事,串联的每一环都在损耗质量和时间。
H3 的做法不同。它把文字、图片、视频、音频当成同一个上下文来处理——官方称之为“统一的多模态上下文”(unified multimodal context)。说得直白一点:你可以把参考图、参考视频、一段配音样本和一句大白话需求一起扔给它,它自己理解这些素材之间的关系,然后一次性生成带声音的成片。按官方公布的规格,它支持最多 9 张参考图、3 段参考视频、3 段参考音频,输出最长 15 秒、24 帧每秒的视频,自带 32kHz 立体声,口型能对上 11 种语言,给一段参考音频甚至能换掉配音的音色。
这里面最要紧的一个细节是:画面和声音是在同一个模型里一起长出来的。传统流水线是先生成画面、再配声音,两者永远差着一层“贴合度”;而 H3 的对白、音效、环境音和画面出自同一次生成,口型、呼吸、脚步声天然咬合。单条 15 秒听起来不长,但广告、产品演示、片头片花,恰恰都活在 15 秒以内。
一位早期实测者的用法很能说明问题:他把多年前写的剧本杀作品的角色卡和手册丢给图像模型生成一套风格图,再把风格图交给 H3——不到 10 分钟,一条 768p 的宣传片就出来了。放在两年前,这是一支小团队加一笔预算才能做的事。
开源当天,生态替它打了第一仗
权重开源和产品发布是两回事。产品发布靠公司自己的工程师迭代;权重开源之后,全世界最聪明的一群人会开始免费帮你优化——这件事永远不会发生在闭源模型身上。
H3 落地当天的时间线足够说明力度:ComfyUI 原生支持当天合入,芯片厂商和推理框架同日宣布适配,卖课的、卖提示词的连夜上架,教程和工作流开始刷屏。真正硬核的变化发生在之后的两天里——SageAttention、EasyCache、FBC(First Block Cache)这一类社区加速方案陆续套上,本地生成速度在 48 小时内翻倍。开源发布当天需要 24 分钟才能跑完的任务,两天后同样的硬件只要一半时间,而且这个优化进程还看不到停下来的迹象。
这个剧本似曾相识。2025 年初,DeepSeek 把接近顶级水平的语言模型权重开源,整个行业的价格体系和生态格局在几周内被改写。H3 被不少人称为“视频生成的 DeepSeek 时刻”,指的就是这个结构:当 SOTA 级(state of the art,指当前最好水平)的能力从付费墙后面走出来变成公共资产,围绕它的生态会以闭源公司永远追不上的速度自我繁殖。
视频生成这个领域,此前一直由闭源模型把持——字节跳动的 Seedance、Google 的 Veo、OpenAI 的 Sora 轮流刷新天花板,用户能做的只有排队和付费。H3 是第一次有开放权重的模型站到了同一张牌桌上。
白送的部分,和不送的部分
但如果只把这件事读成“做慈善”,就看漏了整个设计里最精巧的部分。完整的 H3 系统由三个模块组成,MiniMax 只开源了中间那一个:
| 模块 | 干什么 | 开源了吗 |
|---|---|---|
| H3-Context-IR | 云端的素材理解与编排服务:分析你给的图、视频、音频之间的关系,推理出“什么该保留、什么该改变”,生成结构化提示词 | 否,只有 API |
| H3-Base | 生成主干:按提示词产出 768p 带声音的视频(开源的是蒸馏后的权重) | 是,8 月 3 日放出 |
| H3-Regenerate-2K | 高清模块:把 768p 结果连同原始上下文一起送回模型,以 2K 分辨率重新生成一遍 | 否,只有 API |
这两个没开源的模块,恰好是从“能玩”到“能交付”之间的两级台阶。
Context-IR 解决的是理解问题。实测里有个很直观的对比:拿一段雨夜拉小提琴的视频让模型把衣服改成红色雨衣,只用简单提示词,衣服是变了,但镜头运动也全变了;经过 Context-IR 生成结构化提示词再跑,人物、场景、镜头运动都和原片保持一致。差别不在提示词写得长不长,而在有没有一层“先想清楚再动手”的推理。
Regenerate-2K 解决的是质量问题。值得较真的一个技术细节是:它不是传统意义上的超分辨率放大,而是带着原始上下文把整条片子以 2K 重新生成一遍——细节是“重新画”出来的,不是插值放大出来的。本地部署的开源版本原生只有 768p,强行输出 1080p 级别不仅细节提升有限,时间成本还要翻三倍,第三方超分工具的效果也普遍接不住。想要官方演示里那种 2K 质感,只有一条路:调云端 API。
把这三张牌摆在一起,商业设计就清楚了:把画笔白送出去,把暗房留在手里。开源的 768p 主干负责获客——让全世界的创作者免费试错、刷经验、做教程、建生态;云端的理解和高清模块负责变现——一旦你要把作品变成商品,就回到官方的计费通道上来。而这个计费通道本身也是武器:官方 API 的 2K 档定价约为 Seedance 2.5 的十二分之一,包月包年档还能再往下压。开源打的是生态战,定价打的是价格战,两条战线指向同一个对手。
DeepSeek 当年证明过一次:把权重送出去,换来的是整个生态替你打仗。MiniMax 在这个配方上加了一味——权重照送,但把生产级质量的钥匙留在了云端。
当试错门票从抽卡费降到电费
现在把镜头拉远,看这件事对普通参与者意味着什么。
Seedance 2.0 和 2.5 其实已经解决了“AI 视频能不能进生产线”的问题——广告、短剧行业用得起,也真的在用。但它没解决另一个问题:普通人的试错成本太高了。过去几个月,付得起抽卡费的少数人先掌握了这门手艺,你在信息流里刷到的那些用 AI 参与叙事的博主,作品确实越来越好,但你看不到的是他们背后的账单。更多的人被那份账单挡在了门外。
H3 把这道门槛拆了。本地部署之后,试错的边际成本只剩电费;即便按官方 API 的低价档折算,一整晚 37 条片子的产量也不过一百多块钱。门票便宜到这个程度,练习量的分布就变了——过去是几百个人在高价试错,现在是几个数量级更多的人在同时刷经验。每个人每做一条,提示词就准一分;而这一次,经验的传播速度也会比上一轮快得多,因为一起试错的人多了太多。更好的镜头、更好的叙事,会一波一波地冒出来。
这就引出了整件事里最值得记住的判断:内容形式每升级一次,注意力就重新分配一次。文字到图文,图文到短视频,每一轮形式迁移都造就了一批新的赢家——不是因为他们更有才华,而是因为他们在窗口期里先跑通了新形式。AI 视频正站在同一种窗口期的开口上。
但窗口期是有保质期的。生成成本降下来之后,市场上内容的数量和质量都会水涨船高,而人类的审美疲劳来得很快——酷炫效果几天就看腻了,最终大家还是会回到更好的镜头表达、更好的叙事上来。换句话说,技术红利先到,内容为王后至;能吃到红利的,是在两者交接之前完成练习的人。
这跟你有什么关系
如果你做广告、电商、游戏这类需要视频物料的生意:768p 的免费产能加上 API 的 2K 输出,意味着“先量产试错、再精修交付”的两段式流程已经成立,物料成本会先于你的同行降下来——问题只在于谁先把流程跑通。
如果你是创作者:工具的差距在快速抹平,抽卡费不再构成护城河,接下来拼的是审美和叙事的积累速度。练习量第一次变得几乎免费,这对肯下功夫的人是纯粹的利好。
如果你是埋头写代码的开发者:这可能是最容易被忽略的一条。产品会被海量地生产出来,但传播和获客只会越来越难。做内容的门槛正处在历史最低点,早点建立自己的内容和流量体系,好过将来去找博主买流量。
终局:从生成视频到指挥视频
再往远处看一步。现在的 AI 视频创作,人还在扮演导演和编剧——挑素材、写提示词、抽卡、筛片。但视频生成这条路的终点,大概率是把导演和编剧也交给模型:由一个理解叙事的智能体来指挥视频模型,生成一切。
MiniMax 手里恰好凑齐了这副牌:视频生成模型、创作平台,还有 M 系列语言模型。没有理由不把导演和编剧的能力训练进语言模型里。也许几个月后,“搞提示词”这门刚刚兴起的手艺就会再次贬值,AI 直接接管从创意到成片的全流程。
到那一天,生成能力会彻底沦为水电煤。真正值钱的东西,从头到尾只有一样——
便宜的是像素,贵的是注意力。
信息来源
- MiniMax 官方:Open General Intelligence — MiniMax H3 Is Now Open Source
- MiniMax 官方博客:MiniMax H3 — An Open Model Breaking the Boundaries Between Tasks and Modalities
- MiniMax 中文官网:开放通用智能,MiniMax H3 正式开源
- ComfyUI Wiki: MiniMax H3 — Open Omni-Modal Video Generation Model
- Open Source For You: MiniMax Releases H3 Multimodal AI Model To Challenge Seedance 2.5
- The Information: China's MiniMax Launches New Open-Source AI Video Model
- 少数派:MiniMax H3 全面解读——四分之一价格、四倍分辨率
- IT之家:通用视频模型 MiniMax H3 正式开源,支持多模态上下文、2K 分辨率
- Hugging Face Blog: What Is MiniMax H3 (Hailuo 3.0)?