AI 视频生成(AI Video Generation)
AI 视频生成指由文本/图像/视频输入直接生成或编辑视频的多模态能力,是 2025–2026 年继 Coding 之后又一条「Token 大战」战线。代表性模型包括字节 Seedance、Google Veo、阿里 HappyHorse 等。与图像生成相比,视频生成对算力、时序一致性与可控性要求更高,头部模型仍保有较强议价权。
商业化上视频生成已跑出可观规模。据 36氪独家,火山引擎 将 2026 年 MaaS 营收目标上调至 150 亿元,增长几乎全靠视频模型 Seedance 2.0——其单月收入已超 10 亿元,短剧行业渗透率约 95%,全球份额仅次于 Google Veo。详见 Seedance 商业模式。
供给侧也在快速多元化:阿里 HappyHorse 1.0 登陆百炼 显示大厂纷纷入场;梁文锋投资人会议实录 与 AGI 全景图 则从模型能力演进角度解释了视频生成在通往 AGI 路线图中的位置。该领域与 AI 模型竞争、AI 内容变现 深度交织。
视频生成也开始向长片叙事延伸。Hell Grind(2026-08)自称「世界首部 AI 长片」——95 分钟成片、约 40 万美元算力成本、15 人团队 14 个月完成,使用 Seedance 运动技术并全流程开源(725 万条镜头级提示词、10 万+ 生成素材),曾在戛纳 Cannes Marché 展映。这是 Seedance 从短剧场景向长片制作能力边界拓展的一个实例。
? 「世界首部 AI 长片」为项目方自述口径,尚无第三方佐证,亦未给出「AI 长片」判定标准,待核实;wiki 现有页面无其他「首部 AI 长片」声明可对照,暂不构成矛盾。
2026-08-10 MiniMax H3:开源音视频联合生成进入消费级本地部署
MiniMax 开源的 H3 是**原生多模态(视频+音频联合生成)**路线的又一模型——“一套模型同时生成画面和声音”,而非生成视频后再配音;与 HappyHorse 的云端 API 路线不同,H3 进入了消费级可部署阶段:Pruned 版(≈20B 有效参数)+ GGUF Q4_K_M 量化(≈11.6GB)+ Qwen3-VL-32B 文本编码器 CPU offload + 12fps 出片 RIFE 插帧的组合,可在 16GB 显存(RTX 4070 Ti Super)+ 64GB 系统内存上运行——显存峰值 ≈15.5GB,约 15 分钟生成一条 1280×720 / 24fps / 10 秒立体声视频。开源范围注意:仅 H3-Base 开源(H3-Context-IR 与 H3-Regenerate-2K 未开源),可用的 INT4/Q4 量化权重全部来自第三方仓库 Abiray(非 ComfyUI 官方),存在供应链风险。详见 Source: H3 16GB 本地部署全攻略 与 AIGC 视频。
? 16GB 部署为单一实测配置(显存峰值贴边,需关闭其他 GPU 应用);系统内存不足 64GB 或 PCIe 带宽更低时可行性未验证。