资讯

给 AI 一张陶罐碎片图,它能还原破裂过程吗?Minimax H3 vs Seedance 2.0 Fast 实测

雷峰网·2026/9/1 08:31:00🔗 原文

📌 概要

H3 不是物理仿真最强的模型,但它是开放权重视频模型的一道分水岭。     作者丨 吴海明     编辑丨 李娜 岑峰                                                                                                         MiniMax 选择开放 H3 权重,对视频生成行业来说是一个值得关注的

⚡ 关键要点

  • H3 不是物理仿真最强的模型,但它是开放权重视频模型的一道分水岭。     作者丨 吴海明     编辑丨 李娜 岑峰
H3 不是物理仿真最强的模型,但它是开放权重视频模型的一道分水岭。

    作者丨吴海明

    编辑丨李娜 岑峰

                                                                                                       

MiniMax 选择开放 H3 权重,对视频生成行业来说是一个值得关注的信号。过去,高质量视频生成能力大多集中在闭源平台中,开发者和内容团队更多是在 API 或网页产品里调用模型;而 H3 的开放,让一部分高阶视频生成能力进入本地环境,使研究者可以测试模型边界,开发者可以接入自己的工作流,内容团队也能围绕特定风格和场景做更细的实验。

还记得《名侦探柯南》吗?每次案件发生后,现场看起来往往都很简单:一个人倒下了,一件东西碎了,一个密室出现了,核心考验是从现场不起眼的细节里还原完整的案发细节。

这次,我们把一道柯南式推理题交给了 MiniMax H3。

在《失窃宝物之谜》的故事线里,一只误闯进工作室的猫导致了陶罐破碎,那么猫是怎么进来的?它有没有蹭到窗框?台座为什么会晃?陶罐是被直接撞碎,还是先倾斜、滑落、坠地,再因撞击裂开?现场的碎片、痕迹和动线,能不能串成一条完整因果链?

基于这个背景,我们把任务改造成一次图文生成视频实测:给 H3 一张破碎陶罐的参考图,再用分镜描述补充高窗、猫、台座、坠落、撞击和碎片散落等细节,让它生成一段陶罐为什么会碎的过程视频。

由于 MiniMax H3 已经开放模型权重,我们选择在本地完成部署和推理。接下来,我们会先看它在实战中能做到什么:能不能还原完整因果链,能不能保持陶罐前后一致,能不能让猫的动作、台座晃动、陶罐坠落和最终碎片位置彼此对得上。

随后,我们再拆解 H3 生成这类视频背后的技术逻辑,并把同一任务交给 Seedance 2.0 Fast 做对比,看看开放权重模型和闭源商业模型,在效率、写实质感和物理细节上到底有什么差异?

所以,本文真正探讨的问题也就更具体了:当一个开放权重的通用多模态模型,开始具备把结果还原成过程的能力,AI 视频生成会发生什么变化?它能否真正支撑案发复原、事故推演、故事板预演这类对因果链要求更高的任务?接下来,我们用实测说话。

图片

01


MiniMax H3 实战:

还原陶罐破碎全过程

在本次测试中,我们在一台搭载 英伟达 RTX A6000 GPU 的服务器上部署 MiniMax H3,考虑到后续需要通过节点式工作流接入参考图、分镜指令和视频生成参数,我们选择了更适合视觉生成实验的 ComfyUI 作为部署框架。

具体流程并不复杂,我们先从魔塔社区下载适用于 ComfyUI 的 MiniMax H3 模型权重,并将相关文件放入 ComfyUI 对应的模型目录;随后,安装 ComfyUI 运行环境,完成 Python 依赖、CUDA 加速组件和必要节点的配置。环境准备完成后,启动 ComfyUI 服务,并在浏览器中进入可视化工作流界面。

ComfyUI 部署 H3 的可视化工作流界面

模型启动后,将《名侦探柯南》中“案发结果”的破碎陶罐截图作为参考图输入。图中陶罐已经裂成几块,主体是棕褐色陶土材质,断裂处呈明显浅色边缘,碎片散落在灰色地面上,同时保留了动画风格的线条、阴影和室内低饱和色彩。接下来,我们要求 H3 根据这张结果图反向生成陶罐破碎前后的过程,明确要求模型忽略画面中的字幕、水印和平台标识,只提取陶罐碎片的颜色、材质、破损形态、地面透视和最终布局作为参考。

选取自《名侦探柯南》 #1178 失去的宝物之谜 的破碎陶罐截图,附带有字幕、水印和平台标识

生成结果中,H3 基本遵循了小猫闯入房间打破陶罐的叙事方向,视频开头先给出完整陶罐所在的室内空间,随后通过猫进入、靠近台座,把画面从静态陈设推进到事件发生。后续镜头中,陶罐经历了失衡、坠落和破裂,最终画面收束到地面上的大块陶片。

H3 先给出一个完整陶罐所在的室内空间,再通过猫的进入和靠近,导致陶罐出现失衡、坠落和破裂的连续变化,碎裂后画面逐渐收束到地面上的大块陶片。碎片的棕褐色材质、浅色断面以及动画风格的低饱和质感,与参考图保持了较高的一致性。

这段视频完成度最高的地方是 H3 按照指令里的分镜逻辑,把破碎陶罐还原成了一段有前因后果的事件。视频开头先交代陶艺工作室环境,完整陶罐、低矮台座、高窗等关键元素陆续出现,给后面的“猫从窗户进入”建立空间关系。随后,猫进入室内并靠近陶罐,画面过渡到台座晃动和陶罐失衡,基本建立起“外力介入—陶罐坠落”的因果链。

最终结果的控制也比较稳定,陶罐破碎后,画面中保留了参考图里的几个核心视觉特征:棕褐色陶土材质、浅色断裂边缘、大块弧形碎片,以及低饱和动画风格。表明了 H3 并非机械复制原图,而是抓住了参考图中真正有用的结构信息,并将其融入到视频结尾。此外,视频中的动作节奏也较完整:陶罐不是突然碎裂,而是经历了靠近、晃动、倾斜、坠落、破碎几个阶段。虽然猫与陶罐接触的瞬间还不算完全严丝合缝,但整体叙事已经足够清楚,能够让观众理解陶罐破碎的原因。

图片

02


H3 为什么能生成“案发复原”视频?

H3 能完成这类由结果生成过程的视频任务,关键在于它是一个原生多模态生成模型,能将文本、图像、视频和音频放在同一框架中处理,使参考图、分镜描述和声音指令能够共同参与生成。

不同于传统的先生成视频、再后期配音方式,H3 采用音画联合生成,在生成画面的同时,也生成对应的声音。因此,画面中的动作变化、物体碰撞和环境声可以在同一时间轴上对齐,减少声画错位的问题,能够生成带有窗框摩擦、猫爪落地、陶瓷碎裂等声音细节。

在图像控制上,H3 支持 reference-to-video/audio 工作流(H3的核心能力术语),参考图可以作为主体、风格、材质或最终状态的约束。在本次任务中,破碎陶罐截图提供的是终局信息,陶土颜色、白色断裂边缘、碎片形态和地面布局,同时,文本指令提供过程信息,猫进入、撞击陶罐、陶罐坠落并碎裂。模型则要把图像中的终局状态和文本中的过程描述对齐到一条时间线上,H3 并不是在做真实物理推演,而是在多模态条件约束下,生成一条视觉和听觉上合理的状态变化路径。

从技术上看,视频生成的难点在于时序一致性,H3 的核心任务是让陶罐在多帧之间保持同一主体特征,同时完成从完整、晃动、倾斜、坠落到破碎的连续变化;依靠视频时序建模能力,在潜空间中预测连续画面。

因此,H3 能生成这段视频的核心技术是三项能力:一是多模态统一建模,能够同时理解文本、图像、视频和音频;二是参考图条件控制,能够从结果图中提取关键视觉约束;三是音画联合的时序生成,能够让动作、画面和声音同步展开。