更多AI前沿科技资讯,请关注我们:​closerAI-一个深入探索前沿人工智能与AIGC领域的资讯平台

大家好,我是Jimmy。今天一条新闻十分炸裂:

添加图片注释,不超过 140 字(可选)

“VideoDeltaNet on Minimax H3,8 个 B200 芯片上,11.3 秒内生成 14 秒 768p 视频,实时文本转视频生成。近乎无损的质量”

我们先看OPENVDN团队开源的这个VDN-Minimax-H3的效果:

视频封面
视频封面
视频封面

MiniMax H3 被加速75倍,这一次真正值得关注的,可能不是"快了多少",而是AI视频正在发生什么变化。

如果我告诉你:

一段 14 秒的 768p AI 视频,现在最快只需要 11 秒左右就能生成。你第一反应可能是:"又一个AI视频加速模型?"

但我觉得,这次真正值得关注的不是"75倍"这个数字,而是另外一件事情:

AI视频生成,正在第一次认真地向"实时"靠近。

01 AI视频最大的瓶颈,可能已经不是画质了

过去两年,我们讨论AI视频,最喜欢比较什么?人物像不像、动作自然不自然、运镜够不够电影感、物理效果有没有问题、1080p 和 4K 什么时候普及。这些当然重要,但还有一个一直被忽略的问题:你到底要等多久?

添加图片注释,不超过 140 字(可选)

你写好 Prompt,点击生成,然后开始等。短则几十秒,长则几分钟,甚至更久。如果只是偶尔玩一下,这没什么。但如果你真正开始拿AI做短剧、广告、MV、连续内容、游戏素材、虚拟人……问题马上就来了。

因为创作不是"一次生成",而是:

生成 → 看结果 → 修改 → 再生成 → 再修改 → 再生成。

如果每一次修改都需要等几分钟,创作本身就会变得非常慢。所以我越来越觉得:AI视频真正的下一场竞争,可能已经不是"谁生成得最好",而是谁能生成得足够快。

02 OpenVDN这次做的事情,为什么值得关注?

添加图片注释,不超过 140 字(可选)

最近 OpenVDN 发布了 VideoDeltaNet,也就是 VDN。他们把这种新的 Attention 架构应用到了 MiniMax H3 上,推出了 VDN-H3。官方给出的结果非常夸张:

14.4秒、768p的视频,在8张 NVIDIA B200 上,约11.23秒生成。

也就是说,视频有 14 秒,生成只需要约 11 秒。换句话说,生成这条视频所需要的时间,甚至比你把它看完还短。

官方直接把这个方向定义成 Live Text-to-Video Generation,也就是实时文本生成视频。而且官方表示,相比原始 MiniMax H3,VDN-H3 在视觉质量上接近无损。

03 但先别急着说"AI视频已经实时了"

这里必须泼一盆冷水:11秒不是普通电脑跑出来的。这个测试使用的是 8 × NVIDIA B200,而且官方这个 11.23 秒的数据还有特定测试条件。

所以你如果拿着自己的普通显卡,然后说"为什么我跑不到11秒?"——答案很简单,不是你的显卡突然坏了,这个成绩属于高端多卡GPU环境下的测试结果。

甚至在单张 B200 上,官方给出的 50-step 测试中,原始 Dense H3 生成 15 秒、768p 视频大约需要 13.95 分钟,而 VDN-H3 可以降低到约 5.34 分钟。

添加图片注释,不超过 140 字(可选)

所以,我们现在还不能说AI视频已经进入普通用户的实时生成时代。但是可以说:

实时生成这条技术路线,已经越来越清晰。

这其实更重要。

04 那么,VDN到底干了什么?

这里才是整个事情最有意思的地方。

如果你不了解AI模型,可以简单理解成:AI生成视频的时候,需要不停地"回忆"。这一帧发生了什么?上一帧的人在哪里?人物的衣服是什么颜色?背景是什么?镜头怎么移动?前面发生过什么?后面应该保持什么关系?这些信息都需要模型不断处理。

而这里面最昂贵的一部分,就是注意力(Attention)

添加图片注释,不超过 140 字(可选)

OpenVDN 对 MiniMax H3 的分析显示:

长序列的 Softmax Attention 占据了超过85%的总运行时间。

为什么?因为传统 Attention 的计算量,会随着序列长度快速增加。而视频恰恰是一个非常长的序列——一张图片已经有大量 Token,变成视频以后,图片 × 多帧,Token 数量直接爆炸。所以,AI视频越做得长、分辨率越高,Attention 就越容易成为速度瓶颈。

05 VDN的思路其实非常简单

它没有粗暴地说"那我们把模型变小",而是换了一个思路:

不是所有信息,都值得用同样昂贵的方式处理。

VDN 采用的是一种混合注意力机制(Hybrid Attention)。简单来说:近处的信息,使用比较精细的 Softmax Attention;远处的信息,使用更加高效的 Linear Attention。

也就是:重要的、局部的信息,精细处理;距离很远的信息,用更加高效的方式记忆。

OpenVDN 的设计就是把视频注意力拆成局部滑动窗口 Softmax 分支和长距离 Linear Attention 分支,同时通过边界信息帮助维持全局一致性。

添加图片注释,不超过 140 字(可选)

06 你可以把它理解成一个剧组

假设你现在正在拍一部电影。以前的工作方式是:每拍一个镜头,导演都把演员、摄影、灯光、服装、道具、编剧、后期……全部叫过来开会。上一场戏发生了什么,全部重新确认一遍;下一场戏是什么,也全部重新确认一遍。

当然很严谨。但问题是:太慢了。

添加图片注释,不超过 140 字(可选)

VDN 的思路有点像:眼前最重要的事情,继续开会;已经确定、距离比较远的信息,不需要每次重新开大会。

这样做的目的就是:既不要完全丢掉上下文,又不要让每一个 Token 都付出最高昂的计算成本。这就是为什么这个技术思路值得关注。

07 更有意思的是:他们不是只改了一个Attention

如果你仔细看 OpenVDN 的方案,会发现这不是简单的"换个Attention",它其实是一整套工程优化,包括:Hybrid Attention、Video Delta Attention、优化 Inference Kernel、FP8 Linear Layers、并行化、Few-Step Generation——最后才得到这个速度。

官方的单 B200 测试显示:

  • 原始 Dense H3:332.5ms / layer
  • Hybrid Attention:192.1ms / layer
  • 进一步结合优化 Kernel、缓存以及 FP8 Linear 后:125.3ms / layer

整体 50-step 生成时间也从约 13.95 分钟下降到约 5.34 分钟。

所以这里有一个非常值得普通AI玩家注意的事情:AI模型未来的竞争,不一定只是"模型参数有多少",还会越来越像一场:

模型架构 + GPU + Kernel + 并行计算 + 蒸馏的综合战争。

08 而我觉得,真正值得关注的是下一步

假设有一天,你输入一句话:"一个女孩在香港的雨夜走进便利店。"AI开始生成。

你发现:"不对,我想让镜头从她背后拍。"你改一句 Prompt,画面马上改变。你又说:"让她手里多一把透明雨伞。"画面继续改变。然后:"把镜头移动到她正面。"继续改变

这个时候,你和AI之间的关系就彻底变了。

现在的AI视频更像:

你下订单 → AI去生产 → 你等待结果。

未来真正的实时视频生成,更像:

你和AI一起拍摄。

这两种创作方式,是完全不同的。

添加图片注释,不超过 140 字(可选)

09 到那个时候,AI视频才真正开始改变"拍视频"

现在我们说AI视频创作,实际上仍然有一点像"AI版后期制作"——你先想好,然后生成,然后挑选,然后修改,然后再生成。

但如果生成速度真正接近实时,AI视频就会慢慢变成"AI版摄影机"。

你不是在"生成一个视频",而是在实时导演一个世界

你说"镜头往左",世界往左。你说"换成晚上",整个场景进入夜晚。你说"让这个人笑起来",人物开始微笑。你说"镜头拉远",整个世界跟着变化。

10 所以我认为,AI视频下一场真正的战争已经开始了

以前我们问:谁的视频最好?以后可能会问:谁的视频生成得最快?再往后:谁能让生成速度超过人的创作速度?

这个区别非常重要。因为一旦 AI生成速度 < 人的创作速度,你还是在等AI。但如果 AI生成速度 ≈ 人的创作速度,你就可以和AI实时创作。而如果未来进一步做到 AI生成速度 > 人的创作速度,事情就彻底不一样了。

那时候真正限制你的,就不再是 GPU 速度,而是:

你的想象力。

11 这也是为什么,我觉得OpenVDN值得关注

我并不是说"现在AI视频已经实时了"——还没有。至少从目前公开的结果来看,11秒级别的成绩依然是在 8张B200 这样的高端硬件环境下取得的。

但它给了我们一个非常清晰的信号:AI视频正在从"生成得更好",开始走向"生成得更快"。而且这一次不是简单地降低画质换速度,OpenVDN 的核心目标就是在提高效率的同时,尽量保持接近原始 H3 的视觉质量。

所以真正值得我们关注的不是"75倍到底是不是75倍",而是:

"当AI视频的生成速度开始接近播放速度之后,我们还能用今天的方式理解AI视频吗?"

我觉得答案可能是:不能。

因为那时候,AI视频就不再只是一个"生成工具"。它可能会变成一台新的摄影机,甚至是一台可以实时创造世界的摄影机

最后

以前我们说:AI让不会画画的人也能画画。后来我们说:AI让不会拍电影的人也能拍电影。而下一步可能是:

AI让"拍摄"本身变成实时生成。

OpenVDN 可能还只是这条路上的一个早期信号,但我觉得,这个信号已经足够有意思了。

一句话总结:

AI视频的下一场战争,可能不是"谁生成得最好",而是"谁能先让生成速度追上人的创作速度"。 如果这一天真的到来,你觉得AI视频会首先改变什么?

开源地址:https://huggingface.co/OpenVDN/vdn-minimax-h3

报告:https://openvdn.github.io/

如果对你有启发,请一键三连支持下我,你的支持是我持续输出的源泉!谢谢。

原文地址:https://aigc.douyoubuy.cn/2026/09/03/421919/

会员小伙伴可在小站上下载本期工作流、优化节点、模型。

我在RH上也生成了应用,可以直接在上面体验下


本地算力不够怎么办?

如果本地设备算力不好的小伙伴,推荐使用线上comfyUI来运行体验:runninghub.cn

添加图片注释,不超过 140 字(可选)

minimaxH3 速绘延时视频应用体验地址:

https://www.runninghub.cn/ai-detail/2093325466999541762
添加图片注释,不超过 140 字(可选)

minimax_h3文生视频应用体验地址

https://www.runninghub.cn/ai-detail/2084286232988835841
添加图片注释,不超过 140 字(可选)

minimax_h3图生视频应用体验地址

https://www.runninghub.cn/ai-detail/2084286858103713794
添加图片注释,不超过 140 字(可选)

minimax_h3多参考视频生成应用体验地址

https://www.runninghub.cn/ai-detail/2084287787427262465

注册地址:https://www.runninghub.cn/?utm_source=kol01-RH151

通过这个链接第一次注册送1000点,每日登录送100点


最后几句:

如果对你有帮助,请一键三连支持下我,感谢!以下是小站主流的一些AI工具应用:

  1. CloserAI AI短剧工作台(本地化解决方案) https://aigc.douyoubuy.cn/ai-agent/
  2. closerAI FlowStudio本地AIGC无限画布创作工具 https://aigc.douyoubuy.cn/closerai-flowstudio/
  3. closerAI AI绘画大师万象视界: https://aigc.douyoubuy.cn/closerai-vision/
  4. CLOSERAI POD电商印花批量生产工作站: https://aigc.douyoubuy.cn/?page_id=420541

以上是就是本期的分享,当然,更多工作流、资讯、插件、工具也可以在我们closerAI会员站上获取(查看原文)

以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章,我们,下次再见。

>/ 作者:JimmyMo

更多AI前沿科技资讯,请关注我们:​closerAI-一个深入探索前沿人工智能与AIGC领域的资讯平台

添加图片注释,不超过 140 字(可选)

主题授权提示:请在后台主题设置-主题授权-激活主题的正版授权,授权购买:RiTheme官网

声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。