AI 年度盘点与2025发展趋势展望,50+案例解析亮相AICon 了解详情
写点什么

腾讯视频生成大模型上线即开源:图 / 视频 DiT 同时具备 Scaling Law

  • 2024-12-04
    北京
  • 本文字数:1636 字

    阅读完需:约 5 分钟

大小:790.64K时长:04:29
腾讯视频生成大模型上线即开源:图/视频DiT同时具备Scaling Law

12 月 3 日,腾讯混元大模型正式上线并开源视频生成大模型 Hunyuan video,该视频生成大模型参数量 130 亿,是当前最大的视频开源模型。

 

官网:https://aivideo.hunyuan.tencent.com

代码:https://github.com/Tencent/HunyuanVideo

模型:https://huggingface.co/tencent/HunyuanVideo

技术报告:https://github.com/Tencent/HunyuanVideo/blob/main/assets/hunyuanvideo.pdf

 

腾讯混元相关负责人透露,目前的生成视频支持中英文双语输入、多种视频尺寸以及多种视频清晰度。目前该模型已上线腾讯元宝 APP,用户可在 AI 应用中的“AI 视频”板块申请试用。企业客户通过腾讯云提供服务接入,目前 API 同步开放内测申请。

 

基本架构

 

腾讯混元生成视频大模型基于跟 Sora 类似的 DiT 架构,并在架构设计上进行了多处升级。


 

腾讯负责人表示,经过实践发现,图/视频 DiT 同时具备 Scaling law,后续随算力和数据可以持续升级。Hunyuan video 作为首版 130 亿参数模型,严格基于 Scaling law 高效利用数据。

 

Hunyuan Video 引入了 Transformer,并采用 Full Attention 机制,实现了图像和视频的统一生成。具体来说,该模型采用了“双流转单流”的混合模型设计来进行视频生成。在双流阶段,视频和文本 token 通过多个 Transformer 块独立处理,这使得每个模态都能学习到适合自己的调节机制,而不会相互干扰。在单流阶段,模型将视频和文本 token 连接起来,并输入到后续的 Transformer 块中,实现了有效的多模态信息融合。Hunyuan Video 利用这种设计来捕捉视觉和语义信息之间的复杂交互,从而提升整体模型的性能。


 

先前的文本到视频模型通常使用预训练的 CLIP 和 T5-XXL 作为文本编码器,其中 CLIP 采用 Transformer 编码器,而 T5 则使用编码器-解码器结构。Hunyuan Video 则采用了具有 Decoder-only 结构的预训练多模态大型语言模型(MLLM)作为文本编码器。据介绍,与 T5 相比,经过视觉指令微调后的 MLLM 在特征空间中实现了更好的图像-文本对齐,减轻了扩散模型中指令跟踪的难度;与 CLIP 相比,MLLM 在图像细节描述和复杂推理方面表现更佳。此外,MLLM 可以通过遵循用户提示前面的系统指令来充当零样本学习者,这有助于文本特征更多地关注关键信息。

 

HunyuanVideo 利用 CausalConv3D 技术训练了一个 3D VAE(变分自编码器),将像素空间中的视频和图像压缩到一个紧凑的潜在空间里。混元对视频的长度、空间和通道分别进行了 4 倍、8 倍和 16 倍的压缩比设置。这样可以显著减少后续模型中的 token 数,从而能以视频的原始分辨率和帧速率进行训练。

 

此外,为了解决用户的提示词的语言风格和长度多变性问题,混元对 Hunyuan-Large 模型进行了微调作为提示重写模型。

 

实测效果


腾讯方面表示,混元文生视频主要的优势能力在于:超写实质感:模型生成的视频内容具备高清质感、真实感,可用于工业级商业场景例如广告宣传、创意视频生成等商业应用;高语义遵循:用户可以进行细致的刻画,例如生成主体的细节,人物概念的组合等,模型可以准确的表达出文本的内容;运动画面流畅:可生成大幅度的合理运动,运动镜头流畅、符合物理规律,不易变形;原生镜头转换:模型原生具备自动生成多视角同主体的镜头切换画面,增强画面叙事感。

 

那么,实测效果如何呢?

 

针对这次模型强调的写实风格,我们再输入提示词:“战火中,一个头发凌乱、衣衫褴褛的小女孩蹲在废墟中,远方天空飞来一架战机,写实风格”生成的视频如下:


00:00 / 00:00
    1.0x
    • 3.0x
    • 2.5x
    • 2.0x
    • 1.5x
    • 1.25x
    • 1.0x
    • 0.75x
    • 0.5x
    网页全屏
    全屏
    00:00


    生成过程中,我们选择了“速度优先”,因此会比选择“画质优先”的损失一些画质。但可以看出,生成的视频也很好表达了提示词要表达的意思。

     

    然后,我们还试了下动漫风格,输入提示词:“两只熊猫在竹林打架,动漫风格”,生成的视频如下:

     

    00:00 / 00:00
      1.0x
      • 3.0x
      • 2.5x
      • 2.0x
      • 1.5x
      • 1.25x
      • 1.0x
      • 0.75x
      • 0.5x
      网页全屏
      全屏
      00:00


      这个动漫风格看起来比较偏 3D。


      输入提示词:“在唐朝的街道上,一个机器人正在与一只怪兽打架,周围都是慌乱逃跑的人群,写实风格”,生成的视频如下:

       

      00:00 / 00:00
        1.0x
        • 3.0x
        • 2.5x
        • 2.0x
        • 1.5x
        • 1.25x
        • 1.0x
        • 0.75x
        • 0.5x
        网页全屏
        全屏
        00:00


         整个试用还是需要一定的等待时间,不过完成后混元会发短信提醒。

         

        根据团队在与国内外多个顶尖模型的评测,混元视频生成模型在文本视频一致性、运动质量和画面质量多个维度效果领先。

         

        2024-12-04 18:201

        评论

        发布
        暂无评论

        基于STM32+华为云IOT设计的智能家居控制系统_语音+环境检测

        DS小龙哥

        7月月更

        【这款插件在IntelliJ IDEA中,可以大幅提升工作效率,强烈推荐!】

        了不起的程序猿

        Java java程序员 实用工具

        模块6(拆分电商系统为微服务)

        Geek_701557

        Substrate 技术及生态6月大事记 | Polkadot Decoded 圆满落幕,黑客松获胜项目为生态注入新生力量

        One Block Community

        iOS中方法和函数的区别

        NewBoy

        前端 移动端 iOS 知识体系

        iOS中SEL类型

        NewBoy

        ios 前端 移动端 iOS 知识体系 7月月更

        学一招,docker自启动以及容器自启动的解决方案

        麦洛

        Docker docker image

        LeetCode-136. 只出现一次的数字(java)

        bug菌

        Leet Code 7月月更

        注入攻击

        沃德

        程序员 7月月更

        面试官灵魂暴击:如何保障消息100%投递成功及保证消息的幂等性?

        冉然学Java

        Java后端 #技术干货#

        DFINITY 整合技术解读——阈值ECDSA 实现 IC 与比特币、以太坊整合

        TinTinLand

        spark调优(五):提交任务优化

        怀瑾握瑜的嘉与嘉

        7月月更

        内部排序——选择排序

        乔乔

        7月月更

        【LeetCode】玩筹码Java题解

        Albert

        LeetCode 7月月更

        Flutter 实现爱心三连动画效果

        岛上码农

        flutter ios 安卓 移动端开发 7月月更

        Android 小巧技-不用图片框架,实现加载类似微博超长图片的手法

        芝麻粒儿

        android 7月月更

        Java 技术栈中间件优雅停机方案设计与实现全景图

        bin的技术小屋

        dubbo 优雅停机 netty SpringFramework Graceful Shutdown

        PPT制作

        逝缘~

        PPT 7月月更

        ThreeJS 动画之 Noisy Lines

        南城FE

        CSS 前端 动画 7月月更

        QT 实现文件夹的删除

        小肉球

        qt 7月月更

        SAP Fiori 注解 @ObjectModel.readOnly工作原理解析

        汪子熙

        SAP abap Fiori SAP UI5 7月月更

        给自己点鸡汤吧

        沃德

        程序员 心灵鸡汤 7月月更

        Qt|实现边加载数据边显示页面

        中国好公民st

        qt 7月月更

        GitHub标星1w+超牛的微服务项目,开发脚手架

        冉然学Java

        Java 编程 程序员 面试 Spring Cloud

        去中心化的底层是共识——Polkadot 混合共识机制解读

        One Block Community

        Spring Cloud源码分析之Eureka篇第六章:服务注册

        程序员欣宸

        Java SpringCloud 7月月更

        MySQL灵魂16问,你能撑到第几问?

        了不起的程序猿

        Java MySQL 面试题 java程序员

        你以为,设计一个RPC框架很简单?应该从哪入手,深入剖析? Java架构新资讯

        了不起的程序猿

        Java RPC java程序员 java 编程

        双目立体匹配步骤

        秃头小苏

        7月月更 双目立体匹配

        Arbitrum 推出 AnyTrust 链,满足生态项目多元需求

        TinTinLand

        java零基础入门-抽象类

        喵手

        Java 7月月更

        腾讯视频生成大模型上线即开源:图/视频DiT同时具备Scaling Law_AI&大模型_褚杏娟_InfoQ精选文章