• 我的订阅
  • 科技

RTX3090可跑,360AI团队开源视频模型FancyVideo,红衣大叔都说好

类别:科技 发布时间:2024-08-27 09:52:00 来源:机器之心Pro

AIxiv专栏是机器之心发布学术、技术内容的栏目。过去数年,机器之心AIxiv专栏接收报道了2000多篇内容,覆盖全球各大高校与企业的顶级实验室,有效促进了学术交流与传播。如果您有优秀的工作想要分享,欢迎投稿或者联系报道。投稿邮箱:liyazhou@jiqizhixin.com;zhaoyunfeng@jiqizhixin.com

论文作者之一 Ao Ma,硕士毕业于中科院计算所,曾在 MSRA 视觉计算组和阿里通义实验室进行学术研究和算法落地工作。目前是奇虎 360-AIGC 团队-视频生成方向负责人,长期致力于视觉生成方向研究和落地,以及开源社区建设。

近日,开源社区又迎来一款强力的「视频生成」工作,可以在消费级显卡 (如 GeForce RTX 3090) 上生成任意分辨率、任意宽高比、不同风格、不同运动幅度的视频,其衍生模型还能够完成视频扩展、视频回溯的功能…… 这便是 360AI 团队和中山大学联合研发的 FancyVideo,一种基于 UNet 架构的视频生成模型。

作者基于已经开源的 61 帧模型,实测效果如下。

视频链接:https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==∣=2650931627&idx=5&sn=d5b7c4782075465afe068d6f10d96b1a&chksm=84e7c5d5b3904cc32041e9b1f3a99fe5231513556762a7dde039fe5563a730cdd6dd9b69f1ad&token=467310321⟨=zh_CN#rd

RTX3090可跑,360AI团队开源视频模型FancyVideo,红衣大叔都说好

论文地址:https://arxiv.org/abs/2408.08189 项目主页:https://fancyvideo.github.io/ 代码仓库:https://github.com/360CVGroup/FancyVideo 论文标题:FancyVideo: Towards Dynamic and Consistent Video Generation via Cross-frame Textual Guidance

跨帧文本引导模块

作者在进行视频生成研究过程中,发现现有的文本到视频(T2V)工作通常会采用空间交叉注意力(Spatial Cross Attention),将文本等价地引导至不同帧的生成过程中,缺乏对不同帧灵活性的文本引导(如下图左)。这会导致模型理解提示词所传达的时间逻辑和生成具有连续运动视频的能力受到限制。

FancyVideo 正是从这一角度切入,特殊设计了跨帧文本引导模块(Cross-frame Textual Guidance Module, CTGM, 如下图右)改进了现有文本控制机制。

具体来说,CTGM 包含 3 个子模块:

时序信息注入器(Temporal Information Injector, TII)-- 将来自潜在特征的帧特定信息注入文本条件中,从而获得跨帧文本条件; 时序特征提取器(Temporal Affinity Refiner, TAR)-- 沿时间维度细化跨帧文本条件与潜在特征之间的相关矩阵; 时序特征增强器(Temporal Feature Booster, TFB)-- 增强了潜在特征的时间一致性。

RTX3090可跑,360AI团队开源视频模型FancyVideo,红衣大叔都说好

FancyVideo 训练流程

FancyVideo 整体训练 Pipeline 如下所示。其中在模型结构方面,FancyVideo 选择在 2D T2I 模型基础上插入时序层和基于 CTGM 的运动性模块的方式构造 T2V 模型。在生成视频时,先进行 T2I 操作生成首帧,再进行 I2V。这既保存了 T2I 模型的能力,使视频整体画质变高,又大大减少了训练代价。

此外,为实现运动控制的能力,FancyVideo 在训练阶段将基于 RAFT 提取视频运动信息和 time embedding 一起注入到网络中。

RTX3090可跑,360AI团队开源视频模型FancyVideo,红衣大叔都说好

实验结果

作者通过定量和定性两个方面对模型效果进行评估。他们首先在 EvalCrafter Benchmark 上比较了 FancyVideo 和其他 T2V 模型,可以看到 FancyVideo 在视频生成质量、文本一致性、运动性和时序一致性方面均处于领先位置。

RTX3090可跑,360AI团队开源视频模型FancyVideo,红衣大叔都说好

论文还在 UCF-101 和 MSR-VTT Benchmark 上进行了 Zero-shot 的评测,在衡量生成视频丰富性的 IS 指标和文本一致性的 CLIPSIM 指标均取得了 SOTA 结果。

RTX3090可跑,360AI团队开源视频模型FancyVideo,红衣大叔都说好

此外,论文还基于 FancyVideo 模型的 T2V 和 I2V 能力分别和前人方法进行了人工评测,结果显示在视频生成质量、文本一致性、运动性和时序一致性角度 FancyVideo 均处于领先。

RTX3090可跑,360AI团队开源视频模型FancyVideo,红衣大叔都说好

最后,论文中采用消融实验探究了 CTGM 的不同子模块对于视频生成结果的影响,以验证各个子模块的合理性和有效性。

RTX3090可跑,360AI团队开源视频模型FancyVideo,红衣大叔都说好

应用场景

基于这种训练 pipline 和策略,FancyVideo 可以同时完成 T2V 和 I2V 功能,还可以在生成关键关键帧的基础上进行插帧操作:

RTX3090可跑,360AI团队开源视频模型FancyVideo,红衣大叔都说好

视频扩展、视频回溯操作:

RTX3090可跑,360AI团队开源视频模型FancyVideo,红衣大叔都说好

FancyVideo 上线开源社区不到一周,已经有手快的同学自发搭建了 FancyVideo 的 ComfyUI 插件,让大家可以在自己的机器上玩的开心。

RTX3090可跑,360AI团队开源视频模型FancyVideo,红衣大叔都说好

此外,据作者了解,后续 FancyVideo 团队除了会放出更长、效果更好的模型到开源社区,还计划上线网页版本供大家【免费】使用。在 AIGC 时代,人人都是「能诗会画」的艺术家。

结论

相比于 SORA 类视频生成「产品」的发展,开源社区中视频生成模型的更新和迭代显得略微缓慢,FancyVideo 的发布也给了普通用户更多选择。相信在社区小伙伴共同的努力下,视频生成这一目前看上去费时费力的任务,能够成为更多普通小伙伴日常生活、工作中的工具。

以上内容为资讯信息快照,由td.fyun.cc爬虫进行采集并收录,本站未对信息做任何修改,信息内容不代表本站立场。

快照生成时间:2024-08-27 15:45:01

本站信息快照查询为非营利公共服务,如有侵权请联系我们进行删除。

信息原文地址:

文|DataEye研究院近日,由周鸿祎出演的首部AI短剧《红衣大叔用AI带我穿越》已正式上线。值得注意的是,周鸿祎的两部短剧均出自西安达林内容量子网络科技有限公司之手。DataE
2025-03-03 10:48:00
快手可灵团队最新开源项目火了:大叔实时变身少女 GitHub狂揽7.5K星
...离大谱!!不看视频完整版谁知道里面的美少女竟是一位大叔。好嘛,原来这是用了快手可灵团队的可控人像视频生成框架——LivePortrait
2024-07-23 23:25:00
...加载中》。360集团创始人周鸿祎也亲自下场参演了短剧《红衣大叔用AI带我穿越》。记者梳理发现,目前AI短剧作品往往集中在玄幻、科幻、奇幻“三幻”题材,发挥了AI在生成震撼的战
2025-05-22 09:50:00
《红衣大叔用AI带我穿越》:技术背后的叙事迷失|微剧评
...创,探索微短剧文艺评论的新视角。本篇聚焦AI微短剧《红衣大叔用AI带我穿越》。主演 黄奕、周鸿祎、胡冬晴、王宇峰/集数 6作为一部以AI技术为核心卖点的实验性短剧,《红衣大叔
2025-03-06 13:18:00
叫板Sora出圈后,Luma AI如何接住泼天的流量?
...的。你会发现,ChatGPT不光最好的程序员在用,你隔壁的大叔大妈也在用。我觉得AI工具带来的最大的变化是,由于它本身的可塑性和灵活性,它可以服务几乎所有有视觉需求的人。我并
2024-11-27 13:37:00
AI短剧开始付费,以后拍戏演员都不用请了?
...圈的周鸿祎拿出了新的解法。2月25日,他的首部AI短剧《红衣大叔用AI带我穿越》上线,由他本人主演、演员黄奕客串、DeepSeek参与编剧
2025-03-06 21:06:00
360集团董事长周鸿祎:“超级员工” 是这样炼成的
...董事长、首席执行官周鸿祎亮相论坛作主题演讲。有着“红衣大叔”之称的他,一改平日红色T恤的穿搭,身着深色西装、红色领带。10分钟的演讲,“智能体”出现62次。周鸿祎在“拥抱智能
2025-09-17 08:35:00
“要不是有你们,我可能就没有爸爸了”
...跑了起来,跑了几步才看到前面围了好几个人,一位穿着红衣的大叔躺在路边。周艳荣迅速蹲下,呼唤了大叔好几声都没有回应,她立刻抬起大叔的头,打开口腔清理大叔口中的秽物,李炜则迅速摸
2024-05-13 16:46:00
类Sora模型能否理解物理规律?字节豆包大模型团队系统性研究揭秘
视频生成模型虽然可以生成一些看似符合常识的视频,但被证实目前还无法理解物理规律!自从 Sora 横空出世,业界便掀起了一场「视频生成模型到底懂不懂物理规律」的争论。图灵奖得主 Y
2024-11-09 09:59:00
更多关于科技的资讯:
中国姚绣站上巴黎大展C位
1月15日至19日,非遗苏绣品牌姚绣(Yao Silk)再度亮相巴黎M&O展,成为本届展会Fine Craft(精品工艺)展区唯一中国品牌
2026-01-17 09:40:00
民大学子全国“摘金” AI巧解垃圾分类与楼宇管理难题
荆楚网(湖北日报网)讯(记者林杉 许文秀 通讯员陈韶月 张祎晗)面对垃圾分类的效率瓶颈,人工智能与机械设计如何给出更优解
2026-01-17 10:36:00
长白时评评论员 久泰平近日多起滥用“七天无理由退货”的新闻引发社会关注。有商家曝光,有学生集体网购演出服,演出后再把带着污渍
2026-01-17 05:55:00
1月14日消息,工业和信息化部近日公布了2025年全国中小企业人工智能典型应用场景名单,晋西春雷自主研发的“AI视觉质检实现铜带缺陷精准识别”项目成功入选
2026-01-17 07:39:00
当患者或患者家属去医院的病案室复印住院病历时,会发现住院病案首页出院诊断表格上有一栏疾病编码,疾病编码栏下填有一串串字母数字组成的编码
2026-01-17 04:40:00
■李伯宸 四川传媒学院摘要:随着时代的发展和科学技术的进步,数字媒体艺术与人工智能技术已经为人类的生活方式带来了深刻的变化
2026-01-17 04:40:00
■刘舒浅 对外经济贸易大学管理学院摘要:大数据技术对传统统计工作产生了重要的影响。将大数据与传统统计方法相融合,是统计工作实现规范化
2026-01-17 04:40:00
车联天下与AMD达成战略合作,共推智能网联汽车技术升级
全球汽车产业正加速向电动化、智能化和网联化转型,智能驾驶和车载娱乐已成为未来出行体验的重要驱动力。AI和高性能计算技术在车辆感知
2026-01-16 21:22:00
百奥赛图(688796)以基因编辑技术起家,是一家创新药临床前CRO及生物技术公司,专门为创新药企业提供抗体药物发现及临床前研发服务
2026-01-16 22:48:00
中新经纬1月16日电 16日下午,市场监管总局召开食品安全专题新闻发布会。市场监管总局食品协调司副司长母兰在发布会上称
2026-01-16 21:34:00
在生成式AI重塑信息检索范式的当下,GEO(生成式引擎优化)已从营销小众赛道跃升为企业数字化转型的核心增长引擎。据艾瑞咨询《2026 GEO行业报告》显示
2026-01-16 21:23:00
中国优秀AI企业2026年展望:AI技术迭代深化引领商业化规模化落地 全球AI产业进入技术深耕与商业化兑现双轮加速期,中国优秀AI企业迎来价值释放关键窗口
2026-01-16 17:14:00
8个省级高质量数据集、324家省级“晨星工厂” 临沂扎实筑牢“人工智能+”发展根基
鲁网1月16日讯 (记者 李文静)数据是赋能人工智能训练的原材料。1月16日上午,临沂市人民政府新闻办公室召开新闻发布会
2026-01-16 17:18:00
中新经纬1月16日电 题:中国电影IP的长期主义,还缺什么?作者 张志鹏 中国广告协会文创与IP专业委员会副主任近日,玩具制造商桑尼森迪正式递表港交所
2026-01-16 17:22:00
贾国龙最新发声:今晚10点 将就罗永浩对西贝的重大污蔑诽谤全面回应
华商网讯 1月16日,西贝贾国龙发文称,将就罗永浩对西贝的重大污蔑诽谤一一全面回应。据了解,此前,1月16日,罗永浩再次发长文回应西贝贾国龙近日言论
2026-01-16 18:46:00