• 我的订阅
  • 科技

音频驱动人像视频模型:字节Loopy、CyberHost研究成果揭秘

类别:科技 发布时间:2024-09-13 13:34:00 来源:机器之心Pro

近期,来自字节跳动的视频生成模型 Loopy,一经发布就在 X 上引起了广泛的讨论。Loopy 可以仅仅通过一张图片和一段音频生成逼真的肖像视频,对声音中呼吸,叹气,挑眉等细节都能生成的非常自然,让网友直呼哈利波特的魔法也不过如此。

音频驱动人像视频模型:字节Loopy、CyberHost研究成果揭秘

音频驱动人像视频模型:字节Loopy、CyberHost研究成果揭秘

音频驱动人像视频模型:字节Loopy、CyberHost研究成果揭秘

Loopy 模型采用了 Diffusion 视频生成框架。输入一张图片和一段音频,就可以生成相应的视频。不但可以实现准确的音频和口型同步,还可以生成细微自然的表情动作,例如人物跟随情绪节奏做出抬眉、吸气、憋嘴停顿、叹气、肩膀运动等非语言类动作也能很好地被捕捉到;在唱歌时也能表现得活灵活现,驾驭不同风格。

音频驱动人像视频模型:字节Loopy、CyberHost研究成果揭秘

柔和

音频驱动人像视频模型:字节Loopy、CyberHost研究成果揭秘

高昂

音频驱动人像视频模型:字节Loopy、CyberHost研究成果揭秘

rap

视频链接:https://mp.weixin.qq.com/s/sf_fmjDUOaQXD7BbovaY5A

更多丰富风格的展示,可移步项目主页:https://Loopyavatar.github.io/, https://arxiv.org/pdf/2409.02634

在不同的图片风格上,Loopy 也都表现得不错,像古风画像、粘土风格、油画风格、3D 素材以及侧脸的情况等等。

音频驱动人像视频模型:字节Loopy、CyberHost研究成果揭秘

音频驱动人像视频模型:字节Loopy、CyberHost研究成果揭秘

音频驱动人像视频模型:字节Loopy、CyberHost研究成果揭秘

音频驱动人像视频模型:字节Loopy、CyberHost研究成果揭秘

视频链接:https://mp.weixin.qq.com/s/sf_fmjDUOaQXD7BbovaY5A

Loopy 技术方案

具体来说,Loopy 是如何仅需音频,就能实现这样生动的效果呢?

音频驱动人像视频模型:字节Loopy、CyberHost研究成果揭秘

Loopy 框架中分别对外观信息(对应图中左上角)和音频信息(图中左下角)做了相应的方法设计,在外观上团队引入了 inter/intra- clip temporal layers 模块,通过 inter-clip temporal layer 来捕捉跨时间片段的时序信息,通过 intra-clip temporal layer 来捕捉单个片段内的时序信息,通过分而治之的方式更好建模人物的运动信息。

音频驱动人像视频模型:字节Loopy、CyberHost研究成果揭秘

同时为了进一步的提升效果,团队设计了 Temporal Segment Module 使得 inter-clip temporal layer 可以捕捉长达 100 帧以上的时序信息,从而可以更好的基于数据学习长时运动信息依赖,抛弃了空间模版的限制,最终生成更好的人像运动。这就不难理解为什么 Loopy 可以仅仅依靠音频,不需要任何空间辅助信号就可以生成自然逼真的人像视频了。

音频驱动人像视频模型:字节Loopy、CyberHost研究成果揭秘

除此以外,为了能够捕捉到细腻的表情变化,团队设计了一个名为 audio to latents(A2L)的模块,用来增强音频和头部运动之间的关联关系。这个 A2L 模块在训练过程中会随机选取音频、表情参数、运动参数中的一个,将其转化为 motion latents,作为 diffusion model 的运动控制信号。在测试的时候,只需要音频就能够得到 motion latents。通过这种方式,可以借助与肖像运动强相关的条件(表情参数、运动参数)来帮助较弱相关的条件(audio)生成更好的 motion latents,进而实现对细微生动的肖像运动及表情的生成。

Loopy 在不同场景下都和近期的方法做了数值对比,也体现了相当的优势:

音频驱动人像视频模型:字节Loopy、CyberHost研究成果揭秘

音频驱动人像视频模型:字节Loopy、CyberHost研究成果揭秘

CyberHost 半身人像版模型,手部动作也能驱动

除此以外,该团队近期还推出了一个名为 CyberHost 的半身人像版本。这款模型是首个采用端到端算法框架进行纯音频驱动的半身视频生成系统,将驱动范围从肖像扩大到了半身,不仅表情自然、口型准确,也能生成和音频同步的手部动作,这在该领域是一个重大突破。

手部动作生成一直是视频生成技术中的难题,鲜有模型能实现稳定的效果。特别是在纯音频驱动的场景下,由于缺乏骨架信息输入,保持手部动作的稳定性更具挑战。CyberHost 通过专门设计的 Codebook Attention 来强化对人脸和手部等关键区域的结构先验学习,在纯音频驱动下的手部生成质量甚至超越了许多基于视频驱动的方法。

音频驱动人像视频模型:字节Loopy、CyberHost研究成果揭秘

音频驱动人像视频模型:字节Loopy、CyberHost研究成果揭秘

视频链接:https://mp.weixin.qq.com/s/sf_fmjDUOaQXD7BbovaY5A

音频驱动人像视频模型:字节Loopy、CyberHost研究成果揭秘

音频驱动人像视频模型:字节Loopy、CyberHost研究成果揭秘

视频链接:https://mp.weixin.qq.com/s/sf_fmjDUOaQXD7BbovaY5A

Codebook Attention 引入了一系列可学习的时空联合隐变量参数,专注于在训练过程中学习数据集中局部区域的结构特征和运动模式。同时,该机制还提取了关键区域的外观特征,强化了局部 ID 的一致性。团队将这一机制应用于脸部和手部区域,并在 Denoising U-Net 的各个阶段进行插入,提升了对关键区域的建模能力。

音频驱动人像视频模型:字节Loopy、CyberHost研究成果揭秘

此外,CyberHost 还设计了一系列基于人体结构先验的训练策略,旨在减少音频驱动下人体动作生成的不确定性。这些策略包括 Body Movement Map 和 Hand Clarity Score。Body Movement Map 可以用于限制视频生成中人体的运动范围。而 Hand Clarity Score 通过计算局部像素的 laplacian 算子来控制生成手部的清晰度,规避手部运动模糊带来的效果劣化。

更多细节见论文以及项目主页:

CyberHost: https://cyberhost.github.io/, https://arxiv.org/pdf/2409.01876

团队介绍

字节跳动智能创作数字人团队,智能创作是字节跳动 AI & 多媒体技术团队,覆盖了计算机视觉、音视频编辑、特效处理等技术领域,借助公司丰富的业务场景、基础设施资源和技术协作氛围,实现了前沿算法 - 工程系统 - 产品全链路的闭环,旨在以多种形式为公司内部各业务提供业界前沿的内容理解、内容创作、互动体验与消费的能力和行业解决方案。其中数字人方向专注于建设行业领先的数字人生成和驱动技术,丰富智能创作内容生态。

目前,智能创作团队已通过字节跳动旗下的云服务平台火山引擎向企业开放技术能力和服务。更多大模型算法相关岗位开放中。

以上内容为资讯信息快照,由td.fyun.cc爬虫进行采集并收录,本站未对信息做任何修改,信息内容不代表本站立场。

快照生成时间:2024-09-13 14:45:10

本站信息快照查询为非营利公共服务,如有侵权请联系我们进行删除。

信息原文地址:

Pika、阿里同日炫技!国产视频大模型奋起直追
...之外还包括三大图片转视频神器——阿里的Animate Anyone、字节跳动的Magic Animate、微软的GAIA
2024-03-01 09:26:00
谷歌发布ai前沿成果,生成式ai迎来爆发
...源。不过,值得一提的是,目前谷歌只是发布了 MusicLM的研究成果,因为版权等问题,谷歌还未向公众开放MusicLM
2023-02-01 21:09:00
旷视开源的AI人像视频生成太炸了!输入照片即可模仿任意表情包
...地址:https://megactor.github.io/ MegActor 是旷视研究院的最新研究成果。旷视研究院
2024-06-28 09:41:00
...,豆包大模型团队57篇论文中选ICLR、CVPR、NeurIPS等顶会,研究成果包括下载量超百万的开源工作及GitHub万星项目
2025-01-23 09:51:00
北京大学成立大模型系统软件联合实验室
...报中央厨房-半亩方塘工作室吴丹12月12日,北京大学联合字节跳动成立“豆包大模型系统软件联合实验室”。双方将聚焦大模型时代智能化软件基础科学和关键技术问题,特别是结合企业真实
2024-12-13 09:00:00
BAT等互联网大厂,如何入局人形机器人?
...人形机器人市场,虽然百度、阿里、腾讯、小米、美团、字节、华为等企业也都有尝试入局人形机器人产业。然而,可以发现,在这轮人形机器人的方向下,互联网资本的干涉度已经降低很多,虽然
2024-06-12 11:54:00
8位数年薪!“最懂阿里大模型的人”带整个团队跳槽加入!字节跳动放大招?
...当今世界上最懂阿里大模型的人,但这个人现在跳槽到了字节跳动,对于阿里来说这无异于釜底抽薪。7月中旬,最先曝出来的消息是周畅即将辞职创业,然而10月底,他就已经加入了字节跳动。
2024-12-07 09:52:00
惊掉下巴!被字节起诉800万实习生,拿下NeurIPS 2024最佳论文
...。 除了VAR,团队还发表了LlamaGen等相关技术论文,新的研究成果也将在近期陆续放出。事件始末:恶意注入代码,投毒模型训练回看整件事情,可谓反转又反转。两个月前,圈内
2024-12-05 09:47:00
字节跳动放大招!OmniHuman数字人模型即将上线:一张图+一段音频即可生成视频
...的制作效率和质量。OmniHuman技术主页信息显示,该模型为字节跳动自研的闭源模型,可支持肖像、半身以及全身等不同尺寸的图片输入,并根据输入的音频,在视频中让人物生成与之匹
2025-02-07 18:15:00
更多关于科技的资讯:
农行固堤支行积极拥抱金融科技,全力推动网点智能化转型与服务升级。大力推广手机银行、网上银行等线上渠道,引导客户体验转账汇款
2025-12-24 08:41:00
“您站好,用手机拍正面、侧面、背面三张照片。3分钟后,您不仅能知道最适合自己的衣服尺寸,还能在电脑上实时看到自己穿上这件衣服的虚拟效果
2025-12-24 08:42:00
日前,中国进出口银行深圳分行向纵腾集团子公司香港亿格有限公司发放境外投资贷款,精准助力企业提升跨境电商海外仓运营效能,为跨境电商行业高质量发展注入金融活水
2025-12-24 08:44:00
苏州市镇江商会副会长单位【旭智文化】荣膺2025年度省级专精特新中小企业称号
近日,江苏省工业和信息化厅正式公布2025年度省级专精特新中小企业名单。苏州市镇江商会副会长单位苏州旭智新文化科技有限公司凭借在数字展馆领域的创新研发
2025-12-24 09:03:00
浙江日报讯 (记者 朱银燕 共享联盟·上虞 张汉锋) “我宣布,在浙江绍兴上虞发起的‘与移动机器人连续对打羽毛球次数最多’挑战的最终成绩为1452次
2025-12-24 09:14:00
为迎接即将到来的年度业务“开门红”,张家口农商银行宣泰支行早部署、早行动,全面启动客户储备工作,通过一系列精准、贴心的举措
2025-12-24 10:11:00
京东方布局钙钛矿光伏 多项成果创世界纪录
大皖新闻讯 钙钛矿太阳能电池是依靠钙钛矿结构材料进行光电转换的一种新型光伏电池,可以在室内弱光条件下高效发电,为自动照明
2025-12-24 10:13:00
东古调味与淘宝闪购战略携手,深化即时零售布局
近日,国民调味品牌东古调味与淘宝闪购达成合作,启动“东古暖冬感恩季”主题活动。值得关注的是,双方的合作不仅限于商品推广
2025-12-24 11:04:00
不仅是黑科技,更是新生活:亮亮视野AR字幕眼镜获AIS与联合国双重认可
国际信息系统协会(Association for Information Systems, AIS)近日在美国纳什维尔举办的ICIS 2025大会上宣布
2025-12-24 11:04:00
创新赋能产业升级!千灯镇新增11家苏州市工程技术研究中心
近日,苏州市科学技术局公示2025年苏州市工程技术研究中心(第二批)新建拟认定名单,其中,来自我镇的11家企业成功上榜
2025-12-24 11:26:00
今日开启!“烟海e家”新用户1分钱领鸡蛋,手慢无!
发福蛋了!烟海e家客户端“新粉有特权,1分钱领鸡蛋”活动今日正式启动!即日起至28日24时,烟海e家新注册用户“1分钱+100积分”
2025-12-24 13:52:00
京东工业亮相京东品酒会 以创新持续助力工业产业万亿降本
12月23日,备受关注的京东品酒会在深圳鹏瑞莱佛士酒店举办,本次品酒会由京东工业和人头马携手呈现,不仅联合打造了一场融合美酒品鉴
2025-12-24 14:04:00
瑞金医院携手富士胶片揭牌培训基地 赋能医疗技术培训新未来
2025年12月21日,富士胶片智慧医疗技术培训中心(以下简称"该中心")迎来成立两周年之际,上海交通大学医学院附属瑞金医院胸外科腔镜/内镜(NBSTAT 课程)合作培训基地揭牌仪式于该中心隆重举行
2025-12-24 15:05:00
数智赋能,知行致远——上海大学悉尼工商学院SHU-UTS硕士项目学生走进商汤科技
为搭建理论与实践的桥梁,助力学生近距离感知人工智能产业前沿动态,近日,上海大学悉尼工商学院SHU-UTS硕士项目学生走进商汤科技
2025-12-24 15:05:00
浪潮华鼎:破局能源数智化转型,共筑安全高效新基建
近日,以“新质强国·数智赋能·绿色出海·共赢未来”为主题的第二届能源数智化论坛在北京举行。本届论坛由中国信息协会指导、中国信息协会能源工作委员会主办
2025-12-24 15:57:00