• 我的订阅
  • 科技

只要一张图就能还原绘画过程,这篇论文比Paints-UNDO实现得更早

类别:科技 发布时间:2024-07-31 09:39:00 来源:机器之心Pro

AIxiv专栏是机器之心发布学术、技术内容的栏目。过去数年,机器之心AIxiv专栏接收报道了2000多篇内容,覆盖全球各大高校与企业的顶级实验室,有效促进了学术交流与传播。如果您有优秀的工作想要分享,欢迎投稿或者联系报道。投稿邮箱:liyazhou@jiqizhixin.com;zhaoyunfeng@jiqizhixin.com

作者介绍:宋亦仁:新加坡国立大学 ShowLab 博士研究生, 主要研究方向包括图像和视频生成, AI 安全性。

黄施捷:新加坡国立大学硕士二年级学生,目前在 Tiamat AI 任算法工程师实习生,主要研究方向是视觉生成。目前在寻找 2025 fall 博士入学机会。

最近,lvmin 带来了最新模型 Paints-UNDO。这款 AI 生成工具可以根据图片还原整个绘画过程,整个 AIGC 社区都为之震撼。

Paints-UNDO 的演示 demo。

早在 1 个月前,NUS,SJTU,Tiamat 等机构联合已经发布了一篇做类似任务的工作 ProcessPainter: Learn Painting Process from Sequence Data。Paints-UNDO 技术报告还未公布,让我们一起看看 ProcessPainter 是如何实现的吧!

论文标题:ProcessPainter: Learn Painting Process from Sequence Data 论文链接:https://arxiv.org/pdf/2406.06062 代码链接:https://github.com/nicolaus-huang/ProcessPainter

翻开任意一本绘画教学书籍,都能看到按照步骤画画的指导。然而,在生成式 AI 时代,通过去噪过程完成图像生成和人类画家绘画过程完全不同,AI 画画的过程无法直接用于绘画教学。

为了解决这一问题,ProcessPainter 通过在合成数据和人类画师绘画视频上训练时序模型,首次实现了让扩散模型生成绘画过程。此外,不同题材、画师的绘画过程差异巨大,风格迥异。然而,目前很少有研究将绘画过程作为研究对象。论文作者在预训练的 Motion Model 基础上,通过在特定画师的少量绘画序列上训练 Motion LoRA,学习画师的绘画技法。

深入解读 ProcessPainter 的核心技术

只要一张图就能还原绘画过程,这篇论文比Paints-UNDO实现得更早

1. 时序注意力机制(Temporal Attention)

用时序注意力学习生成绘画过程是 ProcessPainter 的核心创新。绘画序列生成的关键是,整个序列是同一张图从抽象到具体的变化过程, 前后帧在内容和构图上是一致且相关的。为了实现这一目标,作者为 Unet 引入了来自 AnimateDiff 的时序注意模块。该模块位于每一层扩散层之后,通过帧间自注意机制来吸收不同帧的信息,确保整个序列的平滑过渡和连续性。

实验证明,该训练策略可以在帧之间保持一致的绘画效果。绘画过程生成和视频生成任务不同之处在于,绘画过程前后变化更加剧烈,首帧是完成度很低的色块或线稿,而尾帧是完整的画作,这对模型训练带来挑战。为此,论文作者先在大量合成数据集上预训练时序模块,让模型学习各种各种 SBR(Stroke-based rendering) 方法的逐步绘画过程,再用数十个艺术家的绘画过程数据训练 Painting LoRA 模型。

2. 艺术品复制网络(Artwork Replication Network)

绘画实践中,我们更希望知道一幅作品是如何画出来的,以及如何从半成品绘画继续细化以达到期待的成品效果。这就引申出了两个任务:绘画过程重建和补全。鉴于这两个任务都有图像的输入,论文作者提出了艺术品复制网络(Artwork Replication Network)。

这一网络设计能够处理任意帧的图像输入,灵活控制绘画过程的生成。与之前的可控性生成方法类似,论文作者引入一个 ControlNet 的变体,来控制生成结果中的特定帧与参考图一致。

3. 合成数据集与训练策略

由于真实绘画过程数据较难获取,数量不足以支持大规模训练。为此,论文作者构建了用于预训练的合成数据集。

具体采用了三种合成数据方法:

1. 采用 Learn to Paint 来产生半透明贝赛尔曲线笔触的绘画序列;

2. 通过自定义笔触,用 Neural style painting 生成油画风格和中国画风格的绘画序列。

3. 上述 SBR(Stroke base painting)方法是从粗到细的拟合一张目标图像, 意味着允许对于已经绘画的部分进行覆盖和修改,然而很多绘画种类,如中国画和雕刻,由于材料的限制,无法大幅度修改已经完成的部分, 绘画过程是分区域完成的。为此,论文作者采用 SAM(segment anything) 和显著性检测方法,从空白画布逐个子区域添加内容,先绘制显著性物体, 然后逐步向背景扩散,从而合成绘画过程视频。

在训练阶段,论文作者首先在合成数据集上预训练了 Motion Model,然后冻结了 Motion Model 的参数并训练了 Artwork Replication Network。在微调绘画 LoRA 模型时,第一步只使用最终帧来微调空间注意力 LoRA,以防止半成品绘画训练集损害模型的生成质量。

此后,论文作者冻结了空间注意力 LoRA 的参数,并使用完整的绘画序列微调时间注意力 LoRA。在推理阶段,当从文本生成绘画序列时,ProcessPainter 不使用艺术品复制网络。在绘画过程重建和补全任务中,ProcessPainter 使用艺术品复制网络接收特定帧的参考输入。为了确保生成的绘画序列中的帧尽可能与输入图像匹配,ProcessPainter 采用了 DDIM 反演技术来获取参考图像的初始噪声,并在 UNet 中替换特定帧的初始噪声。

ProcessPainter 效果展示

在合成数据集上训练的 ProcessPainter base model 可以生成过程上有风格差异的绘画序列。

只要一张图就能还原绘画过程,这篇论文比Paints-UNDO实现得更早

通过在少量人类画师的绘画序列上分别训练 Motion Lora,ProcessPainter 可以学习特定画师的绘画过程和风格。

只要一张图就能还原绘画过程,这篇论文比Paints-UNDO实现得更早

指定参考图像,ProcessPainter 可以将完成的艺术品逆向解构为绘画步骤,或者从半成品推演出完整的画作。

只要一张图就能还原绘画过程,这篇论文比Paints-UNDO实现得更早

这些技术组件的结合,让 ProcessPainter 不仅能够从文本生成绘画过程,还能将参考图转换成绘画序列,或是对未完成的画作进行补全。这无疑为艺术教育提供了新工具,同时也为 AIGC 社区开辟了新赛道。也许不久的将来,Civitai 上会有各种模拟人类画师绘画过程的不同 Lora 出现。

更多细节,欢迎阅读论文原文或访问 Github 项目主页。

以上内容为资讯信息快照,由td.fyun.cc爬虫进行采集并收录,本站未对信息做任何修改,信息内容不代表本站立场。

快照生成时间:2024-07-31 11:45:08

本站信息快照查询为非营利公共服务,如有侵权请联系我们进行删除。

信息原文地址:

...。然而次月,王某发现该图片出现在武汉某科技公司的AI绘画训练营广告中,被用于AI绘画课程售卖。王某认为该公司侵权,将其告上了法庭。用AI创作的内容能否被视为“作品”?版权又到
2025-02-28 09:34:00
...画核心阅读输入一段话,“绘”出一幅画——人工智能的绘画本领,吸引众多职业画师和零基础用户尝鲜。人工智能绘画的本质是计算,接受“语言描述”指令后根据自身的理解还原出图像。未来,
2022-12-23 05:21:00
谷歌 AI 绘画 4 大牛携手创业,天使估值 7 个亿
...家获悉,这回跟谷歌saybyebye的,是文生图核心团队——AI绘画模型 Imagen论文的四位核心作者,出走目的是要搞自己的AI公司
2023-03-04 23:21:00
我们尝试让绘画ai成为负责插图的新同事
技术正在突飞猛进。随着讨论热度逐渐褪去,“AI绘画”的话题在最近这段时间似乎已经渐渐不再掀起波澜,却已有不少游戏公司悄无声息地将AI绘画加入了自己的工作流程中。在探索AI绘画工具
2022-12-29 14:54:00
本文转自:解放日报用AI绘画的人,享有著作权吗简工博本报记者 简工博当并不具备绘画创作能力的人,通过文字描述,利用人工智能软件生成出一张图片,那么他是否拥有这张图片的著作权?自A
2023-12-14 05:44:00
美术的教育作用体现在创作过程中,而AI恰恰跳脱了过程
...利用人工智能技术来生成内容,去年底相继风靡全网的AI绘画和聊天机器人模型ChatGPT都属于它的分支,至今热度不退,仍处高歌猛进的当口。除了扎堆体验当作娱乐消遣工具的看客,还
2023-02-12 09:05:00
ai绘画侵权实锤,扩散模型可能记住你的照片
AI绘画侵权,实锤了!最新研究表明,扩散模型会牢牢记住训练集中的样本,并在生成时“依葫芦画瓢”。也就是说,像StableDiffusion生成的AI画作里,每一笔背后都可能隐藏着
2023-02-03 22:00:00
AI生成图片侵权第一案宣判:本质上仍是人利用工具进行创作
...片是否构成作品,即涉案人工智能技术生成图片也就是AI绘画图片是否具备独创性,是否体现了人的独创性智力投入,是否应当被认定为作品,受到著作权法保护。法院认为,从原告构思涉案图片
2023-12-12 11:43:00
AI生成内容是否享有著作权?要看这两点→
...件。画面中的是原告李先生,他说,他从几年前开始对AI绘画,也就是人工智能绘画产生兴趣。平日里,他会将一些自己用AI绘画软件制作的图片,发布在网络平台账号上。而在2022年3月
2023-12-21 09:32:00
更多关于科技的资讯:
马中企业家大会|中山市福瑞特科技产业有限公司总经理钟海鹏:创新驱动智能消防发展
8月13日,在贵阳国际生态会议中心召开的第十五届马中企业家大会商务贸易投资交流会上,中山市福瑞特科技产业有限公司总经理钟海鹏对该公司的智慧消防创新技术成果进行介绍
2025-08-14 19:36:00
微视频丨大模型为京雄高速公路装上“智慧大脑”
2025-08-14 19:44:00
京东物流中期业绩:上半年总收入同比增长14.1%,海外及港澳业务持续高速增长
8月14日,京东物流发布2025年年度中期业绩报告。截至2025年6月30日,京东物流总收入达到985.3亿元,同比增长14
2025-08-14 19:52:00
北京时间8月14日,京东集团【纳斯达克代码:JD,港交所代号:9618(港币柜台)及89618(人民币柜台)】发布了2025年二季度业绩
2025-08-14 19:52:00
8月8日至12日,2025世界机器人大会在北京举行。秦皇岛市海港区企业机器人产业发展最新成果亮相大会,包含AI+机器人工厂
2025-08-14 17:38:00
菏泽民生热力集团联合技术专家开展专题培训 赋能供热技术升级
大众网记者 张宁 菏泽报道为进一步提升供热系统运行效率与技术管理水平,8月12日至13日,菏泽民生热力集团公司联合国内多家知名供热设备供应商的技术专家团队
2025-08-14 17:38:00
DeepSeek App重磅更新:支持对话内容生成分享图功能
8月14日,根据手机应用商店显示,DeepSeek App发布了1.3.0版本更新,支持对话内容生成分享图功能。更新之后
2025-08-14 12:00:00
飞猫 5G 旗舰新品随身 WiFi 登场 解锁极速网络新姿势
近年来,5G网络如潮水般席卷而来,从实验室走向千家万户,深刻改变着人们的生活与工作方式。它让远程办公的视频会议清晰如面对面交谈
2025-08-14 07:31:00
何以中国·和合共生 撰稿:谷悦拍摄:刘岩制作:刘岩谷悦监制:李华楠协助单位:意风区资产经营管理有限公司天津海河意式风情区管理委员会
2025-08-14 07:38:00
洞门新秀FOSA的逆袭之路:OnSys系统如何撼动Crocs霸主地位
当洞洞鞋市场被贴上“丑萌”“功能单一”标签时,一个德国基因与中国智造融合的品牌正以三重缓震科技撕开行业裂缝。技术革命:OnSys系统颠覆传统脚感2025年全球洞洞鞋市场规模达142亿美元
2025-08-14 07:38:00
无人车上卖零食,路边招手就可买
8月13日,小巧的零售型无人车正沿着中新南京生态科技岛江岛智立方园区的步道平稳前行,车内放着琳琅满目的零食与饮品。零售型无人车具备L4级自动驾驶能力
2025-08-14 07:44:00
赋予“触觉神经” 推动人形机器人“进化”宁企在六维力传感器行业脱颖而出,获超2亿元战略注资南报网讯(记者张希)8月11日
2025-08-14 07:45:00
南报网讯(记者祝东秀)8月13日,“服务护航促发展·携手同行筑未来”2025年军创企业AI智能专项服务日活动在建邺区政务服务中心举行
2025-08-14 07:45:00
助企业“零代码”写应用、帮警方“大数据”破案、替用户“点对点”营销,雨花台区——大模型“七剑出鞘”,国家级备案数领跑□南京日报/紫金山新闻记者于洁尘今夏
2025-08-14 07:46:00
厦门网讯(厦门日报记者 李晓平)近日,2025年度福建省数字经济核心产业创新企业名单出炉,全省共有350家企业入选省级“独角兽”“未来独角兽”“瞪羚”企业
2025-08-14 07:53:00