• 我的订阅
  • 科技

如何让等变神经网络可解释性更强?试试将它分解成「简单表示」

类别:科技 发布时间:2024-08-24 09:31:00 来源:机器之心Pro

如何让等变神经网络可解释性更强?试试将它分解成「简单表示」

神经网络是一种灵活且强大的函数近似方法。而许多应用都需要学习一个相对于某种对称性不变或等变的函数。图像识别便是一个典型示例 —— 当图像发生平移时,情况不会发生变化。等变神经网络(equivariant neural network)可为学习这些不变或等变函数提供一个灵活的框架。

而要研究等变神经网络,可使用表示论(representation theory)这种数学工具。(请注意,「表示」这一数学概念不同于机器学习领域中的「表征」的典型含义。本论文仅使用该术语的数学意义。)

近日,Joel Gibson、Daniel Tubbenhauer 和 Geordie Williamson 三位研究者对等变神经网络进行了探索,并研究了分段线性表示论在其中的作用。

如何让等变神经网络可解释性更强?试试将它分解成「简单表示」

论文标题:Equivariant neural networks and piecewise linear representation theory 论文地址:https://arxiv.org/pdf/2408.00949

在表示论中,简单表示(simple representation)是指该理论的不可约简的原子。在解决问题时,表示论的一个主要策略是将该问题分解成简单表示,然后分别基于这些基本片段研究该问题。但对等变神经网络而言,这一策略并不奏效:它们的非线性性质允许简单表示之间发生互动,而线性世界无法做到这一点。

但是,该团队又论证表明:将等变神经网络的层分解成简单表示依然能带来好处。然后很自然地,他们又进一步研究了简单表示之间的分段线性映射和分段线性表示论。具体来说,这种分解成简单表示的过程能为神经网络的层构建一个新的基础,这是对傅立叶变换的泛化。

该团队表示:「我们希望这种新基础能为理解和解读等变神经网络提供一个有用的工具。」

该论文证明了什么?

在介绍该论文的主要结果之前,我们先来看一个简单却非平凡的示例。

以一个小型的简单神经网络为例:

如何让等变神经网络可解释性更强?试试将它分解成「简单表示」

其中每个节点都是 ℝ 的一个副本,每个箭头都标记了一个权重 w,并且层之间的每个线性映射的结果都由一个非线性激活函数 组成,然后再进入下一层。

为了构建等变神经网络,可将 ℝ 和 w 替换成具有更多对称性的更复杂对象。比如可以这样替换:

如何让等变神经网络可解释性更强?试试将它分解成「简单表示」

其可被描述为:

如何让等变神经网络可解释性更强?试试将它分解成「简单表示」

不过,要想在计算机上真正实现这个结构,却根本不可能,但这里先忽略这一点。

现在暂时假设函数是周期性的,周期为 2π。当用傅里叶级数展开神经网络时,我们很自然就会问发生了什么。在傅里叶理论中,卷积算子会在傅里叶基中变成对角。因此,为了理解信号流过上述神经网络的方式,还需要理解激活函数在基频上的工作方式。

一个基本却关键的观察是:(sin (x)) 的傅里叶级数仅涉及较高共振频率的项:

如何让等变神经网络可解释性更强?试试将它分解成「简单表示」

(这里展示了当 是 ReLU 时,(sin (x)) 的前几个傅里叶级数项。)这与我们拨动吉他琴弦时发生的情况非常相似:一个音符具有与所弹奏音符相对应的基频,以及更高的频率(泛音,类似于上面底部的三张图片),它们结合在一起形成了吉他独特的音色。

该团队的研究表明:一般情况下,在等变神经网络中,信息会从更低共振频率流向更高共振频率,但反之则不然:

如何让等变神经网络可解释性更强?试试将它分解成「简单表示」

这对等变神经网络有两个具体影响:

    等变神经网络的大部分复杂性都出现在高频区, 如果想学习一个低频函数,那么可以忽略神经网络中与高频相对应的大部分。

举个例子,如果使用典型的流式示意图(称为交互图 /interaction graph)表示,一个基于(8 阶循环群)构建的等变神经网络是这样的:

如何让等变神经网络可解释性更强?试试将它分解成「简单表示」

其中的节点是 C_8 的简单表示,节点中的值表示生成器的动作。在此图中,「低频」简单表示位于顶部,信息从低频流向高频。这意味着在大型网络中,高频将占据主导地位。

主要贡献

该团队做出了一些重要的理论贡献,主要包括:

    他们指出将等变神经网络分解成简单表示是有意义且有用的。 他们论证表明等变神经网络必须通过置换表示构建。 他们证明分段线性(但并非线性)的等变映射的存在受控于类似于伽罗瓦理论的正规子群。 他们计算了一些示例,展示了理论的丰富性,即使在循环群等「简单」示例中也是如此。

等变神经网络和分段线性表示

该团队在论文中首先简要介绍了表示论和神经网络的基础知识,这里受限于篇幅,我们略过不表,详见原论文。我们仅重点介绍有关等变神经网络和分段线性表示的研究成果。

等变神经网络:一个示例

这篇论文的出发点是:学习关于某种对称性的等变映射是有用的。举些例子:

    图像识别结果通常不会随平移变化,比如识别图像中的「冰淇淋」时与冰淇淋所在的位置无关; 文本转语音时,「冰淇淋」这个词不管在文本中的什么位置,都应该生成一样的音频; 工程学和应用数学领域的许多问题都需要分析点云。这里,人们感兴趣的通常是对点云集合的质量评估,而与顺序无关。换句话说,这样的问题不会随点的排列顺序变化而变化。因此,这里的学习问题在对称群下是不变的。

为了解释构建等变神经网络的方式,该团队使用了一个基于卷积神经网络的简单示例,其要处理一张带周期性的图像。

这里,这张周期性图像可表示成一个 n × n 的网格,其中每个点都是一个实数。如果设定 n=10,再将这些实数表示成灰度值,则可得到如下所示的图像:

如何让等变神经网络可解释性更强?试试将它分解成「简单表示」

我们可以在这张图上下左右进行重复,使之具有周期性,也就相当于这张图在一个环面上。令 C_n = ℤ/nℤ 为 n 阶循环群,C^2_n = C_n × C_n。用数学术语来说,一张周期性图像是从群 C^2_n 到 ℝ 的映射的 ℝ 向量空间的一个元素:。在这个周期性图像的模型中,V 是一个「C^2_n 表示」。事实上,给定 (a, b) ∈ C^2_n 和 ∈ V,可通过移动坐标得到一张新的周期性图像:

如何让等变神经网络可解释性更强?试试将它分解成「简单表示」

((a, b)・f)(x, y) = f (x + a, y + b)

也就是说,平移周期性图像会得到新的周期性图像,例如:

如何让等变神经网络可解释性更强?试试将它分解成「简单表示」

得到等变神经网络的一个关键观察是:从 V 到 V 的所有线性映射的 ℝ 向量空间的维度为 n^4,而所有 C^2_n 表示线性映射的 ℝ 向量空间的维度为 n^2。

下面来看一个 C^2_n 等变映射。对于,可通过一个卷积型公式得到 C^2_n 等变映射 V → V:

如何让等变神经网络可解释性更强?试试将它分解成「简单表示」

如何让等变神经网络可解释性更强?试试将它分解成「简单表示」

举个例子,如果令 c = 1/4 ((1, 0) + (0, 1) + (−1, 0) + (0, −1))。则 c・ 是周期性图像且其像素 (a, b) 处的值是其相邻像素 (a+1, b)、(a, b+1)、(a−1, b) 和 (a, b−1) 的值的平均值。用图像表示即为:

如何让等变神经网络可解释性更强?试试将它分解成「简单表示」

更一般地,不同 c 的卷积可对应图像处理中广泛使用的各种映射。

现在,就可以定义这种情况下的 C^2_n 等变神经网络了。其结构如下:

如何让等变神经网络可解释性更强?试试将它分解成「简单表示」

其中每个箭头都是一个卷积。此外,W 通常是 ℝ 或 V。上图是一张卷积神经网络的(经过简化的)图像,而该网络在机器学习领域具有重要地位。对于该网络的构建方式,值得注意的主要概念是:

    此神经网络的结构会迫使得到的映射 V → W 为等变映射。 所有权重的空间比传统的(全连接)神经网络小得多。在实践中,这意味着等变神经网络所能处理的样本比「原始」神经网络所能处理的大得多。(这一现象也被机器学习研究者称为权重共享。)

该团队还指出上图隐式地包含了激活图,而他们最喜欢的选择是 ReLU。这意味着神经网络的组成成分实际上是分段线性映射。因此,为了将上述的第二个主要观察(通过将问题分解成简单表示来简化问题)用于等变神经网络,很自然就需要研究分段线性表示论。

等变神经网络

下面将给出等变神经网络的定义。该定义基于前述示例。

令 G 为一个有限群。Fun (X, ℝ) 是有限群 G 的置换表示(permutation representation)。

定义:等变神经网络是一种神经网络,其每一层都是置换表示的直接和,且所有线性映射都是 G 等变映射。如图所示:

如何让等变神经网络可解释性更强?试试将它分解成「简单表示」

(这里,绿色、蓝色和红色点分别表示输入、隐藏层和输出层,perm 表示一个置换表示,它们并不一定相等。和普通的原始神经网络一样,这里也假设始终会有一个固定的激活函数,其会在每个隐藏层中被逐个应用到分量上。)

最后举个例子,这是一个基于点云的等变神经网络,而点云是指 ℝ^d 中 n 个不可区分的点构成的集合。这里 n 和 d 为自然数。在这种情况下,有限群 G 便为 S_n,即在 n 个字母上的对称群,并且其输入层由 (ℝ^d)^n = (ℝ^n)^d 给定,而我们可以将其看作是 d 个置换模块 Fun ({1, ..., n}, ℝ) 的副本。如果将 Fun ({1, ..., n}, ℝ) 写成 n,则可将典型的等变神经网络表示成:

如何让等变神经网络可解释性更强?试试将它分解成「简单表示」

(这里 d=3 且有 2 层隐藏层。)这里的线性映射应当是 S_n 等变映射,而我们可以基于下述引理很快确定出可能的映射。

引理:对于有限 G 集合 X 和 Y,有,其中 Fun_G (X × Y, ℝ) 表示 G 不变函数 X×Y →ℝ。

根据该引理,,并且 G = S_n 有两条由对角及其补集(complement)给出的轨道。因此,存在一个二维的等变映射空间 n→n,并且这与 n 无关。(在机器学习领域,这种形式的 S_n 的等变神经网络也被称为深度网络。)

为了更详细地理解等变神经网络以及相关的分段线性表示论的定义、证明和分析,请参阅原论文。

以上内容为资讯信息快照,由td.fyun.cc爬虫进行采集并收录,本站未对信息做任何修改,信息内容不代表本站立场。

快照生成时间:2024-08-24 11:45:03

本站信息快照查询为非营利公共服务,如有侵权请联系我们进行删除。

信息原文地址:

用gpt-4解释30万神经元,原来ai的黑盒要ai自己去打开
...数据特征。但对于规模已经达到百亿、千亿级别的大规模神经网络来说,工作量和工作难度就都涨了亿点点吧。由此,OpenAI的研究人员想到,干嘛不让AI去自动化搞定这个大工程?在这项
2023-05-11 20:04:00
科学家竞相破解大型语言模型背后的谜团
...器学习算法,而先进的机器学习算法使用模拟人脑结构的神经网络,信息在不同神经元间传递,以人类不易理解的方式内化数据,缺乏可视化和透明度。这个问题对ChatGPT等大型语言模型(
2024-05-18 02:42:00
...基于“尺度定律”(Scaling Law)去构建更大、更深和更宽的神经网络,可称之为“基于外生复杂性”的通用智能实现方法,但这一路径面临着计算资源及能源消耗难以为继、可解释性
2024-08-17 12:25:00
稀疏自编码器是如何工作的,这里有一份直观说明
...客文章,直观地解释了 SAE 的工作方式。可解释性的难题神经网络最自然的组件是各个神经元。不幸的是,单个神经元并不能便捷地与单个概念相对应,比如学术引用、英语对话、HTTP
2024-08-06 09:27:00
爆火神经网络架构KAN更新2.0!可专属定制,轻松应对经典物理学
爆火神经网络架构KAN,上新了!KAN2.0。此次与科学问题更深入地融合,可以轻松解出经典物理学研究。比如发现拉格朗日量(用来描述整个物理系统动力状态的函数)除此之外,研究者还可
2024-08-22 09:52:00
新一代芯片电路逻辑综合,可扩展可解释的神经电路生成框架
...过程有机结合,展现了新一代逻辑综合技术的美好前景。神经网络架构搜索(Differential Neural Network Architecture Search
2024-11-06 09:44:00
深度学习在AI教育中的应用及其关键技术探究
摘要:本文介绍了深度学习技术的基本原理,包括神经网络结构和工作原理、激活函数的选择和作用、损失函数的定义和优化方法以及反向传播算法的实现细节。然后,以智能教育辅助系统为例,说明了
2023-09-12 11:30:00
揭开黑盒子:探索人工智能背后的科学原理与风险
...是机器是如何表现智能特征的(symptoms of intelligence)。在神经网络时代到来之前,人工智能领域占主导地位的是依靠暴力算法的专家系统
2023-06-05 14:00:00
科学家基于深度学习训练多样性数据集,实现多模光纤的非正交复用
...不处于互相垂直的状态。实验表明,在这种情况下,深度神经网络能够实现对两路非正交信号的解码。更进一步地,该课题组让两路信道的波长、空间位置和偏振态保持完全一致。在这种情况下,使
2024-05-27 10:42:00
更多关于科技的资讯:
给“狂飙”的AI套上伦理的“缰绳”全球首个系统级伦理垂域大模型“问道”发布南报网讯(记者何洁通讯员孙艳)让AI也能像学者一样
2025-11-13 08:06:00
第八届进博会搭建国际合作桥梁——汉诺金携手湖南卫视快乐购共促“健康中国”
近日,第八届中国国际进口博览会(进博会)在上海国家会展中心隆重开幕。作为全球关注的年度经贸盛会,进博会汇聚来自世界各地的顶尖企业与行业代表
2025-11-13 08:57:00
本报讯(全媒体记者左阳天)指尖滑动屏幕,货物飞速流转,一场持续了一个多月的年度消费盛宴,正悄然重塑江西消费者的购物车与江西商家的生产线
2025-11-13 06:45:00
新闻纵深|“人机共生”让绿钢更绿
河钢集团石钢公司五十六个智能模型构建“数字工厂”“人机共生”让绿钢更绿阅读提示订单排产从48小时压缩到30分钟,钢水样品2分40秒完成27种元素分析
2025-11-12 08:14:00
厦门网讯(厦门日报记者 沈彦彦)11月11日,京东发布2025年“双11”购物狂欢节(以下简称“双11”)福建消费热点相关情况
2025-11-12 08:22:00
厦门网讯(厦门日报记者 沈彦彦)昨日,抖音美洋官方旗舰店的直播间里热闹非凡,主播“上链接”话音刚落,新品针织衫链接的下单人数瞬间破百
2025-11-12 08:22:00
厦门网讯 (厦门日报记者 邬秀君)顶峰人文影视艺术会客厅项目签约金额20亿元;同文文化艺术影视科技街区项目签约金额16亿元
2025-11-12 08:22:00
厦门网讯 (文/厦门日报记者 谭心怡)在思明区禾祥西路,一个红色小窗口内闪着金元宝形的灯,客人抽完签、摇响铃铛、再把签递进窗口——冰激凌就会从里面递出
2025-11-12 08:22:00
厦门软件园企业:科技赋能 打开光影新视野
借助XR虚拟拍摄技术,可实现场景自由切换。图为厦门火炬元宇宙(XR)公共技术服务平台。(甚妙视觉 供图)厦门网讯 (厦门日报记者 林露虹 通讯员 管轩 雷飏)光影闪耀鹭岛
2025-11-12 08:22:00
●席恺前不久,星巴克以40亿美元出售中国业务60%股权。消息一传出,众人的目光很快聚焦在瑞幸咖啡上:这个总部设在厦门的咖啡品牌
2025-11-12 08:22:00
鲁网11月11日讯(记者 赵洪斌 吴美琳)11月11日,德州扒鸡®美食城三八路店重装开业,焕新启幕,美耀州城!溯源四十载
2025-11-12 08:43:00
立冬时节,寒意逐渐加重。11月7日,记者走进沧州热力有限公司热网调度中心,只见一块覆盖整面墙壁的智慧大屏格外醒目,沧州智慧热力管理平台正高效运行
2025-11-12 08:57:00
记者走基层|雄安图书馆迎来“新员工”
机器人馆员与小读者热情对话互动,数字人馆员“图小安”为读者推荐书籍,“爱心智送”机器人载着图书穿梭在图书馆内,无人驾驶送书车定时出发往雄安人工智能产业园等点位送书……11月3日
2025-11-12 08:59:00
2025网聚美好安徽 |“多面手”“大力士”……江淮前沿技术协同创新中心机器人“天团”来了
大皖新闻讯 11月11日,“皖美十四五 再启新征程”2025网聚美好安徽网络主题活动来到江淮前沿技术协同创新中心,采访团在这里邂逅了许多形态各异
2025-11-12 09:01:00
从秸秆到新材料,圣泉“链”就产业生态新格局|链上济南项新行
编者按:“十五五”规划建议中提出,提升产业链自主可控水平,强化产业基础再造和重大技术装备攻关,滚动实施制造业重点产业链高质量发展行动
2025-11-12 09:19:00