• 我的订阅
  • 科技

多个中国团队斩获EMNLP'24最佳论文!UCLA华人学者中三篇杰出论文

类别:科技 发布时间:2024-11-18 09:59:00 来源:量子位

刚刚,EMNLP 2024最佳论文奖新鲜出炉!

5篇中榜论文中,华人学者参与三篇,分别来自CMU、上海交通大学、中国科学院大学等机构。

多个中国团队斩获EMNLP'24最佳论文!UCLA华人学者中三篇杰出论文

其中,Pretraining Data Detection for Large Language Models: A Divergence-based Calibration Method主要由中科院网络数据科学与技术重点实验、中国科学院大学的学者完成。

论文一作Weichao Zhang;通讯作者郭嘉丰,现任中科院网络数据科学与技术重点实验室常务副主任。

这项研究提出了一个新的数据集和方法,用于检测给定文本是否为LLM预训练数据的一部分,有助于提高LLM训练数据透明度。

多个中国团队斩获EMNLP'24最佳论文!UCLA华人学者中三篇杰出论文

EMNLP’24今年收录论文总共2978篇,比去年增长5%,其中2455篇主会议论文,523篇workshop论文。

多个中国团队斩获EMNLP'24最佳论文!UCLA华人学者中三篇杰出论文

除最佳论文外,杰出论文也揭晓了,超半数华人学者参与。

多个中国团队斩获EMNLP'24最佳论文!UCLA华人学者中三篇杰出论文

顺便提一嘴,EMNLP 2025将于明年11月5-9日,在中国苏州举办!

国内学者们可以搓搓手准备起来了~

多个中国团队斩获EMNLP'24最佳论文!UCLA华人学者中三篇杰出论文

接下来,具体康康获奖论文有哪些~

上交大CMU等团队获最佳论文

此次共有5项研究成果获得EMNLP’24最佳论文奖。

1、An image speaks a thousand words, but can everyone listen? On image transcreation for cultural relevance(图像能表达千言万语,但每个人都能倾听吗?关于图像再创造的文化相关性)

多个中国团队斩获EMNLP'24最佳论文!UCLA华人学者中三篇杰出论文

这篇来自CMU的论文研究了图像跨文化再创作任务。鉴于多媒体内容兴起,翻译需涵盖图像等模态,传统翻译局限于处理语音和文本中的语言,跨文化再创作应运而生。

作者构建了三个包含SOTA生成模型的管道:e2e-instruct 直接编辑图像,cap-edit 通过字幕和 LLM 编辑后处理图像,cap-retrieve 利用编辑后的字幕检索图像,还创建了概念和应用两部分评估数据集。

结果发现,当前图像编辑模型均未能完成这项任务,但可以通过在循环中利用 LLM 和检索器来改进。

2、Towards Robust Speech Representation Learning for Thousands of Languages(为数千种语言实现稳健的语音表征学习)

多个中国团队斩获EMNLP'24最佳论文!UCLA华人学者中三篇杰出论文

这篇来自CMU、上海交大、丰田工业大学芝加哥分校的论文,介绍了一种名为XEUS的跨语言通用语音编码器,旨在处理多种语言和声学环境下的语音。

研究通过整合现有数据集和新收集的数据,构建了包含 4057 种语言、超 100 万小时数据的预训练语料库,并提出新的自监督任务(声学去混响)增强模型鲁棒性。研究结果显示,XEUS 在多个下游任务中表现优异,在 ML-SUPERB 基准测试中超越了其他模型,如在多语言自动语音识别任务中实现SOTA,且在语音翻译、语音合成等任务中也表现出色。

该团队超半数都是华人,其中一作William Chen目前是CMU语言技术研究所的硕士生,此前获得佛罗里达大学计算机科学和历史学学士学位。

多个中国团队斩获EMNLP'24最佳论文!UCLA华人学者中三篇杰出论文

3、Backward Lens: Projecting Language Model Gradients into the Vocabulary Space(逆向透镜:将语言模型梯度投射到词汇空间)

多个中国团队斩获EMNLP'24最佳论文!UCLA华人学者中三篇杰出论文

了解基于Transformer的语言模型如何学习和调用信息成为行业一个关键目标。最近的可解释性方法将前向传递获得的权重和隐藏状态投射到模型的词汇表中,有助于揭示信息如何在语言模型中流动。

来自以色列理工学院、特拉维夫大学的研究人员将这一方法扩展到语言模型的后向传递和梯度。

首先证明,梯度矩阵可以被视为前向传递和后向传递输入的低秩线性组合。然后,开发了将这些梯度投射到词汇项目中的方法,并探索了新信息如何存储在语言模型神经元中的机制。

4、Pretraining Data Detection for Large Language Models: A Divergence-based Calibration Method(大语言模型的预训练数据检测:基于散度的校准方法)

多个中国团队斩获EMNLP'24最佳论文!UCLA华人学者中三篇杰出论文

这篇论文作者来自中科院网络数据科学与技术重点实验、中国科学院大学、中关村实验室、阿姆斯特丹大学。

通讯作者郭嘉丰,现为中国科学院计算技术研究所研究员、中国科学院大学教授、北京人工智能研究院研究员,中科院网络数据科学与技术重点实验室主任。目前研究方向是信息检索(Neural IR)和自然语言理解的神经模型。

多个中国团队斩获EMNLP'24最佳论文!UCLA华人学者中三篇杰出论文

他们的研究旨在解决大语言模型预训练数据检测问题,因模型开发者不愿透露训练数据细节,现有方法在判断文本是否为训练数据时存在局限。

基于这样的原因,他们提出 DC-PDD 方法,通过计算文本的词元概率分布与词元频率分布的交叉熵(即散度)来校准词元概率,从而判断文本是否在模型预训练数据中。实验在 WikiMIA、BookMIA 和新构建的中文基准 PatentMIA 上进行,结果显示 DC-PDD 在多数情况下优于基线方法,在不同模型和数据上表现更稳定。

5、CoGen: Learning from Feedback with Coupled Comprehension and Generation(CoGen,结合理解和生成,从反馈中学习)

多个中国团队斩获EMNLP'24最佳论文!UCLA华人学者中三篇杰出论文

来自康奈尔大学的研究团队研究了语言理解和生成能力的耦合,提出在与用户交互中结合两者以提升性能的方法。

具体通过参考游戏场景,部署模型与人类交互,收集反馈信号用于训练。采用联合推理和数据共享策略,如将理解数据点转换为生成数据点。

实验结果显示,耦合方法使模型性能大幅提升,理解准确率提高 19.48%,生成准确率提高 26.07%,且数据效率更高。在语言方面,耦合系统的有效词汇增加,与人类语言更相似,词汇漂移减少。

杰出论文

再来看看杰出论文的获奖情况,此次共有20篇论文上榜。

GoldCoin: Grounding Large Language Models in Privacy Laws via Contextual Integrity Theory,香港科技大学研究团队完成,论文共同一作Wei Fan、Haoran Li。

团队提出了一个新框架,基于情境完整性理论来调整大语言模型使其符合隐私法律,提高其在不同情境下检测隐私风险的能力。

多个中国团队斩获EMNLP'24最佳论文!UCLA华人学者中三篇杰出论文

Formality is Favored: Unraveling the Learning Preferences of Large Language Models on Data with Conflicting Knowledge,南京大学团队完成,论文共同一作Jiahuan Li、Yiqing Cao。

论文研究了大语言模型在训练数据中存在冲突信息时的学习倾向。

多个中国团队斩获EMNLP'24最佳论文!UCLA华人学者中三篇杰出论文

科技巨头获奖团队有微软,Learning to Retrieve Iteratively for In-Context Learning提出了一种创造性的方法,模拟上下文学习示例的选择作为马尔可夫决策过程。

多个中国团队斩获EMNLP'24最佳论文!UCLA华人学者中三篇杰出论文

Towards Cross-Cultural Machine Translation with Retrieval-Augmented Generation from Multilingual Knowledge Graphs,由Adobe、苹果与罗马大学研究人员联合完成。

论文探讨并挑战了在跨文化机器翻译中翻译文化相关命名实体的传统方法。

多个中国团队斩获EMNLP'24最佳论文!UCLA华人学者中三篇杰出论文

此外值得一提的是,华人学者、加州大学洛杉矶分校计算机科学系副教授Nanyun Peng团队这次赢麻了,她参与/指导的三篇论文都获奖了。

多个中国团队斩获EMNLP'24最佳论文!UCLA华人学者中三篇杰出论文

三项工作都是关于评估LLM在创意叙事生成方面的能力,分别为:

Measuring Psychological Depth in Language Models(测量语言模型中的心理深度) Do LLMs Plan Like Human Writers? Comparing Journalist Coverage of Press Releases with LLMs(大语言模型能像人类作家一样规划吗?通过与记者对新闻稿的报道比较来评估) Are Large Language Models Capable of Generating Human-Level Narratives?(大语言模型能生成人类水平的叙述吗?)

以下是完整获奖名单:

多个中国团队斩获EMNLP'24最佳论文!UCLA华人学者中三篇杰出论文

多个中国团队斩获EMNLP'24最佳论文!UCLA华人学者中三篇杰出论文

多个中国团队斩获EMNLP'24最佳论文!UCLA华人学者中三篇杰出论文

多个中国团队斩获EMNLP'24最佳论文!UCLA华人学者中三篇杰出论文

最佳论文链接:[1]https://arxiv.org/abs/2404.01247[2]https://arxiv.org/abs/2407.00837[3]https://arxiv.org/abs/2402.12865[4]https://arxiv.org/abs/2409.14781[5]https://www.arxiv.org/abs/2408.15992参考链接:[1]https://x.com/emnlpmeeting/status/1857176170074460260?s=46[2]https://x.com/emnlpmeeting/status/1857173122598010918[3]https://aclanthology.org/events/emnlp-2024/

以上内容为资讯信息快照,由td.fyun.cc爬虫进行采集并收录,本站未对信息做任何修改,信息内容不代表本站立场。

快照生成时间:2024-11-18 11:45:01

本站信息快照查询为非营利公共服务,如有侵权请联系我们进行删除。

信息原文地址:

...图源:pexels撰文|张天祁随着中国科技迅速发展,中国的论文产量和高被引论文占比已经排名第一。今年6月,《经济学人》的封面专题“崛起的中国科学”引起各方关注,专题中一篇文章
2024-07-22 08:57:00
共话侨研未来,共绘多彩画卷(侨界关注)
...“温大侨研”团队获批国家社科基金11项,团队撰写学术论文150余篇、专著170余本、获得采纳的智库报告100余份。学校先后获批教育部意大利研究中心、中国华侨华人研究基地等一批
2024-01-19 03:22:00
华人教授回中国,加入高超计划,自己留不住人才,英国怪不了别人
...机计划公开资料显示,张勇豪教授已经发表近200篇高水平论文,在实验室组建、大型项目组织和人才培养等方面都获得过显著成就。作为从海外请回来的顶尖人才,张教授带领的团队将开发先进
2023-05-15 14:45:00
全球顶尖数学家齐聚上海
...并担任首届联盟主席,旨在通过组织学术年会、评选最佳论文,促进世界各地华人数学家之间的交流与合作,推进数学研究的发展,并通过出版物、会议、推广活动和其他方式服务数学界。联盟的主
2024-01-03 09:24:00
华人环境与资源经济学大会在浙江大学举办
...学院特聘教授薛进军作大会主旨演讲。本次大会共征集到论文306篇,经过专家评审,96篇论文被接收,82篇论文在22个平行论坛作口头报告。平行论坛报告内容涉及低碳减排、气候适应、
2024-05-14 14:32:00
...2Video的研究。他和纽约大学的华人学者谢赛宁一起合著的论文《基于Transformer架构探索一种新的扩散模型》被认为是Sora背后的重要技术基础之一
2024-02-28 10:40:00
...能和命运。王存玉在包括有国际影响的重要学术期刊发表论文110多篇,累计被引次数超过13000次,获得美国立卫生研究院优异奖和国际牙科研究会杰出科学家奖等10多项。作为第一位来
2024-12-24 13:28:00
OpenAI-o1思考替代法火了!焦剑涛高徒一作提出思考偏好优化
...bastian Raschka推荐了一项新研究,被网友们齐刷刷码住了。论文一作为华人学者Tianhao Wu,导师之一是2011年清华特奖得主焦剑涛
2024-10-29 09:58:00
张同海:第十一届尼山世界文明论坛各项筹备工作基本就绪
...到了中外学者的广泛响应,目前已收到来自30多个国家的论文150余篇。二、聚焦文明对话提升学术质量。本届论坛将有来自世界各地的400余位知名专家学者现场与会,其中,国外专家学者
2025-07-04 17:00:00
更多关于科技的资讯:
永清推动服装服饰与文旅、物流等深度融合,构建“设计+生产+展示+销售+物流+文旅”产业链条
永清推动服装服饰与文旅、物流等深度融合,构建“设计+生产+展示+销售+物流+文旅”产业链条融合发展,打造京南时尚产业新城10月23日航拍的永清县云裳小镇
2025-10-29 07:24:00
2025青岛虚拟现实创新大会在即,乐相科技分享产业洞察
鲁网10月28日讯随着虚拟现实技术的蓬勃发展,行业年度盛会——2025青岛虚拟现实创新大会即将在崂山区启幕。作为国内最早布局虚拟现实产业的地区之一
2025-10-28 14:03:00
物生物RELEA联手宫里的世界打造首个联名系列,惊艳深圳礼品展
随着第33届中国(深圳)国际礼品及家居用品展览会的大幕徐徐拉开,全球礼品与家居行业的目光再度聚焦于这座充满创新活力的城市
2025-10-28 14:21:00
京东工业与铜陵化学工业集团签署战略合作 共筑化工行业数智供应链新标杆
10月27日,铜陵化学工业集团有限公司(以下简称“铜化集团”)与北京京东数智工业科技有限公司(以下简称“京东工业”)正式签署战略合作协议
2025-10-28 14:25:00
广州两家“黑珍珠”餐厅入驻大众点评品质外卖,上线专属“主厨推荐单人工作餐”
这届打工人有福了,午休时间点外卖就能尝到“黑珍珠”餐厅的品质美味。10月28日,广州炳胜公馆(珠江新城店)、炳胜私厨(中达旗舰店)两家2025“黑珍珠”上榜餐厅正式入驻大众点评“品质外卖”
2025-10-28 14:25:00
XREAL与广和通达成战略合作,共启AI眼镜产业新纪元
10月27日,广和通与行业头部AR眼镜科技公司XREAL宣布达成战略合作,共同推动消费级AI眼镜产业迈向新纪元。双方将以领先的技术实力与制造能力
2025-10-28 14:51:00
近日,国内规模最大的直营租车平台神州租车正式推出品质服务月“脏必赔”服务保障机制,宣布自2025年10月24日起,用户如在取车后发现车辆清洁不达标
2025-10-28 16:52:00
超80%宁波上市公司用钉钉,钉钉AI助力宁波走向硬核智造
10月28日,以“AI时代的工作方式”为主题的钉峰会在浙江宁波举办。本次峰会由阿里巴巴旗下AI办公平台钉钉主办,吸引了来自制造
2025-10-28 16:57:00
支付宝带31个境外钱包来华消费 超400个友好商圈提前迎客
“我们很高兴与蚂蚁国际、与Alipay+合作,这不仅便利乌兹别克斯坦用户游全球、看中国,相信更是中乌科技合作的典范。”乌兹别克斯坦二维码网络 HUMO的董事会第一副主席马克萨德·穆希特迪诺夫说
2025-10-28 17:15:00
NMN哪个牌子效果好?十大高口碑NMN产品推荐,国产进口口服抗衰老
2025国家级新刊《抗衰老医学专刊》首刊定调:NAD+前体补充剂已成全民抗衰刚需,其中NMN机制明确、临床数据扎实,稳居市场C位
2025-10-28 17:15:00
2025年10月板材十大品牌年度实力回顾 环保品质与贴心服务双重保障
2025年第四季度已经过半,回顾全年板材市场销量和用户体验均有不错表现的前十品牌,板材作为家居装修和建筑工程的基础材料
2025-10-28 17:16:00
一、GEO 优化核心简介GEO(生成式引擎优化)是 AI 搜索时代的核心流量技术,通过适配豆包、DeepSeek 等主流 AI 平台算法
2025-10-28 17:18:00
中新经纬10月28日电 国家金融监管总局网站28日消息,近年来,国家金融监管总局坚持以人民为中心的发展思想,引导财险业积极履行社会责任
2025-10-28 17:30:00
10月27日,“春秋航空开招已婚已育空嫂”话题登顶热搜,引发广泛关注。一项看似寻常的专项招聘,因“已婚已育、年龄放宽至40岁”等条件
2025-10-28 17:33:00
向“新”而行聚力发展 河北工业经济稳中提质
在承德围场滴水湖光伏电站,无人机正在进行智能巡检。河北空天控股公司供图钢铁工厂添了大模型,“AI+钢铁”锻造新质生产力
2025-10-28 17:39:00