• 我的订阅
  • 头条热搜
无一大模型及格! 北大/通研院提出超难基准,评估长文本理解生成
...型及格!北大联合北京通用人工智能研究院提出了一个新基准数据集:LooGLE,专门用于测试和评估大语言模型(LLMs)长上下文理解能力。该数据集既能够评估LLMs对长文本的处理和检索能力,又可以评估其对文本长程依赖的建模...……更多
全模态对齐框架align-anything来啦:实现跨模态指令跟随
... 支持多种开、闭源对齐评估:支持了 30 多个多模态评测基准,包括如 MMBench、VideoMME 等多模态理解评测,以及如 FID、HPSv2 等多模态生成评测训练框架北大对齐小组设计了高度模块化、扩展性以及简单易用的对齐训练框架,支持...……更多
北大推出全新机器人多模态大模型!面向通用和机器人场景的高效推理和操作
...多种操作技能。在实验中,RoboMamba 在通用和机器人评估基准上展示了出色的推理能力,如图 2 所示。同时,我们的模型在模拟和现实世界实验中展示了令人印象深刻的操纵位姿预测能力,其推理速度比现有的机器人 MLLMs 快 7 倍...……更多
下载次数破39万!CMU、Meta联合发布VQAScore文生图优化方案:Imagen3已采用
...图像质量的新方法;GenAI-Bench是一个包含复杂文本提示的基准测试集,用于挑战和提升现有的图像生成模型。两个工具可以帮助研究人员自动评估AI模型的性能,还能通过选择最佳候选图像来实际改善生成的图像。近年来,生成...……更多
NeurIPS | 消除多对多问题,清华大规模细粒度视频片段标注新范式
...粒度标注系统 VERIFIED,并基于此系统构建新的细粒度 VCMR 基准数据集(Charades-FIG、DiDeMo-FIG 和 ActivityNet-FIG),以推动细粒度视频理解的发展。论文题目:VERIFIED: A Video Corpus Moment Retrieval Be……更多
文生图参数量升至240亿!Playground v3发布:深度融合LLM,图形设计能力超越人类
...nd v3(简称PGv3),将模型参数量扩展到240亿,在多个测试基准上达到了最先进的性能,更擅长图形设计。与传统依赖于预训练语言模型如T5或CLIP文本编码器的文本到图像生成模型不同,PGv3完全集成了大型语言模型(LLMs),基于...……更多
AI科学家太多,谁靠谱一试便知!普林斯顿新基准CORE-Bench:最强模型仅有21%准确率
【新智元导读】普林斯顿大学新发布的CORE-Bench基准测试,通过270个基于90篇跨学科科学论文的任务,可评估AI智能体在计算可重复性方面的表现,最简单任务的准确率可以达到60%,最难任务准确率仅有21%大模型的能力越来越强,...……更多
MMMU华人团队更新Pro版!多模态基准升至史诗级难度:过滤纯文本问题、引入纯视觉问答
...入设置)更严格地评估模型的多模态理解能力;模型在新基准上的性能下降明显,表明MMMU-Pro能有效避免模型依赖捷径和猜测策略的情况。多模态大型语言模型(MLLMs)在各个排行榜上展现的性能不断提升,例如GPT-4o在大学水平...……更多
GPT-4不仅性能更强也更贵了:单次输出7.5万单词需6美元,是此前的30倍
...多现实世界场景中的能力不如人类,但在各种专业和学术基准上表现出人类水平,比如在法律考试中可以打败90%的人类。不过,GPT-4仍存和此前模型相似的局限性,仍然不完全可靠,存在事实性“幻觉”并出现推理错误,可能自...……更多
多模态LLM视觉推理能力堪忧,浙大领衔用GPT-4合成数据构建多模态基准
...理方面同样不足。为此他们提出了一种多模态的视觉推理基准,并设计了一种新颖的数据合成方法。无论是语言模型还是视觉模型,似乎都很难完成更抽象层次上的理解和推理任务。语言模型已经可以写诗写小说了,但是依旧算...……更多
清华领衔发布多模态评估MultiTrust:GPT-4可信度有几何?
...的研究人员联合撰写百页长文,发布名为MultiTrust的综合基准,首次从多个维度和视角全面评估了主流多模态大模型的可信度,展示了其中多个潜在安全风险,启发多模态大模型的下一步发展。论文标题:Benchmarking Trustworthiness of ...……更多
Bengio团队提出多模态新基准,直指Claude 3.5和GPT-4o弱点
AIxiv专栏是机器之心发布学术、技术内容的栏目。过去数年,机器之心AIxiv专栏接收报道了2000多篇内容,覆盖全球各大高校与企业的顶级实验室,有效促进了学术交流与传播。如果您有优秀的工作想要分享,欢迎投稿或者联系报...……更多
大幅减缓幻觉 百融云创大模型精度测评结果出炉
...越重要。百融云创参加的这场“考试”名叫检索增强生成基准测评,这是对大模型处理“幻觉问题”的能力测评,也是对大模型生成内容准确性的测评。尽管大模型带来令人兴奋的技术进步,但“幻觉”一直是制约其发展的主要...……更多
Mamba再次挑战霸主Transformer!首个通用Mamba开源大模型一鸣惊人
...型Falcon Mamba 7B,性能与Transformer架构模型相媲美,在多个基准测试上的均分超过了Llama 3.1 8B和Mistral 7B。今天,阿布扎比支持的技术创新研究所(TII) 开源了全球第一个通用的大型Mamba架构模型——Falcon Mamba 7B。虽然之前,但仅……更多
87.8%准确率赶超GPT-4o登顶!谷歌DeepMind发布自动评估模型FLAMe
...动评分器 ( FLAMe-RM 和 FLAMe-Opt-RM)。在12个自动评分器评估基准中的8个基准上,FLAMe及其变体的自动评分性能优于用专有数据训练的GPT-4o、Gemini-1.5-Pro等模型。- 计算高效的多任务训练:引入了一种计算更为高效的方法,使用创新...……更多
文本图格式大一统!首个大规模文本边基准TEG-DB发布 | NeurIPS 2024
...里大学等机构的研究人员首次提出了文本边图的数据集与基准,包括9个覆盖4个领域的大规模文本边图数据集,以及一套标准化的文本边图研究范式。该研究的发表极大促进了文本边图图表示学习的研究,有利于自然语言处理与...……更多
北大林宙辰团队全新混合序列建模架构MixCon:性能远超Mamba
....5 倍(如图 5 所示)。数据集评估本文在一系列标准学术基准测试中评估 Conba 性能,包括常识推理任务(如 HellaSwag、WinoGrande、ARC - E、ARC - Challenge)、阅读理解任务(如 BoolQ、QuAC)、聚合基准测试(如 MMLU、BBH),采用不同……更多
非Transformer架构站起来了!首个纯无注意力大模型,超越Llama 3.1
...理各种文本生成任务。从结果来看,Falcon Mamba 7B 在一些基准上超越同尺寸级别的领先模型,包括 Meta 的 Llama 3 8B、Llama 3.1 8B 和 Mistral 7B。 Falcon Mamba 7B 分为四个变体模型,分别是基础版本、指令微调版本、4bit 版本……更多
开闭源模型「大乱斗」:看看哪个智能体最能窥见人类真实意图
...该工作首先引入了 Intention-in-Interaction(IN3)这一全新的基准测试,旨在通过与用户明确的交互来理解用户的隐式意图。以 Mistral-7B 为框架,基于 IN3 训练的 Mistral-Interact 能主动评估任务的模糊性,询问用户意图,并在启动下游智...……更多
用过GPT-4 Turbo以后,我们再也回不去了
...了不到十分钟。GPT-4 Turbo 具有创纪录的准确率,在 PyLLM 基准上,GPT-4 Turbo 的准确率是 87%,而 GPT-4 的准确率是 52%,这是在速度几乎快了四倍多的情况下(每秒 48 token)实现的。至此,生成式 AI 的竞争似乎进入了新的阶段。很多...……更多
智慧芽垂直领域大模型通过国家网信办“双备案”
...、C-Eval,以及智慧芽面向业内首次提出的专利大模型测试基准(Patent-bench)的测评结果显示,智慧芽垂直领域大模型在问答、总结、写作、翻译、分类等方面能力整体优于商业通用大模型。图:智慧芽垂直领域大模型专业考试成...……更多
速度惊人,手机跑stablediffusion,12秒出图
...分别在三星S23Ultra(Adreno740)和 iPhone14ProMax (A16)进行了一组基准测试。作为去噪神经网络,UNet是计算需求最高的组件。研究人员提供了执行单次迭代的UNet所需的延迟数据,以毫秒为单位测量,图像分辨率为512x512。此外,他们记录...……更多
LLM数学性能暴涨168%,微软14人团队力作!合成数据2.0秘诀曝光,智能体生成教学
...化的合成数据。经过合成数据微调后的模型Orca-3,在多项基准上刷新了SOTA。全世界高质量数据几乎枯竭。AI科学家们为了解决这一难题,可谓是绞尽脑汁。目前来看,合成数据或许就是大模型的未来,也成为业界公认的解决之法...……更多
2023 AI现状报告:GPT-4仍最强,监管方向缺乏全球共识
...变得更加强大和灵活,比较它们的能力越来越困难。由于基准变得不那么明确,用于评估大语言模型的“基于氛围”的方法在业界越来越普遍。·人工智能安全在2023年首次占据舞台中心。但人工智能界内部存在深刻分歧,世界各...……更多
刚刚,Llama 3.2 来了!支持图像推理,还有可在手机上运行的版本
...与 Gemma 相当。具体来说,Meta 在涉及多种语言的 150 多个基准数据集上对 Llama 3.2 进行了评估。对于视觉 LLM,评估基准涉及图像理解和视觉推理任务。视觉模型Llama 3.2 11B 和 90B 模型是首批支持视觉任务的 Llama 模型,因此 Meta 为...……更多
CVPR最佳论文被生成式AI占领,清华武大华南农大上科校友获奖
...性两方面评估生成视频的质量,结果显示该方法明显优于基准:最佳学生论文 BioCLIP: A Vision Foundation Model for the Tree of Life论文作者来自俄亥俄州立大学、微软研究院、加利福尼亚大学欧文分校、伦斯勒理工学院。他们构建了一个...……更多
仅用4块GPU、不到3天训练出开源版GPT-4o,这是国内团队最新研究
...TS) 、 Qwen2-Audio (+TTS) 。主要结果表 1 给出了 InstructS2S-Eval 基准测试主要结果。首先,在 S2TIF 任务中,从内容(content)角度来看,LLaMA-Omni 相比之前的模型有了显著提升,这主要是因为 LLaMA-Omni 是基于最新的 L……更多
北大、快手开源视频生成模型Pyramid Flow,1分钟生成5秒视频
智东西10月11日消息,据VentureBeat报道,北京大学、北京邮电大学和快手科技在本周联合开源了一款名为Pyramid Flow的高清视频生成模型。Pyramid Flow能根据文本描述制作长达10秒、分辨率为1280×768、每秒24帧的视频。Pyramid Flow采用了...……更多
什么影响大模型安全?NeurIPS\\\'24新研究提出大模型越狱攻击新基准
全新大语言模型越狱攻击基准与评估体系来了。来自香港科技大学(Guangzhou)USAIL研究团队,从攻击者和防御者的角度探讨了什么因素会影响大模型的安全。提出攻击分析系统性框架JailTrackBench。JailTrackBench研究重点分析了不同...……更多
迎战GPT-4V!谷歌PaLI-3视觉语言模型问世,更小、更快、更强
...igLIP)进行了比较,结果发现,PaLI-3 虽然在标准图像分类基准上略微表现不佳,但基于 SigLIP 的 PaLI 在各种多模态基准测试中表现出卓越的性能,特别是在定位和文本理解方面。相关研究论文以“PaLI-3 Vision Language Models: Smaller, Fas.……更多
更多关于科技的资讯:
今天是腾讯26岁生日 官方回忆杀:你第一次用QQ、QQ秀是啥时候
快科技11月11日消息,今天不仅是双11电商购物节,还是腾讯的26岁生日。腾讯成立于1998年11月11日,由马化腾、张志东等五位创始人共同创立
2024-11-11 17:46:00
数字创新 造物未来
11月6日,2024中国电子半导体产业创新发展大会暨国际电子电路(大湾区)展览会(2024CPCAShowPlus)在深圳国际会展中心(宝安)启幕
2024-11-11 17:46:00
BBA也没逃脱:为啥第三季度很多车企赚不到钱了
这是一股冰冷的寒潮。跨国车企们,似乎一夜之间失去了钞能力,从扎堆释放的第三季度财报来看,净利润几乎都出现了断崖式下跌。对电动化比较激进的大众
2024-11-11 17:46:00
史低!AMD锐龙9000系列CPU大降价:最高降幅28%
快科技11月11日消息,锐龙9000非X30D系列的价格持续走低。最近,美国颇受消费者喜爱的零售商Microcenter已经将四款锐龙9000系列CPU的价格降到了史低
2024-11-11 17:46:00
领克首款纯电SUV内饰官宣!套内面积4.03平米 首创百变灵动岛
快科技11月11日消息,克汽车最近发布了旗下新车领克Z20的更多细节图片,揭示了其内饰的豪华配置和创新设计。据悉,领克Z20的车内空间拥有4
2024-11-11 17:46:00
动态均速214km/h!奔驰打破保时捷纯电车24小时最长行驶里程纪录
快科技11月11日消息,奔驰CLA纯电版车型的原型车最近达成了一项新的世界纪录:纯电车型24小时最长行驶里程的纪录。它的成绩是24小时连续行驶2309
2024-11-11 17:46:00
三季度全球最赚钱的十家车企:超一半利润腰斩 仅比亚迪、特斯拉逆势上涨
快科技11月11日消息,据报道,在刚刚过去的第三季度,全球主流车企普遍遇到了销量下滑,利润大降的情况。有媒体根据车企财报数据
2024-11-11 17:46:00
造物数科数智成果亮相2024电子半导体产业创新发展大会
2024年11月6日,2024电子半导体产业创新发展大会暨国际电子电路(大湾区)展览会(CPCAShowPlus2024)在深圳国际会展中心(宝安新馆)成功启幕
2024-11-11 18:01:00
特斯拉股价上周暴涨29%!市值再度突破1万亿美元
快科技11月11日消息,据媒体报道,特斯拉在电动汽车产销量的持续大幅增加推动下,曾在2021年10月成为全球首家市值超过10000亿美元的车企
2024-11-11 18:16:00
中国自主研发养鱼桶:养殖密度提高30倍 节水85%
快科技11月11日消息,华中科技大学近日发布消息称,在中国国际大学生创新大赛(2024)总决赛上,该校生命学院的“鱼多康”团队荣获“青年红色筑梦之旅”赛道金奖
2024-11-11 18:16:00
卢伟冰回应发布会上误喊3000:真不是小米15 Pro的成本价
快科技11月11日消息,此前在小米15系列发布会上,卢伟冰在公布小米15 Pro价格时,把5299元说成“3000”,然后改口“5299”
2024-11-11 18:16:00
双11进入最后冲刺阶段!iPhone 16价格出现新低:5099元起
快科技11月11日消息,今天下午,微博话题“iPhone 16价格出现新低”引发热议。据报道,一年一度的双11大促进入了最后的冲刺阶段
2024-11-11 18:46:00
曝Intel将扩大Arrow Lake台积电代工规模!应对AMD和NVIDIA竞争
快科技11月11日消息,据媒体报道,面对AMD和NVIDIA的激烈竞争,英特尔计划在2025年通过扩大与台积电的合作来提升其芯片竞争力
2024-11-11 18:46:00
本田飞度10月卖出695辆:只占比亚迪海鸥销量1/74
快科技11月11日消息,燃油车时代,如果你想花10万元买一台代步车,那么本田飞度无疑是避不开的选择,而它的销量也确实很有保障
2024-11-11 18:46:00
全白高颜值!微星MPG Z890 EDGE TI WIFI刀锋钛主板评测:一键提升10%带宽、降低10%延迟
一、前言:颜值与做工均衡的性价比Z890主板Intel新一代的桌面处理器酷睿Ultra 200S虽然在游戏性能方面不尽如人意
2024-11-11 18:46:00