• 我的订阅
  • 头条热搜
「世界开源新王」跌落神坛?重测跑分暴跌实锤造假,2人团队光速「滑跪」
...源新王」Reflection 70B,才坐上王座没几天就被打假,跌落神坛了!甚至有人质疑,它莫不是套壳的Sonnet 3.5?发布者Matt Shumer和Sahil Chaudhary经过一番挣扎,已经光速「滑跪」,po出的复盘长文也是亮点满满。「开源新王」Reflection 70B...……更多
字节开源全栈AI编程基准,不小心曝光豆包代码大模型
...准,据介绍FullStack Bench是目前最全面的代码评估数据集。团队还同步开源了可随时测评代码大模型的沙盒执行环境SandBox Fusion,单服务器即可部署,也可直接在线体验。全新代码大模型评估基准FullStack Bench既然如此,那就先来了...……更多
铠侠exceriaplus极至光速g3ssd测试
...对消费级市场推出了自家的主流级新品——EXCERIAPLUS极至光速G31TBSSD(代号SD10)。铠侠EXCERIAPLUS极至光速G3SSD是标准的M.2规格,支持PCIe4.0x4速率、NVMe1.4技术,我们收到的版本为1TB。它用的是铠侠自研的BiCSTLC原厂颗粒,顺序读写速度.……更多
微软华人团队发布全新基准AGIEval,专为人类考试而生
随着语言模型的能力越来越强,现有的这些评估基准实在有点小儿科了,有些任务的性能都甩了人类一截。通用人工智能(AGI)的一个重要特点是模型具有处理人类水平任务的泛化能力,而依赖于人工数据集的传统基准测试并...……更多
LLM数学性能暴涨168%,微软14人团队力作!合成数据2.0秘诀曝光,智能体生成教学
...的研究比比皆是。那么,我们该怎么办呢? 最近,微软团队提出了可扩展的智能体框架——AgentInstruct,可自动创建大量多样化、高质量的合成数据。它最大的优势在于,仅只用原始数据源,就能创建完整的提示和回应。论文地...……更多
MMMU华人团队更新Pro版!多模态基准升至史诗级难度:过滤纯文本问题、引入纯视觉问答
...答案?为了解决这一问题并推动多模态AI评估的边界,MMMU团队对MMMU基准在健壮性和问题难度上进行提升,新基准MMMU-Pro能够更准确、更严格地评估模型在广泛的学科领域内真正的多模态理解和推理能力。论文链接:https://arxiv.org/...……更多
什么影响大模型安全?NeurIPS\\\'24新研究提出大模型越狱攻击新基准
...与评估体系来了。来自香港科技大学(Guangzhou)USAIL研究团队,从攻击者和防御者的角度探讨了什么因素会影响大模型的安全。提出攻击分析系统性框架JailTrackBench。JailTrackBench研究重点分析了不同攻击配置对LLMs性能的影响,包...……更多
自动化、可复现,基于大语言模型群体智能的多维评估基准
...社区信赖的基准。 图 3 展示了最终排行榜的截图。研究团队正在继续添加更多的模型和维度,欢迎来自社区的贡献和提交!图 3:Decentralized Arena 排行榜,包括不同维度的排名。方法:通过大语言模型的群体智能进行基准测试去...……更多
超越光速,是能看到过去,还是能回到过去?
在我们深入探讨超越光速的可能性之前,让我们先来聊聊光速本身。光速,通常用字母c表示,在真空中的速度约为每秒299,792,458米,这个数值不仅精确无比,还被用来定义了公里和秒的标准。但光速的意义远不止于此,它是宇...……更多
ibm开发新光学技术,能以光速训练ai模型大幅节省能源
12月11日消息,IBM宣布开发出一种新的光学技术,能够以光速训练AI模型,同时大幅节省能源。该公司表示,通过将这项突破应用于数据中心,训练一个AI模型所节省的能源相当于5000个美国家庭一年的能源消耗。该公司解释说,...……更多
GPT-4V暴露致命缺陷?JHU等发布首个多模态ToM 测试集
...的重要基础。近日,来自 JHU, NYU, MIT, Harvard 等机构的研究团队开创了第一个多模态的 ToM 测试基准,发现现有的多模态模型和 LLM 都表现存在系统性缺陷,同时他们提出了一种有效的新方法。在刚结束的 ACL 2024 会议中,这篇论文...……更多
全自动组装家具! 斯坦福发布IKEA Video Manuals数据集:首次实现「组装指令」真实场景4D对齐
...让数据集更能反映实际应用中的难点。‍有趣的是,研究团队发现25%的家具存在多种有效的组装顺序。比如Laiva架子就有8种不同的组装方式!这种多样性真实地反映了现实世界中组装任务的灵活性。 系统的标注流程为了获得高...……更多
清华团队提出大模型“密度定律”;足球领域首个视觉语言基础模型
...的大模型前沿论文SwiftEdit:50 倍速文本引导图像编辑清华团队提出大模型“密度定律”足球领域首个视觉语言基础模型Aguvis:首个完全自主的纯视觉 GUI agentGoogle DeepMind:利用运动轨迹控制视频生成大模型数学新基准:成功率最...……更多
怎样证明光速在宇宙的任何地方任意时刻都是一样的?
...宙中,有一种速度穿梭于星际,贯穿时间和空间,它就是光速。作为现代物理学的核心原则之一,光速不变原理引人入胜,它告诉我们,在宇宙的任何地方,光速在真空中的速度总是恒定不变,这个速度大约是每秒299,792公里。...……更多
向具有光速能力的计算机的一次充满希望的飞跃
该团队的可重新编程的基于光的处理器。图片来源:Will Wright,皇家墨尔本理工大学科学家们创造了一种世界首创的可重新编程的基于光的处理器,他们说这可能会开创量子计算和通信的新时代。这些在原子水平上运行的新兴领...……更多
迈向多语言医疗大模型:大规模预训练语料,开源模型与全面基准测试
...者来自上海交通大学和上海人工智能实验室智慧医疗联合团队,共同第一作者为上海交通大学博士生邱芃铖和吴超逸,共同通讯作者为上海交通大学人工智能学院王延峰教授和谢伟迪副教授,这是该团队在继 PMC-LLaMA 后,在持续...……更多
苹果AI震撼上线iPhone,进化版Siri却没有ChatGPT!47页技术报告揭秘自研模型
....正如开头所述,能够把苹果AI装进终端设备,背后是来自团队自研的基础模型,在发光发热。iPhone的AI革命:30亿参数装进口袋具体来说,AFM是一款基于Transformer架构的仅解码器稠密模型。其设计思路如下:共享输入/输出嵌入矩...……更多
指令跟随大比拼!Meta发布多轮多语言基准Multi-IF:覆盖8种语言,超4500种任务
...任务,难以揭示复杂场景中的模型表现。最近,Meta GenAI团队发布了一个全新基准Multi-IF,专门用于评估LLM在多轮对话和多语言指令遵循(instruction following)中的表现,包含了4501个三轮对话的多语言指令任务,覆盖英语、中文、法语...……更多
Meta提出“可持续思维链”,让大模型在连续潜空间中推理
今日值得关注的大模型前沿论文北大团队提出「自定义漫画生成」框架UniReal:通过学习真实世界动态实现通用图像生成和编辑苹果团队提出「可扩展视频生成」方法利用扩散 Transformer 进行视频运动迁移ObjCtrl-2.5D:无需训练的「...……更多
马斯克打脸OpenAI!全球最大模型Grok-1开源
...价称,这是有史以来最大的开放大型语言模型,由世界级团队训练,通过磁力链接发布。Apache 2.0。314B,专家混合(8个活跃中的2个)。就连活动参数仅(86B)就超过了最大的Llama。迫不及待地想看到基准测试结果以及人们用它构...……更多
o1金牌团队揭秘AI超越人类惊人时刻!22分完整版视频全公开
【新智元导读】o1诞生,对于OpenAI团队来说,是最具革命性的时刻。在22分钟完整版采访视频中,他们分享了自己对新模型的思考,以及背后的开发故事。OpenAI o1团队采访的完整版视频,终于上线了!全程22分钟,o1研发团队在项...……更多
下载次数破39万!CMU、Meta联合发布VQAScore文生图优化方案:Imagen3已采用
...不足,并进一步提升它们呢?为解决这一问题,CMU和Meta团队联合推出了全新的评估指标VQAScore及基准GenAI-Bench,用于自动评估图像、视频和3D生成模型在复杂提示词下的表现。 ECCV’24论文链接::https://arxiv.org/abs/2404.01291CVPR’……更多
田渊栋团队新作祭出Agent-as-a-Judge!AI智能体自我审判,成本暴跌97%
【新智元导读】AI评估AI可靠吗?来自Meta、KAUST团队的最新研究中,提出了Agent-as-a-Judge框架,证实了智能体系统能够以类人的方式评估。它不仅减少97%成本和时间,还提供丰富的中间反馈。AI智能体,能否像人类一样有效地评估...……更多
杰斐逊实验室用创纪录的电子自旋测量揭开物理学的新前沿
...莉森-泽克(Allison Zec)说:\"当你计算出两个物体以接近光速相互撞击的基本运动学原理时,会有一个最大能量。\"她曾在弗吉尼亚大学物理教授肯特-帕施克(Kent Paschke)的团队工作,现在是新罕布什尔大学的博士后研究员。她...……更多
​首个自主机器学习AI工程师,刚问世就秒了o1,Kaggle大师拿到饱
...数据集能够更好地用于训练:那么它的跑分如何呢?研究团队在 MLE 基准测试(MLE-bench)上对 NEO 进行了全面评估。MLE-bench 是一种创新的基准测试,专注于将 AI 智能体应用于真实世界的机器学习工程任务。与其他人工设计的挑战...……更多
...(编辑 史正丞)北京时间周日午后,社交媒体平台X的AI团队发布公告,正式推出Grok大语言模型。(来源:xAI)Grok一词,是英国作家道格拉斯·亚当斯在知名科幻小说《异乡异客》造出来的概念。《牛津英语词典》对这个词的解...……更多
苹果开源7B模型,训练过程数据集一口气全给了,网友:很不像苹果
...近Llama 3 8B 使用PyTorch和OpenLM框架进行训练具体而言,研究团队先是提出了一个语言模型数据比较新基准——DCLM。之所以提出这一基准,是因为团队发现:由机器学习 (ML) 模型从较大的数据集中自动过滤和选择高质量数据,可能...……更多
无一大模型及格! 北大/通研院提出超难基准,评估长文本理解生成
...别组成,旨在评估LLMs理解短程和长程依赖内容的能力。团队设计了5种类型的长期依赖任务,包括理解与推理、计算、时间线重新排序、多重信息检索和摘要。通过人工标注精心生成了超过1100对高质量的长依赖问答对,以满足长...……更多
2023 AI现状报告:GPT-4仍最强,监管方向缺乏全球共识
...大选期间违法而受到调查。·生成式AI扩展热潮导致一个团队花费超过10亿美元来训练单个大型模型。·除了高层的自愿承诺之外,全球人工智能治理的进展有限。·一首AI生成的歌曲跻身Billboard榜单前10名或Spotify 2024年热门歌曲排...……更多
突发!谷歌发布史上最强大模型Gemini,打爆GPT-4
...ni Pro从今天起,就会在Bard中实装上线。 同时,谷歌Gemini团队还公布了一份60页的详细技术报告。消息一出,社交媒体瞬间炸了锅。英伟达AI科学家Jim Fan就第一时间转发评论:这是OpenAI王座的有力竞争者。 话不多说,一起来看...……更多
更多关于科技的资讯:
荣耀平板v9正式开售:搭载联发科8350处理器
12月16日晚,荣耀正式发布荣耀平板V9。12月24日,CNMO注意到,据荣耀官方消息,荣耀平板V9正式开售时间为今日早上10点08分
2024-12-25 16:43:00
“树人托管惊爆招商新政策,千万别错过这波机遇!“
在当前经济波动和服务业不断深入发展的大背景下,家庭服务业的细分行业——中小学生校外托管行业也面临前所未有的发展机遇,受到广泛的关注
2024-12-25 16:45:00
通讯员 李国秀 王俊菲走进山东厚丰汽车散热器有限公司的研发基地,精密的仪器彰显着高端的科技,其中整车环境模拟实验室可以将环境温度保持在-40℃—60℃的范围内进行试验
2024-12-25 16:54:00
小米官宣:与蔚来、小鹏、理想合作
12月25日,小米汽车通过官方微博宣布,正式与蔚来汽车、小鹏汽车、理想汽车展开充电补能网络合作。此次合作旨在为用户提供更高效便捷的充电服务
2024-12-25 16:55:00
拼多多代运营领域靠谱的代运营团队,电商代运营公司十大排名
在拼多多这个竞争超级激烈的电商平台里混,商家们的日子可不容易。流量就那么多,大家都在抢,想多卖点货、多赚点钱,简直难如登天
2024-12-25 17:10:00
2024“星鲨杯”全球虚拟现实内容大赛颁奖典礼暨《虚拟/增强现实内容制作流程规范》国家标准系列宣贯活动在京举行
中国消费者报北京讯(记者董芳忠)由虚拟现实内容制作中心、星鲨科技集团有限公司主办,青岛星鲨虚拟现实技术研究院协办的2024“星鲨杯”全球虚拟现实内容大赛颁奖典礼于近日在北京举行
2024-12-25 17:46:00
发展新质生产力看山西国企:山西省首个数字孪生隧道全息感知平台正式上线
近日,山西交控交科集团智研院公司研发的山西省首个数字孪生隧道全息感知平台正式上线,并在大南山隧道管理站正式投入使用。此平台是基于数字时空底座能力
2024-12-25 17:47:00
让顺风车用户再次同行更便捷 嘀嗒出行上线顺风车“再次同行邀请”功能
顺风出行,如何更方便地与同行过的同路人再次同行呢?近日,嘀嗒出行推出全新的再次“同行邀请“功能,让曾同行过的车主乘客,下次同行更方便
2024-12-25 17:48:00
嘉桦白桦树汁品牌践行人与自然和谐共生
12月18日,第七届界面财经年会在上海举行,嘉桦白桦树汁品牌凭借其卓越的创新能力和可持续发展实践,荣膺年度臻善企业奖,彰显了品牌在行业内的领先地位与社会责任感
2024-12-25 17:49:00
临沂:企业开足马力赶订单 奋力冲刺“全年红”
冲刺四季度,打好收官战。连日来,临沂市各企业纷纷按下生产“快进键”,开足马力赶订单,奋力夺取“全年红”。
2024-12-25 17:49:00
“潮好玩冰雪季”圆满收官,耕升带你回顾趣味瞬间!
“潮好玩冰雪季”已于2024年12月22日在吉林圆满收官!为了让众多游戏迷和科技爱好者积极参与到这次盛大的活动中,耕升上演一场科技与冰雪的激情碰撞
2024-12-25 17:58:00
中新经纬12月25日电 据工信部官网25日消息,近日,工业和信息化部、国务院国有资产监督管理委员会及中华全国工商业联合会联合印发《制造业企业数字化转型实施指南》(以下简称“《指南》”)
2024-12-25 17:58:00
华商网获评2024年搜狐网年度合作伙伴
2024年,媒体机构创作者们依旧积极活跃在搜狐平台上,持续追踪热点新闻、深度剖析社会现象。以其独特的视角和力量,跨越时空界限
2024-12-25 18:08:00
未来已来,华科尔推出量产级车载无人机WK-AC20MINI
在汽车上配备无人机,一直是汽车行业的宏大梦想之一。如今,梦想照进现实,作为全球主流的无人机制造商,华科尔推出全新的微型车载无人机场WK-AC20MINI
2024-12-25 18:26:00
京东客服再加薪!月固定工资大幅提升,全员平均涨薪2个月
12月25日,京东集团宣布,再次升级客服人员薪酬福利。超2万名京东客服月固定工资将大幅提升,提高收入的保障性和稳定性,实现全员平均涨薪2个月
2024-12-25 18:28:00