• 我的订阅
  • 头条热搜
大模型是否有推理能力?DeepMind数月前的论文让AI社区吵起来了
...,随着 OpenAI o1 模型的推出,关于大型语言模型是否拥有推理能力的讨论又多了起来。比如苹果在前段时间的一篇论文中指出,只要给模型一些干扰,最聪明的模型也会犯最简单的错误(参见《给小学数学题加句「废话」,OpenAI ...……更多
语言≠思维,大模型学不了推理:一篇Nature让AI社区炸锅了
...到,人类大脑生成和解析语言的神经网络并不负责形式化推理,而且提出推理并不需要语言作为媒介。这篇论文声称「语言主要是用于交流的工具,而不是思考的工具,对于任何经过测试的思维形式都不是必需的」,引发了科技...……更多
ICML2024演讲爆火!Meta朱泽园揭秘大模型内心世界:不同于人类推理
...M) 是如何解数学题的?是通过模板记忆,还是真的学会了推理思维?模型的心算过程是怎样的?能学会怎样的推理技能?与人类相同,还是超越了人类?只学一种类型的数学题,是会对通用智能的发展产生帮助?LLM 为什么会犯...……更多
给小学数学题加句废话,OpenAI o1就翻车了,苹果论文质疑AI推理
苹果新论文:AI 大模型可能不会推理。AI 大模型(LLM)真的像我们理解的那样能「思考」或「推理」吗?最近,苹果的一篇论文探讨了这个问题,并且给出了一个倾向于「否」的答案。相关帖子被很多人围观。这篇题为「GSM-Symb...……更多
Llama 4训练已开启!Meta科学家最新采访,揭秘Llama 3.1是如何炼成的
...很多不同的GPU型号和显存大小。再加上,目前广泛应用于推理阶段的量化技术,比如可以用FP16或FP8精度,这会改变推理和训练/微调成本的比重。以上这些限制因素,都让模型规模的选择成为一个非常具有挑战性的问题。总体而...……更多
思维链让大模型推理更准确?谷歌早于OpenAI押中o1模型核心原理
...本质的不同。其不仅进入到复杂的领域,还表现出超强的推理能力。OpenAI 将 GPT-4o 和 o1 在国际数学奥林匹克竞赛资格考试方面进行对比测试。根据结果,二者差异显著,其中,前者正确解决问题的准确率是 13.4%,而 o1 的准确率...……更多
Transformer推理天花板被谷歌打破?DeepMind首席科学家亮出84页PPT,却遭LeCun反对
...科学家Denny Zhou拿出一篇ICLR 2024论文称:CoT可以让Transformer推理无极限。但随即他就遭到了田渊栋和LeCun等的质疑。最终,CoT会是通往AGI的正确路径吗?随着OpenAI o1的爆火,最近CoT也成了圈内热议的高频词。靠着CoT的强力加持,o1...……更多
百倍提升7B模型推理能力!颜水成团队携手新加坡南洋理工大学发布Q*算法
...-7b等小模型达到参数量比其大数十倍、甚至上百倍模型的推理能力,使模型性能迎来惊人提升。自OpenAI的Q*项目曝光后,业内相关讨论始终层出不穷。据现有信息汇总,Q*项目被视作OpenAI在探索人工通用智能(Artificial General Intelli...……更多
港中文团队提出大模型元推理范式,革新大模型的评价体系
...一定启示。日前,相关论文以《大型语言模型评价中的元推理革命》(MR-GSM8K: A Meta-Reasoning Revolution in Large Language Model Evaluation)为题发在 arXiv,曾忠燊是第一作者,香港中文大学教授贾佳亚担任通讯作者 [1]。图……更多
昇思MindSpore 2.3全新发布
...级实现脚本、分布式策略,运行时的统一,Baichuan2-13B的推理部署只需1天。在大模型推理上,通过LLMServing实现推理吞吐提升2倍多;升级模型压缩工具金箍棒2.0实现千亿大模型压缩至十倍。 为降低开发门槛,昇思持续升级MindSpore...……更多
大模型不会推理,为什么也能有思路?有人把原理搞明白了
大模型不会照搬训练数据中的数学推理,回答事实问题和推理问题的「思路」也不一样。大语言模型的「推理」能力应该不是推理,在今年 6 月,一篇 Nature 论文《Language is primarily a tool for communication rather than thought》曾引发……更多
多模态LLM视觉推理能力堪忧,浙大领衔用GPT-4合成数据构建多模态基准
新智元报道编辑:乔杨【新智元导读】LLM的数学推理能力缺陷得到了很多研究的关注,但最近浙大、中科院等机构的学者们提出,先进模型在视觉推理方面同样不足。为此他们提出了一种多模态的视觉推理基准,并设计了一种...……更多
击败GPT-4o的开源模型如何炼成?关于Llama 3.1 405B都写在论文里
...经远超计算最优的时长。结果表明,这些较小模型在相同推理预算下的表现优于计算最优模型。在后训练阶段,Meta 使用了 405B 的旗舰模型进一步提高了 70B 和 8B 模型这些较小模型的质量。3、为了支持 405B 模型的大规模生产推理...……更多
o1 基石论文火爆传阅:Ilya 仍是关键先生,核心项目清北校友闪光
...后的贡献者。Ilya 在 o1 的作用 OpenAI o1 主打进行通用复杂推理,在输出回答之前,会在产生一个很长的思维链,以此增强模型能力。而 Ilya 此前合著的这篇论文主要就是探讨了提高大语言模型多步推理能力的方法。他们主要比较...……更多
昆仑万维重磅发布天工AI高级搜索功能,做最懂金融投资、科研学术的AI搜索
...AI高级搜索功能,具备四大亮点:·全面升级多层次分析推理能力·升级的金融投资专业AI搜索·升级的科研学术专业AI搜索·针对文档AI阅读分析的智能优化「天工AI高级搜索」不仅能提供精准的结果,更能通过多角度的专业优化,...……更多
大模型新趋势之MoE:现状、挑战及研究方向
...,MoE在训练过程通过门控模型实现“因材施教”,进而在推理过程实现专家模型之间的“博采众长”。 图1MoE架构原理示意图1MoE的特征优势是专家化、动态化、稀疏化,在模型研发成本、训练/推理效率和整体性能之间实现最佳...……更多
OpenAI 超强 o1 智商超 120 遥遥领先于其他模型:1 小时写出 NASA 博士 1 年代码,最新编程赛超越 99.8% 选手
...的 agent,是关键的一步。而这篇论文就重点研究了扩展「推理期计算」(inference-time computation)这个问题。研究团队分析了扩展测试时计算的两种主要机制:(1)针对密集的、基于过程的验证器奖励模型进行搜索;(2)根据测...……更多
让大模型能听会说,国内机构开源首个端到端语音对话模型Mini-Omni
...交互能力的核心是模型能够直接在语音模态上进行理解和推理,这与传统的语音对话功能有本质的不同。现有的语音对话系统中主要包含 3 个过程:首先将输入语音内容转换为文本,其次利用大语言模型进行文本推理,最后利用...……更多
罗格斯大学团队提出思想链概念,提高大模型的算数推理能力
...概念,提高了大语言模型(LLM,large language models)在复杂推理任务上的性能,例如算术推理、常识推理和符号推理等。图 | 金明宇(来源:金明宇)CoT 的原理是通过提供推理过程的示例,来教会模型处理推理,详细说明导致最...……更多
Llama版o1来了,来自上海AI Lab,强化学习代码已开源,
复刻OpenAI o1推理大模型,开源界传来最新进展:LLaMA版o1项目刚刚发布,来自上海AI Lab团队。简介中明确:使用了蒙特卡洛树搜索,Self-Play强化学习,PPO,以及AlphaGo Zero的双重策略范式(先验策略+价值评估)。在2024年6月,o1发...……更多
...AI)系统在编码、战略规划和机器人科学三个领域执行复杂推理任务。聊天生成预训练转换器(ChatGPT)和“克劳德3-奥普斯”(Claude 3 Opus)等大语言模型(LLM),根据人类输入“提示词”处理和生成文本。研究人员说,过去18个月,这些技...……更多
科学家提出情景学习新范式,让学霸大模型向学弱大模型输送能力
...十亿左右。“做大”,能让大模型具备更强的涌现能力和推理能力,从而适用于难度更高的任务。“做小”,能让大模型获得更优秀的推理能力,从而能被部署到手机、手表、耳机、录音笔等各类小微终端之中。情景学习(ICL,...……更多
无一大模型及格! 北大/通研院提出超难基准,评估长文本理解生成
...的长依赖任务中的多信息检索、时间重排序、计算、理解推理能力表现均不乐观。比如像Claude3-200k,GPT4-32k、GPT4-8k、GPT3.5-turbo-6k、LlamaIndex这种商业模型,平均只有40%的准确率。而像开源模型表现就更不理想了…ChatGLM2-6B、LongLL……更多
科学家推出大模型数据集,涵盖奥赛数学题,有望让AI辅导数学课程
...解决复杂数学问题的能力。通过此,他们不仅提高了算法推理速度,还提高了算法搜索中间结果的质量。所新推出的数据集 TriMaster100,也更加符合算法在复杂数学问题下的评价场景。目前,赵子龙的合作者正在基于本次成果开...……更多
第一个100%开源的MoE大模型,7B的参数,1B的推理成本
...语言模型 (LM) 在各种任务上取得了重大进展,但在训练和推理方面,性能和成本之间仍然需要权衡。对于许多学者和开发人员来说,高性能的 LM 是无法访问的,因为它们的构建和部署成本过高。改善成本 - 性能的一种方法是使...……更多
北大推出全新机器人多模态大模型!面向通用和机器人场景的高效推理和操作
...码仓库 Trending Research 第一位。为了赋予机器人端到端的推理和操纵能力,本文创新性地将视觉编码器与高效的状态空间语言模型集成,构建了全新的 RoboMamba 多模态大模型,使其具备视觉常识任务和机器人相关任务的推理能力,...……更多
推理性能直逼o1,DeepSeek再次出手,重点:即将开源
...出手了,这次又是重磅炸弹。昨晚,DeepSeek 上线了全新的推理模型 DeepSeek-R1-Lite-Preview,直接冲击 OpenAI o1 保持了两个多月的大模型霸主地位。在美国数学竞赛(AMC)中难度等级最高的 AIME 以及全球顶级编程竞赛(codeforces)等权...……更多
整合长期记忆,AI实现自我进化,探索大模型这一可能性
...也能让模型在处理长期、分散和个性化的数据时逐步提升推理和学习能力。用 LTM 数据提升模型能力,使其能够自我进化在传统 LLM 中,更新模型通常需要调整所有参数,而如果目的是处理个体数据,那这种操作明显不切实际。...……更多
媲美OpenAI事实性基准,这个中文评测集让o1-preview刚刚及格
...面的 leaderboard 榜单。同时我们也在评测集上实验分析了推理 scaling law、模型校准、RAG、对齐税等研究问题,后续本评测集都可以作为这些方向的重要参考之一。总之,我们希望 Chinese SimpleQA 能帮助开发者深入了解其模型在中文...……更多
ChatGPT已经慢了,这是国内AI搜索新高度,免费可用
...了强化。首先面对复杂问题的解决全面升级了多层次分析推理能力,再难的问题都努力为你解答。其次细分了更明确的目标群体,升级了金融投资和科研学术专业 AI 搜索,将这些领域的解答精准度提升到了前所未有的水平。最...……更多
更多关于科技的资讯:
完全隔绝外界网络!科大讯飞AI录音笔S8离线版图赏
快科技12月17日消息,科大讯飞日前推出旗舰新品——“讯飞AI录音笔S8离线版”。现在,这款新品已经来到我们评测室,下面为大家带来图赏
2024-12-17 17:20:00
阿维塔回应新车放弃采用华为平台:假的!
快科技12月17日消息,近日,有媒体报道称阿维塔汽车的下一代产品将基于长安自研的全新SDA 2.0平台研发。新车型将不再使用长安
2024-12-17 17:20:00
曝华为外折叠项目暂停 博主:华为已有三折叠 外折意义不大了
快科技12月17日消息,博主定焦数码爆料,华为外折叠屏项目暂停,毕竟华为已有三折叠屏了,外折再推意义不是很大。回顾华为的折叠屏产品线
2024-12-17 17:20:00
六年设计大换代!iPhone 17 Pro Max渲染图出炉:横向三摄
快科技12月17日消息,综合目前多方爆料,基本可以确定iPhone 17系列有全新的设计方案,是iPhone 11系列以来首次进行背部设计的大换代
2024-12-17 17:20:00
估值超300亿!阿维塔科技完成超110亿元C轮融资
快科技12月17日消息,阿维塔科技,由长安、华为与宁德时代联合打造,已完成超110亿元的C轮融资。此前,阿维塔科技总裁陈卓透露
2024-12-17 17:50:00
新一代AI轻薄设计本!微星尊爵16 AI+ 锐龙版 2024笔记本评测:轻薄之下亦有澎湃
一、前言:AI加持 轻薄本开始迈向实用全能长期以来轻薄本一直都是定位于轻便,为了轻薄牺牲了很多,性能方便只能说能用,用户也逐渐习惯这种情况
2024-12-17 17:50:00
专家谈邹市明儿子注射生长激素:需专业诊治 应慎重
快科技12月17日消息,据报道,最近奥运冠军、拳击运动员邹市明的妻子冉莹颖在社交平台上表示,11岁的二儿子皓皓,身高仅有136
2024-12-17 17:50:00
一汽吉林被曝陷入经营困境:已连续数月停产停薪
快科技12月17日消息,根据媒体报道,一汽吉林汽车有限公司已停产数月。多名员工反映自8月份起公司未发放工资,员工希望一汽集团领导能与他们座谈
2024-12-17 18:20:00
世界上第一款通用微处理器!Intel 8080喜迎50周岁生日
8080,它不是Intel的第一款微处理器,还有两个前辈,但它有着极为特殊的意义:真正开创了微处理器市场,也是微型计算机的起点
2024-12-17 18:20:00
iPhone诈骗频发!中国联通成功开发FaceTime诈骗识别:与苹果联动处置
快科技12月17日消息,今年以来,iPhone手机经常出现FaceTime诈骗的案件。因为FaceTime显示的昵称是用户Apple账户设置的名字
2024-12-17 18:20:00
成都一中学设“学霸就餐区”引争议 学校致歉回应:是月考的奖励
快科技12月17日讯,近日,据国内媒体报道,网传成都“石室成飞中学设置'学霸餐’”引发关注。有网友质疑该校区别对待学生
2024-12-17 18:20:00
打破台积电独霸格局!联电拿下高通芯片先进封装大单
快科技12月17日消息,据媒体报道,联电夺得高通高性能计算(HPC)产品的先进封装大单,预计将应用在AI PC、车用以及AI服务器市场
2024-12-17 18:50:00
男子危险驾驶还拍视频挑衅交警:被罚900记12分
快科技12月17日消息,互联网不是法外之地,做了违法的事情还敢公然挑衅警方,那么下场只有一个。据“央视新闻”报道,近日
2024-12-17 18:50:00
说唱歌手诺米新歌致敬雷军:雷军在街上发传单的励志故事深受激励
快科技12月17日消息,今年4月,说唱歌手诺米一首在社区健身器材上拍摄的《谢天谢帝》火了,诺米因此爆火出圈。洗脑的歌词与魔性的动作迅速火遍网络
2024-12-17 18:50:00
AMD天选内存!七彩虹全球首发高频、低时序DDR5-6400 C28
快科技12月17日消息,七彩虹宣布,全新打造的iGame影系列内存,首次为DDR5-6400频率产品带来了C28的超低时序
2024-12-17 18:50:00