• 我的订阅
  • 头条热搜
...个只有8%。研究人员根据答案是否正确以及答案所包含的逻辑推理是否有效,对大语言模型的答案进行了分类。实验的第一个结果是,在每个测试重复十次的情况下,答案是不一致的。例如,在同一个测试中,有的模型十次中答...……更多
人类和AI在推理任务中的表现相似,Google DeepMind研究揭示AI局限性
...,尽管这些模型在处理自然语言方面表现卓越,但在复杂逻辑推理任务中,人类和语言模型都会受到语义内容合理性和可信度的影响,表现出类似的错误倾向。研究背景人类在推理过程中存在两种系统:“直觉系统”和“理性系...……更多
姚期智院士大模型新研究:思维图DoT,用数学理论确保AI逻辑一致
...看看DoT长啥样。大模型复杂推理新框架 如前所述,DoT将逻辑推理过程建模为在单个LLM内构建有向无环图(DAG)。其框架内部管理三个关键角色:提议者:生成命题或推理步骤,添加新节点。 批评者:评估命题,识别错误、不...……更多
谷歌最新自然语言推理算法
...读理解和问答等任务中取得了极高的性能,但这些模型在逻辑推理方面的性能仍然十分滞后。去年5月「思维链」(ChainofThought,CoT)横空出世,有研究人员发现,只需要在prompt中加入「Let\'sthinkstepbystep」就能让GPT-3的推理性能大幅...……更多
重磅!OpenAI o1模型还没有实现真正的逻辑推理能力
...二、社会评测与同行水平社会评测普遍认可o1 系列模型的逻辑推理能力优于 GPT-4o,但也有很多人提出了不同看法。差评XPIN邀请了理综三科的博士测评,物理评价较高,而生物、化学评价较低,综合认为o1在认知上达到硕士水平...……更多
奥林匹克竞赛里选最聪明的AI:Claude-3.5-Sonnet vs. GPT-4o?
...竞赛不仅是对人类(碳基智能)思维敏捷性、知识掌握和逻辑推理的极限挑战,更是AI(“硅基智能”)锻炼的绝佳练兵场,是衡量AI与“超级智能”距离的重要标尺。OlympicArena——一个真正意义上的AI奥运竞技场。在这里,AI不...……更多
罗格斯大学团队提出思想链概念,提高大模型的算数推理能力
...概念,提高了大语言模型(LLM,large language models)在复杂推理任务上的性能,例如算术推理、常识推理和符号推理等。图 | 金明宇(来源:金明宇)CoT 的原理是通过提供推理过程的示例,来教会模型处理推理,详细说明导致最...……更多
蚂蚁自研知识增强大模型服务框架KAG,可显著提升知识推理准确率
...地,也一定要对时间、数字和逻辑敏感,无论让它做多跳推理,还是逻辑规则数字计算,而这些恰好是大语言模型所不擅长的,包括前一段时间热议的 9.9 和 9.12 比大小的例子。基于此,我们认为在垂直领域落地的时候,大语言...……更多
苹果新论文证明LLM大模型存在缺陷!没有进行真正的逻辑推理
...地依赖于训练数据中的模式进行预测。当需要进行真正的逻辑推理时,这些模型往往无法产生合理的结果,这一发现对人工智能的发展提供了重要的参考。虽然LLM在许多领域表现优异,但其推理能力仍有待改进。【本文结束】如...……更多
商汤又“夺金”!SuperCLUE-V多模态大模型基准发布10月榜单
...度30个二级维度。报告称SenseChat-Vision 5.5在基础能力-数理逻辑推理任务如图表推理、场景推理方面具备领先优势。榜单显示,在数理逻辑分析能力中,SenseChat-Vision 5.5超越国内外所有参评模型包括GPT-4o的最新版本,位列第一。Super...……更多
昆仑万维:“天工大模型3.0”将于4月17日正式发布 同步开源4000亿参数MoE超级模型
...一代“天工2.0”MoE大模型,“天工3.0”在模型语义理解、逻辑推理、以及通用性、泛化性、不确定性知识、学习能力等领域拥有惊人的性能提升,其模型技术知识能力提升超过20%,数学/推理/代码/文创能力提升超过30%。同时,“...……更多
百川智能发布baichuan3稳定语言模型
...语言处理和代码生成领域的强大实力。不仅如此,其在对逻辑推理能力及专业性要求极高的MCMLE、MedExam、CMExam等权威医疗评测上的中文效果同样超过了GPT-4,是中文医疗任务表现最佳的大模型。Baichuan3还突破“迭代式强化学习”...……更多
影响英伟达根本逻辑的大争论:OpenAI改变策略意味着什么?谁在撒谎?
大模型预训练“缩放定律”定律失效?模型推理成“解药”,英伟达一家独大格局要变天?“缩放定律”指导下,AI大模型预训练目前遭遇瓶颈。据路透12日报道,硅谷主要AI实验室的新模型训练计划目前普遍进展不顺,新模型...……更多
语言≠思维,大模型学不了推理:一篇Nature让AI社区炸锅了
...规划和遵循非言语指令,参与多种形式的推理,包括形式逻辑推理、关于世界的因果推理和科学推理(见图 1b)。研究表明,尽管失去了语言能力,一些患有严重失语症的人仍然能够进行所有测试形式的思考和推理,他们在各种...……更多
ICML2024演讲爆火!Meta朱泽园揭秘大模型内心世界:不同于人类推理
...M) 是如何解数学题的?是通过模板记忆,还是真的学会了推理思维?模型的心算过程是怎样的?能学会怎样的推理技能?与人类相同,还是超越了人类?只学一种类型的数学题,是会对通用智能的发展产生帮助?LLM 为什么会犯...……更多
...AI)系统在编码、战略规划和机器人科学三个领域执行复杂推理任务。聊天生成预训练转换器(ChatGPT)和“克劳德3-奥普斯”(Claude 3 Opus)等大语言模型(LLM),根据人类输入“提示词”处理和生成文本。研究人员说,过去18个月,这些技...……更多
9.11和9.9哪个大?实测12个大模型8个都答错,ChatGPT也翻车了
...模型的短板,此前行业也多次讨论过大模型的数学和复杂推理能力较差,即便是目前最好的大模型GPT-4也仍然有很大进步空间。最近的一次,第一财经曾在6月报道过,根据司南评测体系OpenCompass的高考全卷测试,包括GPT-4在内,7...……更多
科学家推出大模型数据集,涵盖奥赛数学题,有望让AI辅导数学课程
...23 年 2 月。当时,已经有一些研究团队开始使用大模型做逻辑推理和数学推理。赵子龙和合作者也认为这个方向很有前景。他表示让自己印象最深的例子就是 OpenAI 网站上的一道数学推理的题: Simplify tan100 + 4sin100。根据 OpenAI 自...……更多
给小学数学题加句废话,OpenAI o1就翻车了,苹果论文质疑AI推理
...降。我们假设这种下降是因为当前的 LLM 无法进行真正的逻辑推理;相反,它们试图复制在训练数据中观察到的推理步骤。」这一结论得到了 Keras 之父 François Chollet 和美国心理学家、认知科学家 Gary Marcus 的转发,他们一直对 AI ...……更多
商汤科技与金山办公达成商业合作,“日日新”大模型补强办公软件理科大脑
...力一直是大模型的痛点,理科领域需要高度的抽象思维和逻辑推理能力,并且要求非常精准的答案,作为计算机科学和信息技术领域的重要工具,代码能力被视作衡量大模型智慧的关键维度。事实上,在过去一年国产大模型如火...……更多
港中文团队提出大模型元推理范式,革新大模型的评价体系
...一定启示。日前,相关论文以《大型语言模型评价中的元推理革命》(MR-GSM8K: A Meta-Reasoning Revolution in Large Language Model Evaluation)为题发在 arXiv,曾忠燊是第一作者,香港中文大学教授贾佳亚担任通讯作者 [1]。图……更多
突破时间序列组合推理难题!南加大发布一站式多步推理框架TS-Reasoner
【新智元导读】TS-Reasoner是一个创新的多步推理框架,结合了大型语言模型的上下文学习和推理能力,通过程序化多步推理、模块化设计、自定义模块生成和多领域数据集评估,有效提高了复杂时间序列任务的推理能力和准确性...……更多
专注于推理的OpenAI“草莓”模型两周内发布?是人工智能下一重大突破
...“秋季发布”(9月至11月)要更早。上述报道称,专注于推理能力的人工智能“草莓”发布前后还有一些亟待解决的问题,但看似“仓促上马”似乎说明OpenAI感受到了大语言模型驱动产品领域的激烈竞争压力,希望通过近几个月...……更多
微软发布旗下最小语言模型phi-2
...相比较其它主流语言模型,依然小很多。微软表示Phi-2在逻辑推理和安全性方面显示出显著的改进。通过正确的微调和定制,小型语言模型是云和边缘应用程序的强大工具。MicrosoftResearch机器学习基础小组负责人SebastienBubeck在Twitt...……更多
OpenAI o1模型到博士水平了?复旦教授:没有真正推理能力,学到的还是概率相关性
...程能力“爆表”新模型到底有多强?它在需要深入思考和逻辑推理的专业任务上不仅吊打GPT-4o,还超过了拥有博士学位的人类专家。OpenAI表示,新模型在物理、化学和生物等学科的挑战性基准测试中,表现超过人类专家。在国际...……更多
真香!智谱大模型,有了首个免费的API
...性的同时增加多样性)。体验地址:https://open.bigmodel.cn/逻辑推理能力,从简单到复杂,包含一般逻辑推理和数学推理。测试 1:先来一道前段时间让很多大模型翻车的「9.11 和 9.9 哪个更大」问题,很容易就答对了。类似的数字...……更多
OpenAI o1太贵?那就自己做一个!纯提示方法让普通LLM进化出复杂推理能力
...爆火,利用纯提示方法让普通LLM摇身一变,成为具备复杂推理能力的OpenAI o1。九月份,OpenAI o1正式登场。作为新一代的老大哥,o1系列专注于复杂的推理任务,一经推出也是直接屠榜了大模型竞技场。在下面这些难度较大的数学...……更多
AI新时代揭幕!会“思考解题逻辑”的OpenAI推理大模型登场
...凌晨1时许,AI时代迎来崭新的起点——能够进行通用复杂推理的大模型终于走到台前。OpenAI在官网发布公告称,开始向全体订阅用户开始推送OpenAI o1预览模型——也就是此前被广泛期待的“草莓”大模型。OpenAI表示,对于复杂推...……更多
位列第一梯队,腾讯混元再度领跑国内大模型
...、多维度的综合性测评基准,由十大基础任务组成,包括逻辑推理、代码、语言理解、长文本、角色扮演等。本次报告选取了国内外具有代表性的32个大模型4月份的版本,通过多维度综合性测评,真实准确地反映了国内外大模型...……更多
...调遣语言模型之外的其他技术。例如,解决数学问题需要逻辑推理,而目前大多数AI模型都不擅长逻辑推理。鉴于此,谷歌深度思维公司开发出AlphaGeometr,将语言模型与符号引擎(使用符号和逻辑规则进行推理)相结合,构建出一...……更多
更多关于科技的资讯:
“学而思长公主”宣布离职:曾在直播间被连升4级成高管
快科技1月16日消息,据媒体报道,近日,“学而思长公主”橙橙宣布离职,她表示由于个人原因选择离开学而思优品主播的职位。在视频中
2025-01-16 17:56:00
小车没拉开距离就强行见缝插针变道:大货车被逼翻横躺高速
科技1月16日消息,学过交规,考过驾照的都应该知道,超车变道时一定要留出足够的安全距离,不能强挤硬挤,然而开车上路后,总有人行车不规范
2025-01-16 17:56:00
长江存储致态TiPro9000 2TB SSD评测:长江首款PCIe 5.0 SSD 登场即是最强
一、前言:长江存储致态首款PCIe 5.0 SSD终于发布不少品牌的PCIe 5.0 SSD上市已经有一段时间,但一直没有普及开来
2025-01-16 17:56:00
学历出处都是浮云!马斯克在线Boss直聘:直接甩代码给我就行
快科技1月16日消息,马斯克在社交平台发布了一则招聘启事,招聘资深软件工程师。马斯克表示招聘标准非常简单直接,不关心应聘者的学历背景
2025-01-16 17:56:00
全球最薄折叠机!OPPO Find N5渲染图出炉:对称式潜望三摄设计
快科技1月16日消息,今日数码博主定焦数码曝光了OPPO Find N5的设计假想图。根据该博主放出的图片来看,OPPO Find N5的摄像头模组采用了对称式设计
2025-01-16 17:56:00
中央经济工作会议提出,要加强监管,促进平台经济健康发展。平台与商家之间共生共赢的互惠关系,一直以来都是推动行业蓬勃发展的不竭动力
2025-01-16 18:14:00
快科技1月16日消息,近日,一段有关极越07的视频在网络上引起了关注,视频中一位极越的供应商展示了这样一幕:有人分享了一份高中物理期末试卷
2025-01-16 18:26:00
灵感源自中国农历龙年!劳斯莱斯幻影“祥龙贺瑞”定制版官宣:现款986万元
快科技1月16日消息,劳斯莱斯发布了幻影“祥龙贺瑞”定制版车型的官方图片。这是一款由中国客户委托定制的车型,由劳斯莱斯上海专属定制中心主导设计
2025-01-16 18:26:00
育碧被曝大多数老员工已离开!留下的只知道推动“觉醒”
快科技1月16日消息,据YouTuber AccolonnTV爆料,育碧内部动荡持续,许多资深开发者已离开公司,转而寻找更好的发展机会
2025-01-16 18:26:00
联发科天玑9400荣膺快科技王者性能大奖!天玑9300+也有斩获
近日,快科技重磅推出2024年年终评奖,分为PC电脑、手机数码、汽车三大品牌类,其中联发科在手机SoC列别中表现突出,天机9400
2025-01-16 18:26:00
解读鸿蒙智行2024智驾报告:华为迈入智驾时代
2024年无疑是智能驾驶领域具有里程碑意义的一年,在过去一年,智能驾驶不仅在技术实现了持续升级迭代,还在市场中实现了快速渗透
2025-01-16 18:26:00
外卖小哥接到奇怪订单 地址是桥下!结果顾客开着大船来取餐
快科技1月16日消息,近日,江苏南通,一位外卖小哥站在桥上精准向大船投送外卖的视频火了。视频中,一位外卖小哥拿着外卖站在桥上等人
2025-01-16 18:26:00
很多人不知道肾脏很怕6种食物:高盐第一个上榜
快科技1月16日消息,肾脏是我们身体里非常重要的“过滤器”,是排出身体废物的重要器官之一,要想保护肾脏,就得尽量远离对肾脏不友好的食物
2025-01-16 18:26:00
本文转自:人民网人民网北京1月16日电 (记者许维娜)30年前,中国开启了互联网新时代。如今,无论是网络购物的便捷,还是移动支付的普及
2025-01-16 18:46:00
青年计算机图像处理专家全宇晖逝世 年仅39岁 曾参与多项国家科研项目
快科技1月16日消息,今日,据澎湃新闻报道,青年计算机图像处理专家、华南理工大学计算机学院副教授全宇晖,于2025年1月14日在广州因病逝世
2025-01-16 18:56:00