• 我的订阅
  • 头条热搜
...个只有8%。研究人员根据答案是否正确以及答案所包含的逻辑推理是否有效,对大语言模型的答案进行了分类。实验的第一个结果是,在每个测试重复十次的情况下,答案是不一致的。例如,在同一个测试中,有的模型十次中答...……更多
人类和AI在推理任务中的表现相似,Google DeepMind研究揭示AI局限性
...,尽管这些模型在处理自然语言方面表现卓越,但在复杂逻辑推理任务中,人类和语言模型都会受到语义内容合理性和可信度的影响,表现出类似的错误倾向。研究背景人类在推理过程中存在两种系统:“直觉系统”和“理性系...……更多
姚期智院士大模型新研究:思维图DoT,用数学理论确保AI逻辑一致
...看看DoT长啥样。大模型复杂推理新框架 如前所述,DoT将逻辑推理过程建模为在单个LLM内构建有向无环图(DAG)。其框架内部管理三个关键角色:提议者:生成命题或推理步骤,添加新节点。 批评者:评估命题,识别错误、不...……更多
谷歌最新自然语言推理算法
...读理解和问答等任务中取得了极高的性能,但这些模型在逻辑推理方面的性能仍然十分滞后。去年5月「思维链」(ChainofThought,CoT)横空出世,有研究人员发现,只需要在prompt中加入「Let'sthinkstepbystep」就能让GPT-3的推理性能大幅...……更多
重磅!OpenAI o1模型还没有实现真正的逻辑推理能力
...二、社会评测与同行水平社会评测普遍认可o1 系列模型的逻辑推理能力优于 GPT-4o,但也有很多人提出了不同看法。差评XPIN邀请了理综三科的博士测评,物理评价较高,而生物、化学评价较低,综合认为o1在认知上达到硕士水平...……更多
奥林匹克竞赛里选最聪明的AI:Claude-3.5-Sonnet vs. GPT-4o?
...竞赛不仅是对人类(碳基智能)思维敏捷性、知识掌握和逻辑推理的极限挑战,更是AI(“硅基智能”)锻炼的绝佳练兵场,是衡量AI与“超级智能”距离的重要标尺。OlympicArena——一个真正意义上的AI奥运竞技场。在这里,AI不...……更多
罗格斯大学团队提出思想链概念,提高大模型的算数推理能力
...概念,提高了大语言模型(LLM,large language models)在复杂推理任务上的性能,例如算术推理、常识推理和符号推理等。图 | 金明宇(来源:金明宇)CoT 的原理是通过提供推理过程的示例,来教会模型处理推理,详细说明导致最...……更多
蚂蚁自研知识增强大模型服务框架KAG,可显著提升知识推理准确率
...地,也一定要对时间、数字和逻辑敏感,无论让它做多跳推理,还是逻辑规则数字计算,而这些恰好是大语言模型所不擅长的,包括前一段时间热议的 9.9 和 9.12 比大小的例子。基于此,我们认为在垂直领域落地的时候,大语言...……更多
苹果新论文证明LLM大模型存在缺陷!没有进行真正的逻辑推理
...地依赖于训练数据中的模式进行预测。当需要进行真正的逻辑推理时,这些模型往往无法产生合理的结果,这一发现对人工智能的发展提供了重要的参考。虽然LLM在许多领域表现优异,但其推理能力仍有待改进。【本文结束】如...……更多
图灵奖得主杨立昆:AI的逻辑推理和规划能力有限,会犯事实错误和逻辑错误
...”杨立昆表示,人工智能距离人类和动物的能力差距在于逻辑推理和规划,这是智能的重要特征,现在的大模型只能“本能反应”。“如果你用一万亿或两万亿个token来训练它们,机器的性能是惊人的,但最终机器会犯事实错误...……更多
商汤又“夺金”!SuperCLUE-V多模态大模型基准发布10月榜单
...度30个二级维度。报告称SenseChat-Vision 5.5在基础能力-数理逻辑推理任务如图表推理、场景推理方面具备领先优势。榜单显示,在数理逻辑分析能力中,SenseChat-Vision 5.5超越国内外所有参评模型包括GPT-4o的最新版本,位列第一。Super...……更多
昆仑万维:“天工大模型3.0”将于4月17日正式发布 同步开源4000亿参数MoE超级模型
...一代“天工2.0”MoE大模型,“天工3.0”在模型语义理解、逻辑推理、以及通用性、泛化性、不确定性知识、学习能力等领域拥有惊人的性能提升,其模型技术知识能力提升超过20%,数学/推理/代码/文创能力提升超过30%。同时,“...……更多
...训练的深度推理大模型,升级后的星火X1在数学、代码、逻辑推理、文本生成、语言理解、知识问答等通用任务上效果显著提升,在模型参数比业界同类模型小一个数量级的情况下,整体效果对标OpenAI o1和DeepSeek R1,再次证明了...……更多
讯飞星火app上线苹果ios平台:搭载v1.5认知大模型
...据称,该App目前已具备“语言理解”、“知识问答”、“逻辑推理”、“数学题解答”等多种应用。讯飞官网显示,目前星火认知模型语言“可翻译多种语言”、“根据文本提取摘要”、“检查语法错误并提供建议”、“分析文...……更多
百川智能发布baichuan3稳定语言模型
...语言处理和代码生成领域的强大实力。不仅如此,其在对逻辑推理能力及专业性要求极高的MCMLE、MedExam、CMExam等权威医疗评测上的中文效果同样超过了GPT-4,是中文医疗任务表现最佳的大模型。Baichuan3还突破“迭代式强化学习”...……更多
国产大模型首发中文逻辑推理,「天工大模型4.0」o1版来了
...始在一些权威评测中取得领先。今天,国内首款具备中文逻辑推理能力的 o1 模型来了,它便是由昆仑万维推出的「天工大模型 4.0」 o1 版(英文名:Skywork o1)。这也是近一个月来,该公司在大模型及相关应用上的第三次大动作...……更多
影响英伟达根本逻辑的大争论:OpenAI改变策略意味着什么?谁在撒谎?
大模型预训练“缩放定律”定律失效?模型推理成“解药”,英伟达一家独大格局要变天?“缩放定律”指导下,AI大模型预训练目前遭遇瓶颈。据路透12日报道,硅谷主要AI实验室的新模型训练计划目前普遍进展不顺,新模型...……更多
微软华人团队发布全新基准AGIEval,专为人类考试而生
...在衡量未来的法律学生的推理和分析能力,考试内容包括逻辑推理、阅读理解和分析推理等部分,需要应试者分析复杂信息和得出准确结论的能力,这些任务可以评估语言模型在法律推理和分析方面的能力。3.律师资格考试可以...……更多
大模型面临四大关键缺陷,“知识方程”能否通向强人工智能
...大模型面临的最重要的挑战之一。第二,大模型的数学和逻辑推理能力仍然需要加强。虽然GPT-4在某些考试中表现优异,但在面对一些精心设计的逻辑推理问题时,大模型的回答与随机答案相差无几。因为在进行深度推理时,即...……更多
人工智能的“胡言乱语”,有没有解法?
...hatGPT只是通过概率最大化不断生成数据而已,而不是通过逻辑推理来生成回复:ChatGPT的训练使用了前所未有的庞大数据,并通过深度神经网络、自监督学习、强化学习和提示学习等人工智能模型进行训练。目前披露的ChatGPT的上...……更多
百度王海峰披露飞桨生态最新成果 开发者数量已达800万
...降低人工智能应用门槛;自动化方面,从训练、适配,到推理部署,提升人工智能研发全流程效率;模块化方面,丰富的产业级模型库,支撑人工智能在广泛场景的便捷应用。 据了解,得益于飞桨产业级深度学习开源开放平台...……更多
大模型权威报告:讯飞星火得分第一
...也是“最聪明”大模型的重要体现,本次逻辑思维评测在逻辑推理、思维链等方面设计了较多的题目,包含类比、常识推理、空间方位、演绎推理、逻辑谬误检测、因果推理等19个二级分类,题型上相对平均,其中填空题最多,...……更多
腾讯最强!混元自研深度思考模型T1正式发布:吐字快、能秒回
...还擅长超长文处理。通过大规模强化学习,并结合数学、逻辑推理、科学和代码等理科难题的专项优化,混元T1正式版进一步提升了推理能力。在体现推理模型基础能力的常见benchmark上,如大语言模型评估增强数据集MMLU-PRO中,...……更多
科技企业竞逐“大模型”:谁能聊下去?谁更接地气? | 2023世界人工智能大会
...”和“文心一言” 新民晚报记者 陈梦泽 摄(下同)秒答逻辑推理题、创作一幅描绘申城未来的图画……大模型能有多聪明?一眼看穿一家陌生公司的门道、成为房产经纪的贴心小助手……大模型能有多实用?今年世界人工智能...……更多
语言≠思维,大模型学不了推理:一篇Nature让AI社区炸锅了
...规划和遵循非言语指令,参与多种形式的推理,包括形式逻辑推理、关于世界的因果推理和科学推理(见图 1b)。研究表明,尽管失去了语言能力,一些患有严重失语症的人仍然能够进行所有测试形式的思考和推理,他们在各种...……更多
...解释:“过去,ChatGPT等大模型像文科生,不擅长理科和逻辑推理。而对人类智慧来说,最底层的智慧是逻辑,逻辑之上是数学,再上面是物理、化学等科学。”去年9月,OpenAI发布的o1推理大模型改变了“文科生”形象,它擅长...……更多
ICML2024演讲爆火!Meta朱泽园揭秘大模型内心世界:不同于人类推理
...M) 是如何解数学题的?是通过模板记忆,还是真的学会了推理思维?模型的心算过程是怎样的?能学会怎样的推理技能?与人类相同,还是超越了人类?只学一种类型的数学题,是会对通用智能的发展产生帮助?LLM 为什么会犯...……更多
权威榜单 | 网易易盾入选中国信通院生成式 AI 技术和应用优秀案例
...内容风控的场景理解与知识迁移能力,进行更深层次认知逻辑推理与综合防控;· 基于其提示上下文学习范式以及思维推理过程,内容风控将在不更新模型的基础上更加便捷的适应不同的标准,差异化分级分层精准防控。四、网...……更多
...AI)系统在编码、战略规划和机器人科学三个领域执行复杂推理任务。聊天生成预训练转换器(ChatGPT)和“克劳德3-奥普斯”(Claude 3 Opus)等大语言模型(LLM),根据人类输入“提示词”处理和生成文本。研究人员说,过去18个月,这些技...……更多
9.11和9.9哪个大?实测12个大模型8个都答错,ChatGPT也翻车了
...模型的短板,此前行业也多次讨论过大模型的数学和复杂推理能力较差,即便是目前最好的大模型GPT-4也仍然有很大进步空间。最近的一次,第一财经曾在6月报道过,根据司南评测体系OpenCompass的高考全卷测试,包括GPT-4在内,7...……更多
更多关于科技的资讯:
深圳香蜜丽格成功举办2025LA-HA中国激光医学研讨会。续写Fotona4D发展新篇章
鹏城8月,热力全开!2025年8月5日,“2025LA-HA中国激光医学研讨会暨Fotona欧洲之星基石方案临床应用交流会”在深圳香蜜丽格圆满落幕
2025-08-08 20:05:00
中新经纬8月8日电 据深交所微信公众号8日消息,8月5日,深交所在杭州举办第二十六期“创享荟”活动,围绕创新药的现状未来及资本市场支持行业高质量发展举办专题座谈交流
2025-08-08 19:27:00
一杯“秋奶”喝出节气新经济:益禾堂立秋单日总GMV破6700万!
当二十四节气与新茶饮浪漫邂逅,一杯奶茶如何成为秋日仪式感的代名词?8月7日立秋,益禾堂以“秋天宠你”为情感内核,成功引爆全民“秋天的第一杯奶茶”消费热潮
2025-08-08 19:34:00
2025跑步机选购榜单:减震技术如何守护你的膝盖舒适与运动健康?
跑步机的价值,最终由膝盖说了算!本榜聚焦长期使用下的膝盖舒适度与耐用性两大核心价值,评选真正懂呵护的跑步机。膝盖舒适度&
2025-08-08 19:34:00
2025最新进口纳豆激酶品牌排行榜!哪个牌子效果好又安全?科研实力+口碑双认证!
在当今健康意识不断提升的时代,纳豆激酶凭借其卓越的心血管保健功效,已成为众多家庭必备的营养补充品。面对市场上琳琅满目的产品选择
2025-08-08 19:34:00
中能拾贝深度赋能某上市发电企业,构建电力生产全链条数字化新范式
随着“双碳”目标的深入推进与数字技术的迅猛发展,能源电力行业正迎来绿色转型与智能升级的关键窗口期。中能拾贝深耕能源电力行业二十载
2025-08-08 19:34:00
2025采购与供应管理大会将于9月在厦门开幕
2025年9月14日—16日,全球供应链管理领域的目光将聚焦于福建省厦门市。在这座美丽的海滨城市,一场备受瞩目的国际盛会——“2025年采购与供应管理大会暨第六届中国供应链管理年会”即将拉开帷幕
2025-08-08 19:34:00
益禾堂“秋奶”狂潮席卷全国,立秋当日总GMV破6700万,创历史新高!
8月7日立秋,“秋天的第一杯奶茶”全民狂欢再度引爆!益禾堂以“益趣”为核心,主打“秋天宠爱”,推出轻乳茶新品,结合创意营销攻势
2025-08-08 19:34:00
在茶馆遇见茶的温度与品牌的厚度:解码小罐茶全新茶馆生态
在快节奏的城市生活中,逐渐兴起的“茶空间”逐渐成为人们逃离压力、精神栖息、社交娱乐的都市新场景。这种生活消费方式的转变
2025-08-08 19:34:00
北京最有人气的购物中心,要被卖了
近日,有市场知情人士透露,英格卡购物中心正计划打包出售国内的10座荟聚购物中心。首批将出售位于无锡、北京、武汉的三座荟聚购物中心
2025-08-08 09:16:00
李现也来参与的“观鸟”,在全球拥有千亿级市场|产品观察
作者 | 张子怡编辑 | 彭孝秋今年春天,明星李现带火一个小众赛道。他分享的观鸟vlog被生态环境部公开表扬,此后一连数日的热搜都跟“观鸟”
2025-08-08 11:22:00
商品多退少补太繁琐?小鹅通称重分拣功能上线,高效管理每一克!
小鹅发现,不少社区团购商家在用小鹅通卖生鲜时,采用的是先销后采的方式,缺少"称重分拣"的环节,销转过程低效还易出错。现在
2025-08-08 12:22:00
外卖大战背后,最直观的受益者当属消费者。数据显示,90后日均打开外卖App的频次已达3.2次,25-45岁人群贡献了82%的订单
2025-08-08 10:39:00
随着美团、饿了么、京东的官宣,这场外卖大战似乎会暂告一段落。其间出现各种意想不到的现象,也引起各方对外卖行业发展的反思
2025-08-08 10:39:00
外卖内卷,算得上今年的一个现象级话题。2月11日京东宣布入局外卖,一池春水即被搅动。美团升级“闪购”,饿了么联合淘宝闪购
2025-08-08 10:39:00