逻辑推理,推理,逻辑,模型,语言,模型头条新闻资讯订阅

我的订阅
头条热搜

我们正处于一个信息大暴发的时代，每天都能产生数以百万计的新闻资讯！

虽然有大数据推荐，但面对海量数据，通过我们的调研发现，在一个小时的时间里，您通常无法真正有效地获取您感兴趣的资讯！

头条新闻资讯订阅，旨在帮助您收集感兴趣的资讯内容，并且在第一时间通知到您。可以有效节约您获取资讯的时间，避免错过一些关键信息。

大语言模型逻辑推理“很糟糕”

...个只有8%。研究人员根据答案是否正确以及答案所包含的逻辑推理是否有效，对大语言模型的答案进行了分类。实验的第一个结果是，在每个测试重复十次的情况下，答案是不一致的。例如，在同一个测试中，有的模型十次中答...……更多

2024-06-12 18:15:00逻辑推理,推理,逻辑,模型,语言,模型

人类和AI在推理任务中的表现相似，Google DeepMi

...，尽管这些模型在处理自然语言方面表现卓越，但在复杂逻辑推理任务中，人类和语言模型都会受到语义内容合理性和可信度的影响，表现出类似的错误倾向。研究背景人类在推理过程中存在两种系统：“直觉系统”和“理性系...……更多

2024-08-19 13:49:00局限性,推理,人类,任务,研究,模型

姚期智院士大模型新研究：思维图DoT，用数学理论确保AI逻辑

...看看DoT长啥样。大模型复杂推理新框架如前所述，DoT将逻辑推理过程建模为在单个LLM内构建有向无环图（DAG）。其框架内部管理三个关键角色：提议者：生成命题或推理步骤，添加新节点。批评者：评估命题，识别错误、不...……更多

2024-09-24 13:36:00维图,院士,逻辑,模型,一致,理论

谷歌最新自然语言推理算法

...读理解和问答等任务中取得了极高的性能，但这些模型在逻辑推理方面的性能仍然十分滞后。去年5月「思维链」（ChainofThought,CoT）横空出世，有研究人员发现，只需要在prompt中加入「Let'sthinkstepbystep」就能让GPT-3的推理性能大幅...……更多

2023-01-09 21:57:00自然语言,算法,推理,自然,语言,目标

重磅！OpenAI o1模型还没有实现真正的逻辑推理能力

...二、社会评测与同行水平社会评测普遍认可o1 系列模型的逻辑推理能力优于 GPT-4o，但也有很多人提出了不同看法。差评XPIN邀请了理综三科的博士测评，物理评价较高，而生物、化学评价较低，综合认为o1在认知上达到硕士水平...……更多

2024-09-18 15:01:00逻辑推理,重磅,推理,逻辑,模型,能力

奥林匹克竞赛里选最聪明的AI：Claude-3.5-Sonn

...竞赛不仅是对人类（碳基智能）思维敏捷性、知识掌握和逻辑推理的极限挑战，更是AI（“硅基智能”）锻炼的绝佳练兵场，是衡量AI与“超级智能”距离的重要标尺。OlympicArena——一个真正意义上的AI奥运竞技场。在这里，AI不...……更多

2024-06-25 09:45:00奥林,奥林匹克,竞赛,模型,推理,能力

罗格斯大学团队提出思想链概念，提高大模型的算数推理能力

...概念，提高了大语言模型（LLM，large language models）在复杂推理任务上的性能，例如算术推理、常识推理和符号推理等。图 | 金明宇（来源：金明宇）CoT 的原理是通过提供推理过程的示例，来教会模型处理推理，详细说明导致最...……更多

2024-03-15 10:41:00罗格,罗格斯,推理,模型,团队,概念

蚂蚁自研知识增强大模型服务框架KAG，可显著提升知识推理准确

...地，也一定要对时间、数字和逻辑敏感，无论让它做多跳推理，还是逻辑规则数字计算，而这些恰好是大语言模型所不擅长的，包括前一段时间热议的 9.9 和 9.12 比大小的例子。基于此，我们认为在垂直领域落地的时候，大语言...……更多

2024-09-13 13:33:00知识,准确率,推理,蚂蚁,框架,模型

苹果新论文证明LLM大模型存在缺陷！没有进行真正的逻辑推理

...地依赖于训练数据中的模式进行预测。当需要进行真正的逻辑推理时，这些模型往往无法产生合理的结果，这一发现对人工智能的发展提供了重要的参考。虽然LLM在许多领域表现优异，但其推理能力仍有待改进。【本文结束】如...……更多

2024-10-13 14:15:00逻辑推理,新论,推理,缺陷,逻辑,模型

商汤又“夺金”！SuperCLUE-V多模态大模型基准发布1

...度30个二级维度。报告称SenseChat-Vision 5.5在基础能力-数理逻辑推理任务如图表推理、场景推理方面具备领先优势。榜单显示，在数理逻辑分析能力中，SenseChat-Vision 5.5超越国内外所有参评模型包括GPT-4o的最新版本，位列第一。Super...……更多

2024-10-14 13:34:00商汤,模态,基准,模型,模型,能力

昆仑万维：“天工大模型3.0”将于4月17日正式发布同步开

...一代“天工2.0”MoE大模型，“天工3.0”在模型语义理解、逻辑推理、以及通用性、泛化性、不确定性知识、学习能力等领域拥有惊人的性能提升，其模型技术知识能力提升超过20%，数学/推理/代码/文创能力提升超过30%。同时，“...……更多

2024-04-01 19:56:00万维,昆仑,模型,将于,同步,参数

讯飞星火X1全面升级领跑教育、医疗、司法行业应用

...训练的深度推理大模型，升级后的星火X1在数学、代码、逻辑推理、文本生成、语言理解、知识问答等通用任务上效果显著提升，在模型参数比业界同类模型小一个数量级的情况下，整体效果对标OpenAI o1和DeepSeek R1，再次证明了...……更多

2025-04-22 16:50:00讯飞,星火,行业应用,司法,升级,医疗

百川智能发布baichuan3稳定语言模型

...语言处理和代码生成领域的强大实力。不仅如此，其在对逻辑推理能力及专业性要求极高的MCMLE、MedExam、CMExam等权威医疗评测上的中文效果同样超过了GPT-4，是中文医疗任务表现最佳的大模型。Baichuan3还突破“迭代式强化学习”...……更多

2024-01-29 19:57:00百川,模型,语言,智能,模型,百川

国产大模型首发中文逻辑推理，「天工大模型4.0」o1版来了

...始在一些权威评测中取得领先。今天，国内首款具备中文逻辑推理能力的 o1 模型来了，它便是由昆仑万维推出的「天工大模型 4.0」 o1 版（英文名：Skywork o1）。这也是近一个月来，该公司在大模型及相关应用上的第三次大动作...……更多

2024-11-28 10:00:00模型,逻辑推理,中文,推理,逻辑,国产

影响英伟达根本逻辑的大争论：OpenAI改变策略意味着什么？

大模型预训练“缩放定律”定律失效？模型推理成“解药”，英伟达一家独大格局要变天？“缩放定律”指导下，AI大模型预训练目前遭遇瓶颈。据路透12日报道，硅谷主要AI实验室的新模型训练计划目前普遍进展不顺，新模型...……更多

2024-11-13 14:09:00英伟,争论,逻辑,意味,根本,策略

微软华人团队发布全新基准AGIEval，专为人类考试而生

...在衡量未来的法律学生的推理和分析能力，考试内容包括逻辑推理、阅读理解和分析推理等部分，需要应试者分析复杂信息和得出准确结论的能力，这些任务可以评估语言模型在法律推理和分析方面的能力。3.律师资格考试可以...……更多

2023-05-13 21:28:00微软,基准,专为,团队,人类,全新

腾讯最强！混元自研深度思考模型T1正式发布：吐字快、能秒回

...还擅长超长文处理。通过大规模强化学习，并结合数学、逻辑推理、科学和代码等理科难题的专项优化，混元T1正式版进一步提升了推理能力。在体现推理模型基础能力的常见benchmark上，如大语言模型评估增强数据集MMLU-PRO中，...……更多

2025-03-22 00:29:00腾讯,深度,模型,推理,腾讯,模型

语言≠思维，大模型学不了推理：一篇Nature让AI社区炸锅

...规划和遵循非言语指令，参与多种形式的推理，包括形式逻辑推理、关于世界的因果推理和科学推理（见图 1b）。研究表明，尽管失去了语言能力，一些患有严重失语症的人仍然能够进行所有测试形式的思考和推理，他们在各种...……更多

2024-06-25 09:45:00推理,模型,思维,语言,社区,语言

GPT-4下岗了，上海高校和企业用DeepSeek开发大模型

...解释：“过去，ChatGPT等大模型像文科生，不擅长理科和逻辑推理。而对人类智慧来说，最底层的智慧是逻辑，逻辑之上是数学，再上面是物理、化学等科学。”去年9月，OpenAI发布的o1推理大模型改变了“文科生”形象，它擅长...……更多

2025-01-29 21:29:00上海,下岗,模型,智能,开发,企业

ICML2024演讲爆火!Meta朱泽园揭秘大模型内心世界:

...M) 是如何解数学题的？是通过模板记忆，还是真的学会了推理思维？模型的心算过程是怎样的？能学会怎样的推理技能？与人类相同，还是超越了人类？只学一种类型的数学题，是会对通用智能的发展产生帮助？LLM 为什么会犯...……更多

2024-08-06 09:27:00推理,模型,内心,人类,世界,模型

混合架构赋予AI人类推理能力

...AI)系统在编码、战略规划和机器人科学三个领域执行复杂推理任务。聊天生成预训练转换器(ChatGPT)和“克劳德3-奥普斯”(Claude 3 Opus)等大语言模型(LLM)，根据人类输入“提示词”处理和生成文本。研究人员说，过去18个月，这些技...……更多

2024-06-12 18:15:00推理,架构,混合,人类,能力,语言

9.11和9.9哪个大？实测12个大模型8个都答错，Chat

...模型的短板，此前行业也多次讨论过大模型的数学和复杂推理能力较差，即便是目前最好的大模型GPT-4也仍然有很大进步空间。最近的一次，第一财经曾在6月报道过，根据司南评测体系OpenCompass的高考全卷测试，包括GPT-4在内，7...……更多

2024-07-17 11:56:00实测,模型,模型,数学,小数,问题

科学家推出大模型数据集，涵盖奥赛数学题，有望让AI辅导数学课

...23 年 2 月。当时，已经有一些研究团队开始使用大模型做逻辑推理和数学推理。赵子龙和合作者也认为这个方向很有前景。他表示让自己印象最深的例子就是 OpenAI 网站上的一道数学推理的题: Simplify tan100 + 4sin100。根据 OpenAI 自...……更多

2024-03-13 10:26:00数学,数学题,科学家,模型,辅导,课程

给小学数学题加句废话，OpenAI o1就翻车了，苹果论文质

...降。我们假设这种下降是因为当前的 LLM 无法进行真正的逻辑推理；相反，它们试图复制在训练数据中观察到的推理步骤。」这一结论得到了 Keras 之父 François Chollet 和美国心理学家、认知科学家 Gary Marcus 的转发，他们一直对 AI ...……更多

2024-10-14 09:55:00数学题,推理,废话,苹果,数学,小学

不止反击，谷歌在AI群隔空@所有人

...的一个代表大模型，其功能的强大已无需赘言，尤其是在逻辑推理和数学表现层面。但据谷歌的官方测试，PaLM2的部分结果（例如数学）比GPT-4还要好。谷歌称，对PaLM2做了算法优化，使得它在体积上比PaLM要小，但整体性能更好...……更多

2023-05-11 23:00:00所有人,模型,语言,训练,能力,搜索

商汤科技与金山办公达成商业合作，“日日新”大模型补强办公软件

...力一直是大模型的痛点，理科领域需要高度的抽象思维和逻辑推理能力，并且要求非常精准的答案，作为计算机科学和信息技术领域的重要工具，代码能力被视作衡量大模型智慧的关键维度。事实上，在过去一年国产大模型如火...……更多

2024-04-12 15:11:00商汤,办公,补强,金山,办公软件,理科

数学不太好的文科生

...它的数学水平高。”赵海告诉记者,“其实,推理能力包含逻辑推理能力和数学抽象思维能力,这两种能力是有区别的,前者侧重寻找因果关系。相对而言,GPT-4的逻辑推理能力更强。”从OpenAI的GPT系列(GPT-1、2、3、ChatGPT和GPT-4)开发思...……更多

2023-03-16 09:23:00文科生,文科,数学,赵海,模型,能力

云从科技发布从容大模型可支持图文理解、文案写作、逻辑推理等

云从科技发布从容大模型可支持图文理解、文案写作、逻辑推理等功能【云从科技发布从容大模型可支持图文理解、文案写作、逻辑推理等功能】《科创板日报》18日讯，云从科技发布从容大模型。在现场演示中，从容大模型...……更多

2023-05-18 10:50:00逻辑推理,文案,推理,从容,逻辑,模型

科研也完了，AI暴虐170位人类专家！Nature子刊：大模

...读、科研的解决方案，其通用能力覆盖了专业考试、有限推理、翻译、解决数学问题，甚至还能写代码。已有的研究考察了大模型在科研领域的表现，但基准数据集大多属于「回顾性质」的，比如MMLU、PubMedQA和MedMCQA，主要以问...……更多

2024-12-09 09:50:00暴虐,准确率,模型,高达,完了,科研

人工智能已经可以解决复杂的数学问题了，还有哪些工作无法被取代

...决数学问题的系统，它是一个组合了自然语言处理和数学推理的系统。这个系统的作用是帮助计算机理解自然语言中的数学问题，从而能够通过推理和计算得出问题的答案。具体来说，这个系统包括多个子系统，包括自然语言处...……更多

2023-02-24 18:22:00人工智能,人工,数学,智能,问题,工作

page 1/3334 首页上一页 12 3 4 5 6 下一页末页

更多关于科技的资讯：

京东11.11直播技术全面升级，立影3D技术、JoyAI大模

随着京东 11.11 大促的火热进行，京东直播再度升级技术布局，以 “立影 3D 技术”“JoyAI大模型”等创新技术

2025-10-27 15:39:00

电机能效提升领域再添标杆！25 项产品 / 技术入选全国节能

为深入贯彻国家 “双碳” 战略，加快电机领域节能降碳技术创新与成果转化，中国电子节能技术协会此前启动 “全国节能降碳示范产品 / 技术推荐” 征集工作

2025-10-27 15:42:00

吉刻现场｜硬核登场！吉林选手角逐第三届全国博士后创新创业大赛

10月26日，第三届全国博士后创新创业大赛在福建泉州（晋江）开幕。本届大赛，吉林省派出23个项目团队组成的参赛队伍角逐三个大赛道

2025-10-27 14:09:00

$厦心医院实现手术\$

厦心医院实现手术"跨洲同台" 全球首例跨国机器人心脏介入手术

厦门网讯（厦门日报记者楚燕通讯员许良友付磊刘云芳）10月23日，一项载入医学史册的创新手术在厦门大学附属心血管病医院（以下简称“厦心医院”）圆满完成

2025-10-27 08:11:00

新闻纵深·解码钢铁大模型｜邯钢构建六大领域全链条智能大模型：

邯钢构建六大领域全链条智能大模型“聪明大脑”带来极致能效编者按当钢铁遇上人工智能，一场“智变”正悄然发生。为生动展现人工智能为钢铁产业生产

2025-10-27 08:12:00

江苏规模最大，1400名软件工程师在宁“聚会”

第十一届NJSD软件开发者会议在软件谷举行江苏规模最大，1400名软件工程师在宁“聚会”南报网讯（记者于洁尘通讯员林园园）70多位业界“大咖”登台演讲

2025-10-27 08:20:00

南化公司首套除盐装置投用技术突破降本增效年可节约超500万

南报网讯（通讯员郑瑞于品华杨刚记者徐宁）近日，南化公司自主研发的橡胶防老剂中间产品RT培司（4-氨基二苯胺）除盐技术取得突破

2025-10-27 08:21:00

南林大携手乐惠国际共建智慧包装产业研究院

南报网讯（通讯员杨淏涵记者张希）日前，南京林业大学与乐惠国际南京基地签署《校企全面合作协议》《产业研究院共建协议》，全面开启校企战略合作

2025-10-27 08:22:00

高效，是都市青年的通行证：InstaShake以“一杯营养”

在生活节奏不断加速的上海，追求健康与追求效率似乎成为一道单选题。然而，新锐健康饮品品牌InstaShake正以其独特的“零添加

2025-10-27 08:39:00

济宁银行锚定金融“五篇大文章” 多维发力赋能区域经济高质量发

鲁网10月27日讯近年来，济宁银行围绕做好金融“五篇大文章”，深入洞察科技企业、中小微企业以及重点产业链金融需求，以产品创新破解融资难题

2025-10-27 11:07:00

量贩零食店，价廉味美才可能“长红”

汪昌莲据《经济日报》报道，“两三元就能买品牌饼干薯片”“上百种散装零食任意挑选”……从县城到乡镇，在街角与量贩零食店不期而遇已成逛街“标配”

2025-10-27 11:10:00

济南未来七天天气预报

受冷空气影响，气温先降后升，27日早晨气温较低。26日夜间到27日白天晴间多云，北风转南风2～3级，最低气温市区4℃左右

2025-10-27 11:28:00

2025青岛虚拟现实创新大会将启，雷神科技聚焦信创生态构建

鲁网10月27日讯虚实无界，智享未来。2025青岛虚拟现实创新大会即将在崂山区拉开帷幕。2017年以来，由崂山区成功承办的虚拟现实创新大会

2025-10-27 11:48:00

智能锁变“共享锁”？家门安全不能成虚设-中国吉林网

长白时评评论员唐小兰近日，北京一市民反映有陌生男子在她家中无人时，通过指纹解锁智能门锁多次进入她家。当事人焦女士告诉新京报记者

2025-10-27 13:38:00

生物制药工艺与设备发展新趋势研讨会举行

“生物制药工艺与设备发展新趋势研讨会”于10月16日下午举行，麦济生物、艾捷博雅科技、碧博生物等企业的代表，就生物制药工艺优化与设备选型提供了新思路与新方法。责编：卢思宇、姚凯红

2025-10-27 10:19:00

头条订阅服务