逻辑推理,推理,逻辑,模型,语言,模型头条新闻资讯订阅

我的订阅
头条热搜

我们正处于一个信息大暴发的时代，每天都能产生数以百万计的新闻资讯！

虽然有大数据推荐，但面对海量数据，通过我们的调研发现，在一个小时的时间里，您通常无法真正有效地获取您感兴趣的资讯！

头条新闻资讯订阅，旨在帮助您收集感兴趣的资讯内容，并且在第一时间通知到您。可以有效节约您获取资讯的时间，避免错过一些关键信息。

大语言模型逻辑推理“很糟糕”

...个只有8%。研究人员根据答案是否正确以及答案所包含的逻辑推理是否有效，对大语言模型的答案进行了分类。实验的第一个结果是，在每个测试重复十次的情况下，答案是不一致的。例如，在同一个测试中，有的模型十次中答...……更多

2024-06-12 18:15:00逻辑推理,推理,逻辑,模型,语言,模型

人类和AI在推理任务中的表现相似，Google DeepMi

...，尽管这些模型在处理自然语言方面表现卓越，但在复杂逻辑推理任务中，人类和语言模型都会受到语义内容合理性和可信度的影响，表现出类似的错误倾向。研究背景人类在推理过程中存在两种系统：“直觉系统”和“理性系...……更多

2024-08-19 13:49:00局限性,推理,人类,任务,研究,模型

姚期智院士大模型新研究：思维图DoT，用数学理论确保AI逻辑

...看看DoT长啥样。大模型复杂推理新框架如前所述，DoT将逻辑推理过程建模为在单个LLM内构建有向无环图（DAG）。其框架内部管理三个关键角色：提议者：生成命题或推理步骤，添加新节点。批评者：评估命题，识别错误、不...……更多

2024-09-24 13:36:00维图,院士,逻辑,模型,一致,理论

谷歌最新自然语言推理算法

...读理解和问答等任务中取得了极高的性能，但这些模型在逻辑推理方面的性能仍然十分滞后。去年5月「思维链」（ChainofThought,CoT）横空出世，有研究人员发现，只需要在prompt中加入「Let'sthinkstepbystep」就能让GPT-3的推理性能大幅...……更多

2023-01-09 21:57:00自然语言,算法,推理,自然,语言,目标

重磅！OpenAI o1模型还没有实现真正的逻辑推理能力

...二、社会评测与同行水平社会评测普遍认可o1 系列模型的逻辑推理能力优于 GPT-4o，但也有很多人提出了不同看法。差评XPIN邀请了理综三科的博士测评，物理评价较高，而生物、化学评价较低，综合认为o1在认知上达到硕士水平...……更多

2024-09-18 15:01:00逻辑推理,重磅,推理,逻辑,模型,能力

奥林匹克竞赛里选最聪明的AI：Claude-3.5-Sonn

...竞赛不仅是对人类（碳基智能）思维敏捷性、知识掌握和逻辑推理的极限挑战，更是AI（“硅基智能”）锻炼的绝佳练兵场，是衡量AI与“超级智能”距离的重要标尺。OlympicArena——一个真正意义上的AI奥运竞技场。在这里，AI不...……更多

2024-06-25 09:45:00奥林,奥林匹克,竞赛,模型,推理,能力

罗格斯大学团队提出思想链概念，提高大模型的算数推理能力

...概念，提高了大语言模型（LLM，large language models）在复杂推理任务上的性能，例如算术推理、常识推理和符号推理等。图 | 金明宇（来源：金明宇）CoT 的原理是通过提供推理过程的示例，来教会模型处理推理，详细说明导致最...……更多

2024-03-15 10:41:00罗格,罗格斯,推理,模型,团队,概念

蚂蚁自研知识增强大模型服务框架KAG，可显著提升知识推理准确

...地，也一定要对时间、数字和逻辑敏感，无论让它做多跳推理，还是逻辑规则数字计算，而这些恰好是大语言模型所不擅长的，包括前一段时间热议的 9.9 和 9.12 比大小的例子。基于此，我们认为在垂直领域落地的时候，大语言...……更多

2024-09-13 13:33:00知识,准确率,推理,蚂蚁,框架,模型

苹果新论文证明LLM大模型存在缺陷！没有进行真正的逻辑推理

...地依赖于训练数据中的模式进行预测。当需要进行真正的逻辑推理时，这些模型往往无法产生合理的结果，这一发现对人工智能的发展提供了重要的参考。虽然LLM在许多领域表现优异，但其推理能力仍有待改进。【本文结束】如...……更多

2024-10-13 14:15:00逻辑推理,新论,推理,缺陷,逻辑,模型

商汤又“夺金”！SuperCLUE-V多模态大模型基准发布1

...度30个二级维度。报告称SenseChat-Vision 5.5在基础能力-数理逻辑推理任务如图表推理、场景推理方面具备领先优势。榜单显示，在数理逻辑分析能力中，SenseChat-Vision 5.5超越国内外所有参评模型包括GPT-4o的最新版本，位列第一。Super...……更多

2024-10-14 13:34:00商汤,模态,基准,模型,模型,能力

昆仑万维：“天工大模型3.0”将于4月17日正式发布同步开

...一代“天工2.0”MoE大模型，“天工3.0”在模型语义理解、逻辑推理、以及通用性、泛化性、不确定性知识、学习能力等领域拥有惊人的性能提升，其模型技术知识能力提升超过20%，数学/推理/代码/文创能力提升超过30%。同时，“...……更多

2024-04-01 19:56:00万维,昆仑,模型,将于,同步,参数

讯飞星火X1全面升级领跑教育、医疗、司法行业应用

...训练的深度推理大模型，升级后的星火X1在数学、代码、逻辑推理、文本生成、语言理解、知识问答等通用任务上效果显著提升，在模型参数比业界同类模型小一个数量级的情况下，整体效果对标OpenAI o1和DeepSeek R1，再次证明了...……更多

2025-04-22 16:50:00讯飞,星火,行业应用,司法,升级,医疗

百川智能发布baichuan3稳定语言模型

...语言处理和代码生成领域的强大实力。不仅如此，其在对逻辑推理能力及专业性要求极高的MCMLE、MedExam、CMExam等权威医疗评测上的中文效果同样超过了GPT-4，是中文医疗任务表现最佳的大模型。Baichuan3还突破“迭代式强化学习”...……更多

2024-01-29 19:57:00百川,模型,语言,智能,模型,百川

国产大模型首发中文逻辑推理，「天工大模型4.0」o1版来了

...始在一些权威评测中取得领先。今天，国内首款具备中文逻辑推理能力的 o1 模型来了，它便是由昆仑万维推出的「天工大模型 4.0」 o1 版（英文名：Skywork o1）。这也是近一个月来，该公司在大模型及相关应用上的第三次大动作...……更多

2024-11-28 10:00:00模型,逻辑推理,中文,推理,逻辑,国产

影响英伟达根本逻辑的大争论：OpenAI改变策略意味着什么？

大模型预训练“缩放定律”定律失效？模型推理成“解药”，英伟达一家独大格局要变天？“缩放定律”指导下，AI大模型预训练目前遭遇瓶颈。据路透12日报道，硅谷主要AI实验室的新模型训练计划目前普遍进展不顺，新模型...……更多

2024-11-13 14:09:00英伟,争论,逻辑,意味,根本,策略

微软华人团队发布全新基准AGIEval，专为人类考试而生

...在衡量未来的法律学生的推理和分析能力，考试内容包括逻辑推理、阅读理解和分析推理等部分，需要应试者分析复杂信息和得出准确结论的能力，这些任务可以评估语言模型在法律推理和分析方面的能力。3.律师资格考试可以...……更多

2023-05-13 21:28:00微软,基准,专为,团队,人类,全新

腾讯最强！混元自研深度思考模型T1正式发布：吐字快、能秒回

...还擅长超长文处理。通过大规模强化学习，并结合数学、逻辑推理、科学和代码等理科难题的专项优化，混元T1正式版进一步提升了推理能力。在体现推理模型基础能力的常见benchmark上，如大语言模型评估增强数据集MMLU-PRO中，...……更多

2025-03-22 00:29:00腾讯,深度,模型,推理,腾讯,模型

语言≠思维，大模型学不了推理：一篇Nature让AI社区炸锅

...规划和遵循非言语指令，参与多种形式的推理，包括形式逻辑推理、关于世界的因果推理和科学推理（见图 1b）。研究表明，尽管失去了语言能力，一些患有严重失语症的人仍然能够进行所有测试形式的思考和推理，他们在各种...……更多

2024-06-25 09:45:00推理,模型,思维,语言,社区,语言

GPT-4下岗了，上海高校和企业用DeepSeek开发大模型

...解释：“过去，ChatGPT等大模型像文科生，不擅长理科和逻辑推理。而对人类智慧来说，最底层的智慧是逻辑，逻辑之上是数学，再上面是物理、化学等科学。”去年9月，OpenAI发布的o1推理大模型改变了“文科生”形象，它擅长...……更多

2025-01-29 21:29:00上海,下岗,模型,智能,开发,企业

ICML2024演讲爆火!Meta朱泽园揭秘大模型内心世界:

...M) 是如何解数学题的？是通过模板记忆，还是真的学会了推理思维？模型的心算过程是怎样的？能学会怎样的推理技能？与人类相同，还是超越了人类？只学一种类型的数学题，是会对通用智能的发展产生帮助？LLM 为什么会犯...……更多

2024-08-06 09:27:00推理,模型,内心,人类,世界,模型

混合架构赋予AI人类推理能力

...AI)系统在编码、战略规划和机器人科学三个领域执行复杂推理任务。聊天生成预训练转换器(ChatGPT)和“克劳德3-奥普斯”(Claude 3 Opus)等大语言模型(LLM)，根据人类输入“提示词”处理和生成文本。研究人员说，过去18个月，这些技...……更多

2024-06-12 18:15:00推理,架构,混合,人类,能力,语言

9.11和9.9哪个大？实测12个大模型8个都答错，Chat

...模型的短板，此前行业也多次讨论过大模型的数学和复杂推理能力较差，即便是目前最好的大模型GPT-4也仍然有很大进步空间。最近的一次，第一财经曾在6月报道过，根据司南评测体系OpenCompass的高考全卷测试，包括GPT-4在内，7...……更多

2024-07-17 11:56:00实测,模型,模型,数学,小数,问题

科学家推出大模型数据集，涵盖奥赛数学题，有望让AI辅导数学课

...23 年 2 月。当时，已经有一些研究团队开始使用大模型做逻辑推理和数学推理。赵子龙和合作者也认为这个方向很有前景。他表示让自己印象最深的例子就是 OpenAI 网站上的一道数学推理的题: Simplify tan100 + 4sin100。根据 OpenAI 自...……更多

2024-03-13 10:26:00数学,数学题,科学家,模型,辅导,课程

给小学数学题加句废话，OpenAI o1就翻车了，苹果论文质

...降。我们假设这种下降是因为当前的 LLM 无法进行真正的逻辑推理；相反，它们试图复制在训练数据中观察到的推理步骤。」这一结论得到了 Keras 之父 François Chollet 和美国心理学家、认知科学家 Gary Marcus 的转发，他们一直对 AI ...……更多

2024-10-14 09:55:00数学题,推理,废话,苹果,数学,小学

不止反击，谷歌在AI群隔空@所有人

...的一个代表大模型，其功能的强大已无需赘言，尤其是在逻辑推理和数学表现层面。但据谷歌的官方测试，PaLM2的部分结果（例如数学）比GPT-4还要好。谷歌称，对PaLM2做了算法优化，使得它在体积上比PaLM要小，但整体性能更好...……更多

2023-05-11 23:00:00所有人,模型,语言,训练,能力,搜索

商汤科技与金山办公达成商业合作，“日日新”大模型补强办公软件

...力一直是大模型的痛点，理科领域需要高度的抽象思维和逻辑推理能力，并且要求非常精准的答案，作为计算机科学和信息技术领域的重要工具，代码能力被视作衡量大模型智慧的关键维度。事实上，在过去一年国产大模型如火...……更多

2024-04-12 15:11:00商汤,办公,补强,金山,办公软件,理科

数学不太好的文科生

...它的数学水平高。”赵海告诉记者,“其实,推理能力包含逻辑推理能力和数学抽象思维能力,这两种能力是有区别的,前者侧重寻找因果关系。相对而言,GPT-4的逻辑推理能力更强。”从OpenAI的GPT系列(GPT-1、2、3、ChatGPT和GPT-4)开发思...……更多

2023-03-16 09:23:00文科生,文科,数学,赵海,模型,能力

云从科技发布从容大模型可支持图文理解、文案写作、逻辑推理等

云从科技发布从容大模型可支持图文理解、文案写作、逻辑推理等功能【云从科技发布从容大模型可支持图文理解、文案写作、逻辑推理等功能】《科创板日报》18日讯，云从科技发布从容大模型。在现场演示中，从容大模型...……更多

2023-05-18 10:50:00逻辑推理,文案,推理,从容,逻辑,模型

科研也完了，AI暴虐170位人类专家！Nature子刊：大模

...读、科研的解决方案，其通用能力覆盖了专业考试、有限推理、翻译、解决数学问题，甚至还能写代码。已有的研究考察了大模型在科研领域的表现，但基准数据集大多属于「回顾性质」的，比如MMLU、PubMedQA和MedMCQA，主要以问...……更多

2024-12-09 09:50:00暴虐,准确率,模型,高达,完了,科研

人工智能已经可以解决复杂的数学问题了，还有哪些工作无法被取代

...决数学问题的系统，它是一个组合了自然语言处理和数学推理的系统。这个系统的作用是帮助计算机理解自然语言中的数学问题，从而能够通过推理和计算得出问题的答案。具体来说，这个系统包括多个子系统，包括自然语言处...……更多

2023-02-24 18:22:00人工智能,人工,数学,智能,问题,工作

page 1/3334 首页上一页 12 3 4 5 6 下一页末页

更多关于科技的资讯：

在数贸会，看见未来生活模样

人工智能不仅能分析人脸情绪，还能读取脑电波信号，为人定制香氛；恐龙变为AI数字虚拟形象，成为人们的“萌宠”——这不是科幻电影

2025-09-30 08:09:00

从线上学习到山水修行：简知文旅×简橙教育共同打造银发文旅的深

近日，长江三峡见证了一场别开生面的银发游学盛事。"三峡简橙号·年度盛典"游学项目在历时七天的精彩行程后圆满落下帷幕。该项目由简知科技旗下两大知名品牌"简知文旅"与"简橙教育"联合策划执行

2025-09-30 08:17:00

聊城智汇链接全球丨锚定国际市场，力得汽车科技加速布局海外

齐鲁晚报·齐鲁壹点国晓宁崔宇晴走进山东力得汽车科技股份有限公司的生产车间，机器轰鸣声不绝于耳，一条条先进的生产线正有序运转

2025-09-30 09:20:00

国庆黄金周变身“家电焕新周”，三联家电门店人气爆棚

随着国庆与中秋双节同庆的长假来临，消费市场迎来了一年之中最炙手可热的“黄金销售季”。与以往不同的是，这个假期在旅游、探亲等传统主题之外

2025-09-30 09:22:00

壹点观察 | 蔚来城商业广场十一开业，德州商业格局再迎新变化

在商业竞争日益激烈的今天，一座全新的商业综合体——蔚来城商业广场，即将于十一正式开门迎客。它的到来，为德州商业市场增添了新的变化

2025-09-30 09:24:00

邮储银行授信1000万元，助力创新型企业蝶变跃升

鲁网9月29日讯（记者杨勇）秋分时节，聊城市莘县升鑫金属制品有限公司的生产车间内，员工工作紧张有序，各种机器设备高效运转

2025-09-30 10:04:00

$Aritco与Dezeen联合举办设计论坛共探\$

Aritco与Dezeen联合举办设计论坛共探"摒弃风格，

苏州2024年9月16日 -- 近日,瑞典家用电梯品牌Aritco瑞特科与全球知名设计媒体Dezeen设志在苏州联合举办了一场主题为"摒弃风格

2025-09-30 10:18:00

民生银行福州分行：小微线上银承助力企业极速开票

小微企业在传统银行承兑汇票（简称“银承”）业务办理中常常面临诸多难题。企业需要多次往返银行网点，提交大量纸质材料，流程烦琐

2025-09-30 10:45:00

中国数据研究中心：中之杰荣膺月饼行业智造先锋奖榜首

9月28日，中国数据研究中心正式发布《2025中国月饼行业白皮书》及“2025中国月饼行业智造先锋奖”十强品牌榜单，吉林中之杰食品科技发展有限公司凭借其位于长春的智能新厂

2025-09-30 11:15:00

【喜报】高新区两家企业获省级“先投后股”项目支持

鲁网9月30日讯近日，省科技厅公布了2025年度科技型中小企业创新能力提升工程（先投后股类）项目名单，全市共4家企业入选

2025-09-30 11:16:00

浪潮海晏荣获2025年“数据要素×”大赛山东分赛决赛三等奖

近日，由国家数据局、山东省人民政府联合指导，山东省大数据局等21家单位联合主办的2025年“数据要素×”大赛山东分赛决赛获奖名单正式公布

2025-09-30 11:21:00

热搜该告别流量主导，重拾公共价值

据人民日报报道，近期国家网信办指导多地网信部门，对微博、快手、小红书、今日头条等多家平台进行约谈，责令限期整改热搜热榜存在的问题

2025-09-30 12:33:00

朱琳：品牌要让Z世代体验“设计师”般的快感

齐鲁晚报·齐鲁壹点记者牟静萍实习生葛同同当下，Z世代正在以其独特的消费观念、多元的兴趣取向和对精神体验的重视

2025-09-30 12:46:00

辉煌“十四五” 奋力往前赶 | 算力崛起赋能转型芜湖“智算

大皖新闻讯算力作为数字经济时代的核心生产力，已成为城市竞争的关键赛道。“十四五”期间，芜湖紧抓“东数西算”国家战略机遇

2025-09-30 13:57:00

把握国庆中秋消费节点，三联家电双节大促开启家庭焕新计划

鲁网9月30日讯国庆中秋长假，历来是家庭消费，特别是家电消费的黄金周期。许多家庭会选择在此期间，集中完成筹划已久的家电焕新计划

2025-09-30 14:55:00

头条订阅服务