• 我的订阅
  • 头条热搜
...个只有8%。研究人员根据答案是否正确以及答案所包含的逻辑推理是否有效,对大语言模型的答案进行了分类。实验的第一个结果是,在每个测试重复十次的情况下,答案是不一致的。例如,在同一个测试中,有的模型十次中答...……更多
人类和AI在推理任务中的表现相似,Google DeepMind研究揭示AI局限性
...,尽管这些模型在处理自然语言方面表现卓越,但在复杂逻辑推理任务中,人类和语言模型都会受到语义内容合理性和可信度的影响,表现出类似的错误倾向。研究背景人类在推理过程中存在两种系统:“直觉系统”和“理性系...……更多
姚期智院士大模型新研究:思维图DoT,用数学理论确保AI逻辑一致
...看看DoT长啥样。大模型复杂推理新框架 如前所述,DoT将逻辑推理过程建模为在单个LLM内构建有向无环图(DAG)。其框架内部管理三个关键角色:提议者:生成命题或推理步骤,添加新节点。 批评者:评估命题,识别错误、不...……更多
谷歌最新自然语言推理算法
...读理解和问答等任务中取得了极高的性能,但这些模型在逻辑推理方面的性能仍然十分滞后。去年5月「思维链」(ChainofThought,CoT)横空出世,有研究人员发现,只需要在prompt中加入「Let\'sthinkstepbystep」就能让GPT-3的推理性能大幅...……更多
重磅!OpenAI o1模型还没有实现真正的逻辑推理能力
...二、社会评测与同行水平社会评测普遍认可o1 系列模型的逻辑推理能力优于 GPT-4o,但也有很多人提出了不同看法。差评XPIN邀请了理综三科的博士测评,物理评价较高,而生物、化学评价较低,综合认为o1在认知上达到硕士水平...……更多
奥林匹克竞赛里选最聪明的AI:Claude-3.5-Sonnet vs. GPT-4o?
...竞赛不仅是对人类(碳基智能)思维敏捷性、知识掌握和逻辑推理的极限挑战,更是AI(“硅基智能”)锻炼的绝佳练兵场,是衡量AI与“超级智能”距离的重要标尺。OlympicArena——一个真正意义上的AI奥运竞技场。在这里,AI不...……更多
罗格斯大学团队提出思想链概念,提高大模型的算数推理能力
...概念,提高了大语言模型(LLM,large language models)在复杂推理任务上的性能,例如算术推理、常识推理和符号推理等。图 | 金明宇(来源:金明宇)CoT 的原理是通过提供推理过程的示例,来教会模型处理推理,详细说明导致最...……更多
蚂蚁自研知识增强大模型服务框架KAG,可显著提升知识推理准确率
...地,也一定要对时间、数字和逻辑敏感,无论让它做多跳推理,还是逻辑规则数字计算,而这些恰好是大语言模型所不擅长的,包括前一段时间热议的 9.9 和 9.12 比大小的例子。基于此,我们认为在垂直领域落地的时候,大语言...……更多
昆仑万维:“天工大模型3.0”将于4月17日正式发布 同步开源4000亿参数MoE超级模型
...一代“天工2.0”MoE大模型,“天工3.0”在模型语义理解、逻辑推理、以及通用性、泛化性、不确定性知识、学习能力等领域拥有惊人的性能提升,其模型技术知识能力提升超过20%,数学/推理/代码/文创能力提升超过30%。同时,“...……更多
百川智能发布baichuan3稳定语言模型
...语言处理和代码生成领域的强大实力。不仅如此,其在对逻辑推理能力及专业性要求极高的MCMLE、MedExam、CMExam等权威医疗评测上的中文效果同样超过了GPT-4,是中文医疗任务表现最佳的大模型。Baichuan3还突破“迭代式强化学习”...……更多
微软华人团队发布全新基准AGIEval,专为人类考试而生
...在衡量未来的法律学生的推理和分析能力,考试内容包括逻辑推理、阅读理解和分析推理等部分,需要应试者分析复杂信息和得出准确结论的能力,这些任务可以评估语言模型在法律推理和分析方面的能力。3.律师资格考试可以...……更多
语言≠思维,大模型学不了推理:一篇Nature让AI社区炸锅了
...规划和遵循非言语指令,参与多种形式的推理,包括形式逻辑推理、关于世界的因果推理和科学推理(见图 1b)。研究表明,尽管失去了语言能力,一些患有严重失语症的人仍然能够进行所有测试形式的思考和推理,他们在各种...……更多
ICML2024演讲爆火!Meta朱泽园揭秘大模型内心世界:不同于人类推理
...M) 是如何解数学题的?是通过模板记忆,还是真的学会了推理思维?模型的心算过程是怎样的?能学会怎样的推理技能?与人类相同,还是超越了人类?只学一种类型的数学题,是会对通用智能的发展产生帮助?LLM 为什么会犯...……更多
...AI)系统在编码、战略规划和机器人科学三个领域执行复杂推理任务。聊天生成预训练转换器(ChatGPT)和“克劳德3-奥普斯”(Claude 3 Opus)等大语言模型(LLM),根据人类输入“提示词”处理和生成文本。研究人员说,过去18个月,这些技...……更多
科学家推出大模型数据集,涵盖奥赛数学题,有望让AI辅导数学课程
...23 年 2 月。当时,已经有一些研究团队开始使用大模型做逻辑推理和数学推理。赵子龙和合作者也认为这个方向很有前景。他表示让自己印象最深的例子就是 OpenAI 网站上的一道数学推理的题: Simplify tan100 + 4sin100。根据 OpenAI 自...……更多
9.11和9.9哪个大?实测12个大模型8个都答错,ChatGPT也翻车了
...模型的短板,此前行业也多次讨论过大模型的数学和复杂推理能力较差,即便是目前最好的大模型GPT-4也仍然有很大进步空间。最近的一次,第一财经曾在6月报道过,根据司南评测体系OpenCompass的高考全卷测试,包括GPT-4在内,7...……更多
不止反击,谷歌在AI群隔空@所有人
...的一个代表大模型,其功能的强大已无需赘言,尤其是在逻辑推理和数学表现层面。但据谷歌的官方测试,PaLM2的部分结果(例如数学)比GPT-4还要好。谷歌称,对PaLM2做了算法优化,使得它在体积上比PaLM要小,但整体性能更好...……更多
云从科技发布从容大模型 可支持图文理解、文案写作、逻辑推理等功能 【云从科技发布从容大模型 可支持图文理解、文案写作、逻辑推理等功能】《科创板日报》18日讯,云从科技发布从容大模型。在现场演示中,从容大模型...……更多
商汤科技与金山办公达成商业合作,“日日新”大模型补强办公软件理科大脑
...力一直是大模型的痛点,理科领域需要高度的抽象思维和逻辑推理能力,并且要求非常精准的答案,作为计算机科学和信息技术领域的重要工具,代码能力被视作衡量大模型智慧的关键维度。事实上,在过去一年国产大模型如火...……更多
...它的数学水平高。”赵海告诉记者,“其实,推理能力包含逻辑推理能力和数学抽象思维能力,这两种能力是有区别的,前者侧重寻找因果关系。相对而言,GPT-4的逻辑推理能力更强。”从OpenAI的GPT系列(GPT-1、2、3、ChatGPT和GPT-4)开发思...……更多
人工智能已经可以解决复杂的数学问题了,还有哪些工作无法被取代
...决数学问题的系统,它是一个组合了自然语言处理和数学推理的系统。这个系统的作用是帮助计算机理解自然语言中的数学问题,从而能够通过推理和计算得出问题的答案。具体来说,这个系统包括多个子系统,包括自然语言处...……更多
港中文团队提出大模型元推理范式,革新大模型的评价体系
...一定启示。日前,相关论文以《大型语言模型评价中的元推理革命》(MR-GSM8K: A Meta-Reasoning Revolution in Large Language Model Evaluation)为题发在 arXiv,曾忠燊是第一作者,香港中文大学教授贾佳亚担任通讯作者 [1]。图……更多
谷歌发布AI语言模型PaLM 2,手机能跑,还知晓百种语言
...数据上的微调,可为企业客户执行某些任务。而在逻辑和推理方面,PaLM 2在超过100多种语言的多语言文本上进行训练,使它可以在语言理解、生成和翻译上的能力更强,还擅长常识推理、数学逻辑分析。编程方面,PaLM 2支持20种...……更多
百度文心一言发布会详细纪要
...和6只兔子。在这两轮提问当中展现出来的是文心一言的逻辑推理能力”。这方面它不仅知道题出的对不对,也不仅能够给出答案,也给出了解题的步骤。这很像是小学生在解应用题,它是有逻辑的,一步一步的推理出来的。我...……更多
专注于推理的OpenAI“草莓”模型两周内发布?是人工智能下一重大突破
...“秋季发布”(9月至11月)要更早。上述报道称,专注于推理能力的人工智能“草莓”发布前后还有一些亟待解决的问题,但看似“仓促上马”似乎说明OpenAI感受到了大语言模型驱动产品领域的激烈竞争压力,希望通过近几个月...……更多
微软发布旗下最小语言模型phi-2
...相比较其它主流语言模型,依然小很多。微软表示Phi-2在逻辑推理和安全性方面显示出显著的改进。通过正确的微调和定制,小型语言模型是云和边缘应用程序的强大工具。MicrosoftResearch机器学习基础小组负责人SebastienBubeck在Twitt...……更多
OpenAI o1模型到博士水平了?复旦教授:没有真正推理能力,学到的还是概率相关性
...程能力“爆表”新模型到底有多强?它在需要深入思考和逻辑推理的专业任务上不仅吊打GPT-4o,还超过了拥有博士学位的人类专家。OpenAI表示,新模型在物理、化学和生物等学科的挑战性基准测试中,表现超过人类专家。在国际...……更多
科大讯飞入局大模型混战,刘庆峰:10月底将赶超ChatGPT
...在七个维度,具体包括文本生成、语言理解、知识问答、逻辑推理、数学能力、代码能力以及多模态能力。“这将对整个人类的生产和生活方式带来巨大的颠覆,产生全新的机会。”“认知大模型成为通用人工智能的曙光,科大...……更多
AI新时代揭幕!会“思考解题逻辑”的OpenAI推理大模型登场
...凌晨1时许,AI时代迎来崭新的起点——能够进行通用复杂推理的大模型终于走到台前。OpenAI在官网发布公告称,开始向全体订阅用户开始推送OpenAI o1预览模型——也就是此前被广泛期待的“草莓”大模型。OpenAI表示,对于复杂推...……更多
真香!智谱大模型,有了首个免费的API
...性的同时增加多样性)。体验地址:https://open.bigmodel.cn/逻辑推理能力,从简单到复杂,包含一般逻辑推理和数学推理。测试 1:先来一道前段时间让很多大模型翻车的「9.11 和 9.9 哪个更大」问题,很容易就答对了。类似的数字...……更多
更多关于科技的资讯:
OPPO Find X8系列最大升级点来了:首发ColorOS 15
快科技9月28日消息,OPPO周意保发文表示,OPPO Find X8系列体验升级最大的当属ColorOS 15。其中ColorOS 15的流体云非常好用
2024-09-28 23:02:00
华为推出业界首个品宽大模型:迈向L4自动驾驶
快科技9月28日消息,在2024中国国际信息通信展会期间,华为光接入领域总裁冯志山在全光宽带高质量发展论坛发表了“加速F5G-A万兆光网商用
2024-09-28 23:02:00
国庆“拍了拍”你,这些手机功能建议开启!
盼了大半年的国庆假期,终于来了,作为“大长假”,相信很多人首先想到的就是出去玩,逃离职场换个地方透透气对于我们打工人来说再合适不过了
2024-09-28 23:05:00
一键三连,Redmi Note 14系列新品发布
日前,红米召开新品发布会,发布了RedmiNote14系列新品,包括RedmiNote14、RedmiNote14Pro以及RedmiNote14Pro+三款手机
2024-09-28 23:06:00
好画质更要性价比!微星电竞显示器超值来袭
最近,随着《黑神话:悟空》的火爆,不少玩家纷纷升级了自己的电脑配置。显卡升到了RTX40系列,处理器也换成了第14代酷睿
2024-09-28 23:06:00
AIPC时代,骁龙X Elite扛大旗,革新体验尽显AI之美
今年5月,微软与高通携手推出了20余款基于骁龙XElite和骁龙XPlus打造的Windows11AIPC设备,让AIPC概念由此前的浅尝辄止变得更加深入人心
2024-09-28 23:07:00
从S9到S10,Apple Watch的华丽蜕变你get了吗
在这个科技日新月异的时代,AppleWatch作为智能穿戴的佼佼者,每一次更新都牵动着无数科技迷的心。今天,就让我们深入剖析一下AppleWatchSeries9(S9)与Series10(S10)之间的那些不得不说的秘密
2024-09-28 23:07:00
联想Y9000P 2024 AI元启版,性价比超高的全能战士
在这个数码产品日新月异的时代,一款真正能打动人心的游戏笔记本实在是太难得了。而今天,我要给大家种草的这款联想拯救者Y9000P2024AI元启版
2024-09-28 23:07:00
iQOO Z9x评测:续航怪兽来袭,轻薄设计颠覆想象!
在这个智能手机遍地开花的时代,如何找到一款既符合预算又能满足日常需求的手机,成为了不少小伙伴们的难题。今天,就让我这个资深博主来给大家种草一款千元级智能手机——iQOOZ9x
2024-09-28 23:07:00
荣耀X60i和荣耀X50i+之间,选择哪款购买更合适?
在智能手机市场日新月异的今天,荣耀X系列再次发力,推出了两款备受瞩目的新机——荣耀X60i与荣耀X50i+。这两款手机在定价相同的情况下
2024-09-28 23:08:00
iQOO Z9 Turbo+来了,是否值得购买?看完就知道了
在智能手机市场日新月异的今天,一款真正能够引领性能潮流的手机无疑是众人瞩目的焦点。iQOOZ9Turbo+,这款搭载了天玑9300+处理器的手机
2024-09-28 23:08:00
Redmi Note 14 Pro+:五年耐用神机
在这个手机更新换代飞速的时代,一款能用上五年的手机无疑是众多消费者的梦想。而今,RedmiNote14Pro+以金刚品质
2024-09-28 23:08:00
华为Mate XT 非凡大师:三屏合一,开启折叠屏新纪元
在手机市场同质化现象日益严重的今天,一款真正能够引领潮流、打破常规的产品显得尤为难得。华为MateXT非凡大师,作为全球首款量产商用的三折叠屏手机
2024-09-28 23:08:00
红米Note 14 Pro+与K70相比较,谁才是你的菜?
在智能手机市场日新月异的今天,选择一款适合自己的手机就像是在茫茫人海中寻找那个对的人。今天,我们就来聊聊红米家族中的两位佼佼者——红米Note14Pro+与红米K70
2024-09-28 23:09:00
荣耀200pro与华为Pura70相比较,哪款手机更适合你?
在当今手机市场,选择一款适合自己的手机并非易事。今天,我们就来聊聊两款备受瞩目的手机——荣耀200pro与华为Pura70
2024-09-28 23:09:00