• 我的订阅
  • 头条热搜
语言≠思维,大模型学不了推理:一篇Nature让AI社区炸锅了
...到,人类大脑生成和解析语言的神经网络并不负责形式化推理,而且提出推理并不需要语言作为媒介。这篇论文声称「语言主要是用于交流的工具,而不是思考的工具,对于任何经过测试的思维形式都不是必需的」,引发了科技...……更多
ICML2024演讲爆火!Meta朱泽园揭秘大模型内心世界:不同于人类推理
...M) 是如何解数学题的?是通过模板记忆,还是真的学会了推理思维?模型的心算过程是怎样的?能学会怎样的推理技能?与人类相同,还是超越了人类?只学一种类型的数学题,是会对通用智能的发展产生帮助?LLM 为什么会犯...……更多
...智能的旗舰产品GPT-4为代表的大语言模型在逻辑测试中的推理表现很糟糕:它们犯下前后不一致的错误,而且推理过程往往是荒谬的。近日发表在《皇家学会开放科学》杂志上的一项研究表明,大语言模型所依赖的语料库往往反...……更多
CMU清华教LLM练成数学高手,LeanSTaR训练模型边思考边证明,登顶新SOTA
...办?CMU清华团队提出了Lean-STaR训练框架,在语言模型进行推理的每一步中都植入CoT,提升了模型的定理证明能力,成为miniF2F上的新SOTA。如果想训练LLM证明定理的能力,你会怎么做?既然模型可以通过海量语料学会生成文本,那...……更多
刚刚,OpenAI震撼发布o1大模型!强化学习突破LLM推理极限
...专门解决难题。这是一个重大突破,新模型可以实现复杂推理,一个通用模型解决比此前的科学、代码和数学模型能做到的更难的问题。OpenAI 称,今天在 ChatGPT 和大模型 API 中新发布的是该系列中的第一款模型,而且还只是预览...……更多
蚂蚁自研知识增强大模型服务框架KAG,可显著提升知识推理准确率
...地,也一定要对时间、数字和逻辑敏感,无论让它做多跳推理,还是逻辑规则数字计算,而这些恰好是大语言模型所不擅长的,包括前一段时间热议的 9.9 和 9.12 比大小的例子。基于此,我们认为在垂直领域落地的时候,大语言...……更多
奥林匹克竞赛里选最聪明的AI:Claude-3.5-Sonnet vs. GPT-4o?
...异,近来Anthropic公司最新发布的Claude-3.5-Sonnet因在知识型推理、数学推理、编程任务及视觉推理等任务上设立新行业基准而引发广泛讨论:Claude-3.5-Sonnet 已经取代OpenAI的GPT4o成为世界上”最聪明的AI“(Most Intelligent AI)了……更多
科学家竞相破解大型语言模型背后的谜团
...复杂行为。面对复杂问题,人类在潜意识里会进行分步骤推理。受此启发,谷歌团队2022年引入了“思维链提示”,以描述一种让LLM展示其“思维”的方法。简单来说,思维链提示是一种特殊的上下文学习。不同于标准提示只给...……更多
思维链让大模型推理更准确?谷歌早于OpenAI押中o1模型核心原理
...本质的不同。其不仅进入到复杂的领域,还表现出超强的推理能力。OpenAI 将 GPT-4o 和 o1 在国际数学奥林匹克竞赛资格考试方面进行对比测试。根据结果,二者差异显著,其中,前者正确解决问题的准确率是 13.4%,而 o1 的准确率...……更多
谷歌最新自然语言推理算法
谷歌发布全新反向推理算法LAMBADA,无惧搜索空间爆炸!自动推理绝对算是自然语言处理领域的一大难题,模型需要根据给定的前提和知识推导出有效且正确的结论。尽管近年来NLP领域借着大规模预训练语言模型在各种「自然语...……更多
谷歌大模型推理范式,主要分为两个阶段
...新研究“自我发现”(Self-Discover),重新定义了大模型推理范式。与已成行业标准的思维链(CoT)相比,新方法不仅让模型在面对复杂任务时表现更佳,还把同等效果下的推理成本压缩至1/40。核心策略其实很简单:千人千面。...……更多
OpenAI o1模型到博士水平了?复旦教授:没有真正推理能力,学到的还是概率相关性
...小尺寸版o1-mini。OpenAI官方发文称,新模型旨在解决复杂推理问题,训练模型在响应之前花更多时间思考,类似于人类的思考方式。“新模型在推理能力上代表了AI能力的新水平。”OpenAI称,该模型可以解决科学、编程和数学等更...……更多
郑小林:建立思维链的AI 具有里程碑意义
...段即对话式AI,AI能解决语言交互问题;第二阶段是具备推理阶段;第三阶段,AI能感知物理世界并与物理世界实现交互;第四阶段,AI将进入创新领域,具备开创新想法和技术的能力;到了第五阶段,AI将具备战略思维和自我管...……更多
ChatGPT大流行的思考-解析篇
...器人的本质区别。2. ChatGPT如何实现知识的获取、存储、推理及实时更新那究竟GPT如何有如此优秀的表现呢?我们不妨从人类学习思路入手,我们学习一般可分为获取知识-存储知识-推理知识-更新知识,而这也是GPT发展及学习的...……更多
人工智能已经可以解决复杂的数学问题了,还有哪些工作无法被取代
...决数学问题的系统,它是一个组合了自然语言处理和数学推理的系统。这个系统的作用是帮助计算机理解自然语言中的数学问题,从而能够通过推理和计算得出问题的答案。具体来说,这个系统包括多个子系统,包括自然语言处...……更多
超越ChatGPT:人类特有的思维要强化
...据驱动学习机制不可避免存在不可解释、数据依赖和逻辑推理弱等不足。忽略这些不足,可能会给全面认识ChatGPT带来一定的困扰。虚假关联带来隐患尽管ChatGPT可以“写”出人机莫辨的论文、诗歌,但当你尝试问它类似这样的问...……更多
姚期智院士大模型新研究:思维图DoT,用数学理论确保AI逻辑一致
姚期智院士领衔,推出大模型新推理框架,CoT“王冠”戴不住了。提出思维图(DiagramofThought),让大模型思考更像人类。团队更是为这种推理过程提供了数学基础,通过拓扑斯理论(Topos Theory)正式化(formalize)DoT,确保其逻...……更多
9.11和9.9哪个大?实测12个大模型8个都答错,ChatGPT也翻车了
...模型的短板,此前行业也多次讨论过大模型的数学和复杂推理能力较差,即便是目前最好的大模型GPT-4也仍然有很大进步空间。最近的一次,第一财经曾在6月报道过,根据司南评测体系OpenCompass的高考全卷测试,包括GPT-4在内,7...……更多
Bengio团队提出多模态新基准,直指Claude 3.5和GPT-4o弱点
...型开发的关键指导之一便是如何让机器像人类一样思考和推理。诸如注意力机制和思维链(Chain-of-Thought)等技术正是由此产生的灵感。然而,可能很多人并没有意识到,很多对人类来说很简单的认知任务也往往伴随着非常复杂...……更多
...大模型加入数学领域的解题算法。“OpenAI说GPT-4有强大的推理能力,我感觉主要指的是它的数学水平高。”赵海告诉记者,“其实,推理能力包含逻辑推理能力和数学抽象思维能力,这两种能力是有区别的,前者侧重寻找因果关系。相...……更多
AI发展变慢了?几位AI头部创业者并不赞同
...月份发布的GPT-4o(多模态语言大模型),9月份发布的o1(推理大模型),质量都可圈可点。与去年相比,他认为,今年AI行业的特色是,之前只有OpenAI一家独大,现在已经变成了群雄并起、你追我赶的状态,各家公司都在提速。...……更多
重磅!OpenAI o1模型还没有实现真正的逻辑推理能力
...-preview和o1-mini模型已经可以使用。OpenAI宣布,“新模型在推理能力上代表了人工智能能力的新水平,因此,计数器将重置为1”。根据OpenAI的自测,o1在竞赛编程问题(Codeforces)中排名第89个百分点,在美国数学奥林匹克竞赛(AIM...……更多
商汤科技与金山办公达成商业合作,“日日新”大模型补强办公软件理科大脑
...直是大模型的痛点,理科领域需要高度的抽象思维和逻辑推理能力,并且要求非常精准的答案,作为计算机科学和信息技术领域的重要工具,代码能力被视作衡量大模型智慧的关键维度。事实上,在过去一年国产大模型如火如荼...……更多
知乎 AI 革命:智能搜索与实时问答的融合
...生成,将这些答案里的有价值信息提炼出来,进行有效的推理,就能为一个 \" 新鲜出炉 \" 的专业问题提供一个立等可取的答案,提问的用户就可以能为快,然后再等其它的专业答主陆续赶到,下场答题。 在灰度测试这个功能...……更多
o1带火的CoT到底行不行?新论文引发了论战
...To CoT or not to CoT?OpenAI ο1 的诞生极大地提升了人们对 LLM 推理能力和思维链(CoT)的兴趣。一时之间,似乎思维链很快就会成为所有 LLM 的标配,但思维链并非万能,就连 OpenAI 自己也提到 o1 在某些任务上的表现并不比 GPT-4o 强...……更多
人类和AI在推理任务中的表现相似,Google DeepMind研究揭示AI局限性
...人工智能(AI),特别是大型Transformer语言模型(LMs)在推理任务中的表现及其局限性。研究结果显示,尽管这些模型在处理自然语言方面表现卓越,但在复杂逻辑推理任务中,人类和语言模型都会受到语义内容合理性和可信度...……更多
Meta首款多模态Llama 3.2开源!1B羊驼宝宝,跑在手机上了
...I正在壮大。 能力一览11B和90B这两款模型,不仅支持图像推理场景,包括图表和图形在内的文档级理解、图像描述以及视觉定位任务,而且还能基于现有图表进行推理并快速给出回答。比如,你可以问「去年哪个月销售业绩最好...……更多
刚刚,Llama 3.2 来了!支持图像推理,还有可在手机上运行的版本
... Meta 对 Llama 模型来了一波大更新:不仅推出了支持图像推理任务的新一代 Llama 11B 和 90B 模型,还发布了可在边缘和移动设备上的运行的轻量级模型 Llama 3.2 1B 和 3B。不仅如此,Meta 还正式发布了 Llama Stack Distribution,其可……更多
ChatGPT 火爆,程序员会不会被取代?答案都在这里!
...评测方法、大模型如何能持续学习、怎么显著提升训练和推理的效率这等。从左起:吴海涛、肖仰华、王文广、蒋涛、林咏华、于建岗、王千祥、王昊奋复旦大学教授肖仰华:大模型绝不仅仅是模型系统和算力,数据是非常重要...……更多
昆仑万维:“天工大模型3.0”将于4月17日正式发布 同步开源4000亿参数MoE超级模型
...“天工2.0”MoE大模型,“天工3.0”在模型语义理解、逻辑推理、以及通用性、泛化性、不确定性知识、学习能力等领域拥有惊人的性能提升,其模型技术知识能力提升超过20%,数学/推理/代码/文创能力提升超过30%。同时,“天工...……更多
更多关于科技的资讯:
王会广 报道 通讯员 李杰 张立为进一步提高自助设备和智慧柜员机管理员的管理能力,提高服务水平,树立良好的社会形象,近日
2024-09-29 14:37:00
超多补贴优惠!陕西西咸新区沣西新城第六届消费购物节明日启动
西咸新区消费品以旧换新展销暨沣西新城第六届消费购物节将于9月30日至10月2日在沣西吾悦广场拉开帷幕。品牌车、家居家电统统来袭
2024-09-29 14:39:00
滨州:推动高端铝产业向“新”提“质”,加快培育和形成新质生产力
鲁网9月29日讯9月27日,滨州市政府新闻办组织召开“走在前、挑大梁”奋力谱写中国式现代化最美滨州篇章主题系列新闻发布会——邹平市专场
2024-09-29 14:40:00
2024年世界互联网大会“互联网之光”博览会将于今年第四季度在浙江乌镇举办,主要设置展览展示、新产品新技术发布、产业合作对接
2024-09-29 14:50:00
《AI交互H5 | 京津冀这十年》互动有奖,火热进行中 扫码阅读手机版
天津北方网讯:津云新媒体策划的《AI交互H5 | 京津冀这十年》推出后,引起热烈反响,H5作品中“游戏车厢”“寻美车厢”设置的互动和活动正在火热进行中
2024-09-29 14:51:00
浪潮通信信息亮相2024 PT展,展示AI+算力网络新成果
近日,第32届中国国际信息通信展(PT EXPO CHINA 2024,简称PT展)在北京国家会议中心举行。浪潮通信信息以“AI+算力网络”为主题
2024-09-29 15:48:00
一说到做手术很多人第一反应就是费时费力想做近视手术的小伙伴总因幻想中的时间成本而不断搁置摘镜计划其实近视手术并不需要耗费大量时间那么
2024-09-29 15:49:00
国庆另辟“熙”径 华熙LIVE打造快乐加油站
送走夏的躁动,秋日的和煦阳光洒满大地,大家期盼已久的国庆黄金周终于要来了。无论是疲惫的生活中需要松弛和治愈,还是想独辟蹊径在平淡的生活里重拾激情和新鲜感
2024-09-29 15:59:00
全新旗舰轿车谍照曝光,有望为华为、江淮合作的“尊界”旗下车型
IT之家 9 月 29 日消息,上周末起,陆续有汽车博主晒出一辆神秘的旗舰级轿车的路试谍照。新车覆盖了厚重的车衣和伪装
2024-09-29 18:05:00
Layout工程师危矣?谷歌推出芯片自动设计工具:联发科已采用!
虽然近年来各大EDA公司都在积极的将AI引入到自己的芯片设计工具当中。但是早在2020年,谷歌就发布了题为《Chip Placement with Deep Reinforcement Learning》预印本论文
2024-09-29 18:07:00
首销斩获“冠军”,售价突降1091元,骁龙8sGen3+三主摄+66W无线充电
荣耀200系列自打它在6月份横空出世,就一路攻城略地,斩获了各种新品销量榜单的冠军称号。毕竟有颜有料,谁看了不心动?但各位小伙伴们
2024-09-29 18:07:00
荣耀急眼了!12GB+256GB+5800mAh,高性价比千元机重回低价
智能手机从诞生的那一刻开始,就给人留下了不耐摔的印象,因为智能手机不同于功能机,它有一个大屏幕,并且为了追求轻薄,内部元器件非常紧密
2024-09-29 18:07:00
π空间揭开面纱,“人车家生活方式聚合场”启幕
业界一直猜测的“π空间”终于解开面纱,“人车家生活方式聚合场”走出想象。2024年9月27日,经过十个月的精心筹备,由建发汽车(集团)携手美凯龙家居集团共同打造的π空间项目首店落子红星美凯龙成都佳灵商场
2024-09-29 16:13:00
“创业服务基层行”活动在万宁举办 创业导师带领企业开展沙盘模拟演练
南海网9月29日消息(记者 谭琦)通过沙盘模拟企业经营有哪些收获?9月26日,在万宁举办的“创业服务基层行”活动吸引近10余名企业代表及创业青年参加
2024-09-29 16:20:00
科研实证赢得消费者青睐:高端婴幼儿奶粉市场迎来新机遇
鲁网9月29日讯随着出生人口放缓,婴幼儿配方奶粉市场正经历着一场转型升级,面对严重内卷的渠道价格和同质化产品,不少国际巨头已经将重点放在了核心科研的差异化竞争上
2024-09-29 16:27:00