• 我的订阅
  • 头条热搜
重磅!OpenAI o1模型还没有实现真正的逻辑推理能力
...二、社会评测与同行水平社会评测普遍认可o1 系列模型的逻辑推理能力优于 GPT-4o,但也有很多人提出了不同看法。差评XPIN邀请了理综三科的博士测评,物理评价较高,而生物、化学评价较低,综合认为o1在认知上达到硕士水平...……更多
重磅!TeleAI 完成首个全国产化万卡万参大模型训练
...一在今年5月的 OpenCampass 测试榜单中,TeleChat 系列模型的逻辑推理能力名列开源大模型榜单第一。作为新一代版本,TeleChat2-115B 在9月最新公布的 C-Eval 评测 Open Access 模型综合榜单中,以 86.9 分的成绩排名第一。其通用能力较 Tele……更多
昆仑万维:“天工大模型3.0”将于4月17日正式发布 同步开源4000亿参数MoE超级模型
...一代“天工2.0”MoE大模型,“天工3.0”在模型语义理解、逻辑推理、以及通用性、泛化性、不确定性知识、学习能力等领域拥有惊人的性能提升,其模型技术知识能力提升超过20%,数学/推理/代码/文创能力提升超过30%。同时,“...……更多
罗格斯大学团队提出思想链概念,提高大模型的算数推理能力
...概念,提高了大语言模型(LLM,large language models)在复杂推理任务上的性能,例如算术推理、常识推理和符号推理等。图 | 金明宇(来源:金明宇)CoT 的原理是通过提供推理过程的示例,来教会模型处理推理,详细说明导致最...……更多
商汤又“夺金”!SuperCLUE-V多模态大模型基准发布10月榜单
...度30个二级维度。报告称SenseChat-Vision 5.5在基础能力-数理逻辑推理任务如图表推理、场景推理方面具备领先优势。榜单显示,在数理逻辑分析能力中,SenseChat-Vision 5.5超越国内外所有参评模型包括GPT-4o的最新版本,位列第一。Super...……更多
奥林匹克竞赛里选最聪明的AI:Claude-3.5-Sonnet vs. GPT-4o?
...竞赛不仅是对人类(碳基智能)思维敏捷性、知识掌握和逻辑推理的极限挑战,更是AI(“硅基智能”)锻炼的绝佳练兵场,是衡量AI与“超级智能”距离的重要标尺。OlympicArena——一个真正意义上的AI奥运竞技场。在这里,AI不...……更多
人类和AI在推理任务中的表现相似,Google DeepMind研究揭示AI局限性
...,尽管这些模型在处理自然语言方面表现卓越,但在复杂逻辑推理任务中,人类和语言模型都会受到语义内容合理性和可信度的影响,表现出类似的错误倾向。研究背景人类在推理过程中存在两种系统:“直觉系统”和“理性系...……更多
姚期智院士大模型新研究:思维图DoT,用数学理论确保AI逻辑一致
...看看DoT长啥样。大模型复杂推理新框架 如前所述,DoT将逻辑推理过程建模为在单个LLM内构建有向无环图(DAG)。其框架内部管理三个关键角色:提议者:生成命题或推理步骤,添加新节点。 批评者:评估命题,识别错误、不...……更多
苹果新论文证明LLM大模型存在缺陷!没有进行真正的逻辑推理
...地依赖于训练数据中的模式进行预测。当需要进行真正的逻辑推理时,这些模型往往无法产生合理的结果,这一发现对人工智能的发展提供了重要的参考。虽然LLM在许多领域表现优异,但其推理能力仍有待改进。【本文结束】如...……更多
AI新时代揭幕!会“思考解题逻辑”的OpenAI推理大模型登场
...凌晨1时许,AI时代迎来崭新的起点——能够进行通用复杂推理的大模型终于走到台前。OpenAI在官网发布公告称,开始向全体订阅用户开始推送OpenAI o1预览模型——也就是此前被广泛期待的“草莓”大模型。OpenAI表示,对于复杂推...……更多
2023IDEA大会:让大模型更好应对复杂问题
...外籍院士沈向洋在会上发表主旨演讲,发布IDEA研究院的重磅研产结晶与市场化成果;在大咖云集的论坛环节,多位领军科学家、企业家、创业者同台论道,碰撞“学研产投”灵感。2023年,AI技术给人类生活带来撼动,一个个看...……更多
...个只有8%。研究人员根据答案是否正确以及答案所包含的逻辑推理是否有效,对大语言模型的答案进行了分类。实验的第一个结果是,在每个测试重复十次的情况下,答案是不一致的。例如,在同一个测试中,有的模型十次中答...……更多
Anthropic再反击!发布Claude 3.5吊打GPT-4o,视觉、逻辑推理等方面表现更强
...个版本Claude 3.5 Sonnet。从官方披露的测试数据来看,其在逻辑推理、编程、数学等方面中的表现性能均超越GPT-4o。网友直言,“太卷了,现在AI竞争是要以周为单位了吗?” 从官方介绍来看,Claude 3.5全家桶仍会有3款系列模型,...……更多
中国首个音乐SOTA模型「天工音乐大模型」今日公测
...,是全球最大的开源MoE大模型。「天工3.0」在语义理解、逻辑推理、通用性、泛化性、不确定性知识、学习能力等领域拥有突破性的性能提升,数学/推理/代码/文创能力提升超过30%。 (天工3.0模型参数超越Grok-1,成全球最大开...……更多
昆仑万维重磅发布天工AI高级搜索功能,做最懂金融投资、科研学术的AI搜索
...提供深度洞察。系统能够理解复杂的上下文关系,并通过逻辑推理为用户提供高质量的解决方案,做更懂你、更省心、更精准的AI搜索。推理能力的跨越式提升,离不开数据和信源检索技术的升级。在数据上,天工AI投入了巨大...……更多
影响英伟达根本逻辑的大争论:OpenAI改变策略意味着什么?谁在撒谎?
大模型预训练“缩放定律”定律失效?模型推理成“解药”,英伟达一家独大格局要变天?“缩放定律”指导下,AI大模型预训练目前遭遇瓶颈。据路透12日报道,硅谷主要AI实验室的新模型训练计划目前普遍进展不顺,新模型...……更多
科学家推出大模型数据集,涵盖奥赛数学题,有望让AI辅导数学课程
...23 年 2 月。当时,已经有一些研究团队开始使用大模型做逻辑推理和数学推理。赵子龙和合作者也认为这个方向很有前景。他表示让自己印象最深的例子就是 OpenAI 网站上的一道数学推理的题: Simplify tan100 + 4sin100。根据 OpenAI 自...……更多
蚂蚁自研知识增强大模型服务框架KAG,可显著提升知识推理准确率
...地,也一定要对时间、数字和逻辑敏感,无论让它做多跳推理,还是逻辑规则数字计算,而这些恰好是大语言模型所不擅长的,包括前一段时间热议的 9.9 和 9.12 比大小的例子。基于此,我们认为在垂直领域落地的时候,大语言...……更多
给小学数学题加句废话,OpenAI o1就翻车了,苹果论文质疑AI推理
...降。我们假设这种下降是因为当前的 LLM 无法进行真正的逻辑推理;相反,它们试图复制在训练数据中观察到的推理步骤。」这一结论得到了 Keras 之父 François Chollet 和美国心理学家、认知科学家 Gary Marcus 的转发,他们一直对 AI ...……更多
港中文团队提出大模型元推理范式,革新大模型的评价体系
...一定启示。日前,相关论文以《大型语言模型评价中的元推理革命》(MR-GSM8K: A Meta-Reasoning Revolution in Large Language Model Evaluation)为题发在 arXiv,曾忠燊是第一作者,香港中文大学教授贾佳亚担任通讯作者 [1]。图……更多
百川智能发布baichuan3稳定语言模型
...语言处理和代码生成领域的强大实力。不仅如此,其在对逻辑推理能力及专业性要求极高的MCMLE、MedExam、CMExam等权威医疗评测上的中文效果同样超过了GPT-4,是中文医疗任务表现最佳的大模型。Baichuan3还突破“迭代式强化学习”...……更多
号称博士生水准!OpenAI最新模型仍分不出9.11和9.8哪个大
...出现的松鼠。这类游戏的逻辑相对复杂,更考验OpenAI o1的逻辑推理能力。官方还表示,相较于GPT-4o等现有的大模型,OpenAI o1能够解决更加困难的推理问题,同时改善过往模型中存在的机制性缺陷。比如在解答编程问题时也会更有...……更多
谷歌最新自然语言推理算法
...读理解和问答等任务中取得了极高的性能,但这些模型在逻辑推理方面的性能仍然十分滞后。去年5月「思维链」(ChainofThought,CoT)横空出世,有研究人员发现,只需要在prompt中加入「Let\'sthinkstepbystep」就能让GPT-3的推理性能大幅...……更多
腾讯大模型混元Turbo:御气升昺云,梓桐金鼎开
...不足,腾讯还特别强化了模型在高质量文本创作、数学和逻辑推理等方面的能力。 文本创作能力的显著提升在文本创作领域,大多数大模型表现平平,尤其在专业写作方面,常常缺乏足够的灵活性和精准度。混元Turbo在这方面...……更多
大模型降价背后,国产大模型的竞争逻辑变了
...市场拱手让人。另一方面,随着大模型产业的快速发展,推理成本飞速下降,也成为终端降价的基础。据百度官方透露,相比一年前,文心大模型的算法训练效率提升到了原来的5.1倍,周均训练有效率达到98.8%,推理性能提升了1...……更多
让OpenAI o1逆天的慢思考,360两月前就做出来了?周鸿祎CoE媲美CoT,应用太前瞻
...势以外,CoE模型在其余11项指标上均优于GPT-4o,特别是「逻辑推理」、「多步推理」、「诗词赏析」这类比较具有中文特色的问题,CoE的领先优势更加明显。目前,360的「多模型协作」已经能打败并远远甩开GPT-4o,媲美o1-preview。...……更多
...我们需要结合快思考的‘黑盒’预测和慢思考的‘白盒’逻辑推理,打造‘灰盒’可信大模型。具体而言,通过融合科学规律、观测数据和合成数据,开发理解物理世界的垂直领域科学大模型。”作为本届大赛评委会主席,上智...……更多
位列第一梯队,腾讯混元再度领跑国内大模型
...、多维度的综合性测评基准,由十大基础任务组成,包括逻辑推理、代码、语言理解、长文本、角色扮演等。本次报告选取了国内外具有代表性的32个大模型4月份的版本,通过多维度综合性测评,真实准确地反映了国内外大模型...……更多
菲尔兹奖得主亲测GPT-4o,经典过河难题破解失败!最强Claude 3.5回答离谱,LeCun嘲讽LLM
...水平(图中0.0边界)甚至超越,其中不乏非常有挑战性的逻辑推理任务,比如需要复杂多步骤推理的BBH(Big-Bench Hard)和数学应用题测试集GSK8k。其中的HellaSwag测试集,由华盛顿大学和Allen AI在2019年推出,专门针对人类擅长但LLM...……更多
ChatGPT 火爆,程序员会不会被取代?答案都在这里!
...自己躬身入局深耕多年来的思考与实践经验,还带来数个重磅发布,都是进入人工智能新十年的“趁手兵器”:华为云与 CSDN 联合发布“智能化编程助手 Snap”,支持 IntelliJ、PyCharm、VS Code 等主流 IDE,不仅可以自动生成代码,还...……更多
更多关于科技的资讯:
罗永浩:建议大家购买新能源汽车时优先考虑二手 更具性价比
快科技11月15日消息,瓜子二手车亮相2024广州车展,这次瓜子二手车邀请罗永浩担任首席砸价官,罗永浩现场抡大锤砸穿新能源底价
2024-11-15 20:21:00
2699元起 ROG THOR雷神III 1200/1000W电源上架:引入GaN氮化镓
快科技11月15日消息,ROG THOR雷神III 1200/1000W电源目前已经上市,首发2699元。据悉,新款电源支持最新的ATX 3
2024-11-15 20:21:00
RTX 50全系升级12V-2x6供电接口!最高功率450W
快科技11月15日消息,RTX 40全系标配了新一代12VHPWR 16针供电接口,但因为缺陷而在RTX 4090上出现了多次烧毁事件
2024-11-15 20:51:00
本文转自:人民网-广西频道近年来,百色紧抓发展机遇,创新前行,积极投身于智慧城市建设,并在2024年印发了《“数字百色”工作方案》
2024-11-15 21:03:00
微软宣布暂停windows11新功能更新直至2025年
微软一直在Windows11的各种测试版中不断推出新功能,但现在要放缓下更新的脚步了。微软宣布,将暂停Windows11的新功能更新直至2025年
2024-11-15 21:24:00
中国消费者报太原讯(记者冯铁飞)11月15日,山西省市场监管局质量技术科技帮扶员派驻启动会在太原市召开。山西省市场监管局党组书记
2024-11-15 21:29:00
四川星马重工机械有限公司:22项专利驱动智能制造,乐至新星闪耀科技之光
本文转自:人民网-四川频道11月14日,在位于四川乐至经济开发区的四川星马重工机械有限公司生产车间里,只见工人们正专注地操作着激光切割机床
2024-11-15 21:54:00
融入新发展格局!汇川工业经济稳健前行
多彩贵州网讯 “物流车到了吗?赶快!这批货要发出去。”“单子打好了,现在装车。”……近日,走进位于汇川区遵绥路的遵义金紫阳食品有限公司
2024-11-15 22:29:00
11月15日,阿里巴巴集团发布2025财年第二季度财报,核心业务保持稳健增长。在当晚的分析师电话会上,集团CEO吴泳铭表示
2024-11-15 22:39:00
自行车受宠200年 | 知书
作为一项无法确定发明者的发明,自行车动态多元的特质在200多年前就已注定。再没有哪种交通工具能如此彰显平民性与创造力,承载流动的生活与自由的梦想
2024-11-15 16:36:00
助力进博,服务客户!德必这趟进博服务“专列”被点赞
2024年11月,第七届中国国际进口博览会(以下简称“进博会”)在国家会展中心如期举行。在这场汇聚全球精品、引领行业潮流的盛会背后
2024-11-15 16:45:00
龙芯中科“龙牙计划”首批联合创新实验室名单揭晓!38所高校入选:有你母校没
快科技11月15日消息,今天,龙芯中科官方发布了龙牙计划首批联合创新实验室名单,共有38所高校入选。据了解,龙芯中科于今年8月启动“LoongArch生态联合创新实验室-龙牙计划”项目
2024-11-15 16:50:00
都11月了!今年为啥还有这么多台风啊
今年立冬以后,短短的 4 天就有 3 个台风相继生成。很多网友不禁感到好奇:这都冬天了,为什么还有这么多台风?这究竟是怎么回事呢
2024-11-15 16:50:00
甜啦啦联合创始人许周分享品牌破卷成长之道,助力新茶饮产业高质量发展
本文转自:人民网-安徽频道11月13日,由中国新餐饮产业联盟、中国新茶饮产业联盟举办的《首届中国新茶饮产业大会暨2024年度中国茶饮红榜颁奖盛典》于上海新国际博览中心盛大启幕
2024-11-15 16:50:00