• 我的订阅
  • 头条热搜
人类和AI在推理任务中的表现相似,Google DeepMind研究揭示AI局限性
...是大型Transformer语言模型(LMs)在推理任务中的表现及其局限性。研究结果显示,尽管这些模型在处理自然语言方面表现卓越,但在复杂逻辑推理任务中,人类和语言模型都会受到语义内容合理性和可信度的影响,表现出类似的...……更多
打脸“AI灭绝伦”!研究反驳:大模型涌现能力不会威胁人类生存
...一般。他们表示,这一发现有助于理解 LLM 的实际能力和局限性,并为未来的模型优化提供新的方向。 智能涌现:只是“即兴表演”?AI 大模型的“涌现能力”来自哪里?它是否真如听起来那样神秘,甚至令人担忧?为了破解...……更多
语言≠思维,大模型学不了推理:一篇Nature让AI社区炸锅了
...也有人表示经过实测可见,它仍然具有 Transformer 架构的局限性。对此,图灵奖获得者 Yann LeCun 表示,问题不在于 Transformer,而是因为 Claude 3.5 仍然是一个自回归大模型。无论架构细节如何,使用固定数量的计算步骤来计算每个 t...……更多
Bengio团队提出多模态新基准,直指Claude 3.5和GPT-4o弱点
...的字幕恢复任务巧妙地揭开了现有模型图像 - 文本对齐的局限性,以及模型与人类在高级认知任务上的推理能力差异。相信这一任务可以启发未来更加有效的 VLM 训练、评测和推理方法,进一步拉近多模态模型和人类认知能力的...……更多
给小学数学题加句废话,OpenAI o1就翻车了,苹果论文质疑AI推理
...新生也会被误导,或许人类在推理方面具有和 LLM 类似的局限性。论文概述论文标题:GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models 论文地址……更多
AI新时代揭幕!会“思考解题逻辑”的OpenAI推理大模型登场
...基准测试中,表现能够与博士生水平类似。该讲讲缺点和局限性了不难理解,会自己思考问题的AI模型,对于程序员、创意工作者,以及几乎所有的理科相关专业工作者而言是有益的升级,但这个新模型也有局限性。首先,OpenAI ...……更多
全球首篇!调研近400篇文献,鹏城实验室&中大深度解析具身智能
...的具身机器人和具身仿真平台,深入分析了其研究重点和局限性。接着,透彻解析了四个主要研究内容:1)具身感知,2)具身交互,3)具身智能体和 4)虚拟到现实的迁移,这些研究内容涵盖了最先进的方法、基本范式和全面的数据...……更多
GPT刚刚公开「草莓」项目:推理能力翻倍,定价200美元?
...,这也意味着它在处理图像、视频等复杂数据时可能面临局限性。 还有价格。首先要说明的是,在官方还未发布甚至官宣定价之前,实际「草莓」模型的价格是个未知数。但几乎可以肯定,「草莓」模型的训练和推理成本都会...……更多
对标o1,Kimi放出了最能打的国产模型
...LaTeX 格式难以描述的几何图形类问题。此外,它还有一些局限性需要突破,包括对于过于简单的数学问题。例如「1+1=?」,k0-math 模型可能会过度思考。「意图增强」等三大推理能力注入 Kimi 探索版新的强化学习技术范式带来的...……更多
突破时间序列组合推理难题!南加大发布一站式多步推理框架TS-Reasoner
...良好,但难以应对需要结构化多步推理的复杂任务。这种局限性在需要综合多个时间序列信息的复合问题中尤为突出,限制了模型在复杂应用场景中的适用性。为了应对这些挑战,南加州大学的研究人员提出了一种全新的时间序...……更多
智能体首达Kaggle Grandmaster,华为结构化推理补齐思维链短板
...经验来实现更据适应性的学习。这能克服思维链等方法的局限性。如图 2 所示。 左侧是基本思维链推理,其按顺序生成中间步骤,其中每个步骤都是下一步骤的直接条件,直到得到最终答案。右侧是新提出的结构化推理方法,...……更多
苹果新论文证明LLM大模型存在缺陷!没有进行真正的逻辑推理
...论文,揭示了大型语言模型(LLM)在数学推理方面的显著局限性。尽管这些模型在生成人类水平的文本方面表现出色,但当处理简单的数学问题时,即使问题仅进行了微小的改动,如添加无关信息,模型的表现也会急剧下降。在...……更多
重磅!OpenAI o1模型还没有实现真正的逻辑推理能力
...工智能在复杂逻辑推理、抽象概念理解上,还存在明显的局限性。数学、物理和围棋虽然都强调逻辑思维,但侧重点不同。围棋侧重于空间布局和策略选择。数学、物理的基本概念和公理构成了一个演绎系统,通过这些基本元素...……更多
对话王田苗:万亿市场之下,大模型 + 机器人还有四大问题未解决
...在解决复杂环境感知、动作生成、灵巧操作等问题时存在局限性。尽管大模型增强了其学习、语义理解、推理及判断能力,但在从理解、推理、判断、执行到运动系列过程中,还涉及其他多种模型算法和软硬件协同的问题,包括...……更多
87.8%准确率赶超GPT-4o登顶!谷歌DeepMind发布自动评估模型FLAMe
...低的偏见,同时能够有效地识别代码生成的高质量响应。局限性和未来工作由于评估标准不断变化以及评估新的LLM功能的需要,评估LLM具有挑战性,通过开源贡献扩大我们的数据收集范围可以解决这个问题。此外,模型主要在上...……更多
李飞飞最新报告:美去年AI领域私人投资是中国近9倍,中国仍是美最大竞争对手
...这种做法使得系统比较和判断人工智能模型存在的风险和局限性的工作变得更加复杂。4.经济生成式AI领域投资激增。据统计,尽管去年人工智能领域的总体投资有所下降,但生成式AI领域的投资资金激增,比 2022 年增加了近八倍...……更多
2023IDEA大会:让大模型更好应对复杂问题
...存在深度推理能力差、知识不可追溯、实时更新代价高等局限性,这也成为其在许多严肃领域落地的主要瓶颈。如何弥补大模型的这部分缺陷,是当下AI应用的重要课题。为此,IDEA研究院团队研发了思维图谱技术,让大模型和知...……更多
综合RLHF、DPO、KTO优势,统一对齐框架UNA来了
...能够处理二元数据(如正向和负向反馈),但它同样有其局限性,无法统一处理不同类型的反馈数据,也无法有效利用已有的奖励模型。在这种背景下,来自 Salesforce、厦门大学的研究团队提出了一种名为 UNA 的新方法,它通过...……更多
...AI)系统在编码、战略规划和机器人科学三个领域执行复杂推理任务。聊天生成预训练转换器(ChatGPT)和“克劳德3-奥普斯”(Claude 3 Opus)等大语言模型(LLM),根据人类输入“提示词”处理和生成文本。研究人员说,过去18个月,这些技...……更多
5年后ai所需算力超100万倍
...定义限制在人工智能领域内,同时忽略了人工智能固有的局限性以及人类、机器和事物之间三元互动的重要作用。另一个学派将智能计算(intelligentcomputing)视为计算智能(computationalintelligence),模仿人类或生物智能来实现解决...……更多
RAG没有银弹!四级难度,最新综述覆盖数据集、解决方案,教你「LLM+外部数据」的正确使用姿势
...种主要形式:上下文、小模型和微调,分析各自的优势、局限性以及适合解决的问题类型。级别1:显式事实查询(explicit fact queries)例:2024年夏季奥运会将在何处举行?Where will the 2024 Summer Olympics be held?这类查询是最简单的形.……更多
...智能的旗舰产品GPT-4为代表的大语言模型在逻辑测试中的推理表现很糟糕:它们犯下前后不一致的错误,而且推理过程往往是荒谬的。近日发表在《皇家学会开放科学》杂志上的一项研究表明,大语言模型所依赖的语料库往往反...……更多
罗格斯大学团队提出思想链概念,提高大模型的算数推理能力
...概念,提高了大语言模型(LLM,large language models)在复杂推理任务上的性能,例如算术推理、常识推理和符号推理等。图 | 金明宇(来源:金明宇)CoT 的原理是通过提供推理过程的示例,来教会模型处理推理,详细说明导致最...……更多
谷歌大模型推理范式,主要分为两个阶段
...新研究“自我发现”(Self-Discover),重新定义了大模型推理范式。与已成行业标准的思维链(CoT)相比,新方法不仅让模型在面对复杂任务时表现更佳,还把同等效果下的推理成本压缩至1/40。核心策略其实很简单:千人千面。...……更多
Meta版慢思考来了!田渊栋团队整合快慢思考,能走迷宫推箱子
...本更低。能解决迷宫、推箱子等复杂问题。通过让模型在推理轨迹和最终答案上进行训练,再基于特定策略丢掉部分轨迹,Dualformer模型可以在模仿慢思考的同时,像快思考一样走捷径。由此能形成更简洁的思维链(CoT)。从结...……更多
支持1024帧、准确率近100%,英伟达「LongVILA」开始发力长视频
...也不足以处理长上下文 VLM 工作负载。在确定现有系统的局限性之后,研究者得出结论,一个理想的多模态序列并行方法应该通过解决模态和网络异构性来优先实现效率和可扩展性,并且扩展性不应受到注意力头数量的限制。 MM...……更多
补齐Transformer规划短板又不放弃快速思考,Dualformer双重优势
...些解答或慢点思考。OpenAI ο1 模型的发布掀起了人们对 AI 推理过程的关注,甚至让现在的 AI 行业开始放弃卷越来越大的模型,而是开始针对推理过程进行优化了。今天我们介绍的这项来自 Meta FAIR 田渊栋团队的研究也是如此,其...……更多
...版本依旧存在幻觉问题、运行速度较慢及成本高昂等诸多局限性,限制了其应用范围。与之相比,更早提出“慢思考”概念的360通过其首创的CoE(Collaboration of Experts,专家协同)技术架构及混合大模型对“慢思考”进行落地实践,...……更多
新物种?联想Tech World 2024:AI的一切才刚刚开始
...在网络速度、云端效率、成本考量、数据隐私等方面存在局限性。而在混合式人工智能框架中,个人大模型和企业大模型,以及在其基础上开发出的个人智能体和企业智能体,将与公有大模型共存互补,提供更加个性化的服务并...……更多
​首个自主机器学习AI工程师,刚问世就秒了o1,Kaggle大师拿到饱
...时通常会有几十种算法可用,每种算法都有自己的优势和局限性,选择正确的方法成为一个关键的决策点。仅神经网络就提供了无数的架构可能性,从简单的前馈网络到 Transformer,每个模型都需要仔细调整超参数。计算资源增加...……更多
更多关于科技的资讯:
行业新标杆丨科华携手国家电网打造新一代大型数据中心新典范
数字化、智能化成为今年全国两会的高频词,以数据资源作为关键生产要素的数字经济成为国家级增长的关键。作为承担着经济发展重任的大型电力央企
2025-03-13 11:00:00
如何将TikTok收益提至国内账户?
如何将在TikTok上赚得的美元转换成人民币提至国内账户中,成为了许多人关注的问题。今天就带各位了解一下如何高效的将TikTok收益提至国内账户
2025-03-13 11:15:00
中国经济网北京3月13日讯 3月12日,北京人形机器人创新中心(国家地方共建具身智能机器人创新中心)在京发布了全球首个“一脑多能”
2025-03-13 11:28:00
九测科技丨公交测酒仪正式上线,为公交安全保驾护航
在繁忙的都市生活中,公交车作为城市流动的血脉,承载着无数人的日常出行。然而,在享受公交带来的便捷之时,公交驾驶员的安全意识与身体状况
2025-03-13 11:35:00
化工行业近年来在全球范围内经历了一系列关键转型与升级。尤其在“互联网+”的背景下,化工行业的发展呈现出更加多元化和智能化的趋势
2025-03-13 11:37:00
我国在三维世界造出二维金属!厚度为头发丝二十万分之一
本文转自:人民日报客户端在我国神话传说中,“重塑金身”的故事流传已久,像哪吒以莲藕重塑肉身,关键就在于材料的选择。无独有偶
2025-03-13 11:47:00
长虹厨卫焕新升级,开启健康生活“虹”利时代
在国家“以旧换新”政策加码下,消费升级正在加速推动,而厨卫行业也正经历着深刻变革。消费者不再仅仅满足于产品的基本功能,对绿色环保
2025-03-13 12:00:00
3月13日,阿里巴巴宣布推出AI旗舰应用——新夸克。新夸克基于阿里通义领先的推理及多模态大模型,全面升级为一个无边界的“AI超级框”
2025-03-13 12:00:00
集联网络:虹膜识别,高安全等级的“火眼金睛”
树立行业标杆,讲好中国故事,传递中国声音,充分展现腾飞的中国经济、崛起的民族品牌和向上的企业家精神。近日,“崛起的民族品牌”专题系列节目对话北京集联网络技术有限公司(简称
2025-03-13 12:01:00
□卫烨2025年开年之际,中国低空经济以破竹之势划破长空。作为改写区域经济版图、重构产业竞争格局的战略性新兴产业,低空经济继续成为今年全国两会期间的热点话题
2025-03-13 12:31:00
董明珠回应格力造车进展:不做家用车,这不叫放弃而是战略选择
近日,四川成都,格力电器董事长兼总裁董明珠接受采访回应格力造车进展时,董明珠说格力不造家用车:我们不做小轿车,但环卫车
2025-03-13 12:40:00
一博主从小米车标中炼出黄金,雷军曾喊话“不要打车标的主意”
3月11日,一汽车博主发布视频显示,其将自己最新购买的小米SU7 Ultra的车标扣下送去炼金厂进行提炼,从中提炼出0
2025-03-13 12:44:00
在全球数字经济与跨境电商深度融合的浪潮中,中国企业家林蕾凭借其敏锐的市场洞察力、卓越的技术创新能力和全球化战略思维,带领福州家易鑫信息科技有限公司(以下简称“家易鑫”)在北美市场开辟了一条独特的品牌出海之路
2025-03-13 13:05:00
IGT生态即将上线,InFinitar共识加持引爆GameFi!
GameFi即将迎来重大突破!据悉,InFinitar生态即将迎来里程碑式升级,IGT生态项目即将震撼上线!这一创新生态体系不仅将拓展InFinitar的应用场景
2025-03-13 13:05:00
诸葛智能全渠道数智化经营平台,让城商行快速落地“大行级”经营能力
在城商行零售业务从“规模扩张”向“价值深耕”转型的关键阶段,诸葛智能深入研究,发现以下痛点和机遇:1、 客群聚焦摒弃“全量客户”思维
2025-03-13 13:07:00