• 我的订阅
  • 头条热搜
LLM仍然不能规划,刷屏的OpenAI o1远未达到饱和
... o1 在基准测试上性能超过了竞争对手,但它还远未达到饱和状态。论文标题:LLMs Still Can't Plan; Can LRMs? A Preliminary Evaluation of OpenAI's o1 on PlanBench 论文地址……更多
OpenAI o1 模型 PlanBench 规划能力实测:准确率 97.8%
...学的科研团队利用 PlanBench 基准,测试了 OpenAI o1 模型的规划能力。研究结果表明 o1 模型取得了长足的进步,但仍然存在很大的局限性。PlanBench 基准简介PlanBench 开发于 2022 年,用于评估人工智能系统的规划能力,包括 600 个来自...……更多
LeCun 的世界模型初步实现!基于预训练视觉特征,零样本规划
...续性记忆,不能推理(只要推理的定义是合理的)、不能规划。」Yann LeCun 批评 LLM 的推文之一相反,他更注重所谓的世界模型(World Model),也就是根据世界数据拟合的一个动态模型。比如驴,正是有了这样的世界模型,它们才...……更多
o1规划能力首测!已超越语言模型范畴,preview终于赢mini一回
...mini一次!亚利桑那州立大学的最新研究表明,o1-preview在规划任务上,表现显著优于o1-mini。相比于传统模型的优势更是碾压级别,在超难任务上的准确率比Llama3.1-405B高了11倍。要知道之前,OpenAI自己人也发了一张图,显示preview...……更多
调研219篇文献,全面了解GenAI在自适应系统中的现状与研究路线图
...能够显著增强系统的自适应能力。例如,GenAI 可以分析并规划系统策略,自动调整配置以应对环境变化。尽管已有一些研究探索了 GenAI 在自适应系统中的应用,但该领域尚缺乏系统性和深入的研究。因此,本论文旨在为研究人...……更多
很强也很贵!OpenAI12天12场直播收官,官宣最新推理模型o3
...况下,创建对人类来说容易但对人工智能来说不可能的不饱和、有趣的基准仍然是可行的。当创建这样的测试变得完全不可能时,我们将拥有AGI”。当然,ARC-AGI只是AI领域的重要基准之一,对AGI的定义只是其中之一。肖莱称,主...……更多
菲尔兹奖得主亲测GPT-4o,经典过河难题破解失败!最强Claude 3.5回答离谱,LeCun嘲讽LLM
...径庭。从下面这张图中可以看到,LLM在各种基准测试上的饱和速度越来越快。几乎是每提出一个新的测试集,模型就能迅速达到人类水平(图中0.0边界)甚至超越,其中不乏非常有挑战性的逻辑推理任务,比如需要复杂多步骤推...……更多
GPT-4V暴露致命缺陷?JHU等发布首个多模态ToM 测试集
...PT-4V 无法区分信念和真实世界状态。BIP-ALM 小模型 + 逆向规划超过 GPT-4V那么,我们该如何缩小 AI 模型和人类表现之间的差距?该团队提出了一种新方法:BIP-ALM (Bayesian Inverse Planning Accelerated by Language M……更多
北大推出全新机器人多模态大模型!面向通用和机器人场景的高效推理和操作
...boMamba图 1. RoboMamba 具备的机器人相关能力,其中包括任务规划、提示性任务规划、长程任务规划、可操纵性判断、可操纵性生成、未来与过去预测、末端执行器位姿预测等。摘要机器人操纵的一个基本目标是使模型能够理解视觉...……更多
o1金牌团队揭秘AI超越人类惊人时刻!22分完整版视频全公开
...做的事情是否正确,而且最后很多常用的行业基准也趋于饱和,需要重新找到适合o1能力的基准测试。除了模型的开发历程,研究人员们还被问到了自己最喜欢的o1模型用例。Hyung Won Chung表示,o1可以成为很好的编码助手。他自己...……更多
理想的智能驾驶,到底「City 不 City」?
...能够在各种道路条件下行驶; 绕行丝滑:具备时空联合规划能力,对道路障碍物的避让和绕行更加流畅;路口轻松:通过超视距导航选路能力,在复杂路口也能顺畅通行;默契安心:考虑用户心理安全边界,实现分米级微操,...……更多
大模型是否有推理能力?DeepMind数月前的论文让AI社区吵起来了
...型的性能随着深度的增加而增加,但似乎在 8 层左右达到饱和,这表明深度很重要,但不能超过某个点。 ……更多
补齐Transformer规划短板又不放弃快速思考,Dualformer双重优势
... dynamics bootstrapping》,参阅机器之心报道《补齐 Transformer 规划短板,田渊栋团队的 Searchformer 火了》。为了执行规划,他们要训练一个 Transformer 来建模一个 token 序列,而该序列则是以顺序方式来表示该规划任务、A* 算法的计……更多
...策的实施,促使学生对学业和未来的职业生涯要及早做出规划。高中生经验不足,对生涯规划比较陌生,因此特别需要家长指导帮助孩子做好生涯规划。高中生生涯规划易出现的问题问题一:学生缺乏职业生涯教育。很多学生都...……更多
全球首篇!调研近400篇文献,鹏城实验室&中大深度解析具身智能
...抓取需要全面的语义理解、场景感知、决策和稳健的控制规划。具身抓取方法将传统的机器人运动学抓取与大型模型(如大语言模型和视觉语言基础模型)相结合,使智能体能够在多感官感知下执行抓取任务,包括视觉主动感知...……更多
钉钉发布全新AI搜索,将面向深度用户邀请测试
...系统。如在思考系统方面,AI助理具备更强的记忆和推理规划能力。用户授权后,可以让AI助理记住与其相关的信息、习惯、偏好等,包括姓名、岗位、上下级关系、工作任务进展,也支持用户自定义设置记忆,让AI助理的生成结...……更多
o1带火的CoT到底行不行?新论文引发了论战
...方法,使用 CoT 时 LLM 能更好地生成可执行的形式化方案规划;但如果使用语言模型来生成方案规划,然后再使用外部符号解算器来求解该规划,性能表现还会更好一些。这样的结果忽然让 CoT 的处境变得有点尴尬:在 CoT 有用的...……更多
集群建设不断加码,齐鲁软件园做对了啥
...产业策源地与高质量发展的前沿技术高地。随着不断强化规划引领、引导产业集聚、优化产业生态,齐鲁软件园的软件和新一代信息技术产业取得蓬勃发展,形成软件和信息技术服务、人工智能、集成电路、信息技术应用创新等...……更多
对标OpenAI o1!Kimi发布新一代推理模型:中考高考考研全第一
...ath模型在做题过程中会花更长的时间来推理,包括思考和规划思路,并且在必要时自行反思改进解题思路,提升答题的成功率。不过,月之暗面坦言,k0-math虽然擅长解答大部分很有难度的数学题,但是当前版本还无法解答LaTeX格...……更多
ai硬件产品规划流程
...正在变革。下面这篇文章是笔者整理分享的关于硬件产品规划手册的相关内容,大家一起来看看吧!随着人工智能(AI)的快速发展和全球数字化转型的加速,硬件产品正经历着前所未有的变革。在这个时代,智能化、网络化、...……更多
Mistral放大招!124B多模态巨无霸登场,免费版ChatGPT震撼突袭
...一个生成数据分析报告的工作流,工作流共包含数据分析规划、代码生成与执行、分析报告总结三步,每一步都有一个单独的智能体。数据分析规划:数据分析规划智能体编写一份全面的数据分析计划,概述分析数据所需的步骤...……更多
...整车智能才是新能源汽车智能化发展的正确方向。”按照规划,比亚迪未来将在智能化领域投入1000亿元,沿着整车智能的技术路线,加速汽车行业智能化转型。“整车智能,才是真智能”比亚迪之所以提出“整车智能”的概念...……更多
安兔兔评测pc版正式发布,欢迎大家下载体验
...NPU的支持,准确评判电脑的AI能力,以便让您可以更好地规划电脑在AI方面的使用场景。CPU测试部分,通过运行特定的AI任务和算法,对CPU的计算能力、数据处理速度以及指令执行效率进行评估,小到简单的数学运算,大到复杂的...……更多
不靠更复杂的策略,仅凭和大模型训练对齐,零样本零经验单LLM调用
...算,它可以帮你预订酒店。既拥有海量常识,又能做长期规划的大语言模型(LLM),自然成为了智能体常用的基础模块。于是上下文学习示例、任务技巧、多智能体协同、强化学习算法…… 一切适用于通用智能体的想法都抢着...……更多
GPT刚刚公开「草莓」项目:推理能力翻倍,定价200美元?
...究任务,这意味着它不再仅限于生成答案,而是能够提前规划、自动导航互联网,甚至自主解决高度复杂的科学问题。 相比现有的 GPT-4 系列模型,「草莓」被寄予了厚望,可以帮助 AI 更好地模仿人类的思维过程,尤其是在数...……更多
google向美国用户推出人工智能驱动概览功能
...驱动的概览功能。此外,该公司还希望使用Gemini作为旅行规划等方面的代理。Google搜索部门主管利兹-里德(LizReid)说,公司为搜索建立了一个定制的Gemini模型,将实时信息、Google排名、长语境和多模态功能结合在一起。自去年...……更多
...文章链接。ChatGLM3还集成了自研的AgentTuning技术,在智能规划和执行方面相比于上一代ChatGLM2提升了1000%,并开启了国产大模型原生支持工具调用、代码执行、游戏、数据库操作、知识图谱搜索与推理、操作系统等复杂场景。以代...……更多
转型关键期:如何高效构建AI产品线的专业能力和权威地位?
...从前到后,可以分为:转型之机、搭建团队、制定AI战略规划、AI商业化规划、内部AI工具建设、外部AI产品开发、申报权威荣誉、大模型备案、加强知识产权保护、培训和知识分享等10个方面,其中几个环节是在以后的产品研发...……更多
CVPR’24 Navsim挑战赛冠军方案!
...的研究表明,近年来涌现的不少端到端自动驾驶模型,在规划范式上存在一定问题。近期,NVIDIA 研究团队提出了一种新型的端到端自动驾驶框架 Hydra-MDP。在 CVPR 2024 NAVSIM(大规模端到端驾驶)挑战赛中,Hydra-MDP 获得了第一名和...……更多
拿下首个右舵左行地区自动驾驶测试牌照,萝卜快跑开启全球化
...面的障碍物刻画、数据标准化环节都实现了能力跃升,在规划决策层则可基于多源环境信息的输入,直接生成最终轨迹。这不仅意味着Apollo ADFM大模型可以识别更多种类的物体(包括特殊车辆和不规则障碍物),还能在面对更加...……更多
更多关于科技的资讯:
聚焦2025中国国际数字经济博览会·访谈|沈昌祥:发挥优势,不断筑牢人工智能安全底座
发挥优势,不断筑牢人工智能安全底座——访中国工程院院士沈昌祥中国工程院院士沈昌祥。 河北日报记者 李东宇摄2025中国国际数字经济博览会的主题为“可信数据赋能产业发展”
2025-10-18 08:25:00
10月17日,2025中国国际数字经济博览会,一款AI绘画机器人精准识别人脸神态,快速绘画出人脸素描,被这只机械臂画得心服口服。(摄制:苏畅、白中豪、朱泊宇)
2025-10-18 08:27:00
深化开发利用,让高质量数据“动”起来——2025中国国际数字经济博览会探新之一机器人亮绝活、大模型总动员、虚拟空间沉浸体验……10月17日
2025-10-18 08:37:00
厦门网讯(厦门日报记者 薛尧)苹果iPhone17 Air昨日正式开启预售,这款取消实体卡槽、仅支持eSIM(嵌入式虚拟SIM卡)的新机
2025-10-18 08:59:00
近日,建设银行正式启动“‘享趣’玩·惠游中华”信用卡活动,为客户提供涵盖景区票务、特色餐饮、文创消费等多方面的用卡优惠
2025-10-18 10:41:00
海信贾少谦:AI重塑企业管理模式,打法要快,生意要慢
10月17日,第十五届中国管理·全球论坛暨首届“中国企业管理最佳实践榜”发布盛典在青岛举办。作为C50+2025年度轮值企业家召集人
2025-10-18 10:57:00
竹溪县数字经济产业链招商签约超亿元
十堰广电讯(全媒体记者 白孟尧 通讯员 付延峰)竞逐数字经济新赛道,孕育产业链招商硕果。10月18日,湖北十堰竹溪县竹溪数字经济产业链招商暨2025“国芯一号”生态合作伙伴大会在桃花岛夯土小镇举行
2025-10-18 13:47:00
东南网龙岩10月17日讯(通讯员 陈碧霞)近日,工行龙岩漳平支行组织青年志愿者主动深入当地企业园区,精心开展集“个人金融产品精准营销”与“金融反诈知识普及”于一体的“一站式”综合服务活动
2025-10-18 16:32:00
烟台银行荣登2025上半年度高质量数字化转型十大典型案例榜单
近日,由中国信通院主办的以“洞见十五五”为主题的2025数字生态发展大会暨“铸基计划”年中会议在北京盛大召开。会上,烟台银行联合长亮科技申报的《DataOps赋能烟台银行建设高质量智能数据中枢》案例
2025-10-18 17:45:00
视源股份广交会展示AI全场景创新实力,机器人机器人系列产品亮相成焦点
在第138届中国进出口商品交易会(广交会)上,视源股份以“AI+未来教育、AI+企业服务、AI+机器人、AI+生活”为主线
2025-10-18 18:18:00
本土智造重磅升级,医科达将八度亮相进博
第八届中国国际进口博览会(进博会)进入倒计时,作为八年“全勤生”,全球精准放疗先锋医科达将以“共建本土生态,共筑抗癌未来”为主题
2025-10-18 18:42:00
不用等到20号了!现在来京东11.11 iPhone 17 Pro系列可领300元惊喜券
每年11.11对于广大果粉而言无疑是换新的绝佳时机,无论是追求最新款还是预算有限入手上一代机型都能享受到极具吸引力的价格
2025-10-18 18:43:00
破局重构引领前行,联众优车持续锻造二手车服务新基建
近年来,在国内汽车消费结构持续升级的背景下,二手车市场已成为拉动汽车消费的重要引擎。特别是随着国家一系列利好政策的推出
2025-10-18 18:43:00
从龙虎到鹤年堂 京东七鲜十月品牌日再造下一个老字号联名爆款
随着“养生年轻化”与“即食化养生”成为主流,当代消费者愈发青睐“轻松养生、即时进补”。如何让传统养生智慧通过自有品牌融入日常
2025-10-18 18:43:00
全时段畅飞 全年不限次:长龙航空“365畅飞卡”10月19日在京东旅行限时开售
国内随心飞历史新低,全时段畅飞、全年不限次!在推出海航随心飞,并创下2天超25万用户下单、2亿销售额的纪录之后,京东11
2025-10-18 18:45:00