逻辑推理,推理,逻辑,视觉,方面,模型头条新闻资讯订阅

我的订阅
头条热搜

我们正处于一个信息大暴发的时代，每天都能产生数以百万计的新闻资讯！

虽然有大数据推荐，但面对海量数据，通过我们的调研发现，在一个小时的时间里，您通常无法真正有效地获取您感兴趣的资讯！

头条新闻资讯订阅，旨在帮助您收集感兴趣的资讯内容，并且在第一时间通知到您。可以有效节约您获取资讯的时间，避免错过一些关键信息。

Anthropic再反击！发布Claude 3.5吊打GPT

...个版本Claude 3.5 Sonnet。从官方披露的测试数据来看，其在逻辑推理、编程、数学等方面中的表现性能均超越GPT-4o。网友直言，“太卷了，现在AI竞争是要以周为单位了吗？” 从官方介绍来看，Claude 3.5全家桶仍会有3款系列模型，...……更多

2024-06-21 11:50:00逻辑推理,推理,逻辑,视觉,方面,模型

奥林匹克竞赛里选最聪明的AI：Claude-3.5-Sonn

...竞赛不仅是对人类（碳基智能）思维敏捷性、知识掌握和逻辑推理的极限挑战，更是AI（“硅基智能”）锻炼的绝佳练兵场，是衡量AI与“超级智能”距离的重要标尺。OlympicArena——一个真正意义上的AI奥运竞技场。在这里，AI不...……更多

2024-06-25 09:45:00奥林,奥林匹克,竞赛,模型,推理,能力

能看风水夸我有情趣 Kimi现在都这么野了吗

...一个道理。在模型 “ 学好数学 ” 的基础上，再将这种逻辑推理的能力应用到物理、化学，乃至于咱们日常生活的方方面面，直到最后真正理解这个世界。而很显然， Kimi 推理模型的泛化能力已经开始显现出来了。在数据见顶...……更多

2024-12-19 00:21:00看风水,情趣,模型,能力,推理,更多

重磅！OpenAI o1模型还没有实现真正的逻辑推理能力

...二、社会评测与同行水平社会评测普遍认可o1 系列模型的逻辑推理能力优于 GPT-4o，但也有很多人提出了不同看法。差评XPIN邀请了理综三科的博士测评，物理评价较高，而生物、化学评价较低，综合认为o1在认知上达到硕士水平...……更多

2024-09-18 15:01:00逻辑推理,重磅,推理,逻辑,模型,能力

清华团队提出大模型“密度定律”；足球领域首个视觉语言基础模型

...后向问题中生成后向推理。在涵盖常识推理、数学推理和逻辑推理的 12 个数据集上进行的实验表明，这一方法比学生模型的零样本性能平均提高了 13.53%，比 SOTA 知识提炼基线提高了 6.84%。此外，这一方法还展示了样本效率——...……更多

2024-12-10 09:53:00模型,语言基础,清华,定律,密度,团队

苹果新论文证明LLM大模型存在缺陷！没有进行真正的逻辑推理

...地依赖于训练数据中的模式进行预测。当需要进行真正的逻辑推理时，这些模型往往无法产生合理的结果，这一发现对人工智能的发展提供了重要的参考。虽然LLM在许多领域表现优异，但其推理能力仍有待改进。【本文结束】如...……更多

2024-10-13 14:15:00逻辑推理,新论,推理,缺陷,逻辑,模型

人类和AI在推理任务中的表现相似，Google DeepMi

...，尽管这些模型在处理自然语言方面表现卓越，但在复杂逻辑推理任务中，人类和语言模型都会受到语义内容合理性和可信度的影响，表现出类似的错误倾向。研究背景人类在推理过程中存在两种系统：“直觉系统”和“理性系...……更多

2024-08-19 13:49:00局限性,推理,人类,任务,研究,模型

国产大模型首发中文逻辑推理，「天工大模型4.0」o1版来了

...始在一些权威评测中取得领先。今天，国内首款具备中文逻辑推理能力的 o1 模型来了，它便是由昆仑万维推出的「天工大模型 4.0」 o1 版（英文名：Skywork o1）。这也是近一个月来，该公司在大模型及相关应用上的第三次大动作...……更多

2024-11-28 10:00:00模型,逻辑推理,中文,推理,逻辑,国产

昆仑万维：“天工大模型3.0”将于4月17日正式发布同步开

...一代“天工2.0”MoE大模型，“天工3.0”在模型语义理解、逻辑推理、以及通用性、泛化性、不确定性知识、学习能力等领域拥有惊人的性能提升，其模型技术知识能力提升超过20%，数学/推理/代码/文创能力提升超过30%。同时，“...……更多

2024-04-01 19:56:00万维,昆仑,模型,将于,同步,参数

商汤又“夺金”！SuperCLUE-V多模态大模型基准发布1

...度30个二级维度。报告称SenseChat-Vision 5.5在基础能力-数理逻辑推理任务如图表推理、场景推理方面具备领先优势。榜单显示，在数理逻辑分析能力中，SenseChat-Vision 5.5超越国内外所有参评模型包括GPT-4o的最新版本，位列第一。Super...……更多

2024-10-14 13:34:00商汤,模态,基准,模型,模型,能力

Meta提出“可持续思维链”，让大模型在连续潜空间中推理

...而不是像 CoT 那样过早地进行单一的确定性路径。在某些逻辑推理任务中，Coconut 的表现优于 CoT，因为在规划过程中需要大量的回溯，而在推理过程中则需要较少的思考 token。论文链接：https://arxiv.org/abs/2412.0676911.GameArena：通过...……更多

2024-12-13 09:19:00推理,模型,思维,空间,模型,生成

罗格斯大学团队提出思想链概念，提高大模型的算数推理能力

...概念，提高了大语言模型（LLM，large language models）在复杂推理任务上的性能，例如算术推理、常识推理和符号推理等。图 | 金明宇（来源：金明宇）CoT 的原理是通过提供推理过程的示例，来教会模型处理推理，详细说明导致最...……更多

2024-03-15 10:41:00罗格,罗格斯,推理,模型,团队,概念

大语言模型逻辑推理“很糟糕”

...个只有8%。研究人员根据答案是否正确以及答案所包含的逻辑推理是否有效，对大语言模型的答案进行了分类。实验的第一个结果是，在每个测试重复十次的情况下，答案是不一致的。例如，在同一个测试中，有的模型十次中答...……更多

2024-06-12 18:15:00逻辑推理,推理,逻辑,模型,语言,模型

谷歌最新自然语言推理算法

...读理解和问答等任务中取得了极高的性能，但这些模型在逻辑推理方面的性能仍然十分滞后。去年5月「思维链」（ChainofThought,CoT）横空出世，有研究人员发现，只需要在prompt中加入「Let'sthinkstepbystep」就能让GPT-3的推理性能大幅...……更多

2023-01-09 21:57:00自然语言,算法,推理,自然,语言,目标

AI新时代揭幕！会“思考解题逻辑”的OpenAI推理大模型登

...凌晨1时许，AI时代迎来崭新的起点——能够进行通用复杂推理的大模型终于走到台前。OpenAI在官网发布公告称，开始向全体订阅用户开始推送OpenAI o1预览模型——也就是此前被广泛期待的“草莓”大模型。OpenAI表示，对于复杂推...……更多

2024-09-13 13:34:00新时代,推理,逻辑,模型,模型,问题

姚期智院士大模型新研究：思维图DoT，用数学理论确保AI逻辑

...看看DoT长啥样。大模型复杂推理新框架如前所述，DoT将逻辑推理过程建模为在单个LLM内构建有向无环图（DAG）。其框架内部管理三个关键角色：提议者：生成命题或推理步骤，添加新节点。批评者：评估命题，识别错误、不...……更多

2024-09-24 13:36:00维图,院士,逻辑,模型,一致,理论

讯飞星火X1全面升级领跑教育、医疗、司法行业应用

...训练的深度推理大模型，升级后的星火X1在数学、代码、逻辑推理、文本生成、语言理解、知识问答等通用任务上效果显著提升，在模型参数比业界同类模型小一个数量级的情况下，整体效果对标OpenAI o1和DeepSeek R1，再次证明了...……更多

2025-04-22 16:50:00讯飞,星火,行业应用,司法,升级,医疗

百度智能云两大基础设施再升级！打造AI时代最开放的智能基础设

...统级能力打造企业专属AI基础设施。百舸+昆仑芯超节点：推理性能提升13倍、成本降低95%算力是AI时代的“新电力”。百度智能云通过自研昆仑芯P800芯片及百舸大规模推理加速能力，实现算力性能与成本的双重突破。本次大会...……更多

2025-04-25 16:27:00基础设施,设施,智能,基础,升级,开放

对话北大赵东岩：为啥DeepSeek幻觉率这么高？用户如何避

...达14.3%，显著高于DeepSeek-V3的3.9%，也远远超过行业的其他推理模型，比如OpenAI-o1的测试结果是2.4%。这种AI大模型生成内容与真实数据不符，或偏离用户指令的现象，会极大影响用户的使用体验。在医疗、法律、金融等对准确性要...……更多

2025-03-05 15:54:00东岩,幻觉,北大,对话,用户,模型

不遥控的机器人来了！中国首个基于 3DSGs 的人形机器人

...工干预、无需遥控的自主完成跨空间人形机器人任务规划推理执行系统Raydiculous—1正式亮相。该系统在执行大空间和跨空间任务中拥有长视野（Long Horizon）推理规划能力，同时具备自主学习、处理跨场景任务的特性。是人形机器...……更多

2025-03-11 09:35:00机器人,机器,成都,人形,中国,推理

影响英伟达根本逻辑的大争论：OpenAI改变策略意味着什么？

大模型预训练“缩放定律”定律失效？模型推理成“解药”，英伟达一家独大格局要变天？“缩放定律”指导下，AI大模型预训练目前遭遇瓶颈。据路透12日报道，硅谷主要AI实验室的新模型训练计划目前普遍进展不顺，新模型...……更多

2024-11-13 14:09:00英伟,争论,逻辑,意味,根本,策略

大模型降价背后，国产大模型的竞争逻辑变了

...市场拱手让人。另一方面，随着大模型产业的快速发展，推理成本飞速下降，也成为终端降价的基础。据百度官方透露，相比一年前，文心大模型的算法训练效率提升到了原来的5.1倍，周均训练有效率达到98.8%，推理性能提升了1...……更多

2024-05-29 09:29:00模型,逻辑,背后,国产,竞争,模型

OpenAI o1模型到博士水平了?复旦教授:没有真正推理能

...程能力“爆表”新模型到底有多强？它在需要深入思考和逻辑推理的专业任务上不仅吊打GPT-4o，还超过了拥有博士学位的人类专家。OpenAI表示，新模型在物理、化学和生物等学科的挑战性基准测试中，表现超过人类专家。在国际...……更多

2024-09-13 16:44:00复旦,相关性,概率,推理,模型,教授

混合架构赋予AI人类推理能力

...AI)系统在编码、战略规划和机器人科学三个领域执行复杂推理任务。聊天生成预训练转换器(ChatGPT)和“克劳德3-奥普斯”(Claude 3 Opus)等大语言模型(LLM)，根据人类输入“提示词”处理和生成文本。研究人员说，过去18个月，这些技...……更多

2024-06-12 18:15:00推理,架构,混合,人类,能力,语言

给小学数学题加句废话，OpenAI o1就翻车了，苹果论文质

...降。我们假设这种下降是因为当前的 LLM 无法进行真正的逻辑推理；相反，它们试图复制在训练数据中观察到的推理步骤。」这一结论得到了 Keras 之父 François Chollet 和美国心理学家、认知科学家 Gary Marcus 的转发，他们一直对 AI ...……更多

2024-10-14 09:55:00数学题,推理,废话,苹果,数学,小学

百川智能发布baichuan3稳定语言模型

...语言处理和代码生成领域的强大实力。不仅如此，其在对逻辑推理能力及专业性要求极高的MCMLE、MedExam、CMExam等权威医疗评测上的中文效果同样超过了GPT-4，是中文医疗任务表现最佳的大模型。Baichuan3还突破“迭代式强化学习”...……更多

2024-01-29 19:57:00百川,模型,语言,智能,模型,百川

英伟达没有慌，黄仁勋再谈DeepSeek：“推理”的计算需求

...Seek、Grok、OpenAl等冲击，AI正在从感知和生成式AI向推理和逻辑推理领域发展。而推理AI又增加了一条扩展规律——增加训练的计算能力能让模型变得更智能，而增加深度思考的计算能力则能让答案更精准，与一次性推理相比，长...……更多

2025-02-27 11:55:00英伟,推理,需求,英伟,增长,推理

2023IDEA大会：让大模型更好应对复杂问题

...本正经的胡说八道”怎么解？众所周之，大模型存在深度推理能力差、知识不可追溯、实时更新代价高等局限性，这也成为其在许多严肃领域落地的主要瓶颈。如何弥补大模型的这部分缺陷，是当下AI应用的重要课题。为此，IDEA...……更多

2023-11-24 10:53:00模型,大会,问题,模型,研究,能力

科学家推出大模型数据集，涵盖奥赛数学题，有望让AI辅导数学课

...23 年 2 月。当时，已经有一些研究团队开始使用大模型做逻辑推理和数学推理。赵子龙和合作者也认为这个方向很有前景。他表示让自己印象最深的例子就是 OpenAI 网站上的一道数学推理的题: Simplify tan100 + 4sin100。根据 OpenAI 自...……更多

2024-03-13 10:26:00数学,数学题,科学家,模型,辅导,课程

真香！智谱大模型，有了首个免费的API

...性的同时增加多样性）。体验地址：https://open.bigmodel.cn/逻辑推理能力，从简单到复杂，包含一般逻辑推理和数学推理。测试 1：先来一道前段时间让很多大模型翻车的「9.11 和 9.9 哪个更大」问题，很容易就答对了。类似的数字...……更多

2024-08-28 09:43:00真香,模型,模型,能力,应用,开发

page 1/3334 首页上一页 12 3 4 5 6 下一页末页

更多关于科技的资讯：

集思录｜读懂“包挂热”背后的新潮流

近来，“包挂热”在年轻消费者群体中持续升温。社交平台上，有关“包挂”“包搭子”等相关话题的浏览量超过亿次。数据显示，今年上半年

2025-11-25 08:41:00

基于企业核心竞争力提升的创新管理策略

摘要：在全球市场飞速发展、竞争日趋激烈的当下，企业获得并保持核心竞争力是长远发展的动力源泉。企业的静态核心竞争力易随着技术的进步与市场的变换而失去光彩

2025-11-25 07:04:00

大数据时代中小企业管理创新研究

摘要：随着大数据技术的快速发展，传统中小企业的管理模式面临前所未有的挑战与机遇。大数据的应用使得中小企业能够通过数据分析

2025-11-25 07:04:00

外卖大战结束？京东外卖App上线饿了么或更名淘宝闪购

外卖大战在不久前刚刚告一段落，市场就又有了新的动作：京东上线了独立App京东外卖，同时还发布了京东点评。而11月以来，也多次传出阿里的外卖平台“饿了么”要更名为淘宝闪购的消息

2025-11-25 07:22:00

社交媒体“信息茧房”的成因与破解路径探析

在高度媒介化的社会环境中，社交媒体作为关键基础设施，其算法推荐机制催生的“信息茧房”现象日益凸显。本研究聚焦大学生群体

2025-11-25 07:04:00

猛犸世纪AI智能体训练营开课，引爆“一人公司”新范式

AI时代，企业的核心竞争力是什么？在2025年11月19日至20日于深圳南山成功举办的“猛犸AI智能体增长训练营”上，答案被清晰地指向了同一个方向

2025-11-24 14:18:00

澳柯玛多款产品获市长杯工业设计大赛金、银、铜奖

鲁网11月24日讯近日，青岛市2025年第八届“市长杯”工业设计大赛获奖名单正式公布，澳柯玛生活电器凭借卓越的设计实力

2025-11-24 14:44:00

嘉必优捷报频传，瞄定中国生物制造踏新阶

近日，《中共中央关于制定国民经济和社会发展第十五个五年规划的建议》正式发布，明确提出，推动生物制造、量子科技、氢能和核聚变能等成为新的经济增长点

2025-11-24 15:18:00

“一键注销”让用户彻底告别“注销难”

为规范大型网络平台个人信息处理活动，保护个人信息合法权益，促进平台经济健康发展，国家互联网信息办公室、公安部起草了《大型网络平台个人信息保护规定（征求意见稿）》

2025-11-24 15:29:00

富德生命人寿张家口中支开展合规与风险提示专项培训

为强化员工合规意识，切实保障SPACC+营销模式下老年客户的服务安全，富德生命人寿保险有限公司张家口中心支公司于11月12日至13日

2025-11-24 15:32:00

百年人寿银保精英深大研学圆满收官

10月29日至31日，百年人寿银行保险渠道在深圳大学举办“金鹏启梦，领行新程”主题研学班。本次活动聚焦专业能力跃升与价值成长路径

2025-11-24 15:33:00

邮储银行三明市分行携手商圈平台打造银客商共赢典范

多维促消费，畅享“双十一”——邮储银行三明市分行携手商圈平台打造银客商共赢典范东南网11月24日讯为紧抓“双十一”消费机遇

2025-11-24 15:44:00

王嘉琳女士受邀出席睿海希尔顿花园酒店开业盛典，共贺新章

日前，重庆渝北中央公园睿海希尔顿花园酒店（以下简称“睿海希尔顿花园酒店”）在渝北区中央公园片区盛大开业。作为全国首家开业的4

2025-11-24 16:30:00

“四轮驱动”，推动零售业实现可持续发展

11月21日，2025北京零售商品博览会在北京展览馆启幕，展会以“品质零售·融聚共生”为主题，联动生产商、品牌商、渠道商

2025-11-24 17:41:00

东湖评论：“良心产品”不应成为稀缺品

“这个锅的厂家还在吗？”一则寻锅视频在全网爆火，这口“用了三十年仍旧不锈不粘、耐用如初”的锅也被网友称为“传家锅”。感动之余

2025-11-24 18:26:00

头条订阅服务