• 我的订阅
  • 头条热搜
国产大模型首发中文逻辑推理,「天工大模型4.0」o1版来了
...始在一些权威评测中取得领先。今天,国内首款具备中文逻辑推理能力的 o1 模型来了,它便是由昆仑万维推出的「天工大模型 4.0」 o1 版(英文名:Skywork o1)。这也是近一个月来,该公司在大模型及相关应用上的第三次大动作...……更多
大模型降价背后,国产大模型的竞争逻辑变了
配图来自Canva可画随着人工智能技术的快速发展,大模型以其强大的数字处理能力和深度学习能力,不断与各领域交叉融合,逐步成为产业创新的关键抓手,和驱动新质生产力的关键引擎。据国家最新公布的数据显示,截至今年...……更多
重磅!TeleAI 完成首个全国产化万卡万参大模型训练
...一在今年5月的 OpenCampass 测试榜单中,TeleChat 系列模型的逻辑推理能力名列开源大模型榜单第一。作为新一代版本,TeleChat2-115B 在9月最新公布的 C-Eval 评测 Open Access 模型综合榜单中,以 86.9 分的成绩排名第一。其通用能力较 Tele……更多
奥林匹克竞赛里选最聪明的AI:Claude-3.5-Sonnet vs. GPT-4o?
...竞赛不仅是对人类(碳基智能)思维敏捷性、知识掌握和逻辑推理的极限挑战,更是AI(“硅基智能”)锻炼的绝佳练兵场,是衡量AI与“超级智能”距离的重要标尺。OlympicArena——一个真正意义上的AI奥运竞技场。在这里,AI不...……更多
360智脑7b参数模型采用3.4万亿tokens训练
...包括自然语言理解、知识、数学计算和推理、代码生成、逻辑推理等。其中360模型在四个评测数据集上达到第一,平均分为第三。在LongBench(多任务、中英双语、针对大语言模型长文本理解能力的评测基准)测试中,360选择其中...……更多
让OpenAI o1逆天的慢思考,360两月前就做出来了?周鸿祎CoE媲美CoT,应用太前瞻
...势以外,CoE模型在其余11项指标上均优于GPT-4o,特别是「逻辑推理」、「多步推理」、「诗词赏析」这类比较具有中文特色的问题,CoE的领先优势更加明显。目前,360的「多模型协作」已经能打败并远远甩开GPT-4o,媲美o1-preview。...……更多
智源评测体系发布 国内外“百模”评估结果出炉
...存在一定的偏差。当前,大模型的发展具备了通用性,在逻辑推理能力上有显著提升,日趋接近人脑的特征。因此,在海淀区教委支持下,智源研究院联合与海淀区教师进修学校对齐学生测验方式,考察大模型与人类学生的学科...……更多
港中文团队提出大模型元推理范式,革新大模型的评价体系
...院工作过一段时间。在 ChatGPT 面世以后,他意识到针对大模型的研究范式存在一定的不足,于是决定来到香港中文大学读博。图 | 曾忠燊(来源:曾忠燊)前不久,曾忠燊和所在团队提出一个全新评测范式。基于这一评测范式,...……更多
商汤又“夺金”!SuperCLUE-V多模态大模型基准发布10月榜单
...度30个二级维度。报告称SenseChat-Vision 5.5在基础能力-数理逻辑推理任务如图表推理、场景推理方面具备领先优势。榜单显示,在数理逻辑分析能力中,SenseChat-Vision 5.5超越国内外所有参评模型包括GPT-4o的最新版本,位列第一。Super...……更多
百川智能发布baichuan3稳定语言模型
...语言处理和代码生成领域的强大实力。不仅如此,其在对逻辑推理能力及专业性要求极高的MCMLE、MedExam、CMExam等权威医疗评测上的中文效果同样超过了GPT-4,是中文医疗任务表现最佳的大模型。Baichuan3还突破“迭代式强化学习”...……更多
一款国产日系风的侦探推理冒险游戏
...。当发起对决后,辩论的双方各摆证据,展开你来我往的逻辑推理攻击,如果选择错误还会扣除血条,就和“逆转裁判”中的法庭辩论如出一辙。游戏共有三种结局,根据调查的过程、线索收集的完整度与最后判定的犯人,都将...……更多
...“深数所”)发布了500个垂直行业多模态算料集,按照大模型应用的不同阶段(训练、推理、调优),有的放矢地提供数据源,让国产大模型厂商“寻数有路”。此次深数所发布的首批500个人工智能大模型高质量训练数据集,由...……更多
国产大模型加速落地,争夺“中国版ChatGPT”心智定位
从创业狂潮到争相落地,国产大模型进入了新的竞争阶段。5月7日,零一万物官宣了一站式AI工作平台——万知。据官方介绍,万知可以帮助用户做会议纪要、周报、写作助手,还可以解读财报、论文等各类文件,也可以实现PPT...……更多
文心一言“点评”李彦宏发布会紧张原因:对AI掌握不充分,担心被误解作秀
...ChatGPT的定位不准确,ChatGPT实际上也是一个通用型的语言模型,并非特定领域的语言模型。推理能力6.我去了一个聚会,我比John先到达,Davie在Joe之后到达,Joe比我先到达,John在David之后到达。请问是谁第一个到达的?文心一言...……更多
位列第一梯队,腾讯混元再度领跑国内大模型
...、多维度的综合性测评基准,由十大基础任务组成,包括逻辑推理、代码、语言理解、长文本、角色扮演等。本次报告选取了国内外具有代表性的32个大模型4月份的版本,通过多维度综合性测评,真实准确地反映了国内外大模型...……更多
国产模型指令跟随全球第一!来自LeCun亲推的最难作弊LLM新榜单
...方都是谁。模型辩论,主要靠的是信息理解、知识整合、逻辑推理、语言生成和对话能力。当然了,同时还能测复杂语境中信息的处理深度和迁移应变能力,反映其学习与推理的进步水平。浅玩了一下,有些议题还蛮有意思。比...……更多
“百模大战”,国产 GPT 大全
...的超大规模的语言模型,功能包括多轮对话、文案创作、逻辑推理、多语言支持。能够创作文案,续写小说,编写邮件等。通义千问的缺点是不支持多语言,只支持中文。通义千问入口:tongyi.aliyun.com小冰 小冰是一套完整的、...……更多
...加持的行业安全可信大模型,具备生成创作、多轮对话、逻辑推理等多项核心能力,通过海量通用数据与行业特有数据融合,更好的适应行业客户的业务需求,推动大模型在政企行业场景的精准落地。面向行业的安全可信行业专...……更多
科大讯飞入局大模型混战,刘庆峰:10月底将赶超ChatGPT
...在七个维度,具体包括文本生成、语言理解、知识问答、逻辑推理、数学能力、代码能力以及多模态能力。“这将对整个人类的生产和生活方式带来巨大的颠覆,产生全新的机会。”“认知大模型成为通用人工智能的曙光,科大...……更多
推理性能直逼o1,DeepSeek再次出手,重点:即将开源
...了,这次又是重磅炸弹。昨晚,DeepSeek 上线了全新的推理模型 DeepSeek-R1-Lite-Preview,直接冲击 OpenAI o1 保持了两个多月的大模型霸主地位。在美国数学竞赛(AMC)中难度等级最高的 AIME 以及全球顶级编程竞赛(codeforces)等权威评...……更多
算力逻辑修复!各大厂商接入DS催化港股AI基建概念 李彦宏称仍应持续投入
...国数据-SW(09698.HK)涨超6%。消息面上,DeepSeek作为开源AI大模型,近期各大厂商纷纷宣布接入,直接引发市场对拉动算力、云服务等相关需求的预期。此外,华为计算官微给出了DeepSeek V3/R1及蒸馏模型昇腾一体机推荐配置,中国电信...……更多
...总经理陈宁介绍,DeepEdge10是国内首创的国产14nm Chiplet大模型推理芯片,采用自主可控的国产工艺,内含国产RISC-V核,支持大模型推理部署。依托自研芯片DeepEdge10创新的D2D chiplet架构打造的X5000推理卡,已适配并可承载SAM CV大模型...……更多
云从科技发布从容大模型 可支持图文理解、文案写作、逻辑推理等功能 【云从科技发布从容大模型 可支持图文理解、文案写作、逻辑推理等功能】《科创板日报》18日讯,云从科技发布从容大模型。在现场演示中,从容大模型...……更多
...个只有8%。研究人员根据答案是否正确以及答案所包含的逻辑推理是否有效,对大语言模型的答案进行了分类。实验的第一个结果是,在每个测试重复十次的情况下,答案是不一致的。例如,在同一个测试中,有的模型十次中答...……更多
上海AI实验室版o1已上线!数学题、Leetcode全拿下,还会玩24点
...、数字游戏等任务。这就是上海AI实验室版o1——强推理模型书生InternThinker,刚刚正式开放试用!新模型不仅在长思维能力方面有了很大提升,而且还能在推理过程中进行自我反思和纠正。先来一起看两个例子感受一下:比如官...……更多
重磅!OpenAI o1模型还没有实现真正的逻辑推理能力
...二、社会评测与同行水平社会评测普遍认可o1 系列模型的逻辑推理能力优于 GPT-4o,但也有很多人提出了不同看法。差评XPIN邀请了理综三科的博士测评,物理评价较高,而生物、化学评价较低,综合认为o1在认知上达到硕士水平...……更多
百度文心一言发布会详细纪要
...和6只兔子。在这两轮提问当中展现出来的是文心一言的逻辑推理能力”。这方面它不仅知道题出的对不对,也不仅能够给出答案,也给出了解题的步骤。这很像是小学生在解应用题,它是有逻辑的,一步一步的推理出来的。我...……更多
...解释:“过去,ChatGPT等大模型像文科生,不擅长理科和逻辑推理。而对人类智慧来说,最底层的智慧是逻辑,逻辑之上是数学,再上面是物理、化学等科学。”去年9月,OpenAI发布的o1推理大模型改变了“文科生”形象,它擅长...……更多
11项指标击败GPT-4o!360攒局让16家大模型联手作战
...包。遇到编程问题,就会召唤代码能力较强的DeepSeek。以逻辑推理为主的问题,可能会让智谱来应对。当然界面中所展示的任务分类比较具有概括性,实际运行过程中AI助手还对任务进行了更细粒度的划分。另外,在选择模型的...……更多
姚期智院士大模型新研究:思维图DoT,用数学理论确保AI逻辑一致
...看看DoT长啥样。大模型复杂推理新框架 如前所述,DoT将逻辑推理过程建模为在单个LLM内构建有向无环图(DAG)。其框架内部管理三个关键角色:提议者:生成命题或推理步骤,添加新节点。 批评者:评估命题,识别错误、不...……更多
更多关于科技的资讯:
近日,极兔速递发布了2024年全年业绩报告,公司在全球市场实现规模与盈利双突破。财报显示,2024年,极兔在全球范围内累计处理包裹数量达到246
2025-03-12 19:09:00
年轻人不买账,短剧干脆免费了
图片为《好一个乖乖女》剧照出品 | 搜狐科技作者 | 张莹编辑 | 杨锦商业类畅销书作者克里斯・安德森,曾提出一种免费的经济理论
2025-03-12 19:17:00
“嗅觉经济”逆势爆发,国际大牌扎堆撒钱,国货欲靠东方美学破圈
期待一场“东方香调”的复兴。 全球美妆行业正经历寒冬,香水市场却逆势崛起,成了“嗅觉经济”核心赛道。艾媒咨询数据显示,2023年中国香水市场规模达207亿元
2025-03-12 20:09:00
近日,荣昌区税务局开展“2024年度个人所得税综合所得汇算清缴要点”直播活动,通过线上“零距离”互动,为纳税人解答政策疑问
2025-03-12 20:11:00
深度数科:以专业筑基,引领票据服务生态革新
在数字化转型浪潮席卷金融领域的当下,深度数科集团凭借其对票据业务的深刻理解与技术创新的双重驱动,持续巩固行业领军地位,为票据服务生态的升级注入专业力量
2025-03-12 20:14:00
吉利被“硅谷教父”皮埃罗赞誉为一家人工智能领域的公司
近日,一则来自外网的资讯显示,硅谷AI界的领航人物、硅谷人工智能研究院院长、斯坦福大学顶级AI学者、“硅谷教父”皮埃罗·斯加鲁菲(PieroScaruffi)在“AI在全球出行领域的变革研讨”活动中
2025-03-12 20:31:00
2025年2月28日-3月1日,由中国会展经济研究会指导,首都会展(集团)有限公司和31会议联合主办的第八届2025中国会展业数字化与创新大会(CEIDIC2025)将于北京北辰五洲皇冠国际酒店盛大开幕
2025-03-12 20:32:00
新年换机首选华硕a豆14 Air高颜值AI PC 国家补贴至高立减20%
新年临近,假期就在眼前啦!京东年货节也在火热进行中,想趁此机会入手一台新笔记本电脑的小伙伴们看过来,推荐种草这款华硕a豆14Air
2025-03-12 20:33:00
\
近日,硅谷AI领域的顶尖学者、硅谷人工智能研究院院长皮埃罗·斯加鲁菲(PieroScaruffi)在“AI重塑全球出行未来”研讨会上
2025-03-12 20:34:00
北京十大律师事务所精品推荐:实力与服务兼备的诉讼专家
在法律服务的众多领域中,诉讼业务以其复杂性和高难度著称。选择一家优秀的律师事务所,尤其是在涉及诉讼案件时,能够直接影响案件的最终结果
2025-03-12 20:37:00
首款原生鸿蒙正式版手机将发布,鸿蒙生态「朋友圈」如何走向正循环?
“原生鸿蒙正式版,就要来了!” 3月12日,华为常务董事、终端BG董事长、智能汽车解决方案BU董事长余承东语带激动地说
2025-03-12 23:05:00
谷子火了?从小红书烧起来的二次元“烫门”
你了解谷子吗?谷子,即轻度周边,例如徽章、立牌和卡牌等。不同于挂画和手办等高价格和高精度的重度周边,轻度周边更便于携带
2025-03-12 20:50:00
吉斯波尔酒业“昆全十一年”威士忌新品上市发布会圆满举行
3月11日上午,“时酿其华 岁成真味”半岛核心产区吉斯波尔酒业十四周年庆典暨“昆全十一年”威士忌新品发布会在烟台隆重举行
2025-03-12 21:02:00
海报新闻记者 孙杰 济南报道3月10日,京东电器城市旗舰店北园大街店举办项目启动仪式,该店位于济南市天桥区北园大街451号
2025-03-12 21:18:00
河北新闻网讯(刘晓丹、张耕朴)3月11日,雄安医疗大健康技术应用大赛场景打造对接会在深圳举办。会上,深圳安泰创新科技股份有限公司市场总监尹波表示,安泰利用异构汇集技术实现数据高效
2025-03-12 21:36:00