• 我的订阅
  • 头条热搜
蚂蚁自研知识增强大模型服务框架KAG,可显著提升知识推理准确率
...AI 原生 App “支小宝” 采用这套框架,在政务问答场景的准确率提升到了 91%,医疗问答垂直的指标解读准确率可达 90% 以上。梁磊还透露,KAG 框架会进一步向社区开放,并在开源框架 OpenSPG (https://github.com/OpenSPG/openspg) 中原生支..……更多
智能体不够聪明怎么办?清华&蚂蚁团队:让它像学徒一样持续学习
...具备获得 IMO 金牌的数学素养,但在具体场景下利用特定知识和工具完成复杂任务(例如使用搜索引擎、处理私有文档等)的能力却是不可或缺的。这一特点也意味着 AI Agent 的开发者们需要一套既通用又高效的 Agent 构建方法论...……更多
未来医院变形记:生成式AI将病历书写从8小时缩短至25分钟
...海市一医院联合蚂蚁做了九大类30+个细分意图,意图识别准确率在90%以上,上海市一医院称,接下来准确率有望提高到95%。那么,AI陪诊师的实际应用究竟如何?钛媒体App也进行了现场体验:打开支付宝,平台若定位到上海市一...……更多
...备高精度的意图理解,个性化的沟通风格:金融意图识别准确率达到95%,金融事件分析推理能力不逊于真人行业专家,能够进行多回合的高质量对话。智能业务助手“支小助”的1.0版本,则包含了“服务专家版”“投研专家版”...……更多
...备高精度的意图理解,个性化的沟通风格,金融意图识别准确率达到95%,金融事件分析推理能力不逊于真人行业专家,能够进行多回合的高质量对话。至于支小助,是金融行业从业者的好助手,包含“服务专家版”“投研专家版...……更多
蚂蚁井贤栋:通过专业智能体的深度连接,AI会像互联网一样带来服务的代际升级
...用大模型落地严谨产业,面临着三个“能力短板”:领域知识相对缺乏、复杂决策难以胜任,以及对话交互不等于有效协同。井贤栋介绍,为了破解这些难题,蚂蚁选择了构建专业智能体生态的路径,“从我们的实践来看,专业...……更多
突破时间序列组合推理难题!南加大发布一站式多步推理框架TS-Reasoner
...-Reasoner在所有测试指标上仍然略胜一筹。在因果关系分类准确率(CRA)和因果图准确率(CGA)上,TS-Reasoner分别实现了相对较高的成功率,进一步证明了其在复杂因果推理任务中的潜力。此外,本文对错误类型进行了详细分析,...……更多
2024WAIC热议大模型助力产业新趋势,可信应用成焦点
...型实现千亿级别参数的视觉语言识别,报告、药物等识别准确率高达 90%,中英文医疗水平测试超越 GPT-4,在 PromptCBLUE 中实现 A 榜第一,B榜第二。另外,百灵医疗可信一体机的算力支持实现国产化的训推一体,交付周期降低90%;...……更多
阿里多模态检索智能体,自带o1式思考过程!复杂问题逐步拆解
...问题,OmniSearch的表现显著优于GPT-4V结合启发式mRAG方法,准确率提升了近88%。 多模态知识需求:OmniSearch能够有效地结合图像和文本进行检索,其在需要额外视觉知识的复杂问题上的表现远超现有模型,准确率提高了35%以上。 ...……更多
超级推理模型正面对垒:谷歌版o1发布次日,OpenAI o1下一代o3登场
...突破,最高的测试成绩达到了类人水平。o3软件工程测试准确率比o1高近47% 竞赛数学高15% 人类博士专家级生化物高近13%今年9月,OpenAI 发布o1的预览版o1 preview时称,o1是第一个具备真正通用推理能力的大模型,它的核心能力推理...……更多
大模型面临四大关键缺陷,“知识方程”能否通向强人工智能
...无几。因为在进行深度推理时,即便大模型每一步的预测准确率都高达95%,但是当推理到20步时,最终的准确率将会是0.95的20次方,即不到36%,这是一个无法令人满意的结果。 第三,大模型的形式语义理解能力有待提升。虽然...……更多
...与没有“动作域获取”影响的情况下执行相同任务相比,准确率分别提高了59%和89%。研究人员希望在可预见的未来为“动作域获取”找到其他家务用途。能够解决问题“语言引导的抽象”框架也让机器人能够像人一样更好地理解...……更多
奥林匹克竞赛里选最聪明的AI:Claude-3.5-Sonnet vs. GPT-4o?
...过基于规则的匹配进行评估,研究团队对非编程任务使用准确率,并对编程任务使用公正的pass@k指标,定义如下: 本次评估中设定k = 1且n = 5,c表示通过所有测试用例的正确样本数量。奥林匹克竞技场奖牌榜:与奥运会使用的...……更多
谷歌大模型推理范式,主要分为两个阶段
...ncy,而且准确性更高。如果想要达到和自发现步骤同样的准确率,需要的推理计算量则是其40倍。研究团队本项研究由南加州大学和谷歌DeepMind联合推出。第一作者是PeiZhou,他现在正在南加州大学的NLP小组攻读博士。两位通讯作...……更多
给小学数学题加句废话,OpenAI o1就翻车了,苹果论文质疑AI推理
...据集之间,模型存在显著的性能波动,以及与原始 GSM8K 准确率相当的性能下降。这种差异表明,大型语言模型所采用的推理过程可能不是形式化的,因此容易受到某些变化的影响。一个可能的解释是这些模型主要专注于分布内...……更多
OpenAI直播最后一天放出“王炸”:下一代推理模型o3亮相
...OpenAI于8月推出的SWE-bench Verified代码生成评估基准中,o3的准确率为71.7%,比o1高出了22.8个百分点。o3还在2024年美国AIME数学竞赛中取得了96.7%准确率的高分,只缺了一道题,并在GPQA Diamond(一套研究生水平的生物、物理和化学试题)...……更多
AI 的“心智理论”难题:Meta ExploreToM 探索突破之路
...测试效果GPT-4o 和 Llama-3.1-70B 模型在 ExploreToM 数据集上的准确率分别只有 9% 和 0%,凸显了现有 LLM 在处理复杂 ToM 推理方面的不足。在 ExploreToM 数据上进行微调后,模型在经典 ToMi 基准测试中的准确率提高了 27 个百分点,证明……更多
LLM群体智能崛起,数学性能暴增11.6%!谷歌DeepMind四大机构联手新作
...6呈现了,新论文所提出的方法,在4个案例中实现了最高准确率。总之,作者提出一个LLM提取元认知知识框架,其形式是根据解决问题所需的概念,对数学数据集中的问题进行分类的技能。目前,新框架依赖于GPT-4等高级模型的...……更多
首个o1复现开源RL框架OpenR来了,UCL、上交等高校联合团队发布
...法在推理过程中的性能。y 轴表示 MATH500 数据集上的测试准确率,而 x 轴显示生成预算(每个问题的平均标记数),反映了每个问题的计算消耗或标记使用情况。该图表明,随着生成预算的增加,最佳 N 选择和束搜索方法的性能...……更多
多模态模型免微调接入互联网,即插即用新框架,效果超闭源方案
...ini 1.5 Pro、InternVL-1.5、LLaVA-1.6等。在UDK-VQA数据集上的回答准确率,则配备了SearchLVLMs的SOTA LVLMs超过了自带互联网检索增强的GPT-4o模型35%。开源框架SearchLVLMsSearchLVLMs框架主要由三部分组成:查询生成……更多
整合长期记忆,AI实现自我进化,探索大模型这一可能性
...,Omne 在最复杂、要求最高的 3 级问题上达到了 26.53% 的准确率。这证明了其通过利用强大的基础模型(尤其是具有强大推理和逻辑能力的模型)解决现实问题的潜力。未来计划该团队并不打算止步于此,他们已经制定了未来研...……更多
...、民生诉求接待等场景,其业务覆盖率达到95%,多轮理解准确率达到90%。早在2023年11月,中国电信就在2023数字科技生态大会上发布了千亿参数“星辰语义大模型”,并公布了后续的开源开放的时间表。IT之家发现,本次TeleChat-7B...……更多
微软华人团队发布全新基准AGIEval,专为人类考试而生
...和数学竞赛中的成绩超过了人类平均水平,SAT数学考试的准确率达到了95%,中国高考英语考试的准确率达到了92.5%,表明了目前基础模型的非凡表现。但GPT-4在需要复杂推理或特定领域知识的任务中不太熟练,文中对模型能力(理...……更多
百倍提升7B模型推理能力!颜水成团队携手新加坡南洋理工大学发布Q*算法
...推理能力:在GSM8K数据集上,Q*帮助Llama-2-7b提升至80.8%的准确率,超越了ChatGPT;在MATH数据集上,Q*帮助DeepSeek-Math-7b提升至55.4%的准确率,超越了Gemini Ultra;在MBPP数据集上,Q*帮助CodeQwen1.5-7b-Chat提……更多
大模型下探音视频AI市场,战争才刚刚开始 | ToB产业观察
...行业主流的中英文测试集VoxCeleb和CN-Celeb上均刷新了最优准确率,并且在计算效率和推理速度上有着明显优势。而此次听悟上线测试的通义千问大模型的信息摘要能力,为保证抽取出的摘要信息的事实准确,大幅度减少幻觉,团...……更多
...文档知识库检索方法,提高了专业模型在下游任务的推理准确率,得到了评委老师的认可。我们有种‘初生牛犊不怕虎’的心态,学校也特别注重培养学生的创新精神、创新能力,日常在社团我们也有很多真实项目做演练,这些...……更多
超越YOLOv10/11、RT-DETRv2/3!D-FINE重新定义边界框回归任务
...%)。在 Objects365 上进行了简单的有监督预训练后,D-FINE 的准确率达到了 59.3% AP。在 paperwithcode 网站的 Real-Time Object Detection on MS COCO benchmark 上,D-FINE 的速度和性能都远超其他方法……更多
趣丸科技副总裁兼CTO谢睿:多模态智能激发应用新场景 | 新质生产力·AI Partner大会
...架NCNN的改造,打造了一款具备低延迟、低资源消耗和高准确率、高安全性的的移动端轻量级语音识别方案。它适配不同口音、语速和环境噪声,可应用在语音直播、多人聊天等场景。例如,多人聊天场景中,我们帮助客户开发...……更多
科学家提出大模型分子交互学习框架,已在400多万分子对中验证
...次序给出分子的关键生化性质,从而提升分子交互的预测准确率。图 | 预训练阶段的提示词和预期回复的设计(来源:arXiv)期间,预训练阶段的数据来自 Drugbank 和 PubChem,它们都是包含分子-性质对的权威生化数据库。此外,为...……更多
科研也完了,AI暴虐170位人类专家!Nature子刊:大模型精准预测研究结果,准确率高达81%
...语言模型在预测神经科学结果方面超越了人类专家,平均准确率达到81%,而人类专家仅为63%;模型通过整合大量文献数据,展现出了惊人的前瞻性预测能力,预示着未来科研工作中人机协作的巨大潜力。在现代化工具的帮助下,...……更多
更多关于科技的资讯:
本文转自:人民网-广西频道近日,南方电网广西梧州供电局信息中心成功开发上线电网全域作业自动化监控及“体外循环”风险预警系统
2024-12-27 23:04:00
网约车司机使用“甩位”外挂软件抢单:随意增加里程 小单可变大单
快科技12月27日消息,据央广网报道,近日,多地警方披露,网约车司机通过使用一种能够“甩位”的外挂软件,可以实现筛选订单
2024-12-27 23:38:00
本文转自:人民网-广西频道近日,在南宁市秀灵路77号的状元坡换电站,中国铁塔股份有限公司广西壮族自治区分公司(以下简称“广西铁塔”)维护主管杨凌霄正在进行日常巡检
2024-12-27 23:44:00
RTX 5090公版太奢华了!16+6+7相供电、14层PCB
快科技12月27日消息,RTX 5090显卡的PCB电路板、GPU核心先后曝光,现在又得到了更多细节,尤其是供电、功耗等
2024-12-27 19:08:00
张雪峰公司开年会“撒”现金:图书4个月线上卖了5000万
快科技12月27日消息,据媒体报道,近日,张雪峰公司“峰学蔚来”举办年会活动。活动现场,张雪峰现场摇奖,开启了多轮抽现金红包活动
2024-12-27 19:08:00
埃及两男子从海底偷数百件文物被捕 网友:考古队省心了
快科技12月27日消息,据报道,埃及最近逮捕两名男子,他们从海底盗取古代文物448件,其中包括硬币、雕像、斧头、青铜杯
2024-12-27 19:08:00
尊界S800为何用1.5T增程器 余承东:考虑过2.0T、但车头太重
快科技12月27日消息,鸿蒙智行首款百万级豪华轿车尊界S800已经申报,将提供纯电和增程两种动力类型,均分为双电机和三电机
2024-12-27 19:08:00
蔚来萤火虫三眼灯引争议 网友爆改出15款前脸!你觉得哪款更好看
快科技12月27日消息,在蔚来2024 NIO Day上,蔚来发布第三品牌首款车型萤火虫。萤火虫前脸采用了“三重奏”的理念
2024-12-27 19:08:00
台积电3nm拿下高通骁龙8 Elite 2订单!三星无奈瞄准骁龙8 Elite 3
快科技12月27日消息,据媒体报道,台积电近日成功夺得高通下一代处理器“骁龙8 Elite 2”的代工订单,将采用其先进的3纳米制程技术“N3P”进行量产
2024-12-27 19:08:00
《小小的我》豆瓣早期评价:易烊千玺扮脑瘫突破演技
今日,由易烊千玺主演的电影《小小的我》全国正式上映。在豆瓣早期评价中,观众们给予了不错的评价。不少观众被易烊千玺饰演的“脑瘫”主角刘春和所感动
2024-12-27 19:08:00
极越欠款3700万供应商讨债:1000多万是抵押的房子 2000多万是借的
快科技12月27日消息,据媒体报道,近期,极越欠款3700万的供应商星塘文化负责人李红星发视频疑似在线讨债。在视频中,李红星表示
2024-12-27 19:38:00
节电率53%!国内首台自主研发磁悬浮地源热泵机组投运
快科技12月27日消息,据“天瑞磁悬浮”官微发文,天瑞重工自主研发的国内首台磁悬浮离心式地源热泵机组,在山东省潍坊市某住宅小区成功开机运行
2024-12-27 19:38:00
游戏性能最高提升14%!七彩虹Z890主板迎来0x114微码更新
快科技12月27日消息,今天七彩虹宣布,旗下Z890系列主板迎来最新的0x114微码更新,为酷睿Ultra 200S系列处理器提供全新功能和性能提升
2024-12-27 19:38:00
涂鸦智能携手星环科技、思码光,重塑全屋智能影音新体验
近日,全球化云开发者平台涂鸦智能(NYSE:TUYA,HKEX:2391)与国内知名影音品牌星环科技、智能照明行业领先品牌思码光达成合作
2024-12-27 20:00:00
陕西迈入万兆时代:首位全光万兆园区用户诞生
快科技12月27日消息,近日,西安市碑林科技产业园内的陕西红顶名医堂药业有限公司成功开通了万兆宽带服务,成为陕西省首个采用50G PON解决方案的全光万兆园区用户
2024-12-27 20:08:00