• 我的订阅
  • 科技

阿里多模态检索智能体,自带o1式思考过程!复杂问题逐步拆解

类别:科技 发布时间:2024-12-05 09:45:00 来源:量子位

多模态检索增强生成(mRAG)也有o1思考推理那味儿了!

阿里通义实验室新研究推出自适应规划的多模态检索智能体。

名叫OmniSearch,它能模拟人类解决问题的思维方式,将复杂问题逐步拆解进行智能检索规划。

随便上传一张图,询问任何问题,OmniSearch都会进行一段“思考过程”,不仅会将复杂问题拆解检索,而且会根据当前检索结果和问题情境动态调整下一步检索策略。

阿里多模态检索智能体,自带o1式思考过程!复杂问题逐步拆解

相比传统mRAG受制于其静态的检索策略,这种设计不仅提高了检索效率,也显著增强了模型生成内容的准确性。

为评估OmniSearch,研究团队构建了全新Dyn-VQA数据集。

在一系列基准数据集上的实验中,OmniSearch展现了显著的性能优势。特别是在处理需要多步推理、多模态知识和快速变化答案的问题时,OmniSearch相较于现有的mRAG方法表现更为优异。

目前OmniSearch在魔搭社区还有demo可玩。

动态检索规划框架,打破传统mRAG局限

传统mRAG方法遵循固定的检索流程,典型的步骤如下:

输入转化:接收多模态输入(例如图像+文本问题),将图像转化为描述性文本(例如通过image caption模型)。 单一模态检索:将问题或描述性文本作为检索查询,向知识库发送单一模态检索请求(通常是文本检索)。 固定生成流程:将检索到的信息与原始问题结合,交由MLLM生成答案。

OmniSearch旨在解决传统mRAG方法的以下痛点:

静态检索策略的局限:传统方法采用固定的两步检索流程,无法根据问题和检索内容动态调整检索路径,导致信息获取效率低下。 检索查询过载:单一检索查询往往包含了多个查询意图,反而会引入大量无关信息,干扰模型的推理过程。

为克服上述局限,OmniSearch引入了一种动态检索规划框架。

阿里多模态检索智能体,自带o1式思考过程!复杂问题逐步拆解

OmniSearch的核心架构包括:

规划智能体(Planning Agent):负责对原始问题进行逐步拆解,根据每个检索步骤的反馈决定下一步的子问题及检索策略。 检索器(Retriever):执行实际的检索任务,支持图像检索、文本检索以及跨模态检索。 子问题求解器(Sub-question Solver):对检索到的信息进行总结和解答,具备高度的可扩展性,可以与不同大小的多模态大语言模型集成。 迭代推理与检索(Iterative Reasoning and Retrieval):通过递归式的检索与推理流程,逐步接近问题的最终答案。 多模态特征的交互:有效处理文本、图像等多模态信息,灵活调整检索策略。 反馈循环机制(Feedback Loop):在每一步检索和推理后,反思当前的检索结果并决定下一步行动,以提高检索的精确度和有效性。

阿里多模态检索智能体,自带o1式思考过程!复杂问题逐步拆解

构建新数据集进行实验评估

为了更好地评估OmniSearch和其它mRAG方法的性能,研究团队构建了全新的Dyn-VQA数据集。Dyn-VQA包含1452个动态问题,涵盖了以下三种类型:

答案快速变化的问题:这类问题的背景知识不断更新,需要模型具备动态的再检索能力。例如,询问某位明星的最新电影票房,答案会随着时间的推移而发生变化。 多模态知识需求的问题:问题需要同时从多模态信息(如图像、文本等)中获取知识。例如,识别一张图片中的球员,并回答他的球队图标是什么。 多跳问题:问题需要多个推理步骤,要求模型在检索后进行多步推理。

这些类型的问题相比传统的VQA数据集需要更复杂的检索流程,更考验多模态检索方法对复杂检索的规划能力。

阿里多模态检索智能体,自带o1式思考过程!复杂问题逐步拆解

在Dyn-VQA数据集上的表现

答案更新频率:对于答案快速变化的问题,OmniSearch的表现显著优于GPT-4V结合启发式mRAG方法,准确率提升了近88%。 多模态知识需求:OmniSearch能够有效地结合图像和文本进行检索,其在需要额外视觉知识的复杂问题上的表现远超现有模型,准确率提高了35%以上。 多跳推理问题:OmniSearch通过多次检索和动态规划,能够精确解决需要多步推理的问题,实验结果表明其在这类问题上的表现优于当前最先进的多模态模型,准确率提升了约35%。

阿里多模态检索智能体,自带o1式思考过程!复杂问题逐步拆解

在其它数据集上的表现

接近人类级别表现:

OmniSearch在大多数VQA任务上达到了接近人类水平的表现。例如,在VQAv2和A-OKVQA数据集中,OmniSearch的准确率分别达到了70.34和84.12,显著超越了传统mRAG方法。

复杂问题处理能力:

在更具挑战性的Dyn-VQA数据集上,OmniSearch通过多步检索策略显著提升了模型的表现,达到了50.03的F1-Recall评分,相比基于GPT-4V的传统两步检索方法提升了近14分。

阿里多模态检索智能体,自带o1式思考过程!复杂问题逐步拆解

阿里多模态检索智能体,自带o1式思考过程!复杂问题逐步拆解

模块化能力与可扩展性

OmniSearch可以灵活集成不同规模和类型的多模态大语言模型(MLLM)作为子问题求解器。

无论是开源模型(如Qwen-VL-Chat)还是闭源模型(如GPT-4V),OmniSearch都能通过动态规划与这些模型协作完成复杂问题的解决。

它的模块化设计允许根据任务需求选择最合适的模型,甚至在不同阶段调用不同大小的MLLM,以在性能和计算成本之间实现灵活平衡。

下面是OmniSearch和不同模型配合的实验结果:

阿里多模态检索智能体,自带o1式思考过程!复杂问题逐步拆解

Paper:https://arxiv.org/abs/2411.02937Github:https://github.com/Alibaba-NLP/OmniSearchModelScope Demo: https://modelscope.cn/studios/iic/OmniSearch/summary?header=default&fullWidth=false

以上内容为资讯信息快照,由td.fyun.cc爬虫进行采集并收录,本站未对信息做任何修改,信息内容不代表本站立场。

快照生成时间:2024-12-05 12:45:02

本站信息快照查询为非营利公共服务,如有侵权请联系我们进行删除。

信息原文地址:

AI“大姨”现场刁难智能客服!直击一群AI打PK赛,真能落地的那种
...大模型以及丰富第三方模型(如Llama、百川等)。支持多模态模型服务,提供灵活高效易用的模型API与SDK。提供文本生成、图片生成、视觉理解、视频生成、语音识别以及语音合成能
2024-09-23 09:53:00
...还能理解和索引视频、图片、语音等多样化内容。这种多模态的处理能力,使得AI搜索能够从更广泛的数据源中提取信息,为用户提供更丰富和准确的搜索结果。同时,AI也重塑了搜索的产品形
2024-11-16 11:04:00
中国科学院地化所发布国际首个月球专业大模型,基于通义大模型及阿里云百炼专属版打造
...地球化学研究所与阿里云联合发布国际首个“月球科学多模态专业大模型”(简称“月球专业大模型”)。该大模型以视觉、多模态及自然语言等通义系列模型为基模,结合RAG检索增强等技术,
2024-08-29 15:42:00
WAIC 2025盛大开幕:WISHEE以多模型交响乐团重塑AI穿戴边界
...并导航,耳机设置,音乐播放全部能脱离手机完成。2.多模态交互:开口即得的无缝体验无需唤醒词,无需连接手机,按住耳机向AI朋友随时开启“语音对话”3.声学黑科技:听见未来的声音
2025-07-29 12:30:00
全球顶尖人工智能科学家加盟 阿里AI To C业务布局再提速
...出任阿里集团副总裁,向吴嘉汇报,负责AI To C业务的多模态基础模型及Agents相关基础研究与应用解决方案。近期
2025-02-08 18:48:00
昆仑万维重磅发布天工AI高级搜索功能,做最懂金融投资、科研学术的AI搜索
...精力进行解析,能够识别出其中的文本、图表、图片等多模态内容,同时将这些图表、图片信息做了相应的检索库。此外,天工AI还构建并搭载了分钟级的信源收录系统,能够更快地收集全网高价
2024-11-05 14:56:00
文心一言发布百度市值蒸发200亿,外界称缺乏亮点,应用前景难超ChatGPT
...业。但发布仅仅是一小步,更大的挑战还在后面。具备多模态,实测后或将暴露更多问题在发布会现场,李彦宏通过提前录制的视频演示了文心一言在文学创作、商业文案创作、数理推算、中文理解
2023-03-17 10:00:00
阿里云通义大模型家族迎来新成员,通义万相已开启定向邀测
...云智能集团CTO周靖人表示,这是阿里云大模型全面掌握多模态能力的关键一步,该能力将逐步向行业客户开放。阿里云宣布AI绘画创作大模型通义万相开启定向邀测据介绍,通义万相在语义理
2023-07-07 16:55:00
阿里云重磅升级全栈AI体系,一文看懂云栖大会技术发布
...模型智能水平、Agent工具调用和Coding能力、深度推理、多模态等方面实现多项突破。2025云栖大会,阿里云CTO周靖人发布多项重磅技术更新在大语言模型中
2025-09-24 13:30:00
更多关于科技的资讯:
联通超清电视狂欢双十一,临沂IPTV用户喜获iPhone17豪礼
鲁网12月1日讯一年一度的双十一购物狂欢盛宴圆满收官,在这场全民消费热潮中,山东联通精心策划的“双十一福利再升级”活动脱颖而出
2025-12-01 11:12:00
千里运荔藏巧思 现代加盟终端拓新局
“就算失败,我也想知道,自己倒在距离终点多远的地方。”电视剧《长安的荔枝》中这句掷地有声的台词,精准道出了当下创业者选择加盟之路时的执着与忐忑
2025-12-01 12:23:00
赛事总奖金160万元!WCI国际冠军赛苏州完美收官
2025年坦克世界国际冠军赛(WCI)11月30日在苏州阳澄国际电竞馆落下帷幕。来自中国、欧洲、北美和亚太地区的八支顶尖战队经过激烈角逐
2025-12-01 13:58:00
2025年北京市中小学生电子与信息创意实践活动圆满举行
当AI小球听懂指令,当智能车驰骋赛场,当电路在指尖点亮创意……孩子们像科学家一样思考,像工程师一样实践。11月30日,2025年北京市中小学生电子与信息创意实践活动在北京市第十四中学(畿辅校区)火热开幕
2025-12-01 14:26:00
烟台联通创新应用高压直流供电技术 破解高铁5G基站供电瓶颈
胶东在线12月1日讯在青烟威荣高铁5G覆盖扩容工程建设中,烟台联通成功应用高压直流供电技术创新方案,有效解决了牟平北山隧道西口
2025-12-02 05:00:00
海尔智慧家庭成立创新实验室布局好房子住居生态
海尔智慧家庭战略持续强化、开放和加速布局,又交出新成果。11 月 28日,以“AI 新纪元 共筑智慧家”为主题的海尔智慧家庭生态创新研讨会在北京召开
2025-12-01 14:51:00
海尔智慧家庭新成果:2025物联网大会斩获两项大奖
海尔智慧家庭持续强化、开放并加速智慧居住领域战略布局,如今再添重磅新成果。11 月 29 日,在首届全球万物智联数字经济可持续发展大会暨2025(第十届)世界物联网大会上
2025-12-01 14:51:00
海尔印尼冷柜工厂奠基将增百万产能
11月27日,海尔印尼冷柜工厂奠基。这座规划年产能100万台的冷柜工厂,将成为海尔智家本土化战略布局及数字化转型落地的又一里程碑
2025-12-01 14:53:00
海尔城市体验中心天津店开业落地数字化转型战略
11月29日,海尔城市体验中心天津店开业。在这里,用户挑选的不再只是一台台冰箱、洗衣机这样的AI单品,而是可以直接把成套解决方案搬回家
2025-12-01 14:54:00
2025年11月27日,梨花教育发布业界首款聚焦“声音”领域的AI声学学习机。该产品主要面向银龄群体,以精准的适老化与智能化设计
2025-12-01 14:56:00
殷平:推动铁路旅游发展 厘清基本概念是前提
在旅游需求多元化个性化发展的拉动下,在国家和部门政策的推动下,在铁路行业深耕市场、实现“旅客变游客”理念的具体落实下,铁路旅游得到了蓬勃的发展
2025-12-01 15:13:00
中国演出行业协会发布团播权威报告,携手抖音启动“优质团播”遴选
作为多人协同的演艺直播新形式,“团播”正成为线上文化演出市场的重要增长点。近日,中国演出行业协会发布《2025中国网络表演行业团体直播业务现状与发展情况分析报告》(以下简称《报告》)
2025-12-01 15:26:00
中国科大发现活性液晶可编程双行波新机制
大皖新闻讯 12月1日,大皖新闻记者从中国科学技术大学获悉,该校物理学院彭晨晖教授、蒋景华研究员团队与香港科技大学、厦门大学合作
2025-12-01 15:27:00
比音勒芬高端破局:新疆鹅绒如何改写“原料出口,品牌进口”的产业困境?
作为全球鹅绒产量第一大国,中国鹅绒年产量占全球总量的 80% 以上。然而,长期以来,中国鹅绒产业却陷入 “原料大国、品牌小国”的困境
2025-12-01 15:27:00
《如何做一个会赚钱的自媒体》出版,助力普通人抓住AI时代自媒体新机遇
鲁网12月1日讯近日,聚焦普通人自媒体变现的实用书籍《如何做一个会赚钱的自媒体》正式出版。该书以“多维度能力叠加”为核心
2025-12-01 15:30:00