• 我的订阅
  • 科技

全球瞩目,又是杭州!这款视觉推理模型一夜起飞

类别:科技 发布时间:2025-02-26 07:07:00 来源:杭州网

杭州日报讯 “点击图中最小的红色三棱柱”——我们登录DeepSeek时,都遇到类似验证问题。

识图、辨别、点击。这对我们人类来说并不难;但若AI在深度思考几秒后,也能自动识别图片并圈出答案,并把它的思考过程“解释”给你听呢?

——这不是想象!这两天,全球开源圈又“炸”了。

在全球最大的代码托管与协作平台GitHub上,一款名叫VLM-R1的全新开源项目在上线短短十多个小时内,收到了来自各国开发者的2000多个星标收藏,并迅速登上平台热门趋势榜,关注度持续居高不下。

VLM-R1是什么?

2000多个星标又意味着什么?

“你可以把VLM-R1简单理解成‘视觉版DeepSeek’,它不仅会看,还很擅长思考,会举一反三。”项目带头人、Om AI Lab人工智能中心主任、浙江大学博士生导师赵天成博士在为记者通俗解释的同时,也表达了对引发反响的意外惊喜,“一天涨十几个星标比较常见,能收获几百个星标已经算是全球顶尖了;像VLM-R1这样一夜之间暴增上千关注的,前所未见!”

当DeepSeekR1方法遇上视觉模型

会有什么新变化?

“这个项目的灵感来自DeepSeek R1方法,其通过GRPO(Group Relative Policy Optimization)强化学习方法,在纯文本大模型上取得了显著效果。”赵天成表示。他毕业于卡内基梅隆大学(CMU),是全球最早一批推动生成式AI与大模型理论技术成熟的青年学者之一,“基于这个思路,我们开始思考:视觉模型是否也能实现类似的推理能力?”

与传统大模型训练的 SFT(Supervised Fine-Tuning)方法不同,R1方法的突破在于其路径创新。SFT依赖海量标注数据进行“填鸭式”教学,而R1方法则通过强化学习,让模型自主探索最优路径。“我们在Qwen2.5-VL的基础上,同时对比了R1和SFT方法,发现R1在各种复杂场景下都能保持稳定的高性能,这对实际应用至关重要。”赵天成解释道。

采访时,他分享了一个训练案例:在一张人行道的街景照片中,VLM-R1被要求定位可能对盲人行走造成危险的物体。照片中包含了常见的障碍物,如公交站牌、车辆、行人等,但其中还出现了一个特殊的元素——台阶。VLM-R1通过逐步分析,清晰地展示了其思考过程,并准确地圈出了台阶的位置。“对人类来说,这种推理是常识,但对视觉模型而言,准确识别图像、进行专业推理并用文本清晰表达,却非常具有挑战性。”

更令人惊叹的是VLM-R1的泛化能力。“它能举一反三,适应多种场景和任务,而无需针对每个任务进行专门训练。”赵天成举例,当你想买台电脑,苦恼于多种款式和不同价格,拍下比较图问AI:“选出性价比最高的一款”;当你在健身对吃大餐有负担,拍下菜单发给AI:“挑出高蛋白、低脂肪的食物”……这意味着R1方法让模型真正“学会”了理解视觉内容,而非简单的机械记忆。

2月15日,赵天成在海外社交平台上发布VLM-R1的实验结果,并将它开源、上传到GitHub,一夜之间成“顶流”。截至目前,该项目已获得全球开发者们给出的2800多个星标收藏。

“性能惊艳,潜力无限”“证明了R1方法的通用性,不止文本领域玩得转”“为多模态AI带来全新思路”“或许能够引领一种全新的视觉语言模型训练潮流”……业内人士纷纷对 VLM-R1表示高度认可。

“视觉版DeepSeek”

为什么是VLM-R1?

VLM-R1爆火,看似意料之外,实则情理之中。

以赵天成为首,这支以“95后”为主的年轻研发团队,含金量极高。在位于滨江区秋溢路上的金润科技园里,Om AI Lab汇聚了来自卡内基梅隆大学、微软研究院、清华大学、浙江大学等顶尖学术机构和科研单位的50名计算机领域精英。

“VLM-R1项目从春节启动,能迅速通过实验验证并取得成果,离不开我们前期的深厚积累,主要还是基础搭得牢。”赵天成表示,“我自2014年考入CMU时起就专注于AI生成式模型的研究,并结识了一群志同道合的伙伴。2021年,我们回国成立了Om AI Lab,就一直深耕于滨江。团队具备丰富的研究经验和创新思维,聚焦于AGI底层技术与架构的探索,始终致力于推动人工智能技术在各个领域的应用与发展。”

当行业刚刚开始关注大语言模型时,Om AI Lab早已坚定地探索多模态方向,并取得了工信部大模型检测的001号证书。“而002号证书的获得者,便是大家熟悉的‘文心一言’。”赵天成笑着说。

而Om AI Lab背后的母公司联汇科技,其多个智能体应用已通过与运营商、国家电网、广电媒体等企业机构的合作实现规模化落地,例如自动化输电线路巡检、开发AI眼镜帮助视障者“看见”世界等。

“视觉智能体产品,就像为机器人装上‘大脑’,为人类提供‘副脑’。随着VLM-R1内核的升级,未来将能实现更多应用场景。”赵天成表示,借助多模态的思考能力,VLM-R1将显著提升图像识别准确率,并生成相应的解决方案,“目前版本还处于1.0阶段,仍需更多实验来完善。”

以上内容为资讯信息快照,由td.fyun.cc爬虫进行采集并收录,本站未对信息做任何修改,信息内容不代表本站立场。

快照生成时间:2025-02-26 08:45:04

本站信息快照查询为非营利公共服务,如有侵权请联系我们进行删除。

信息原文地址:

机器人,“链”上滨江
...“CMG世界机器人大赛·系列赛”机甲格斗擂台赛上,来自杭州高新区(滨江)的宇树G1人形机器人作为唯一参赛机型,以硬核实力惊艳“破圈”。这台在聚光灯下挥洒自如的“钢铁之躯”,是
2025-06-13 08:53:00
近日,浙江大学脑机智能全国重点实验室重磅发布最新研制的新一代神经拟态类脑计算机——Darwin Monkey(“悟空”)。这是国际上首台神经元规模超过20亿的基于专用神经拟态芯片
2025-08-05 22:18:00
阿里云重磅升级全栈AI体系,一文看懂云栖大会技术发布
...像编辑功能,输入一句话即可完成P图。通义百聆发布2025杭州云栖大会上,通义大模型家族还迎来了全新的成员——语音大模型通义百聆
2025-09-24 13:30:00
DeepSeek,这条诞生在杭州的“鲸鱼” 这几天在全球科技圈、资本圈掀起滔天巨浪
...被称为“来自东方神秘力量”的DeepSeek。他们的总部位于杭州,是“杭州四小龙”的代表,创始人梁文锋毕业于浙大,前不久刚被国务院总理李强接见。中国的大模型已经追上美国了?故
2025-01-28 07:53:00
...日常生活中不可或缺的一部分。而在这场全球AI浪潮中,杭州,这座被誉为“人间天堂”的城市,正以它独特的科技活力,站在了时代的风口浪尖。今年春天,杭州的科技创新氛围格外活跃。从算
2025-03-20 09:00:00
年度生成式AI大会上海站公布最新嘉宾,报名进入最后阶段
...中昊芯英芯片软件栈负责人 朱国梁朱国梁,中昊芯英(杭州)科技有限公司芯片软件栈负责人,国防科技大学博士,主要研究方向为分布式系统、操作系统、编译器。曾参与国家重大项目天河系列
2024-11-26 09:38:00
...天凌晨,阿里巴巴又默默干了件大事:发布并开源全新的推理模型通义千问QwQ-32B。千问QwQ-32B是阿里探索推理模型的最新成果
2025-03-07 07:27:00
提质降价,国产大模型加速奔跑
...长的同时,国产大模型的使用成本也不断降低。不久前,杭州深度求索人工智能基础技术研究有限公司推出的DeepSeek-V3上线并同步开源
2025-02-05 03:48:00
字节猛踩油门
...借“用图像思考”能力瞬间占据热搜头条。几个小时后,杭州,字节跳动旗下火山引擎面向企业市场发布了豆包1.5深度思考模型,同步升级文生图模型3.0、视觉理解模型,并推出OS Ag
2025-04-18 22:26:00
更多关于科技的资讯:
武汉智博会:三翼鸟小场景蕴含大智慧
随着技术变革与消费升级的交织演进,智能家居领域逐渐从单品智能向全屋智能加速升级。在这一过程中,面对越来越多的设备数量,纷繁复杂的产品功能
2025-11-05 21:22:00
家电院评测:海尔智家APP获评“数字孪生3D智慧家庭”
智慧家能被完整“搬”进手机吗?答案是肯定的。日前,海尔智家APP正式上线“3D智慧家庭视图”功能,将平面的APP操控变成3D立体化的可视家
2025-11-05 21:24:00
禾蛙以AI智能体+定向顾问筛选,助力新能源出海项目顺利交付
当前新能源行业蓬勃发展,企业出海已成新常态。然而,海外人才招聘却成为许多企业面临的共同难题——既要精准匹配行业经验与资质
2025-11-05 21:25:00
在武汉智博会,看见三翼鸟智慧家庭的3个进阶
当2025国际(武汉)智能建造产业博览会以前沿科技叩问居住未来时,三翼鸟在核心展区的呈现,正在印证行业的一个关键转变:智能家居的竞争
2025-11-05 21:25:00
在快节奏的现代餐饮业中,商用炒菜机器人以其高效、稳定、卫生的特点,逐渐成为各大餐厅、食堂后厨的得力助手。今天,我们特别推荐包括鸿博智成在内的10款商用炒菜机器人
2025-11-05 21:26:00
中国东航×MSC邮轮首推“航空+邮轮”梦旅计划
记者从中国东航获悉,2025年11月5日起,中国东航将与全球著名邮轮品牌MSC地中海邮轮正式启动国内首个“航空+邮轮”联合会员计划——“东方航空MSC地中海邮轮联合会员”
2025-11-05 15:29:00
海工核心装备自主化取得新突破全国首台(套)船用SCV模块化装置成功交付南报网讯(通讯员张正平记者张希)近日,由江宁高新区企业中圣科技集团旗下中圣高科公司自主研发的全国首台(套)应
2025-11-05 08:17:00
□南京日报/紫金山新闻记者余梦娇通讯员彭蓉10月31日,在“向栖霞·享未来”2025年栖霞区秋季引才校园行南京财经大学站专场招聘会上
2025-11-05 09:56:00
智艺共生:AI赋能传播设计研究生作品展开幕
展览开幕历经三十余载积淀与发展,中国传媒大学广告与品牌学院以教学、科研与创意实践的融合创新,持续引领设计教育的前沿进程
2025-11-05 10:56:00
大皖新闻讯 11月5日,威马汽车在其官方微信号发布消息称,“我们很高兴地宣布,小威随行APP于2025年11月5日重新上线iOS和Android平台
2025-11-05 11:00:00
钉钉AI表格支持千万热行,超复杂实时计算真实可用
11月5日,钉钉AI表格宣布成为业内首个单表容量支持1000万热行的智能表格,目前已率先应用于“老字号”餐饮德香苑烤鸭等多家连锁零售
2025-11-05 11:23:00
沂南农商银行:助力科技企业打造新领域标杆
鲁网11月5日讯一根摩丝仅比头发丝略粗一点,但中间却是空的,这款膜组件直径36毫米,里面装了2000多根摩丝,直径最大的膜组件超过600毫米
2025-11-05 11:44:00
科技为骨,情感为魂:米连科技如何用温度重塑品牌连接
在竞争激烈的市场中,技术和服务是骨架,而品牌情感则是血肉。米连科技的过人之处,在于它成功地将“帮助用户获得爱与归属感”这一企业使命
2025-11-05 13:58:00
2025留学机构推荐:高口碑中介综合评测
在当前全球教育交流日益频繁的趋势下,越来越多的学生选择出国深造,出国留学中介机构因此承担起连接国内外教育资源的重要角色
2025-11-05 11:09:00
在线许愿,“听劝”的Leader统帅成了年轻人最想@的家电品牌
一条评论区里的留言,一次产品论坛里的建议,甚至是一段短视频下的“许愿”……这些散落在互联网角落的零散声音,正被统帅仔细收集起来
2025-11-05 11:07:00