• 我的订阅
  • 科技

全球瞩目,又是杭州!这款视觉推理模型一夜起飞

类别:科技 发布时间:2025-02-26 07:07:00 来源:杭州网

杭州日报讯 “点击图中最小的红色三棱柱”——我们登录DeepSeek时,都遇到类似验证问题。

识图、辨别、点击。这对我们人类来说并不难;但若AI在深度思考几秒后,也能自动识别图片并圈出答案,并把它的思考过程“解释”给你听呢?

——这不是想象!这两天,全球开源圈又“炸”了。

在全球最大的代码托管与协作平台GitHub上,一款名叫VLM-R1的全新开源项目在上线短短十多个小时内,收到了来自各国开发者的2000多个星标收藏,并迅速登上平台热门趋势榜,关注度持续居高不下。

VLM-R1是什么?

2000多个星标又意味着什么?

“你可以把VLM-R1简单理解成‘视觉版DeepSeek’,它不仅会看,还很擅长思考,会举一反三。”项目带头人、Om AI Lab人工智能中心主任、浙江大学博士生导师赵天成博士在为记者通俗解释的同时,也表达了对引发反响的意外惊喜,“一天涨十几个星标比较常见,能收获几百个星标已经算是全球顶尖了;像VLM-R1这样一夜之间暴增上千关注的,前所未见!”

当DeepSeekR1方法遇上视觉模型

会有什么新变化?

“这个项目的灵感来自DeepSeek R1方法,其通过GRPO(Group Relative Policy Optimization)强化学习方法,在纯文本大模型上取得了显著效果。”赵天成表示。他毕业于卡内基梅隆大学(CMU),是全球最早一批推动生成式AI与大模型理论技术成熟的青年学者之一,“基于这个思路,我们开始思考:视觉模型是否也能实现类似的推理能力?”

与传统大模型训练的 SFT(Supervised Fine-Tuning)方法不同,R1方法的突破在于其路径创新。SFT依赖海量标注数据进行“填鸭式”教学,而R1方法则通过强化学习,让模型自主探索最优路径。“我们在Qwen2.5-VL的基础上,同时对比了R1和SFT方法,发现R1在各种复杂场景下都能保持稳定的高性能,这对实际应用至关重要。”赵天成解释道。

采访时,他分享了一个训练案例:在一张人行道的街景照片中,VLM-R1被要求定位可能对盲人行走造成危险的物体。照片中包含了常见的障碍物,如公交站牌、车辆、行人等,但其中还出现了一个特殊的元素——台阶。VLM-R1通过逐步分析,清晰地展示了其思考过程,并准确地圈出了台阶的位置。“对人类来说,这种推理是常识,但对视觉模型而言,准确识别图像、进行专业推理并用文本清晰表达,却非常具有挑战性。”

更令人惊叹的是VLM-R1的泛化能力。“它能举一反三,适应多种场景和任务,而无需针对每个任务进行专门训练。”赵天成举例,当你想买台电脑,苦恼于多种款式和不同价格,拍下比较图问AI:“选出性价比最高的一款”;当你在健身对吃大餐有负担,拍下菜单发给AI:“挑出高蛋白、低脂肪的食物”……这意味着R1方法让模型真正“学会”了理解视觉内容,而非简单的机械记忆。

2月15日,赵天成在海外社交平台上发布VLM-R1的实验结果,并将它开源、上传到GitHub,一夜之间成“顶流”。截至目前,该项目已获得全球开发者们给出的2800多个星标收藏。

“性能惊艳,潜力无限”“证明了R1方法的通用性,不止文本领域玩得转”“为多模态AI带来全新思路”“或许能够引领一种全新的视觉语言模型训练潮流”……业内人士纷纷对 VLM-R1表示高度认可。

“视觉版DeepSeek”

为什么是VLM-R1?

VLM-R1爆火,看似意料之外,实则情理之中。

以赵天成为首,这支以“95后”为主的年轻研发团队,含金量极高。在位于滨江区秋溢路上的金润科技园里,Om AI Lab汇聚了来自卡内基梅隆大学、微软研究院、清华大学、浙江大学等顶尖学术机构和科研单位的50名计算机领域精英。

“VLM-R1项目从春节启动,能迅速通过实验验证并取得成果,离不开我们前期的深厚积累,主要还是基础搭得牢。”赵天成表示,“我自2014年考入CMU时起就专注于AI生成式模型的研究,并结识了一群志同道合的伙伴。2021年,我们回国成立了Om AI Lab,就一直深耕于滨江。团队具备丰富的研究经验和创新思维,聚焦于AGI底层技术与架构的探索,始终致力于推动人工智能技术在各个领域的应用与发展。”

当行业刚刚开始关注大语言模型时,Om AI Lab早已坚定地探索多模态方向,并取得了工信部大模型检测的001号证书。“而002号证书的获得者,便是大家熟悉的‘文心一言’。”赵天成笑着说。

而Om AI Lab背后的母公司联汇科技,其多个智能体应用已通过与运营商、国家电网、广电媒体等企业机构的合作实现规模化落地,例如自动化输电线路巡检、开发AI眼镜帮助视障者“看见”世界等。

“视觉智能体产品,就像为机器人装上‘大脑’,为人类提供‘副脑’。随着VLM-R1内核的升级,未来将能实现更多应用场景。”赵天成表示,借助多模态的思考能力,VLM-R1将显著提升图像识别准确率,并生成相应的解决方案,“目前版本还处于1.0阶段,仍需更多实验来完善。”

以上内容为资讯信息快照,由td.fyun.cc爬虫进行采集并收录,本站未对信息做任何修改,信息内容不代表本站立场。

快照生成时间:2025-02-26 08:45:04

本站信息快照查询为非营利公共服务,如有侵权请联系我们进行删除。

信息原文地址:

机器人,“链”上滨江
...“CMG世界机器人大赛·系列赛”机甲格斗擂台赛上,来自杭州高新区(滨江)的宇树G1人形机器人作为唯一参赛机型,以硬核实力惊艳“破圈”。这台在聚光灯下挥洒自如的“钢铁之躯”,是
2025-06-13 08:53:00
近日,浙江大学脑机智能全国重点实验室重磅发布最新研制的新一代神经拟态类脑计算机——Darwin Monkey(“悟空”)。这是国际上首台神经元规模超过20亿的基于专用神经拟态芯片
2025-08-05 22:18:00
阿里云重磅升级全栈AI体系,一文看懂云栖大会技术发布
...像编辑功能,输入一句话即可完成P图。通义百聆发布2025杭州云栖大会上,通义大模型家族还迎来了全新的成员——语音大模型通义百聆
2025-09-24 13:30:00
DeepSeek,这条诞生在杭州的“鲸鱼” 这几天在全球科技圈、资本圈掀起滔天巨浪
...被称为“来自东方神秘力量”的DeepSeek。他们的总部位于杭州,是“杭州四小龙”的代表,创始人梁文锋毕业于浙大,前不久刚被国务院总理李强接见。中国的大模型已经追上美国了?故
2025-01-28 07:53:00
...日常生活中不可或缺的一部分。而在这场全球AI浪潮中,杭州,这座被誉为“人间天堂”的城市,正以它独特的科技活力,站在了时代的风口浪尖。今年春天,杭州的科技创新氛围格外活跃。从算
2025-03-20 09:00:00
年度生成式AI大会上海站公布最新嘉宾,报名进入最后阶段
...中昊芯英芯片软件栈负责人 朱国梁朱国梁,中昊芯英(杭州)科技有限公司芯片软件栈负责人,国防科技大学博士,主要研究方向为分布式系统、操作系统、编译器。曾参与国家重大项目天河系列
2024-11-26 09:38:00
...天凌晨,阿里巴巴又默默干了件大事:发布并开源全新的推理模型通义千问QwQ-32B。千问QwQ-32B是阿里探索推理模型的最新成果
2025-03-07 07:27:00
提质降价,国产大模型加速奔跑
...长的同时,国产大模型的使用成本也不断降低。不久前,杭州深度求索人工智能基础技术研究有限公司推出的DeepSeek-V3上线并同步开源
2025-02-05 03:48:00
字节猛踩油门
...借“用图像思考”能力瞬间占据热搜头条。几个小时后,杭州,字节跳动旗下火山引擎面向企业市场发布了豆包1.5深度思考模型,同步升级文生图模型3.0、视觉理解模型,并推出OS Ag
2025-04-18 22:26:00
更多关于科技的资讯:
省数据和政务服务局发布公告公开征集一批河北省高质量数据集河北日报讯(记者解楚楚)9月26日,河北省数据和政务服务局发布公告
2025-10-04 08:03:00
央媒看太原9月30日,央视财经频道《经济信息联播》栏目以《双节市场备货足美食特产受青睐》为题,报道了假期到来,太原市各大综合市场提前备货
2025-10-04 07:17:00
厦门网讯(厦门日报记者 朱道衡)近日,2025鼓浪屿世遗文创作品征集活动启动。此次活动面向全国(含港澳台地区)高校、企业
2025-10-03 08:37:00
厦门网讯(厦门日报记者 楚燕 通讯员 石青青)长假期间,许多人从忙碌的工作中解脱出来,趁机好好休息。可是,如果休息方式不得当
2025-10-03 08:37:00
渤海之潮涌动着澎湃的脉搏,海河之畔镌刻着科技的印记。10年前,一颗带有“清华”基因的种子在天津这片沃土扎根;10年后,它长成一棵枝繁叶茂的参天大树
2025-10-03 09:25:00
太燃了!无人机空中展旗!高新区国庆“氛围组”已上线!
2025-10-03 23:48:00
抖音生活服务联合北京卫视发起“老板驾到”直播活动,吸引用户下单超100万元团购券
9月29日,抖音生活服务联合北京卫视发起“老板驾到”直播活动,助力北京国庆中秋消费。抖音用户在@北京卫视 直播间下单超1万次
2025-10-03 18:36:00
“FutureBOT未来引力”2025北京机器人文化节首日盛况 打造国庆科技打卡新地标
国庆首日,“FutureBOT未来引力”2025北京机器人文化节在北京昌平超极合生汇正式拉开帷幕,成为国庆假期极具科技温度的打卡地
2025-10-03 19:06:00
走到白石山巅的尽头,这家建在悬崖边的“云端咖啡厅”绝对让你惊呼。
2025-10-03 11:37:00
泰康人寿发布新品“泰康百万药无忧(庆典版)医疗保险”(以下‬简称“百万药无忧”),以广覆盖、易投保、强保障、低费率为优势
2025-10-03 09:17:00
厦门网讯(厦门日报记者 翁华鸿 通讯员 林雨新)在近日举行的2025全球数据管理峰会“数据要素分论坛暨大数据统计与人工智能技术创新管理研讨会”上
2025-10-03 08:38:00
兴趣-实践-视野:达芬奇金奖少年带来的教育启示录
摘要:2025“你是达芬奇”全球青少年科学与艺术创新赛圆满落幕,其中金奖获奖少年的亲身实践告诉我们,在AI赋能的新时代
2025-10-02 16:22:00
单日调用近1万亿次,高德助力北斗规模化民用跨入新量级
2025年10月1日,随着国庆长假首日出行高峰的到来,高德基于北斗卫星导航系统的定位数量接近1万亿次,支撑导航总里程数超90亿公里
2025-10-02 22:31:00
10月1日,从太钢获悉,今年以来,太钢不锈进料加工团队以“精准备案、高效协同”为核心,在进料铬铁镍铁资源利用方面取得突破性进展
2025-10-02 17:39:00
厦门网讯(厦门日报记者 林露虹)记者昨日从中国移动咪咕公司获悉,该公司打造的“鼓浪屿AI伴游”服务已正式上线。市民和游客只需打开“鼓浪屿元宇宙”微信小程序
2025-10-02 08:57:00