• 我的订阅
  • 科技

全球瞩目,又是杭州!这款视觉推理模型一夜起飞

类别:科技 发布时间:2025-02-26 07:07:00 来源:杭州网

杭州日报讯 “点击图中最小的红色三棱柱”——我们登录DeepSeek时,都遇到类似验证问题。

识图、辨别、点击。这对我们人类来说并不难;但若AI在深度思考几秒后,也能自动识别图片并圈出答案,并把它的思考过程“解释”给你听呢?

——这不是想象!这两天,全球开源圈又“炸”了。

在全球最大的代码托管与协作平台GitHub上,一款名叫VLM-R1的全新开源项目在上线短短十多个小时内,收到了来自各国开发者的2000多个星标收藏,并迅速登上平台热门趋势榜,关注度持续居高不下。

VLM-R1是什么?

2000多个星标又意味着什么?

“你可以把VLM-R1简单理解成‘视觉版DeepSeek’,它不仅会看,还很擅长思考,会举一反三。”项目带头人、Om AI Lab人工智能中心主任、浙江大学博士生导师赵天成博士在为记者通俗解释的同时,也表达了对引发反响的意外惊喜,“一天涨十几个星标比较常见,能收获几百个星标已经算是全球顶尖了;像VLM-R1这样一夜之间暴增上千关注的,前所未见!”

当DeepSeekR1方法遇上视觉模型

会有什么新变化?

“这个项目的灵感来自DeepSeek R1方法,其通过GRPO(Group Relative Policy Optimization)强化学习方法,在纯文本大模型上取得了显著效果。”赵天成表示。他毕业于卡内基梅隆大学(CMU),是全球最早一批推动生成式AI与大模型理论技术成熟的青年学者之一,“基于这个思路,我们开始思考:视觉模型是否也能实现类似的推理能力?”

与传统大模型训练的 SFT(Supervised Fine-Tuning)方法不同,R1方法的突破在于其路径创新。SFT依赖海量标注数据进行“填鸭式”教学,而R1方法则通过强化学习,让模型自主探索最优路径。“我们在Qwen2.5-VL的基础上,同时对比了R1和SFT方法,发现R1在各种复杂场景下都能保持稳定的高性能,这对实际应用至关重要。”赵天成解释道。

采访时,他分享了一个训练案例:在一张人行道的街景照片中,VLM-R1被要求定位可能对盲人行走造成危险的物体。照片中包含了常见的障碍物,如公交站牌、车辆、行人等,但其中还出现了一个特殊的元素——台阶。VLM-R1通过逐步分析,清晰地展示了其思考过程,并准确地圈出了台阶的位置。“对人类来说,这种推理是常识,但对视觉模型而言,准确识别图像、进行专业推理并用文本清晰表达,却非常具有挑战性。”

更令人惊叹的是VLM-R1的泛化能力。“它能举一反三,适应多种场景和任务,而无需针对每个任务进行专门训练。”赵天成举例,当你想买台电脑,苦恼于多种款式和不同价格,拍下比较图问AI:“选出性价比最高的一款”;当你在健身对吃大餐有负担,拍下菜单发给AI:“挑出高蛋白、低脂肪的食物”……这意味着R1方法让模型真正“学会”了理解视觉内容,而非简单的机械记忆。

2月15日,赵天成在海外社交平台上发布VLM-R1的实验结果,并将它开源、上传到GitHub,一夜之间成“顶流”。截至目前,该项目已获得全球开发者们给出的2800多个星标收藏。

“性能惊艳,潜力无限”“证明了R1方法的通用性,不止文本领域玩得转”“为多模态AI带来全新思路”“或许能够引领一种全新的视觉语言模型训练潮流”……业内人士纷纷对 VLM-R1表示高度认可。

“视觉版DeepSeek”

为什么是VLM-R1?

VLM-R1爆火,看似意料之外,实则情理之中。

以赵天成为首,这支以“95后”为主的年轻研发团队,含金量极高。在位于滨江区秋溢路上的金润科技园里,Om AI Lab汇聚了来自卡内基梅隆大学、微软研究院、清华大学、浙江大学等顶尖学术机构和科研单位的50名计算机领域精英。

“VLM-R1项目从春节启动,能迅速通过实验验证并取得成果,离不开我们前期的深厚积累,主要还是基础搭得牢。”赵天成表示,“我自2014年考入CMU时起就专注于AI生成式模型的研究,并结识了一群志同道合的伙伴。2021年,我们回国成立了Om AI Lab,就一直深耕于滨江。团队具备丰富的研究经验和创新思维,聚焦于AGI底层技术与架构的探索,始终致力于推动人工智能技术在各个领域的应用与发展。”

当行业刚刚开始关注大语言模型时,Om AI Lab早已坚定地探索多模态方向,并取得了工信部大模型检测的001号证书。“而002号证书的获得者,便是大家熟悉的‘文心一言’。”赵天成笑着说。

而Om AI Lab背后的母公司联汇科技,其多个智能体应用已通过与运营商、国家电网、广电媒体等企业机构的合作实现规模化落地,例如自动化输电线路巡检、开发AI眼镜帮助视障者“看见”世界等。

“视觉智能体产品,就像为机器人装上‘大脑’,为人类提供‘副脑’。随着VLM-R1内核的升级,未来将能实现更多应用场景。”赵天成表示,借助多模态的思考能力,VLM-R1将显著提升图像识别准确率,并生成相应的解决方案,“目前版本还处于1.0阶段,仍需更多实验来完善。”

以上内容为资讯信息快照,由td.fyun.cc爬虫进行采集并收录,本站未对信息做任何修改,信息内容不代表本站立场。

快照生成时间:2025-02-26 08:45:04

本站信息快照查询为非营利公共服务,如有侵权请联系我们进行删除。

信息原文地址:

...杯奶茶 1138万杯咖啡 3000吨鸡蛋……千问3.5为全球AI提供“杭州方案”杭州日报讯 刚刚过去的马年春节,杭州AI迎来技术与应用的双重突破
2026-02-26 06:35:00
机器人,“链”上滨江
...“CMG世界机器人大赛·系列赛”机甲格斗擂台赛上,来自杭州高新区(滨江)的宇树G1人形机器人作为唯一参赛机型,以硬核实力惊艳“破圈”。这台在聚光灯下挥洒自如的“钢铁之躯”,是
2025-06-13 08:53:00
近日,浙江大学脑机智能全国重点实验室重磅发布最新研制的新一代神经拟态类脑计算机——Darwin Monkey(“悟空”)。这是国际上首台神经元规模超过20亿的基于专用神经拟态芯片
2025-08-05 22:18:00
阿里云重磅升级全栈AI体系,一文看懂云栖大会技术发布
...像编辑功能,输入一句话即可完成P图。通义百聆发布2025杭州云栖大会上,通义大模型家族还迎来了全新的成员——语音大模型通义百聆
2025-09-24 13:30:00
阿里发布千问3.5,性能媲美Gemini 3, Token价格仅为其1/18
...性能超过万亿参数的Qwen3-Max模型,部署显存占用降低60%,推理效率大幅提升,最大推理吞吐量可提升至19倍。Qwen3
2026-02-16 17:34:00
DeepSeek,这条诞生在杭州的“鲸鱼” 这几天在全球科技圈、资本圈掀起滔天巨浪
...被称为“来自东方神秘力量”的DeepSeek。他们的总部位于杭州,是“杭州四小龙”的代表,创始人梁文锋毕业于浙大,前不久刚被国务院总理李强接见。中国的大模型已经追上美国了?故
2025-01-28 07:53:00
年度生成式AI大会上海站公布最新嘉宾,报名进入最后阶段
...中昊芯英芯片软件栈负责人 朱国梁朱国梁,中昊芯英(杭州)科技有限公司芯片软件栈负责人,国防科技大学博士,主要研究方向为分布式系统、操作系统、编译器。曾参与国家重大项目天河系列
2024-11-26 09:38:00
...日常生活中不可或缺的一部分。而在这场全球AI浪潮中,杭州,这座被誉为“人间天堂”的城市,正以它独特的科技活力,站在了时代的风口浪尖。今年春天,杭州的科技创新氛围格外活跃。从算
2025-03-20 09:00:00
...天凌晨,阿里巴巴又默默干了件大事:发布并开源全新的推理模型通义千问QwQ-32B。千问QwQ-32B是阿里探索推理模型的最新成果
2025-03-07 07:27:00
更多关于科技的资讯:
为期三天的“浙里买全球·消费启杭”活动汇聚了来自全球各地的特色商品,活动会为消费者带来怎样的全新体验?走进展区,仿佛开启了一场环球之旅
2026-03-15 20:52:00
全国两会结束后的第一个周末,金华迎来了一群特殊的客人。据《金华日报》报道,3月14日,商务部党组书记、部长王文涛率队来我市调研对外贸易
2026-03-15 20:52:00
中新经纬3月15日电 “中国互联网金融协会”公众号15日发布关于OpenClaw在互联网金融行业应用安全的风险提示。近期
2026-03-15 21:30:00
在AWE2026海尔展区,五大套系呈现了智能家电的不同探索路径:Seeker套系以L4级AI智能体实现主动感知,小红花套系面向年轻群体聚焦极简交互
2026-03-15 18:40:00
3月9日至10日,滦州农商银行举办业务拓展与营销技能提升专题培训。本次培训采取“理论授课+实战走访”模式,机关部室负责人
2026-03-15 18:45:00
今年以来,肥乡联社将线上贷款营销作为零售贷款增户扩面、信贷结构调整优化的切入点,强化督导考核,加强营销培训,丰富信贷产品
2026-03-15 18:54:00
小叶医探 | 手术机器人“学院派”来了!安医大医用机器人产业学院正式启航
大皖新闻讯 3月15日,一所由政府、高校、行业、企业四方协同共建的创新型学院——医用机器人产业学院,在安徽医科大学正式揭牌启航
2026-03-15 19:18:00
“沧州造”高性能膜开年斩获千万元海外订单
2026-03-15 18:47:00
长白时评评论员 刘颂寒又是一年春草绿,又是一年“3·15”时。每年的 ‌“3·15晚会”‌,必然是不少商家坐立难安的时刻
2026-03-15 08:16:00
近日,从山西转型综改示范区传来好消息,山西中电科电子装备有限公司市场开拓捷报频传,碳化硅涂层设备、纯化设备、铜铸锭炉等订单接连落地
2026-03-15 07:11:00
14日,“金华·金漪湖”2026人工智能产业融合发展大会在金义新区举行。今年全国两会上,政府工作报告提出“打造智能经济新形态”
2026-03-15 07:41:00
杭州创新力量表现抢眼杭州日报讯 3月12日,国家服务贸易创新发展引导基金二期的首场项目路演会在杭州举行。22个来自数字贸易
2026-03-15 07:42:00
这些天,乍暖还寒,慈溪家电企业的生产车间却热潮涌动。“我们自主研发的多功能高速风梳一开年就拿下了100万台订单。”宁波瑞卡电器负责人说
2026-03-15 07:42:00
中国科大提出常温常压绿氨合成的标准化方案
大皖新闻讯 3月14日,大皖新闻记者从中国科学技术大学获悉,该校熊宇杰教授团队提出基于等离子体和电催化耦合的绿氨合成技术的标准化实验方案
2026-03-14 21:31:00