• 我的订阅
  • 头条热搜
英伟达开源NVLM 1.0屠榜多模态!纯文本性能不降反升
...源模型(如GPT-4o)的表现并不一致。为了改变这一现状,英伟达的研究团队最近宣布推出NVLM 1.0,在视觉-语言任务上取得了最先进的成果,能够与最强大的闭源模型(如GPT-4o)和开源模型(如Llama 3-V 405B和InternVL 2)相媲美,并且...……更多
支持1024帧、准确率近100%,英伟达「LongVILA」开始发力长视频
...(涵盖系统、数据和 pipeline)是必不可少的。本文,来自英伟达、MIT、UC 伯克利、得克萨斯大学奥斯汀分校的研究者引入了 LongVILA,这是一种用于训练和部署长上下文视觉语言模型的全栈解决方案,包括系统设计、模型训练策略...……更多
多模态竞技场对标90B Llama 3.2!Pixtral 12B技术报告全公开
...是为了多模态的性能而牺牲了本身的自然语言性能,之前英伟达的NVLM 1.0也谈到了这点。Pixtral本次也是成功避开了这个缺陷,单单比较文本模型的性能,也在同等尺寸的模型中居于前列。另一点与大多数模型不同的是,Pixtral选...……更多
Meta首款多模态Llama 3.2开源!1B羊驼宝宝,跑在手机上了
...了闭源Claude 3 Haiku。甚至,90B版本击败了GPT-4o mini。就连英伟达高级科学家Jim Fan都不禁夸赞,在轻量级模型中,开源社区整体上并不落后! 同时,为了适配边缘计算和终端设备,Meta还推出了1B和3B两个轻量级纯文本的版本,可支...……更多
MMMU华人团队更新Pro版!多模态基准升至史诗级难度:过滤纯文本问题、引入纯视觉问答
...候选选项、引入纯视觉输入设置)更严格地评估模型的多模态理解能力;模型在新基准上的性能下降明显,表明MMMU-Pro能有效避免模型依赖捷径和猜测策略的情况。多模态大型语言模型(MLLMs)在各个排行榜上展现的性能不断提...……更多
文本、图像、点云任意模态输入,AI能够一键生成高质量CAD模型了
...同完成,是全球首个同时支持文本描述、图像、点云等多模态输入的计算机辅助设计(CAD)生成大模型。计算机辅助设计(Computer-Aided Design,简称 CAD)软件是工业软件的重要分支,也是工业设计流程中的核心工具。然而,目前...……更多
智谱AI发布视频生成大模型,B站参与研发,亦庄提供算力|甲子光年
...脸书的Make-A-Video、谷歌的Phenaki和MAGVIT、微软女娲DragNUWA、英伟达Video LDMs等视频生成模型工作中都有引用。2024年5月,GLM大模型技术团队在ICLR 2024主旨演讲环节全面阐述了GLM大模型面向AGI三大技术趋势,原生多模态大模型在其中扮...……更多
对比学习滥用隐私数据!中科院等发布「多步误差最小化」方法 | ACM MM2024
...出了一种新颖的多步误差最小化(MEM)方法,用于生成多模态不可学习样本,以保护个人数据不被多模态对比学习模型滥用。通过优化图像噪声和文本触发器,MEM方法有效地误导模型,降低其对隐私数据的学习能力,并在不同模...……更多
跨模态大升级!少量数据高效微调,LLM教会CLIP玩转复杂文本
在当今多模态领域,CLIP 模型凭借其卓越的视觉与文本对齐能力,推动了视觉基础模型的发展。CLIP 通过对大规模图文对的对比学习,将视觉与语言信号嵌入到同一特征空间中,受到了广泛应用。然而,CLIP 的文本处理能力被广...……更多
首个可保留情感的音频LLM!Meta重磅开源7B-Spirit LM,一网打尽「音频+文本」多模态任务
【新智元导读】Meta最近开源了一个7B尺寸的Spirit LM的多模态语言模型,能够理解和生成语音及文本,可以非常自然地在两种模式间转换,不仅能处理基本的语音转文本和文本转语音任务,还能捕捉和再现语音中的情感和风格。...……更多
微软宣布Team Copilot发布,年内将推出初步预览版
...的业务流程。AzureAIStudio现已支持提供GPT-4oAPI将率先使用英伟达BlackwellAI芯片纳德拉介绍,由OpeanAI开发的最新旗舰模型GPT-4o,现已在AzureAIStudio中提供,并作为API提供。该多模态模型集成了文本、图像和音频处理能力,带来了全新...……更多
疯狂一夜!美国AMD、谷歌纷纷亮出大杀器,人类迎来巨变前夜?|钛媒体焦点
...夜,谷歌(Google)、AMD先后上新,终于要“打爆”OpenAI和英伟达了。钛媒体App 12月7日消息,北京时间今天凌晨,谷歌CEO桑达尔·皮查伊 (Sundar Pichai) 宣布,谷歌公司正式发布迄今为止功能最强大、最通用的多模态人工智能(AI)...……更多
阿里多模态检索智能体,自带o1式思考过程!复杂问题逐步拆解
多模态检索增强生成(mRAG)也有o1思考推理那味儿了!阿里通义实验室新研究推出自适应规划的多模态检索智能体。名叫OmniSearch,它能模拟人类解决问题的思维方式,将复杂问题逐步拆解进行智能检索规划。随便上传一张图,...……更多
大模型重构生命科学!最大基础模型面世,解锁DNA超长序列
...巨头任命首席AI官;科技巨头纷纷出手布局,诸如谷歌Meta英伟达也早已相关探索。还有像赛诺菲,这种全球TOP10药企愿意砸超10亿美金与百图生科共同打造AI模型。各种生命科学大模型也纷纷被顶刊所接收,比如像百图生科此前发...……更多
背水一战狙击GPT-4,谷歌最强大模型Gemini终发布,听说读写全能选手 | 焦点分析
...圈,Gemini才在千呼万唤中面世。△图源:谷歌一个月前,英伟达的资深科学家Jim Fan就为Gemini捏了把汗:“人们对谷歌Gemini的期望高得离谱!”他表示,Meta要惊艳世界的话,只要让Llama 3开源就好了。但谷歌想要重夺当年AlphaGo的...……更多
苹果的封闭生态为大模型打开!发布开源多模态大模型、每天为 AI 烧百万美元,零碎的 Android 生态打得过吗?
...谷歌。如果大量人工智能使用转向苹果硬件,它们也会对英伟达构成威胁,Arm 和台积电将获胜。”有网友说到苹果在大模型发展上的状况。也有网友认为,苹果在大模型上的发力将为其在未来的手机市场竞争中带来优势。他们...……更多
阿里国际发布最新开源多模态模型Ovis,多模态能力再升级
...手写英文准确翻译成中文、还能精准分析财报数据……多模态能力再次升级!今天,阿里国际AI团队发布了一款多模态大模型Ovis,在图像理解任务上不断突破极限,多种具体的子类任务中均达到了SOTA(最新技术)水平。多模态...……更多
Sora再度颠覆AI视频行业,A股哪些公司有相关布局?
...:HK)、三人行(605168)等;上游增加需求来看,推荐关注英伟达等算法、算力方面标的。东方证券早前的报告认为,从技术突破的角度来看,下一阶段的重点攻克方向必然会是多模态技术。能够真正处理和应用好多模态AI能力,...……更多
迎战GPT-4V!谷歌PaLI-3视觉语言模型问世,更小、更快、更强
...像与语音识别能力。本月初,微软更是公布了 166 页的多模态版 GPT-4V 的相关文档,详细探讨了 GPT-4V 的功能和使用情况,这一举动引起了业界的广泛关注。然而,在视觉语言模型的角逐中,谷歌也不甘示弱。 近日,Google Research...……更多
别只盯着ChatGPT版Her,多模态AI拟人互动上,国内玩家也支棱起来了
... AI 发起挑战的高规格赛事落下了帷幕!这就是第二届多模态情感识别挑战赛(MER24),它由清华大学陶建华教授、中国科学院自动化研究所连政、帝国理工学院 Björn W.Schuller、奥卢大学赵国英以及南洋理工大学 Erik Cambra 联合在 A...……更多
击败Gemini-1.5-Pro、GPT-4V,从容大模型多模态能力跻身全球前三
...云从科技从容大模型在综合评测权威平台 OpenCompass 的多模态评测领域中取得重大进展。最新评测结果显示,云从科技的从容大模型在该体系中的平均得分为 65.5,这一成绩使得从容大模型跻身全球前三,超越了谷歌的 Gemini-1.5-Pro...……更多
llava-1.6与gpt-4vmp面硬刚的性能,一起来看看
...Qwen-VL-Plus,与GPT-4V正面硬刚,这个有着SOTA级别性能的多模态大模型真正做到了“人无我有,人有我优”。继2023年4月的初级版本、2023年10月的LLaVA-1.5之后,2024年1月31日,微软研究院又联合威斯康星大学麦迪逊分校和哥伦比亚大...……更多
Gemini引领多模态AI热潮,产业发展有望加速
12月11日,多模态AI概念股继续活跃,苏州科达(603660.SH)三连板。截至当日中午收盘,因赛集团(300781.SZ)涨13.32%,苏州科达涨9.96%,宣亚国际(300612.SZ)涨9.7%。消息面上,GoogleAI大模型Gemini近日发布,Gemini是Google到目前为止规……更多
全模态对齐框架align-anything来啦:实现跨模态指令跟随
... OpenAI o1 技术的深入分析累计点击量已超过 15 万。如何全模态大模型与人类的意图相对齐,已成为一个极具前瞻性且至关重要的挑战。在当前 AI 领域的快速发展中,「有效加速」和「超级对齐」已经成为两个主要的发展动向,...……更多
文档处理效能飙升!浩鲸科技“文档大模型”核心技术揭秘!
...的整体性方案,不仅包含了文档大模型能力,还提供了多模态文档工具链 DocChain 和开箱即用的软硬件一体机,基于垂直模型能力和软硬件相互配合,可帮助企业实现文档的知识抽取、知识融合,直至知识推理和问答的全流程覆...……更多
价格便宜75%!亚马逊推出全新大模型系列,3纳米自研芯片明年上市
...训练苹果智能背后的AI模型,而不是像其他公司那样使用英伟达芯片。 3日当天,亚马逊(Nasdaq:AMZN)涨1.3%收于每股213.44美元,总市值2.24万亿美元。今年以来,公司股价已涨超40%。 ……更多
vivo发布自研大模型,为用户和开发者带来诸多惊喜
...随着大模型技术日益成熟,vivo在语言、图像、语音、多模态等全模态的AI技术上逐步升级为大模型能力,正从传统的AI技术时代迈向大模型AI技术时代。vivoAI算法技术总监李方圆全新蓝心大模型带来4项核心升级:1、语言大模型升...……更多
本周硅谷发生了什么?| 高通第三代骁龙8;谷歌20亿美元追投Anthropic;联想拿出能跑大模型个人PC
...拥有70名员工。Moreh 表示,旗舰人工智能软件 MoAI类似于英伟达的CUDA,但与现有的机器学习框架(如Meta的PyTorch、谷歌的TensorFlow)以及以前只能在英伟达上运行的应用程序和人工智能模型兼容。(新浪VR) 新玩意Zero123++:从单一...……更多
多模态LLM视觉推理能力堪忧,浙大领衔用GPT-4合成数据构建多模态基准
...进模型在视觉推理方面同样不足。为此他们提出了一种多模态的视觉推理基准,并设计了一种新颖的数据合成方法。无论是语言模型还是视觉模型,似乎都很难完成更抽象层次上的理解和推理任务。语言模型已经可以写诗写小说...……更多
多模态大模型是当下很火的一种创新技术,加快对多模态大模型技术的布局,可进一步提高金融服务效率,缓解行业发展困境。为了攻克创新技术领域的难题,度小满联合哈尔滨工业大学共同研发出一种创新的自适应剪枝算法...……更多
更多关于科技的资讯:
“分钟级”匹配面料杭州日报讯 昨日,以“新发展格局与产业竞争力提升”为主题的中国印染大会在绍兴柯桥召开。会上,纺织产业首个AI大模型“AI布”1
2025-07-23 06:24:00
启东八大产业全景扫描丨电动工具产业:40年深耕筑全链优势
自今年上半年广交会结束后,位于启东市吕四港镇的江苏仟得电动工具有限公司已迎来20多批次登门考察的外商,订单量激增。眼下
2025-07-23 07:40:00
打造“第二课堂” 为青年就业搭“金”桥金融行业“青柠实践实境课堂”启动南报网讯(记者余梦迪)7月21日,南京金融行业“青柠实践实境课堂”启动暨金融青年与高校学子面对面活动举行
2025-07-23 07:52:00
近日,山姆会员商店在国内上新了一款售价49.9元、内含48枚的好丽友派产品。相比市售普通款,该商品“减糖80%”的同时“增加30%可可成分”
2025-07-23 07:56:00
近日,航旅纵横APP正式上线“民航官方直销平台”功能,用户可在单一界面完成多家航司直销机票的比价和购买。据介绍,航旅纵横民航直销平台是航空公司直接面向旅客销售机票产品的线上平台
2025-07-23 07:58:00
数智羽翼赋能未来农业:牧族科技重塑300万羽蛋鸡产业新纪元
大众网记者 王帅 潍坊报道走进山东牧族的无抗蛋鸡生态养殖基地,偌大的鸡舍中鸡群正悠闲地散步、进食,却不见工作人员的身影
2025-07-22 20:11:00
潍坊昌邑优然牧业:数字赋能让牛舍“会思考”“会呼吸”
潍坊昌邑优然牧业:数字赋能打造“会思考”“会呼吸”的“科技牛舍”大众网记者 王帅 潍坊报道在科技浪潮重塑农业版图的当下
2025-07-22 20:15:00
先理知学:一站式服务,助力牙科学子申博圆梦
获取博士学位的意义在不同时代各有侧重,当下,其为个人搭起一座通往更高层次知识探索与开创的桥梁,同时对社会和行业发展亦影响深远
2025-07-22 21:08:00
先理知学:深耕申博套磁细节,以定制化服务学子
当下,越来越多的学生选择海外申博。但博士申请并非易事,在申请阶段,学子们常常会面临不同的挑战。加之申博时间紧,任务重的原因
2025-07-22 21:08:00
解读墨迹天气品牌焕新TVC:用“时间魔法”诠释“可预见的未来”
你是否也遇过这样的时刻:狂风撕扯着摄影师的镜头,雨帘撞碎了绿茵场的欢呼,阴云吞噬了期待的烟火,约会被突来的大雨打消……如果时光能倒流
2025-07-22 21:12:00
行业首创定义标杆典范,瑞幸生椰拿铁获2025消费大赏好物榜单权威认可
近日,瑞幸咖啡常青爆款生椰拿铁凭借其行业首创的标杆价值,以及卓越的市场表现和消费者口碑,成功入选南方都市报“2025消费大赏好物榜单”
2025-07-22 21:12:00
盈米基金与阿里云达成AI全栈战略合作
随着生成式人工智能的迅猛发展,财富管理领域的AI转型也迈入了“加速期”。7月21日,盈米基金与阿里云达成AI全栈战略合作
2025-07-22 21:12:00
一个工程师的极限挑战——专访山子有谦V17项目创业团队
在新能源汽车行业“反内卷”呼声高涨的当前,市场再次迎来有力竞争对手。日前,天猫与山子高科技股份有限公司(以下简称“山子高科”)签署战略合作协议
2025-07-22 21:12:00
迈入数字化时代,人工智能正以前所未有的速度重塑着各个行业的格局。2025年政府工作报告明确提出持续推进“人工智能+”行动
2025-07-22 21:12:00
深度智控出席工达科技“智汇多能·零碳未来”交流会暨生态伙伴答谢晚宴,并达成战略合作
2025年7月18日,“智汇多能·零碳未来”交流会暨工达科技生态伙伴答谢晚宴在济南百花汀国际酒店隆重举行。本次活动由济南工达捷能科技发展有限公司主办
2025-07-22 21:12:00