• 我的订阅
  • 头条热搜
英伟达开源NVLM 1.0屠榜多模态!纯文本性能不降反升
...源模型(如GPT-4o)的表现并不一致。为了改变这一现状,英伟达的研究团队最近宣布推出NVLM 1.0,在视觉-语言任务上取得了最先进的成果,能够与最强大的闭源模型(如GPT-4o)和开源模型(如Llama 3-V 405B和InternVL 2)相媲美,并且...……更多
支持1024帧、准确率近100%,英伟达「LongVILA」开始发力长视频
...(涵盖系统、数据和 pipeline)是必不可少的。本文,来自英伟达、MIT、UC 伯克利、得克萨斯大学奥斯汀分校的研究者引入了 LongVILA,这是一种用于训练和部署长上下文视觉语言模型的全栈解决方案,包括系统设计、模型训练策略...……更多
Meta首款多模态Llama 3.2开源!1B羊驼宝宝,跑在手机上了
...了闭源Claude 3 Haiku。甚至,90B版本击败了GPT-4o mini。就连英伟达高级科学家Jim Fan都不禁夸赞,在轻量级模型中,开源社区整体上并不落后! 同时,为了适配边缘计算和终端设备,Meta还推出了1B和3B两个轻量级纯文本的版本,可支...……更多
MMMU华人团队更新Pro版!多模态基准升至史诗级难度:过滤纯文本问题、引入纯视觉问答
...候选选项、引入纯视觉输入设置)更严格地评估模型的多模态理解能力;模型在新基准上的性能下降明显,表明MMMU-Pro能有效避免模型依赖捷径和猜测策略的情况。多模态大型语言模型(MLLMs)在各个排行榜上展现的性能不断提...……更多
商汤发布开源社区最大最强多模态多任务通用大模型“书生2.5”
商汤发布开源社区最大最强多模态多任务通用大模型“书生2.5” 3月14日,商汤科技发布多模态多任务通用大模型“书生(INTERN)2.5”,在多模态多任务处理能力方面实现多项全新突破,其卓越的图文跨模态开放任务处理能力可...……更多
智谱AI发布视频生成大模型,B站参与研发,亦庄提供算力|甲子光年
...脸书的Make-A-Video、谷歌的Phenaki和MAGVIT、微软女娲DragNUWA、英伟达Video LDMs等视频生成模型工作中都有引用。2024年5月,GLM大模型技术团队在ICLR 2024主旨演讲环节全面阐述了GLM大模型面向AGI三大技术趋势,原生多模态大模型在其中扮...……更多
对比学习滥用隐私数据!中科院等发布「多步误差最小化」方法 | ACM MM2024
...出了一种新颖的多步误差最小化(MEM)方法,用于生成多模态不可学习样本,以保护个人数据不被多模态对比学习模型滥用。通过优化图像噪声和文本触发器,MEM方法有效地误导模型,降低其对隐私数据的学习能力,并在不同模...……更多
微软宣布Team Copilot发布,年内将推出初步预览版
...的业务流程。AzureAIStudio现已支持提供GPT-4oAPI将率先使用英伟达BlackwellAI芯片纳德拉介绍,由OpeanAI开发的最新旗舰模型GPT-4o,现已在AzureAIStudio中提供,并作为API提供。该多模态模型集成了文本、图像和音频处理能力,带来了全新...……更多
疯狂一夜!美国AMD、谷歌纷纷亮出大杀器,人类迎来巨变前夜?|钛媒体焦点
...夜,谷歌(Google)、AMD先后上新,终于要“打爆”OpenAI和英伟达了。钛媒体App 12月7日消息,北京时间今天凌晨,谷歌CEO桑达尔·皮查伊 (Sundar Pichai) 宣布,谷歌公司正式发布迄今为止功能最强大、最通用的多模态人工智能(AI)...……更多
苹果的封闭生态为大模型打开!发布开源多模态大模型、每天为 AI 烧百万美元,零碎的 Android 生态打得过吗?
...谷歌。如果大量人工智能使用转向苹果硬件,它们也会对英伟达构成威胁,Arm 和台积电将获胜。”有网友说到苹果在大模型发展上的状况。也有网友认为,苹果在大模型上的发力将为其在未来的手机市场竞争中带来优势。他们...……更多
背水一战狙击GPT-4,谷歌最强大模型Gemini终发布,听说读写全能选手 | 焦点分析
...圈,Gemini才在千呼万唤中面世。△图源:谷歌一个月前,英伟达的资深科学家Jim Fan就为Gemini捏了把汗:“人们对谷歌Gemini的期望高得离谱!”他表示,Meta要惊艳世界的话,只要让Llama 3开源就好了。但谷歌想要重夺当年AlphaGo的...……更多
阿里国际发布最新开源多模态模型Ovis,多模态能力再升级
...手写英文准确翻译成中文、还能精准分析财报数据……多模态能力再次升级!今天,阿里国际AI团队发布了一款多模态大模型Ovis,在图像理解任务上不断突破极限,多种具体的子类任务中均达到了SOTA(最新技术)水平。多模态...……更多
Sora再度颠覆AI视频行业,A股哪些公司有相关布局?
...:HK)、三人行(605168)等;上游增加需求来看,推荐关注英伟达等算法、算力方面标的。东方证券早前的报告认为,从技术突破的角度来看,下一阶段的重点攻克方向必然会是多模态技术。能够真正处理和应用好多模态AI能力,...……更多
GPT-4撞上文心一言,百度压力骤增:多模态和中文能力受关注,或多种方式落地
...元为 OpenAI 建造了一台巨大的超级计算机,使用了上万颗英伟达GPU计算芯片,并称愿意投入更多资金。前述互联网分析师也提到,对文心一言等类似大模型来说,最重要的还是算力。“这次百度抢先在国内最早发布类ChatGPT应用,...……更多
迎战GPT-4V!谷歌PaLI-3视觉语言模型问世,更小、更快、更强
...像与语音识别能力。本月初,微软更是公布了 166 页的多模态版 GPT-4V 的相关文档,详细探讨了 GPT-4V 的功能和使用情况,这一举动引起了业界的广泛关注。然而,在视觉语言模型的角逐中,谷歌也不甘示弱。 近日,Google Research...……更多
别只盯着ChatGPT版Her,多模态AI拟人互动上,国内玩家也支棱起来了
... AI 发起挑战的高规格赛事落下了帷幕!这就是第二届多模态情感识别挑战赛(MER24),它由清华大学陶建华教授、中国科学院自动化研究所连政、帝国理工学院 Björn W.Schuller、奥卢大学赵国英以及南洋理工大学 Erik Cambra 联合在 A...……更多
紫东.太初再进化,揭秘全模态大模型的想象力
...有云、私有云、混合云在内的多种部署方式,兼容昇腾、英伟达、AMD、英特尔等不同AI硬件,作为AI框架的昇思MindSpore还提供了数据中心、训练中心、模型中心、推理中心在内大模型微调套件,进一步降低了大模型的开发门槛,...……更多
击败Gemini-1.5-Pro、GPT-4V,从容大模型多模态能力跻身全球前三
...云从科技从容大模型在综合评测权威平台 OpenCompass 的多模态评测领域中取得重大进展。最新评测结果显示,云从科技的从容大模型在该体系中的平均得分为 65.5,这一成绩使得从容大模型跻身全球前三,超越了谷歌的 Gemini-1.5-Pro...……更多
llava-1.6与gpt-4vmp面硬刚的性能,一起来看看
...Qwen-VL-Plus,与GPT-4V正面硬刚,这个有着SOTA级别性能的多模态大模型真正做到了“人无我有,人有我优”。继2023年4月的初级版本、2023年10月的LLaVA-1.5之后,2024年1月31日,微软研究院又联合威斯康星大学麦迪逊分校和哥伦比亚大...……更多
Gemini引领多模态AI热潮,产业发展有望加速
12月11日,多模态AI概念股继续活跃,苏州科达(603660.SH)三连板。截至当日中午收盘,因赛集团(300781.SZ)涨13.32%,苏州科达涨9.96%,宣亚国际(300612.SZ)涨9.7%。消息面上,GoogleAI大模型Gemini近日发布,Gemini是Google到目前为止规……更多
全模态对齐框架align-anything来啦:实现跨模态指令跟随
... OpenAI o1 技术的深入分析累计点击量已超过 15 万。如何全模态大模型与人类的意图相对齐,已成为一个极具前瞻性且至关重要的挑战。在当前 AI 领域的快速发展中,「有效加速」和「超级对齐」已经成为两个主要的发展动向,...……更多
文档处理效能飙升!浩鲸科技“文档大模型”核心技术揭秘!
...的整体性方案,不仅包含了文档大模型能力,还提供了多模态文档工具链 DocChain 和开箱即用的软硬件一体机,基于垂直模型能力和软硬件相互配合,可帮助企业实现文档的知识抽取、知识融合,直至知识推理和问答的全流程覆...……更多
vivo发布自研大模型,为用户和开发者带来诸多惊喜
...随着大模型技术日益成熟,vivo在语言、图像、语音、多模态等全模态的AI技术上逐步升级为大模型能力,正从传统的AI技术时代迈向大模型AI技术时代。vivoAI算法技术总监李方圆全新蓝心大模型带来4项核心升级:1、语言大模型升...……更多
多模态LLM视觉推理能力堪忧,浙大领衔用GPT-4合成数据构建多模态基准
...进模型在视觉推理方面同样不足。为此他们提出了一种多模态的视觉推理基准,并设计了一种新颖的数据合成方法。无论是语言模型还是视觉模型,似乎都很难完成更抽象层次上的理解和推理任务。语言模型已经可以写诗写小说...……更多
本周硅谷发生了什么?| 高通第三代骁龙8;谷歌20亿美元追投Anthropic;联想拿出能跑大模型个人PC
...拥有70名员工。Moreh 表示,旗舰人工智能软件 MoAI类似于英伟达的CUDA,但与现有的机器学习框架(如Meta的PyTorch、谷歌的TensorFlow)以及以前只能在英伟达上运行的应用程序和人工智能模型兼容。(新浪VR) 新玩意Zero123++:从单一...……更多
多模态大模型是当下很火的一种创新技术,加快对多模态大模型技术的布局,可进一步提高金融服务效率,缓解行业发展困境。为了攻克创新技术领域的难题,度小满联合哈尔滨工业大学共同研发出一种创新的自适应剪枝算法...……更多
只有谷歌受伤的世界达成了,但“全能模型”到底该不该跟?
...OpenAI、谷歌那样做不行。最简单的,GPT-4o能第一时间拿到英伟达最先进的显卡,这就是国内厂商很难拥有的资源。此外,ToB领域对模型可控性的要求、私有化部署的需求等,国内企业的智能化要从数据清洗、知识库等基础工作开...……更多
支付宝发布多模态医疗大模型:支持千亿级视觉识别
...快科技7月5日消息,在2024世界人工智能大会上,支付宝多模态医疗大模型正式亮相,成为国内首批多模态医疗大模型之一。据悉,该医疗大模型的基石,源自蚂蚁集团自主研发的蚂蚁百灵大模型,这一先进平台不仅拥有“视听言...……更多
2B多模态新SOTA!华科、华南理工发布Mini-Monkey,专治「切分增大分辨率」后遗症
【新智元导读】Mini-Monkey 是一个轻量级的多模态大型语言模型,通过采用多尺度自适应切分策略(MSAC)和尺度压缩机制(SCM),有效缓解了传统图像切分策略带来的锯齿效应,提升了模型在高分辨率图像处理和文档理解任务的...……更多
奥林匹克竞赛里选最聪明的AI:Claude-3.5-Sonnet vs. GPT-4o?
...数据泄露,从而反映模型的真实性能。研究团队测试了多模态大模型(LMMs)和纯文本大模型(LLMs)。对于LLMs的测试,输入时不提供任何与图像相关的信息给模型,仅提供文本。所有评估均采用零样本(zero-shot)思维链(Chain of ...……更多
更多关于科技的资讯:
国产电车卷太猛!宝马奔驰联盟了 2年落地1000座超充站
罕见一幕。大家熟悉的“蓝天白云”和“三叉戟”LOGO,一起印在了超充站上。刚刚,奔驰宝马在北京联合发布超充站,计划以服务和充电速度打出差异化
2024-10-25 12:57:00
重大突破!芯片光刻胶关键技术被攻克:原材料全部国产 配方全自主设计
快科技10月25日消息,据华中科技大学官微消息,近日,该校武汉光电国家研究中心团队,在国内率先攻克合成光刻胶所需的原料和配方
2024-10-25 12:57:00
国内单体规模最大!德令哈塔式光热项目吸热塔及主厂房封顶
快科技10月25日消息,据报道,国内单体规模最大塔式光热项目——中国广核集团德令哈20万千瓦塔式光热项目吸热塔、主厂房封顶
2024-10-25 12:57:00
harman/kardon SOUNDSTICKS 4音乐水
再忙的生活,也要抽空放松下,一首音乐能带来满腔活力。harman/kardonSOUNDSTICKS4音乐水晶四代桌面式蓝牙立体声音音箱极具艺术感的剔透穹顶设计载以醇正立体声音效
2024-10-25 13:11:00
飞行汽车如何让我们“飞”起来?
在科技日新月异的今天,飞行汽车作为一种结合了地面行驶与空中飞行功能的运载工具,正逐步从科幻电影走进现实生活,成为各界关注的焦点
2024-10-25 13:31:00
三养食品创新呈现泰式咖喱蟹味火鸡面,中国食客:这一口泰地道辣!
随着新一代消费群体对个性化与多样化需求的激增,中国速食行业正加速向高品质、多口味创新转型。三养食品自2021年进驻中国市场后迅速崛起
2024-10-25 13:34:00
古镇灯博会热点追踪:找师傅不踩雷!奇兵到家获市场认可,售后服务屡获佳评
自2014年起,中国·古镇国际灯饰博览会便以一年双展的非凡姿态,十年间为展商与买家搭建了专业化的交流平台,迄今为止已成功举办31届
2024-10-25 13:48:00
无锡移动“车路云一体化”试点应用项目获阶段性奖项
日前,2024年“数据要素×”大赛江苏省分赛颁奖仪式暨供需对接活动在无锡国际会议中心成功举行,无锡移动提交的《无锡市城市级智能网联汽车“车路云一体化”试点应用项目》在“数据要素x大赛江苏省分赛交通运输”赛道中荣获一等奖
2024-10-25 13:49:00
郑州地铁携手百望云,以数电票平台升级打造坚实便民惠民服务能力
随着城市的快速发展,地铁成为很多大城市市民出行的主力工具。为民众出行提供安全、便捷、合规的出行服务,成为相关机构的重点工作
2024-10-25 14:07:00
国补助力,双11洗地机消费热情继续高涨 头部品牌添可展现领先科技力
在国家以旧换新补贴政策的推动下,今年双11,消费者换新智能家电、提升生活品质的意愿强烈提升。洗地机作为近年来清洁电器市场的明星品类
2024-10-25 14:10:00
福特CEO:我已经开了半年小米 并且舍不得撒手
美国第二大汽车生产商福特公司首席执行官(CEO)吉姆·法利在10月21日的一档播客节目中透露,自己过去半年来一直在驾驶小米电动汽车
2024-10-25 14:30:00
什么是玻璃化转变温度-冻干小知识
玻璃化转变温度(Glasstransitiontemperature,Tg’):冻干过程的玻璃化温度指最大冻结浓缩液的玻璃化转变温度
2024-10-25 14:45:00
本文转自:人民网以旧换新进万家 焕岀美好新生活焕新吉林百秒说|白城市秋力电器:增加补贴额度 线上线下推广 让政策直达快享大家好
2024-10-25 14:47:00
以知识产权护航高质量出海,上百名南京跨境商家参加SHEIN最新IP赋能活动
跨境电商正在作为贸易模式的革新者重塑全球贸易版图。作为昔日的“六朝古都”、“十代都会”、如今的长三角特大城市和辐射带动中西部地区发展的重要门户城市
2024-10-25 14:47:00
小米15屏幕参数出炉:首发1.38mm超窄四等边直屏
快科技10月25日消息,据小米官微消息,小米15配备一块超级阳光屏,拥有惊艳四座的1.38mm超窄四等边,同时独家定制M9发光材料
2024-10-25 14:57:00