• 我的订阅
  • 头条热搜
英伟达开源NVLM 1.0屠榜多模态!纯文本性能不降反升
...源模型(如GPT-4o)的表现并不一致。为了改变这一现状,英伟达的研究团队最近宣布推出NVLM 1.0,在视觉-语言任务上取得了最先进的成果,能够与最强大的闭源模型(如GPT-4o)和开源模型(如Llama 3-V 405B和InternVL 2)相媲美,并且...……更多
支持1024帧、准确率近100%,英伟达「LongVILA」开始发力长视频
...(涵盖系统、数据和 pipeline)是必不可少的。本文,来自英伟达、MIT、UC 伯克利、得克萨斯大学奥斯汀分校的研究者引入了 LongVILA,这是一种用于训练和部署长上下文视觉语言模型的全栈解决方案,包括系统设计、模型训练策略...……更多
多模态竞技场对标90B Llama 3.2!Pixtral 12B技术报告全公开
...是为了多模态的性能而牺牲了本身的自然语言性能,之前英伟达的NVLM 1.0也谈到了这点。Pixtral本次也是成功避开了这个缺陷,单单比较文本模型的性能,也在同等尺寸的模型中居于前列。另一点与大多数模型不同的是,Pixtral选...……更多
Meta首款多模态Llama 3.2开源!1B羊驼宝宝,跑在手机上了
...了闭源Claude 3 Haiku。甚至,90B版本击败了GPT-4o mini。就连英伟达高级科学家Jim Fan都不禁夸赞,在轻量级模型中,开源社区整体上并不落后! 同时,为了适配边缘计算和终端设备,Meta还推出了1B和3B两个轻量级纯文本的版本,可支...……更多
MMMU华人团队更新Pro版!多模态基准升至史诗级难度:过滤纯文本问题、引入纯视觉问答
...候选选项、引入纯视觉输入设置)更严格地评估模型的多模态理解能力;模型在新基准上的性能下降明显,表明MMMU-Pro能有效避免模型依赖捷径和猜测策略的情况。多模态大型语言模型(MLLMs)在各个排行榜上展现的性能不断提...……更多
文本、图像、点云任意模态输入,AI能够一键生成高质量CAD模型了
...同完成,是全球首个同时支持文本描述、图像、点云等多模态输入的计算机辅助设计(CAD)生成大模型。计算机辅助设计(Computer-Aided Design,简称 CAD)软件是工业软件的重要分支,也是工业设计流程中的核心工具。然而,目前...……更多
智谱AI发布视频生成大模型,B站参与研发,亦庄提供算力|甲子光年
...脸书的Make-A-Video、谷歌的Phenaki和MAGVIT、微软女娲DragNUWA、英伟达Video LDMs等视频生成模型工作中都有引用。2024年5月,GLM大模型技术团队在ICLR 2024主旨演讲环节全面阐述了GLM大模型面向AGI三大技术趋势,原生多模态大模型在其中扮...……更多
对比学习滥用隐私数据!中科院等发布「多步误差最小化」方法 | ACM MM2024
...出了一种新颖的多步误差最小化(MEM)方法,用于生成多模态不可学习样本,以保护个人数据不被多模态对比学习模型滥用。通过优化图像噪声和文本触发器,MEM方法有效地误导模型,降低其对隐私数据的学习能力,并在不同模...……更多
首个可保留情感的音频LLM!Meta重磅开源7B-Spirit LM,一网打尽「音频+文本」多模态任务
【新智元导读】Meta最近开源了一个7B尺寸的Spirit LM的多模态语言模型,能够理解和生成语音及文本,可以非常自然地在两种模式间转换,不仅能处理基本的语音转文本和文本转语音任务,还能捕捉和再现语音中的情感和风格。...……更多
微软宣布Team Copilot发布,年内将推出初步预览版
...的业务流程。AzureAIStudio现已支持提供GPT-4oAPI将率先使用英伟达BlackwellAI芯片纳德拉介绍,由OpeanAI开发的最新旗舰模型GPT-4o,现已在AzureAIStudio中提供,并作为API提供。该多模态模型集成了文本、图像和音频处理能力,带来了全新...……更多
疯狂一夜!美国AMD、谷歌纷纷亮出大杀器,人类迎来巨变前夜?|钛媒体焦点
...夜,谷歌(Google)、AMD先后上新,终于要“打爆”OpenAI和英伟达了。钛媒体App 12月7日消息,北京时间今天凌晨,谷歌CEO桑达尔·皮查伊 (Sundar Pichai) 宣布,谷歌公司正式发布迄今为止功能最强大、最通用的多模态人工智能(AI)...……更多
大模型重构生命科学!最大基础模型面世,解锁DNA超长序列
...巨头任命首席AI官;科技巨头纷纷出手布局,诸如谷歌Meta英伟达也早已相关探索。还有像赛诺菲,这种全球TOP10药企愿意砸超10亿美金与百图生科共同打造AI模型。各种生命科学大模型也纷纷被顶刊所接收,比如像百图生科此前发...……更多
背水一战狙击GPT-4,谷歌最强大模型Gemini终发布,听说读写全能选手 | 焦点分析
...圈,Gemini才在千呼万唤中面世。△图源:谷歌一个月前,英伟达的资深科学家Jim Fan就为Gemini捏了把汗:“人们对谷歌Gemini的期望高得离谱!”他表示,Meta要惊艳世界的话,只要让Llama 3开源就好了。但谷歌想要重夺当年AlphaGo的...……更多
苹果的封闭生态为大模型打开!发布开源多模态大模型、每天为 AI 烧百万美元,零碎的 Android 生态打得过吗?
...谷歌。如果大量人工智能使用转向苹果硬件,它们也会对英伟达构成威胁,Arm 和台积电将获胜。”有网友说到苹果在大模型发展上的状况。也有网友认为,苹果在大模型上的发力将为其在未来的手机市场竞争中带来优势。他们...……更多
阿里国际发布最新开源多模态模型Ovis,多模态能力再升级
...手写英文准确翻译成中文、还能精准分析财报数据……多模态能力再次升级!今天,阿里国际AI团队发布了一款多模态大模型Ovis,在图像理解任务上不断突破极限,多种具体的子类任务中均达到了SOTA(最新技术)水平。多模态...……更多
Sora再度颠覆AI视频行业,A股哪些公司有相关布局?
...:HK)、三人行(605168)等;上游增加需求来看,推荐关注英伟达等算法、算力方面标的。东方证券早前的报告认为,从技术突破的角度来看,下一阶段的重点攻克方向必然会是多模态技术。能够真正处理和应用好多模态AI能力,...……更多
迎战GPT-4V!谷歌PaLI-3视觉语言模型问世,更小、更快、更强
...像与语音识别能力。本月初,微软更是公布了 166 页的多模态版 GPT-4V 的相关文档,详细探讨了 GPT-4V 的功能和使用情况,这一举动引起了业界的广泛关注。然而,在视觉语言模型的角逐中,谷歌也不甘示弱。 近日,Google Research...……更多
别只盯着ChatGPT版Her,多模态AI拟人互动上,国内玩家也支棱起来了
... AI 发起挑战的高规格赛事落下了帷幕!这就是第二届多模态情感识别挑战赛(MER24),它由清华大学陶建华教授、中国科学院自动化研究所连政、帝国理工学院 Björn W.Schuller、奥卢大学赵国英以及南洋理工大学 Erik Cambra 联合在 A...……更多
击败Gemini-1.5-Pro、GPT-4V,从容大模型多模态能力跻身全球前三
...云从科技从容大模型在综合评测权威平台 OpenCompass 的多模态评测领域中取得重大进展。最新评测结果显示,云从科技的从容大模型在该体系中的平均得分为 65.5,这一成绩使得从容大模型跻身全球前三,超越了谷歌的 Gemini-1.5-Pro...……更多
llava-1.6与gpt-4vmp面硬刚的性能,一起来看看
...Qwen-VL-Plus,与GPT-4V正面硬刚,这个有着SOTA级别性能的多模态大模型真正做到了“人无我有,人有我优”。继2023年4月的初级版本、2023年10月的LLaVA-1.5之后,2024年1月31日,微软研究院又联合威斯康星大学麦迪逊分校和哥伦比亚大...……更多
Gemini引领多模态AI热潮,产业发展有望加速
12月11日,多模态AI概念股继续活跃,苏州科达(603660.SH)三连板。截至当日中午收盘,因赛集团(300781.SZ)涨13.32%,苏州科达涨9.96%,宣亚国际(300612.SZ)涨9.7%。消息面上,GoogleAI大模型Gemini近日发布,Gemini是Google到目前为止规……更多
全模态对齐框架align-anything来啦:实现跨模态指令跟随
... OpenAI o1 技术的深入分析累计点击量已超过 15 万。如何全模态大模型与人类的意图相对齐,已成为一个极具前瞻性且至关重要的挑战。在当前 AI 领域的快速发展中,「有效加速」和「超级对齐」已经成为两个主要的发展动向,...……更多
文档处理效能飙升!浩鲸科技“文档大模型”核心技术揭秘!
...的整体性方案,不仅包含了文档大模型能力,还提供了多模态文档工具链 DocChain 和开箱即用的软硬件一体机,基于垂直模型能力和软硬件相互配合,可帮助企业实现文档的知识抽取、知识融合,直至知识推理和问答的全流程覆...……更多
vivo发布自研大模型,为用户和开发者带来诸多惊喜
...随着大模型技术日益成熟,vivo在语言、图像、语音、多模态等全模态的AI技术上逐步升级为大模型能力,正从传统的AI技术时代迈向大模型AI技术时代。vivoAI算法技术总监李方圆全新蓝心大模型带来4项核心升级:1、语言大模型升...……更多
多模态LLM视觉推理能力堪忧,浙大领衔用GPT-4合成数据构建多模态基准
...进模型在视觉推理方面同样不足。为此他们提出了一种多模态的视觉推理基准,并设计了一种新颖的数据合成方法。无论是语言模型还是视觉模型,似乎都很难完成更抽象层次上的理解和推理任务。语言模型已经可以写诗写小说...……更多
本周硅谷发生了什么?| 高通第三代骁龙8;谷歌20亿美元追投Anthropic;联想拿出能跑大模型个人PC
...拥有70名员工。Moreh 表示,旗舰人工智能软件 MoAI类似于英伟达的CUDA,但与现有的机器学习框架(如Meta的PyTorch、谷歌的TensorFlow)以及以前只能在英伟达上运行的应用程序和人工智能模型兼容。(新浪VR) 新玩意Zero123++:从单一...……更多
多模态大模型是当下很火的一种创新技术,加快对多模态大模型技术的布局,可进一步提高金融服务效率,缓解行业发展困境。为了攻克创新技术领域的难题,度小满联合哈尔滨工业大学共同研发出一种创新的自适应剪枝算法...……更多
刚刚,我们感受了一波最「像人」的国产AI,模型还是开源的
...择了两条路线分别开拓:一条是 GPT-4o 所代表的端到端多模态大模型的探索,一条是 o1 所代表的关于推理 Scaling Law 的探索。具体到 GPT-4o 上,OpenAI 跨文本、视觉和音频端到端地训练了一个新模型,所有输入和输出都由同一神经...……更多
只有谷歌受伤的世界达成了,但“全能模型”到底该不该跟?
...OpenAI、谷歌那样做不行。最简单的,GPT-4o能第一时间拿到英伟达最先进的显卡,这就是国内厂商很难拥有的资源。此外,ToB领域对模型可控性的要求、私有化部署的需求等,国内企业的智能化要从数据清洗、知识库等基础工作开...……更多
支付宝发布多模态医疗大模型:支持千亿级视觉识别
...快科技7月5日消息,在2024世界人工智能大会上,支付宝多模态医疗大模型正式亮相,成为国内首批多模态医疗大模型之一。据悉,该医疗大模型的基石,源自蚂蚁集团自主研发的蚂蚁百灵大模型,这一先进平台不仅拥有“视听言...……更多
更多关于科技的资讯:
英特尔酷睿Ultra 200HX/H系列技术解析:超强能效实现150W暴力输出
太平洋时间1月6日上午,英特尔举办了CES 2025展前发布会,全新的英特尔酷睿Ultra 200HX/H系列移动级处理器正式发布
2025-01-08 21:19:00
别克GL8最强对手登场!比亚迪全新MPV夏正式上市:24.98万起
快科技1月8日消息,今日晚间,比亚迪全新中大型MPV夏正式上市,共推出4款车型,售价24.98-30.98万元。新车全系标配“天神之眼”DiPilot 100高阶智驾辅助系统
2025-01-08 21:19:00
中大型智能旗舰MPV又一猛将!一图看懂比亚迪夏
快科技1月8日消息,作为王朝网的首款旗舰MPV车型配置丰富,外观设计基于王朝网设计语言,预热已久,造型获好评。内饰方面
2025-01-08 21:19:00
抖音电商严打违法违规营销!严重违规主播永封带货权限
快科技1月8日消息,今日,抖音电商发布关于保障消费者权益,严打违法违规营销行为的公告。公告提到,为创造公平健康的交易环境
2025-01-08 21:19:00
芝奇达成48GB DDR5-10600!AMD锐龙平台突破10GHz
快科技1月8日消息,芝奇宣布,在AMD锐龙平台上,成功将内存超频到了DDR5-10600的超高速度,突破10GHz大关
2025-01-08 22:49:00
丰田董事长谈日产本田合并:期待他们造出更具竞争力的产品
快科技1月8日消息,丰田汽车董事长丰田章男在CES 2025展览会上谈到了日本两大车企本田、日产面临的合并问题。丰田章男表示
2025-01-08 22:49:00
最美CTO携保定神车亮相 中国智能车扎堆拉斯维加斯
保定智能车勇闯拉斯维加斯,首次亮相“科技春晚”。2025元旦刚过,长城CTO吴会肖从保定出发,途经北京、仁川,几经辗转
2025-01-08 22:49:00
用户期待已久!HDMI 2.2规范来了:带宽暴增
2025年1月6日,美国拉斯维加斯—HDMI Forum,Inc.宣布HDMI规范2.2版本,新HDMI规范为规模庞大的HDMI生态系统带来更多选择
2025-01-08 23:19:00
Switch 2大量情报泄露!配件商自曝:黑市能买到真机吗
虽然任天堂并未参展CES 2025拉斯维加斯消费电子展,但展会上却处处透露着Switch 2即将发布的信息。多家配件厂商纷纷展示了他们为这款新主机准备的首批配件
2025-01-08 23:49:00
印尼维持iPhone 16销售禁令 前一天刚批准建设AirTag工厂
据媒体报道,印度尼西亚维持了对苹果iPhone 16的销售禁令,称苹果承诺的、包括AirTag工厂在内的10亿美元投资计划仍不足以满足当地的投资要求
2025-01-08 23:49:00
腊八节腾讯给员工发巨型甘蔗:员工扛到一楼去削皮
快科技1月8日消息,据媒体报道,1月7日是腊八节,在节日当天,腾讯公司给员工准备了惊喜—巨型甘蔗,祝员工“掂过碌蔗”,寓意今年顺顺利利
2025-01-08 23:49:00
男子4s店花320万订劳斯莱斯库里南 结果车款被4S店挪用无法提车
快科技1月8日消息,据报道,湖南长沙,游先生向媒体反馈称,自己花费320万元订购库里南,结果购车款被4S店挪用,现在仍无法提车
2025-01-09 00:19:00
2025年首次更新!微信安卓版8.0.56正式发布:朋友圈视频支持倍速播放、新增语音倒计时
快科技1月9日消息,日前,微信安卓版迎来8.0.56正式版更新,这是2025年首次版本更新。关于更新内容,依然是那9个字
2025-01-09 00:19:00
千呼万唤!《王者荣耀》今日开启华为HarmonyOS NEXT限量付费删档测试
快科技1月9日消息,今日,腾讯旗下热门手游《王者荣耀》将开启华为HarmonyOS NEXT版本的限量付费删档测试。本次测试限量开放
2025-01-09 00:49:00
Apple Watch芯片首次在美国生产:台积电代工
快科技1月9日消息,据媒体报道,苹果扩大了在美国生产芯片的规模,Apple Watch Series 9使用的S9芯片将在台积电亚利桑那州凤凰城Fab 21工厂生产
2025-01-09 00:49:00