• 我的订阅
  • 头条热搜
英伟达开源NVLM 1.0屠榜多模态!纯文本性能不降反升
...源模型(如GPT-4o)的表现并不一致。为了改变这一现状,英伟达的研究团队最近宣布推出NVLM 1.0,在视觉-语言任务上取得了最先进的成果,能够与最强大的闭源模型(如GPT-4o)和开源模型(如Llama 3-V 405B和InternVL 2)相媲美,并且...……更多
支持1024帧、准确率近100%,英伟达「LongVILA」开始发力长视频
...(涵盖系统、数据和 pipeline)是必不可少的。本文,来自英伟达、MIT、UC 伯克利、得克萨斯大学奥斯汀分校的研究者引入了 LongVILA,这是一种用于训练和部署长上下文视觉语言模型的全栈解决方案,包括系统设计、模型训练策略...……更多
多模态竞技场对标90B Llama 3.2!Pixtral 12B技术报告全公开
...是为了多模态的性能而牺牲了本身的自然语言性能,之前英伟达的NVLM 1.0也谈到了这点。Pixtral本次也是成功避开了这个缺陷,单单比较文本模型的性能,也在同等尺寸的模型中居于前列。另一点与大多数模型不同的是,Pixtral选...……更多
Meta首款多模态Llama 3.2开源!1B羊驼宝宝,跑在手机上了
...了闭源Claude 3 Haiku。甚至,90B版本击败了GPT-4o mini。就连英伟达高级科学家Jim Fan都不禁夸赞,在轻量级模型中,开源社区整体上并不落后! 同时,为了适配边缘计算和终端设备,Meta还推出了1B和3B两个轻量级纯文本的版本,可支...……更多
MMMU华人团队更新Pro版!多模态基准升至史诗级难度:过滤纯文本问题、引入纯视觉问答
...候选选项、引入纯视觉输入设置)更严格地评估模型的多模态理解能力;模型在新基准上的性能下降明显,表明MMMU-Pro能有效避免模型依赖捷径和猜测策略的情况。多模态大型语言模型(MLLMs)在各个排行榜上展现的性能不断提...……更多
智谱AI发布视频生成大模型,B站参与研发,亦庄提供算力|甲子光年
...脸书的Make-A-Video、谷歌的Phenaki和MAGVIT、微软女娲DragNUWA、英伟达Video LDMs等视频生成模型工作中都有引用。2024年5月,GLM大模型技术团队在ICLR 2024主旨演讲环节全面阐述了GLM大模型面向AGI三大技术趋势,原生多模态大模型在其中扮...……更多
对比学习滥用隐私数据!中科院等发布「多步误差最小化」方法 | ACM MM2024
...出了一种新颖的多步误差最小化(MEM)方法,用于生成多模态不可学习样本,以保护个人数据不被多模态对比学习模型滥用。通过优化图像噪声和文本触发器,MEM方法有效地误导模型,降低其对隐私数据的学习能力,并在不同模...……更多
微软宣布Team Copilot发布,年内将推出初步预览版
...的业务流程。AzureAIStudio现已支持提供GPT-4oAPI将率先使用英伟达BlackwellAI芯片纳德拉介绍,由OpeanAI开发的最新旗舰模型GPT-4o,现已在AzureAIStudio中提供,并作为API提供。该多模态模型集成了文本、图像和音频处理能力,带来了全新...……更多
疯狂一夜!美国AMD、谷歌纷纷亮出大杀器,人类迎来巨变前夜?|钛媒体焦点
...夜,谷歌(Google)、AMD先后上新,终于要“打爆”OpenAI和英伟达了。钛媒体App 12月7日消息,北京时间今天凌晨,谷歌CEO桑达尔·皮查伊 (Sundar Pichai) 宣布,谷歌公司正式发布迄今为止功能最强大、最通用的多模态人工智能(AI)...……更多
大模型重构生命科学!最大基础模型面世,解锁DNA超长序列
...巨头任命首席AI官;科技巨头纷纷出手布局,诸如谷歌Meta英伟达也早已相关探索。还有像赛诺菲,这种全球TOP10药企愿意砸超10亿美金与百图生科共同打造AI模型。各种生命科学大模型也纷纷被顶刊所接收,比如像百图生科此前发...……更多
背水一战狙击GPT-4,谷歌最强大模型Gemini终发布,听说读写全能选手 | 焦点分析
...圈,Gemini才在千呼万唤中面世。△图源:谷歌一个月前,英伟达的资深科学家Jim Fan就为Gemini捏了把汗:“人们对谷歌Gemini的期望高得离谱!”他表示,Meta要惊艳世界的话,只要让Llama 3开源就好了。但谷歌想要重夺当年AlphaGo的...……更多
苹果的封闭生态为大模型打开!发布开源多模态大模型、每天为 AI 烧百万美元,零碎的 Android 生态打得过吗?
...谷歌。如果大量人工智能使用转向苹果硬件,它们也会对英伟达构成威胁,Arm 和台积电将获胜。”有网友说到苹果在大模型发展上的状况。也有网友认为,苹果在大模型上的发力将为其在未来的手机市场竞争中带来优势。他们...……更多
阿里国际发布最新开源多模态模型Ovis,多模态能力再升级
...手写英文准确翻译成中文、还能精准分析财报数据……多模态能力再次升级!今天,阿里国际AI团队发布了一款多模态大模型Ovis,在图像理解任务上不断突破极限,多种具体的子类任务中均达到了SOTA(最新技术)水平。多模态...……更多
Sora再度颠覆AI视频行业,A股哪些公司有相关布局?
...:HK)、三人行(605168)等;上游增加需求来看,推荐关注英伟达等算法、算力方面标的。东方证券早前的报告认为,从技术突破的角度来看,下一阶段的重点攻克方向必然会是多模态技术。能够真正处理和应用好多模态AI能力,...……更多
迎战GPT-4V!谷歌PaLI-3视觉语言模型问世,更小、更快、更强
...像与语音识别能力。本月初,微软更是公布了 166 页的多模态版 GPT-4V 的相关文档,详细探讨了 GPT-4V 的功能和使用情况,这一举动引起了业界的广泛关注。然而,在视觉语言模型的角逐中,谷歌也不甘示弱。 近日,Google Research...……更多
别只盯着ChatGPT版Her,多模态AI拟人互动上,国内玩家也支棱起来了
... AI 发起挑战的高规格赛事落下了帷幕!这就是第二届多模态情感识别挑战赛(MER24),它由清华大学陶建华教授、中国科学院自动化研究所连政、帝国理工学院 Björn W.Schuller、奥卢大学赵国英以及南洋理工大学 Erik Cambra 联合在 A...……更多
击败Gemini-1.5-Pro、GPT-4V,从容大模型多模态能力跻身全球前三
...云从科技从容大模型在综合评测权威平台 OpenCompass 的多模态评测领域中取得重大进展。最新评测结果显示,云从科技的从容大模型在该体系中的平均得分为 65.5,这一成绩使得从容大模型跻身全球前三,超越了谷歌的 Gemini-1.5-Pro...……更多
llava-1.6与gpt-4vmp面硬刚的性能,一起来看看
...Qwen-VL-Plus,与GPT-4V正面硬刚,这个有着SOTA级别性能的多模态大模型真正做到了“人无我有,人有我优”。继2023年4月的初级版本、2023年10月的LLaVA-1.5之后,2024年1月31日,微软研究院又联合威斯康星大学麦迪逊分校和哥伦比亚大...……更多
Gemini引领多模态AI热潮,产业发展有望加速
12月11日,多模态AI概念股继续活跃,苏州科达(603660.SH)三连板。截至当日中午收盘,因赛集团(300781.SZ)涨13.32%,苏州科达涨9.96%,宣亚国际(300612.SZ)涨9.7%。消息面上,GoogleAI大模型Gemini近日发布,Gemini是Google到目前为止规……更多
全模态对齐框架align-anything来啦:实现跨模态指令跟随
... OpenAI o1 技术的深入分析累计点击量已超过 15 万。如何全模态大模型与人类的意图相对齐,已成为一个极具前瞻性且至关重要的挑战。在当前 AI 领域的快速发展中,「有效加速」和「超级对齐」已经成为两个主要的发展动向,...……更多
文档处理效能飙升!浩鲸科技“文档大模型”核心技术揭秘!
...的整体性方案,不仅包含了文档大模型能力,还提供了多模态文档工具链 DocChain 和开箱即用的软硬件一体机,基于垂直模型能力和软硬件相互配合,可帮助企业实现文档的知识抽取、知识融合,直至知识推理和问答的全流程覆...……更多
vivo发布自研大模型,为用户和开发者带来诸多惊喜
...随着大模型技术日益成熟,vivo在语言、图像、语音、多模态等全模态的AI技术上逐步升级为大模型能力,正从传统的AI技术时代迈向大模型AI技术时代。vivoAI算法技术总监李方圆全新蓝心大模型带来4项核心升级:1、语言大模型升...……更多
多模态LLM视觉推理能力堪忧,浙大领衔用GPT-4合成数据构建多模态基准
...进模型在视觉推理方面同样不足。为此他们提出了一种多模态的视觉推理基准,并设计了一种新颖的数据合成方法。无论是语言模型还是视觉模型,似乎都很难完成更抽象层次上的理解和推理任务。语言模型已经可以写诗写小说...……更多
本周硅谷发生了什么?| 高通第三代骁龙8;谷歌20亿美元追投Anthropic;联想拿出能跑大模型个人PC
...拥有70名员工。Moreh 表示,旗舰人工智能软件 MoAI类似于英伟达的CUDA,但与现有的机器学习框架(如Meta的PyTorch、谷歌的TensorFlow)以及以前只能在英伟达上运行的应用程序和人工智能模型兼容。(新浪VR) 新玩意Zero123++:从单一...……更多
多模态大模型是当下很火的一种创新技术,加快对多模态大模型技术的布局,可进一步提高金融服务效率,缓解行业发展困境。为了攻克创新技术领域的难题,度小满联合哈尔滨工业大学共同研发出一种创新的自适应剪枝算法...……更多
刚刚,我们感受了一波最「像人」的国产AI,模型还是开源的
...择了两条路线分别开拓:一条是 GPT-4o 所代表的端到端多模态大模型的探索,一条是 o1 所代表的关于推理 Scaling Law 的探索。具体到 GPT-4o 上,OpenAI 跨文本、视觉和音频端到端地训练了一个新模型,所有输入和输出都由同一神经...……更多
只有谷歌受伤的世界达成了,但“全能模型”到底该不该跟?
...OpenAI、谷歌那样做不行。最简单的,GPT-4o能第一时间拿到英伟达最先进的显卡,这就是国内厂商很难拥有的资源。此外,ToB领域对模型可控性的要求、私有化部署的需求等,国内企业的智能化要从数据清洗、知识库等基础工作开...……更多
支付宝发布多模态医疗大模型:支持千亿级视觉识别
...快科技7月5日消息,在2024世界人工智能大会上,支付宝多模态医疗大模型正式亮相,成为国内首批多模态医疗大模型之一。据悉,该医疗大模型的基石,源自蚂蚁集团自主研发的蚂蚁百灵大模型,这一先进平台不仅拥有“视听言...……更多
2B多模态新SOTA!华科、华南理工发布Mini-Monkey,专治「切分增大分辨率」后遗症
【新智元导读】Mini-Monkey 是一个轻量级的多模态大型语言模型,通过采用多尺度自适应切分策略(MSAC)和尺度压缩机制(SCM),有效缓解了传统图像切分策略带来的锯齿效应,提升了模型在高分辨率图像处理和文档理解任务的...……更多
奥林匹克竞赛里选最聪明的AI:Claude-3.5-Sonnet vs. GPT-4o?
...数据泄露,从而反映模型的真实性能。研究团队测试了多模态大模型(LMMs)和纯文本大模型(LLMs)。对于LLMs的测试,输入时不提供任何与图像相关的信息给模型,仅提供文本。所有评估均采用零样本(zero-shot)思维链(Chain of ...……更多
更多关于科技的资讯:
抢先一步来体验吧!华为小艺网页版上线啦
快科技2月28日消息,今天真是个好日子,继原生鸿蒙版小艺App上架后,华为小艺网页版也迎来了上架!据了解,小艺网页版是一款功能丰富的人工智能在线服务平台
2025-02-28 11:07:00
一举打破六项记录!ROG Astral夜神RTX 5090频率狂飙3.45GHz
快科技2月28日消息,日前华硕宣布,其ROG Astral GeForce RTX 5090 OC Edition显卡成功打破了6项超频纪录
2025-02-28 11:07:00
人人买得起!努比亚Flip 2定档3月4日:国民小折叠
快科技2月28日消息,努比亚Flip 2今天正式官宣,将于3月4日发布,定位国民小折叠。据悉,前代努比亚Flip定价只要2999元
2025-02-28 11:07:00
玄铁最高性能处理器!阿里达摩院玄铁首款服务器级CPU下月交付
快科技2月28日消息,在今天达摩院举办的2025玄铁RISC-V生态大会上,官方宣布玄铁最高性能处理器C930即将在3月开启交付
2025-02-28 11:07:00
理想首款纯电SUV i8更多官曝:座椅样式大更新
快科技2月28日消息,理想汽车公布了首款纯电SUV车型i8的更多官图,展示了新配色,并且可以看到内饰部分细节。不同于前两次发布的白色
2025-02-28 11:07:00
女网红顾茜茜多平台被禁言!曾自曝躺床上什么也没干一天收入30万 骂声越大赚得越多
快科技2月28日消息,近日,自曝“躺床上什么也没干一天收入30万元”的网红顾茜茜引发极大争议。最新消息显示,其多平台账号已被禁言
2025-02-28 11:07:00
积极拥抱DeepSeek 烟台高新区驶入数智化发展快车道
鲁网2月28日讯(记者 魏萱)新年伊始,国产开源大模型DeepSeek火热出圈,引发各行业用户追捧。走在科技前沿的烟台高新区紧跟潮流
2025-02-28 11:16:00
民营经济迎利好!10年服饰老厂在SHEIN“爆单”上岸
所谓衣食住行,衣为先,潮州老板宋骏一直在服饰制造这个赛道上摸爬滚打。在这一领域里,经验丰富的大厂商、大品牌们早已布局多年
2025-02-28 11:23:00
本文转自:人民网人民网北京2月28日电 (记者赵竹青)记者从中国科学院获悉,2月28日,国家重大科技基础设施“冷泉生态系统研究装置”(以下简称“冷泉装置”)在广州市全面启动建设
2025-02-28 11:36:00
罕见!极氪汽车:祝贺小米SU7 Ultra成功发布
快科技2月28日消息,车圈儿罕见的一幕发生了!就在刚刚,极氪汽车发布微博称“祝贺小米SU7 Ultra 成功发布”,而配图则是一台正在赛道上驰骋的极氪001 FR
2025-02-28 11:37:00
4499元开卖!iPhone 16e黑、白两色真机图一览:黑边宽到窒息
快科技2月28日消息,如果你有4000+预算,你会毫不犹豫的买iPhone 16e吗,暂且不说单摄、256GB这些落伍的配置
2025-02-28 11:37:00
中国科大郭光灿院士团队量子研究有新进展
大皖新闻讯 据中国科学技术大学官网消息,该校郭光灿院士团队在多体量子非局域性研究方面取得重要进展。该团队李传锋、黄运锋
2025-02-28 11:38:00
康士伯数字携手客户共赢共生,共绘数字化转型新蓝图
一场意义非凡的历史性盛会近日,康士伯数字成功举办了一场意义非凡的历史性盛会——“明日秀”。此次展会汇聚了来自各行各业的领袖与专业人士
2025-02-28 11:45:00
FIBBR菲伯尔镀银DP80电竞线 | 次世代显卡的理想伙伴
近期,万众期待的RTX5070Ti终于上市了,这次50系显卡也更新的DP接口,升级成了DP2.1,以满足高分辨率和高刷新率的游戏及专业应用需求
2025-02-28 11:45:00
漫评丨公共规则面前,没有明星特权
□潘宁 史博文 廉征近日,一男团在深圳宝安机场插队登机,引发现场群众不满。这一事件再次将“明星特权”推向公众视野,这不仅暴露了个别群体的规则失范
2025-02-28 11:56:00