• 我的订阅
  • 头条热搜
推动终端侧AI发展 MWC2024高通带来多项全球首发
...示了全球首个在搭载第三代骁龙8的Android手机上运行的多模态大模型(LMM)。多模态指AI模型不仅能够接受文本输入,还可以接受图像、音频等其它输入数据类型。在这一演示中展示了一个超过70亿参数的LMM,其支持文本、语音和...……更多
不够惊艳?还是更务实?谷歌对上OpenAI,能否打好翻身...
...项目Project Astra、对标Sora的文生视频模型Veo,以及支持多模态输入的AI搜索引擎和第六代Tensor处理器单元(TPU)Trillium芯片等等。其中,Astra是谷歌的AI智能体项目,能够通过手机摄像头或智能眼镜来“看到”用户眼前的内容,响...……更多
生成式AI大爆发后,2024年人工智能行业有哪些新趋势
...(人工智能)发展史的一个转折点,活跃的开源环境和多模态模型一同推动了AI研究的进步。随着生成式AI持续从实验室走入现实,人们对这项技术的态度正在变得越来越成熟。对于2024年的AI发展趋势,行业专家们也给出了一些...……更多
最强开源文生图模型一夜易主!SD原班人马打造,要发SOTA视频生成模型
...研究员成立。与Stability AI类似,黑森林致力于研发优质多模态模型并开源,目前已完成3100万美元(约合人民币2.25亿元)的种子轮融资。黑森林还预告不久之后将发布SOTA(当前技术指标第一)视频模型。从其放出的Demo来看,无...……更多
2B多模态新SOTA!华科、华南理工发布Mini-Monkey,专治「切分增大分辨率」后遗症
【新智元导读】Mini-Monkey 是一个轻量级的多模态大型语言模型,通过采用多尺度自适应切分策略(MSAC)和尺度压缩机制(SCM),有效缓解了传统图像切分策略带来的锯齿效应,提升了模型在高分辨率图像处理和文档理解任务的...……更多
本周硅谷发生了什么?| 高通第三代骁龙8;谷歌20亿美元追投Anthropic;联想拿出能跑大模型个人PC
...跑大模型的个人PC。还有谷歌20亿追投Anthropic,并曝光多模态模型Gemini和工具Stubbs,将为用户更多便捷和创新的应用开发方式。Meta公布第三季度财报,实现23%的营收增长,是公司自2021年三季度以来最大的营收增幅,表现亮眼。部...……更多
AI应用正面临能耗挑战?分布式算力提供新路径!
...术为医疗诊断、安全监控和娱乐行业提供了强大支持。多模态AI:使AI能够同时处理和理解来自不同来源的信息,如文本、图像、声音和视频等,多模态AI的发展使得机器能够感知、理解甚至预测需求,提供更加个性化和智能化的...……更多
让大模型能听会说,国内机构开源首个端到端语音对话模型Mini-Omni
...zhou@jiqizhixin.com;zhaoyunfeng@jiqizhixin.com本文出自启元世界多模态算法组,共同一作是来自清华大学的一年级硕士生谢之非与启元世界多模态负责人吴昌桥,研究兴趣为多模态大模型、LLM Agents 等。本论文上线几天内在 github 上斩获 1...……更多
全模态对齐框架align-anything来啦:实现跨模态指令跟随
... OpenAI o1 技术的深入分析累计点击量已超过 15 万。如何全模态大模型与人类的意图相对齐,已成为一个极具前瞻性且至关重要的挑战。在当前 AI 领域的快速发展中,「有效加速」和「超级对齐」已经成为两个主要的发展动向,...……更多
别只盯着ChatGPT版Her,多模态AI拟人互动上,国内玩家也支棱起来了
... AI 发起挑战的高规格赛事落下了帷幕!这就是第二届多模态情感识别挑战赛(MER24),它由清华大学陶建华教授、中国科学院自动化研究所连政、帝国理工学院 Björn W.Schuller、奥卢大学赵国英以及南洋理工大学 Erik Cambra 联合在 A...……更多
苹果的封闭生态为大模型打开!发布开源多模态大模型、每天为 AI 烧百万美元,零碎的 Android 生态打得过吗?
...人员于在 2023 年 10 月低调发布的一个名为 Ferret 的开源多模态大模型也没有收到太多关注。当时,该版本包含代码和权重,但仅供研究使用,而非商业许可。但随着 Mistral 开源模型备受关注、谷歌 Gemini 即将应用于 Pixel Pro 和 Andr...……更多
多模态竞技场对标90B Llama 3.2!Pixtral 12B技术报告全公开
...客之姿杀入江湖的Mistral AI,在9月份甩出了自家的首款多模态大模型Pixtral 12B,如今,报告之期已至,技术细节全公开。作为欧洲的OpenAI,Mistral最近压力不小。端侧小模型端不出来,对比评测的结果又遭到质疑。上个月震撼登场...……更多
“大模型”时代 路凯智行如何Rock AI
...型,随着近几个月SORA的横空出世,融合语言与视觉的多模态模型也已初露峥嵘,但目前市面上的通用大模型并非“万金油”,面向垂直领域内的各类生成式AI应用还需要结合场景需求积累数据和构建定制化的模型。矿山无人驾驶...……更多
Meta首款多模态Llama 3.2开源!1B羊驼宝宝,跑在手机上了
【新智元导读】Meta首个理解图文的多模态Llama 3.2来了!这次,除了11B和90B两个基础版本,Meta还推出了仅有1B和3B轻量级版本,适配了Arm处理器,手机、AR眼镜边缘设备皆可用。Llama 3.1超大杯405B刚过去两个月,全新升级后的Llama 3....……更多
...大量通用数据、行业数据,支持文本、图像、视频等多种模态,并打造了全流程的数据处理工具。超过700万亿字节的通用数据集可以开展通用模型训练,同时,4.33万亿字节的行业垂类数据对模型训练也极为重要。当前已知的全...……更多
...融合监控等多点发力,实现输电线路巡检从感知智能到多模态生成式智能的新跨域,为新型电力系统安全稳定运行提供坚强网架支撑。 ……更多
只有谷歌受伤的世界达成了,但“全能模型”到底该不该跟?
...对二,谷歌就跟四个王。那么,这一次较量的核心——多模态大模型,国内AI行业是否要跟进呢?如果要跟进,又该提前考量到哪些问题呢?每一次新产品问世,如果只跟着新闻“震惊”是很难进步的。不妨和我们一起,认真给G...……更多
超越扩散模型!自回归新范式仅需2.9秒就生成高质量图像
...VAR指出是因为自回归模型逐个预测token的行为不符合图像模态的特点,提出“next-scale prediction”范式,将视觉自回归建模为逐个预测更大尺度scale的token map。这一方式避免了原始基于next-token的自回归方案难以建模图像模态的问题...……更多
高通aihub正式发布:支持75个ai模型
...示了全球首个在搭载第三代骁龙8的安卓手机上运行的多模态大模型(LMM)。在这一演示中,高通展示了一个超过70亿参数的LMM,其支持文本、语音和图像输入,并能够基于输入的内容进行多轮对话。同时高通还在搭载全新骁龙XEl...……更多
刚刚,我们感受了一波最「像人」的国产AI,模型还是开源的
...择了两条路线分别开拓:一条是 GPT-4o 所代表的端到端多模态大模型的探索,一条是 o1 所代表的关于推理 Scaling Law 的探索。具体到 GPT-4o 上,OpenAI 跨文本、视觉和音频端到端地训练了一个新模型,所有输入和输出都由同一神经...……更多
AIGC工具测评:生成式AI的产品表现如何
...力上也有了重大突破。更值得一提的是,GPT-4引入了“多模态”功能,支持图像和语音输入,甚至可以输出图片,大大拓宽了其应用范围。界面体验ChatGPT-4的用户界面呈现了现代化和直观的设计风格,其简洁的设计语言和优化的...……更多
...业内分析认为,该项新产品或将促使大模型厂商加大对多模态大模型的研发投入,并进一步推动AGI(通用人工智能)进程。一直以来,视频领域便是被普遍看好的AI应用落脚点之一。继可生成图文的ChatGPT之后,Sora的发布迎合了...……更多
Bengio团队提出多模态新基准,直指Claude 3.5和GPT-4o弱点
...灵奖得主Yoshua Bengio教授。博士期间的主要工作聚焦于多模态、GFlowNet、多智能体强化学习、AI于气候变化的应用。目前已在ICML、ICLR、ICASSP等机器学习顶会发表论文。代表作为Large-scale Contrastive Language-Audio Pretrai……更多
CVPR最佳论文被生成式AI占领,清华武大华南农大上科校友获奖
...并得到最终反馈标签。之后,设计了一种基于ViT和T5X的多模态Transformer模型RAHF,使用三种预测器预测上述丰富的人类反馈信息:使用卷积层和上采样层预测失真和不匹配的热力图 使用卷积层和全连接层预测4个方面的评分 使用Trans...……更多
新扩散模型OmniGen一统图像生成,架构还高度简化、易用
...的扩散模型架构 OmniGen,一种新的用于统一图像生成的多模态模型。OmniGen 具有以下特点:统一性:OmniGen 天然地支持各种图像生成任务,例如文生图、图像编辑、主题驱动生成和视觉条件生成等。此外,OmniGen 可以处理经典的计...……更多
大模型的未来,快手在自己身上找答案
...有 GPT-4o 不具备的表情和肢体动作,是一个真正意义的多模态输入输出的实时互动智能体。快手展位「AI 关小芳」数字人 | 图片来源:视觉中国而另一片场地上,快手视频生成大模型明星「可灵」发布了一系列重磅升级和 AIGC 短...……更多
华中科技大学白翔教授发布多模态大模型
...华中科技大学软件学院白翔教授领衔的VLRLab团队发布了多模态大模型——“Monkey”。该模型号称能够实现对世界的“观察”,对图片进行深入的问答交流和精确描述。▲图源Monkey项目的GitHub页面IT之家注:多模态大模型是一类可...……更多
●多模态使人形机器人能融合图像、语义、力感知、环境感知等多种因素,综合判断、生成任务并执行任务,是让人形机器人具有自主思考能力的关键核心技术●标志着成都在我国多模态模型应用于人形机器人领域率先取得突...……更多
下载次数破39万!CMU、Meta联合发布VQAScore文生图优化方案:Imagen3已采用
...论文提名和最佳短论文奖等。其研究成果在生成模型和多模态学习领域受到了学术界和工业界的广泛认可。Pengchuan Zhang是Meta AI(原Facebook AI研究院)的人工智能研究科学家,曾在微软研究院担任高级研究科学家。他的研究领域主...……更多
SIGGRAPH上首个Real-Time Live的中国团队用生成式AI创建3D世界
... 3D 版 ControlNet,极简的架构使它能够高效地支持各种不同模态的条件 (Condition)控制。他们实现了几种用户可以轻松提供的示例条件,包括文本(原生支持),以及图像 / 草图、体素 (Voxel)、多视图图像(Multiview Images)、点云...……更多
更多关于科技的资讯:
本文转自:人民网推进中国式现代化,科学技术要打头阵,科技创新是必由之路。2025年全国两会期间,科创无疑是最受关注的热词之一
2025-03-11 00:06:00
发现没法干翻苹果后 手机厂商开始强行兼容苹果
经常关注数码圈的差友应该都知道,各家厂商拿自家手机对标 iPhone,早就不是什么新鲜事儿了,从性能参数上的正面硬刚,再到外观设计上的争锋相对
2025-03-11 00:18:00
11999元起!华为Mate 70 RS非凡大师全系现货供应
快科技3月11日消息,去年11月,华为Mate 70 RS非凡大师正式发布,汇集了华为目前各方面最顶级的技术。此前该机一直供应不充足
2025-03-11 00:18:00
二次元AI新玩具破圈走红!短短几个月100万MAU
二次元圈子突然冒出了个AI新玩具,最近有点小火你可能在小破站、小红薯频频刷到一些精美的二次元图,belike:有的图非常复杂
2025-03-11 00:18:00
10毫秒直达大湾区!贵州算力“高速路”跑出品牌加速度|贵州有“数”
人眨眼一次是100~400ms,而从贵阳到杭州的数据传输,只需16ms,到广州、深圳仅需10ms。2023年,贵州建成全球首条400G算力通道
2025-03-11 00:26:00
等等党又赢了 今年可能会是智驾最卷的一年
想不到啊,在国内的新势力们卷了 N 年智驾之后,真正让智驾火出圈的,竟然是一直被说智驾不灵的比亚迪。靠着一手七万多就能用上的高阶智驾
2025-03-11 00:48:00
欧洲小青年,爱上中国“老头乐” | 出海 New Land
全球商业处于动荡和剧变之中,出海成为许多中国公司当下无法回避的命题。海外65亿人口,分散在近200个发展极不平衡的国家和地区
2025-03-11 05:56:00
“80后死亡率高”疑似是AI造谣,AI已经开始胡说八道了
2025年2月,如果不是长期从事人口研究的中国人民大学教授李婷的公开辟谣,很多人都真诚地相信了一组数据——“中国80后累计死亡率为5
2025-03-11 05:56:00
国产机器人,挺进欧美庭院
最近欧美消费圈曝出了一个大新闻——困扰欧美家庭多年的积雪,被来自中国的机器人解决了!各地网友纷纷秀出“壮汉十八,不如自家铲雪机器人微挖”的精彩表演
2025-03-11 05:56:00
想做企业级智能体的「AutoAgents」,获数千万元天使轮融资 | 涌现好项目
一句话介绍: 基于自研Multi-Agent架构,为企业提供部署到生产环节的智能体服务商。团队介绍:杨劲松(CEO):原达摩院产品/商业化总监
2025-03-11 05:56:00
消费热点洞见|OPPO Find N5:折叠屏赛道技术破局与市场博弈
2月20日晚,OPPO以一场充满未来感的技术盛宴,揭开了折叠屏赛道的新篇章——全新旗舰OPPO Find N5正式亮相
2025-03-11 05:56:00
中国AI情趣娃娃,成了全球抢手货
“成人用品”四个字,本身具有神秘的禁忌力量。在中国如果问“你用过吗”,答案多半是“我没有”。然而市场逐年上涨的消费额却侧面证明了这个市场——前景良好
2025-03-11 05:57:00
2025具身智能机器人发展大会在天津成功举办
2025年3月7日,2025具身智能机器人发展大会在天津国家会展中心隆重举行。本次大会以“智创未来——具身智能机器人产业发展与创新”为主题
2025-03-11 05:57:00
加速布局前置仓,京东要打怎样的一仗?| 氪金·大事件
作者 | 谢芸子 编辑 | 郑怀舟 近日,36氪从多处信源获悉,京东旗下自营超市“京东七鲜”正加速布局仓店,计划于今年6月底在天津新增20家仓店
2025-03-11 05:57:00
让一副眼镜“成精”,杭州“第七龙”藏不住了
全国每卖出10台消费级AR眼镜,就有3台是他家的,连天宫一号航天员也戴着他发明的眼镜在太空巡逻,做实时交互。他就是祝铭明
2025-03-11 05:57:00