• 我的订阅
  • 头条热搜
大模型新趋势之MoE:现状、挑战及研究方向
2024年,全球主流企业加快推出MoE大模型,1-5月发布千亿以上大模型均采用MoE优化架构,且数量超过近三年总和。MoE大模型架构凭借平衡大模型训推成本和计算效率等优势,更适合处理大规模数据和复杂任务,已成谷歌、OpenAI、...……更多
Llama3训练每3小时崩一次?豆包大模型、港大为脆皮万卡训练提效
伴随大模型迭代速度越来越快,训练集群规模越来越大,高频率的软硬件故障已经成为阻碍训练效率进一步提高的痛点,检查点(Checkpoint)系统在训练过程中负责状态的存储和恢复,已经成为克服训练故障、保障训练进度和提...……更多
chatgpt低成本复现流程开源
首个开源的ChatGPT低成本复现流程来了!预训练、奖励模型训练、强化学习训练,一次性打通。最小demo训练流程仅需1.62GB显存,随便一张消费级显卡都能满足了。单卡模型容量最多提升10.3倍。相比原生PyTorch,单机训练速度最高...……更多
...人 、新加坡国立大学校长青年教授尤洋发表了题为《大模型训练的关键技术》的主题演讲。尤洋指出,庞大的AI模型规模对模型训练提出了挑战,现有的硬件设备已无法满足训练所需的大量计算资源和储存空间需求。为解决上述...……更多
chatgpt低成本复现流程来了
首个开源的ChatGPT低成本复现流程来了!预训练、奖励模型训练、强化学习训练,一次性打通。最小demo训练流程仅需 1.62GB 显存,随便一张消费级显卡都能满足了。单卡模型容量最多提升 10.3倍。相比原生PyTorch,单机训练速度最...……更多
zyphra推出zamba2-mini1.2b模型
...29日消息,Zyphra于8月27日发布博文,宣布推出Zamba2-mini1.2B模型,共有12亿参数,声称是端侧SOTA小语言模型,在4bit量化下内存占用低于700MB。IT之家注:SOTA全称为state-of-the-art,并不是特指某个具体的模型,而是指在该项研究任务中...……更多
支持1024帧、准确率近100%,英伟达「LongVILA」开始发力长视频
现在,长上下文视觉语言模型(VLM)有了新的全栈解决方案 ——LongVILA,它集系统、模型训练与数据集开发于一体。现阶段,将模型的多模态理解与长上下文能力相结合是非常重要的,支持更多模态的基础模型可以接受更灵活...……更多
Mamba再次挑战霸主Transformer!首个通用Mamba开源大模型一鸣惊人
【新智元导读】TII开源全球第一个通用的大型Mamba架构模型Falcon Mamba 7B,性能与Transformer架构模型相媲美,在多个基准测试上的均分超过了Llama 3.1 8B和Mistral 7B。今天,阿布扎比支持的技术创新研究所(TII) 开源了全球第一个通用的...……更多
综合RLHF、DPO、KTO优势,统一对齐框架UNA来了
...Alignment。3. 黄灿:厦门大学数学系副教授随着大规模语言模型的快速发展,如 GPT、Claude 等,LLM 通过预训练海量的文本数据展现了惊人的语言生成能力。然而,即便如此,LLM 仍然存在生成不当或偏离预期的结果。这种现象在推...……更多
CPU,正在被AI时代抛弃?
...对话可以通过语音识别技术被录入到病例系统中,随后大模型AI推理技术辅助进行智能总结和诊断,医生们撰写病例的效率显著提高。AI推理的应用不仅节省了时间,也保护了患者隐私;在法院、律所等业务场景中,律师通过大...……更多
第一个100%开源的MoE大模型,7B的参数,1B的推理成本
... checkpoint、训练日志和训练数据都已经开源。尽管大语言模型 (LM) 在各种任务上取得了重大进展,但在训练和推理方面,性能和成本之间仍然需要权衡。对于许多学者和开发人员来说,高性能的 LM 是无法访问的,因为它们的构建...……更多
GPU训Llama 3.1疯狂崩溃,竟有大厂用CPU服务器跑千亿参数大模型?
【新智元导读】是时候用CPU通用服务器跑千亿参数大模型了!马斯克19天建成由10万块H100串联的世界最大超算,已全力投入Grok 3的训练中。与此同时,外媒爆料称,OpenAI和微软联手打造的下一个超算集群,将由10万块GB200组成。...……更多
微软连发3款Phi-3.5模型:128K上下文,首用MoE架构,部分性能超GPT-4o mini
...东西8月21日消息,今天,微软一口气甩出3款超强轻量级模型!微软本次发布的轻量级模型系列名为Phi-3.5,适合在内存和算力受限的环境中运行,均支持128k上下文长度。Phi-3.5-mini-instruct主要面向基础快速推理任务,Phi-3.5-MoE-instru...……更多
超擎数智重磅发布擎天、锋锐、元景系列AI服务器,打造人工智能新质生产力强劲引擎
...U可提供200G带宽,大大提高工作效率,能够充分满足AI推理、模型微调和高性能计算过程中的强大算力需求。强大性能:采用 AMD EPYC 9004处理器提供了高达 64个核心和 128个线程,适合处理需要大量并行处理能力的任务,如数据分析、科学...……更多
图灵奖得主Yoshua Bengio新作:Were RNNs All We Needed?
自从 Transformer 模型问世以来,试图挑战其在自然语言处理地位的挑战者层出不穷。这次登场的选手,不仅要挑战 Transformer 的地位,还致敬了经典论文的名字。再看这篇论文的作者列表,图灵奖得主、深度学习三巨头之一的 Yoshu...……更多
最强大模型训练芯片H200发布!
...联技术,可以以最高性能运行各种应用负载,包括175B大模型的训练和推理。HGX板的独立性质使其能够插入合适的主机系统,从而允许使用者定制其高端服务器的非GPU部分。接下来是QuadGH200超算节点——它由4个GH200组成,而GH200是...……更多
Meta祭出三篇最详尽Llama微调指南!千字长文,0基础小白必备
...开的彻彻底底。这不,Meta一连放出三篇技术文章,从大模型适配方法出发,介绍了:如何使用特定领域数据微调LLM,如何确定微调适配自己的用例,以及如何管理良好训练数据集的经验法则。接下来,直接进入正题。适配大模...……更多
晶圆级AI芯片WSE-3性能公布:80亿参数模型上每秒生成1800个Token
...上一代WSE-2的两倍,可用于训练业内一些最大的人工智能模型。在近日的Hot Chips 2024大会上,Cerebras Systems详细介绍了这款芯片在AI推理方面的性能。根据官方资料显示,WSE-3依然是采用了一整张12英寸晶圆来制作,基于台积电5nm制...……更多
非Transformer架构站起来了!首个纯无注意力大模型,超越Llama 3.1
Mamba 架构的大模型又一次向 Transformer 发起了挑战。Mamba 架构模型这次终于要「站」起来了?自 2023 年 12 月首次推出以来,Mamba 便成为了 Transformer 的强有力竞争对手。此后,采用 Mamba 架构的模型不断出现,比如 Mistral 发布的首...……更多
不是RNN的锅!清华团队深入分析长上下文建模中的状态崩溃,Mamba作者点赞
【新智元导读】RNN模型在长上下文中表现不佳?近日,来自清华的研究团队对此进行了深入的实验分析,结果表明:不是RNN的锅。与Transformer相比,RNN模型的一大优势是应对长序列的能力。比如Mamba,内部状态大小始终保持不变...……更多
华为AI存储助力中国移动构建超大规模智算集群
...转自:人民日报《人民日报》(2024年12月19日第 18 版)大模型领域普遍存在规模化定律,即大模型的性能深受模型参数量、数据集大小以及训练算力规模三要素的影响。生成式AI的运行主要基于深度学习原理,其发展离不开海量...……更多
大模型算力新选择——宝德AI服务器采用8颗英特尔Gaudi2加速器
...性强、高能效和开箱即用等优势,能够为AI客户尤其是大模型训练和推理提供超高性价比的算力支撑。全新Gaudi®2训练加速器,专为深度学习而生Gaudi®2采用7nm制程工艺,拥有高性能架构,具备24个可编程Tensor处理器核心(TPCs),21...……更多
无需训练即可大幅提升SAM 2!SAM2Long来了,港中文 上海AI Lab出品
...出了创新的记忆结构设计,打造了专为复杂长视频的分割模型。论文链接:https://mark12ding.github.io/project/SAM2Long/asset/images/paper.pdf 项目链接:https://mark12ding.github……更多
AMD的GPU跑AI模型终于Yes了?PK英伟达H100不带怕的
...过。但是,也需要说明这些测试存在局限:仅使用了一种模型,即来自 Meta 的 Llama 2 70B。希望未来能看到这些测试中使用更多不同的 AI 模型。对 MI300X 及 AMD 未来的 GPU 来说,这个结果很是不错。但到今年年底时,考虑到英伟达 B...……更多
掰开安卓手机 满屏都是三个字:大模型
这年头,安卓厂商没个大模型,都不敢开手机发布会了。前脚OPPO刚用大模型升级了语音助手,后脚vivo就官宣自研手机AI大模型;小米发布会则直接将大模型当场塞进手机系统……其竞争激烈程度,不亚于抢芯片首发。到底是怎...……更多
infini-attention:谷歌大内存机制
...歌大改Transformer,“无限”长度上下文来了。现在,1B大模型上下文长度可扩展到1M(100万token,大约相当于10部小说),并能完成Passkey检索任务。8B大模型在500K上下文长度的书籍摘要任务中,拿下最新SOTA。这就是谷歌最新提出的...……更多
清华郑纬民院士:AI for Science的出现,让高性能计算与AI的融合成为刚需|MEET2023
...准设计四大目标以及如何通过并行方法加速大规模预训练模型。为了完整体现郑纬民院士的分享及思考,在不改变原意的基础上,量子位对他的演讲内容进行了编辑整理。关于MEET 智能未来大会:MEET大会是由量子位主办的智能科...……更多
被股民用脚投票!AMD的AI“终极武器”输在了哪里?
...1个CDNA 3图形引擎和128GB HBM3内存。MI300X则是AMD针对大语言模型优化的版本,该产品的晶体管数量达到1530亿个,内存达到了192GB,内存带宽为5.2TB/s,Infinity Fabric带宽为896GB/s。对比英伟达的H100,MI300X提供的HBM(高带宽内存……更多
36氪首发|打造分布式AI开发和部署平台,「潞晨科技」完成数亿元A轮融资
...。众所周知,如今生成式AI的“涌现”能力来自于底层大模型的成熟,但训练大模型需要的算力、网络、数据成本非寻常公司能承受。而本文主角潞晨科技,希望为这一难题提供解法。潞晨科技成立于2021年,主要业务是通过打造...……更多
缓存内存储存?一文剖析AIGC对配置数据的需求
...脑自然也是有一定的配置需求的。对于在AIGC的世界中,模型训练和运行通常需要依赖大量的计算资源和内存。其中CPU与内存之间的信息交换速率、CPU的缓存大小、内存的容量和带宽等因素,起着至关重要的作用!因为复杂度极...……更多
更多关于科技的资讯:
河北新闻网讯(孙明明、王育民)从曹妃甸综合保税区获悉,天猫国际“双十一”购物节于10月20日20时拉开帷幕,首日4个小时
2025-10-23 19:56:00
长春机场廊桥智能播报,打造“无缝”行李提取体验
近日,长春机场“行李转盘信息提示系统”科创项目在219号廊桥顺利投入使用。该系统融合智能语音播报与电子屏幕动态指引,实现了旅客从舱门到行李提取厅的“信息无缝衔接”
2025-10-23 19:24:00
PITAKA浮织工艺再升级,以浮织·光影波纹带来「浮光跃金」新品
、2025年9月,PITAKA发布了iPhone 17系列新品,也正式推出全新Moment系列新纹路——「浮光跃金」,分别有清梦蓝
2025-10-23 16:50:00
76年,于历史长河或为一瞬;于中国保险业,则是一从小到大、由弱及强、自稚嫩向成熟蜕变的壮阔史诗。76年,于一家险企而言
2025-10-23 17:01:00
能环宝NiOS™智慧能源管理系统:驱动光伏电站效益跃升与运维变革
在光伏产业迈向全面平价时代的关键节点,电站运营的精细化管理与经济效益最大化已成为行业共识。面对分布式光伏电站运维成本高
2025-10-23 15:29:00
三位核心人物的真诚分享,道尽燕教授 13 年健康深耕的温度与底气
10月20日19:30,燕教授《一“张”邀请函》第六季天津蓟州站在官方视频号如期开播,一场以“一“张”邀请函”为主题的深度访谈
2025-10-23 08:15:00
Soul App Q3生态安全报告:AI筑防线,共建安全可靠连接空间
随着移动互联网的普及与社交应用深度融入日常生活,社交平台已成为公众表达观点、建立连接的重要渠道。然而,随之而来的虚假信息传播
2025-10-23 08:15:00
厦门网讯(厦门日报记者 李晓平)近日,省工信厅公布第九批省级制造业单项冠军企业名单,15家厦企上榜,占全省31.2%。包括此次公布的名单
2025-10-23 08:43:00
深耕SUV越野赛道,山东新大陆跻身全球轮胎影响力品牌
齐鲁晚报·齐鲁壹点 高松山东新大陆橡胶科技有限公司成立于2012年,位于临沂市沂水县庐山工业园,是一家以研发、生产、销售高性能半钢子午胎为主的高新技术企业
2025-10-23 11:37:00
小米汽车SOS 1秒接通?高管辟谣:该内容完全失实
10月22日,小米汽车副总裁李肖爽发文:针对近期网传 “小米汽车SOS 1秒接通 不含排队时间”等相关内容,为了避免误传
2025-10-23 11:38:00
天猫双11闪购服务再升级:上线“爆火好店”超时20分钟享免单
2025天猫双11已于10月20日晚正式开售,首次参与双11大促的淘宝闪购今日官宣再加码:全面上线“爆火好店”频道,并推出“超时20分钟免单”服务
2025-10-23 11:38:00
京东001号“国民好车”最高出价超7800万元 京东回应此次异常高价成交事件
10月22日14时,京东001号“国民好车”在京东拍卖平台正式开拍,至18时结束时,最终价格为7819.3399万元,京东用户@j*p竞拍成功
2025-10-23 11:38:00
参小妹海参官宣倪萍为品牌代言人,新工厂同步剪彩开启秋冬滋补新篇
金秋十月,正值秋冬滋补季启动节点,生鲜电商领域知名海参品牌 “参小妹海参”于大连保税区工厂,正式官宣国民级主持人倪萍出任品牌代言人
2025-10-23 11:47:00
苹果入局F1直播:生态渗透与体育转播的范式革命
当苹果与F1的红色标识在屏幕上并置,一场关于体育转播、数字生态与用户体验的深层变革已然开启。2026年起,苹果将以7.5亿美元的价格拿下F1美国地区独家转播权
2025-10-23 12:17:00