• 我的订阅
  • 科技

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

类别:科技 发布时间:2024-10-23 12:05:00 来源:量子位

微软开源1bit大模型推理框架!

现在1000亿参数大模型量化后单CPU可跑,速度可达每秒5-7个token。

就是今年爆火论文The Era of 1-bit LLMs的官方代码实现,开源不到一周GitHub已揽获7.9k Star。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

传统大模型参数以16位浮点数(如FP16或BF16)形式的存储,而BitNet b1.58将其统统变成了三进制,也就是 {-1, 0, 1}。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

这里的“1.58 bit”指每个参数可以用1.58位的信息来表示。

转换之后,矩阵中的计算就只会涉及到加法,因此会让大模型在保持一定精度的同时,显著减少所需的存储空间和计算资源,也显著提升了在本地设备上运行LLM的可能性。

这个项目开源后,在X上也受到了一波高度关注。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

千亿参数模型量化后单CPU可跑

bitnet.cpp是1bit LLM(例如 BitNet b1.58)的官方推理框架。

该框架配备了一系列优化内核,支持在CPU上进行快速且无损的1.58bit模型推理,未来将扩展支持NPU和GPU。

bitnet.cpp的首版主要支持CPU推理。

具体性能改进方面,在ARM CPU上,该框架可实现1.37至5.07倍的加速,而且更大的模型将有更显著的性能提升。

同时,它能将能耗降低55.4%至70.0%,进一步增强效率。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

在x86 CPU上,加速效果介于2.37至6.17倍之间,能耗减少71.9%至82.2%。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

网友们也发现了华点,在x86上的性能增益量比ARM更大。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

此外,bitnet.cpp能使千亿参数模型量化后单CPU可跑,速度可达每秒5-7个token,接近人类阅读速度。

微软还展示了使用bitnet.cpp推理框架支持的不同1 bit LLM。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

6页论文,引入1 bit LLM

1 bit LLM的实现方法,微软在一年前就有相关研究,称为BitNet(一种Transformer),用BitLinear替换了nn.Linear。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

今年二月,BitNet原班人马在上一篇论文的基础之上做了优化,提出BitNet b1.58,在原始BitNet的基础上增加了一个额外的0值。

然后这篇内容只有6页的论文引发热议:

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

BitNet b1.58模型的权重被量化为三元值{-1, 0, 1},相当于在二进制系统中使用了1.58 bit来表示每个权重。

采用了absmean量化函数来约束权重,将权重矩阵通过其平均绝对值进行缩放,然后四舍五入到最接近的整数值(-1、0或1)。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

激活量化中,激活值被缩放到[−Qb, Qb]的范围,以此来消除零点量化。

在架构设计上,BitNet b1.58借鉴了Llama,使用了RMSNorm、SwiGLU、旋转位置编码等组件,并移除了所有偏置项。这种设计使其能够轻松集成到主流的开源框架中。

实验中,与Llama相比,BitNet b1.58在矩阵乘法方面节省了71.4倍的计算能耗。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

这种方法发布后,也有不少人在这项研究的基础之上进行探索。

其中一个问题是,BitNet b1.58将每个参数仅用三元值表示,但是所有这些都需要从头开始训练模型,并不是谁都有预算来进行LLM预训练。

而Huggingface Transformers最近整合了BitNet b1.58,运用了一些技巧,使得现有模型可以直接微调到1.58bit。

感兴趣的童鞋可以自行查阅。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

不过也有网友指出了这种方法的局限:

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

总之,1 bit LLM具有巨大的潜力。

但也正如网友所言,1 bit LLM关键还得是能在实践中证明自己。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

参考链接:[1]https://github.com/microsoft/BitNet[2]https://x.com/rohanpaul_ai/status/1847814379657462201[3]https://x.com/rohanpaul_ai/status/1848172443258728860?s=46&t=iTysI4vQLQqCNJjSmBODPw[4]https://huggingface.co/blog/zh/1_58_llm_extreme_quantization

以上内容为资讯信息快照,由td.fyun.cc爬虫进行采集并收录,本站未对信息做任何修改,信息内容不代表本站立场。

快照生成时间:2024-10-23 15:45:02

本站信息快照查询为非营利公共服务,如有侵权请联系我们进行删除。

信息原文地址:

系统级玩家微软、苹果先后出牌,端侧大模型路径清晰了?
落地端侧被认为是大模型走向普及的关键。个人PC和智能手机是当前受众最为广泛的两大终端品类。2023年下半年以来,全球范围内各大PC、手机厂商纷纷通过硬件扩容,尝试将大模型在物理意
2024-06-21 09:16:00
DeepSeek“朋友圈”不断扩围:10家国内外云厂商宣布接入,供用户按需部署
...儿。1月20日,中国AI初创公司深度求索(DeepSeek)推出大模型DeepSeek-R1。作为一款开源模型,R1在数学
2025-02-06 07:23:00
蚂蚁自研知识增强大模型服务框架KAG,可显著提升知识推理准确率
...增强的专业智能体” 相关工作,并带来了知识图谱与大模型结合最新研发成果 —— 知识增强大模型服务框架 KAG。梁磊介绍,专业领域增强大模型服务框架 KAG 通过图谱逻辑符号引
2024-09-13 13:33:00
Meta提出“可持续思维链”,让大模型在连续潜空间中推理
今日值得关注的大模型前沿论文北大团队提出「自定义漫画生成」框架UniReal:通过学习真实世界动态实现通用图像生成和编辑苹果团队提出「可扩展视频生成」方法利用扩散 Transformer 进行视频运动迁移ObjCtrl-2
2024-12-13 09:19:00
微软连发3款Phi-3.5模型:128K上下文,首用MoE架构,部分性能超GPT-4o mini
...东西8月21日消息,今天,微软一口气甩出3款超强轻量级模型!微软本次发布的轻量级模型系列名为Phi-3.5,适合在内存和算力受限的环境中运行
2024-08-22 09:49:00
大模型新趋势之MoE:现状、挑战及研究方向
2024年,全球主流企业加快推出MoE大模型,1-5月发布千亿以上大模型均采用MoE优化架构,且数量超过近三年总和。MoE大模型架构凭借平衡大模型训推成本和计算效率等优势,更适合
2024-11-04 16:00:00
微软推出14b参数“最先进”小型语言模型
...13日消息,微软今天宣布推出14B参数“最先进”小型语言模型(SLM)Phi-4,除了传统的语言处理外,它还擅长数学等领域的复杂推理
2024-12-14 00:08:00
微软发布旗下最小语言模型phi-2
...会已拉开帷幕,微软在本次活动中发布了旗下最小的语言模型Phi-2,共有27亿参数,相比较此前版本有明显提升。注:微软于今年6月发布Phi-1,只有13亿代码,适用于QA问答、
2023-11-17 14:00:00
GPU训Llama 3.1疯狂崩溃,竟有大厂用CPU服务器跑千亿参数大模型?
【新智元导读】是时候用CPU通用服务器跑千亿参数大模型了!马斯克19天建成由10万块H100串联的世界最大超算,已全力投入Grok 3的训练中
2024-08-02 09:47:00
更多关于科技的资讯:
马年新春年味尚浓,元宵汤圆市场就“马”力全开。各大品牌纷纷推出“马”元素汤圆。这些产品凭借萌趣外形迅速出圈,部分热款销量突破40万单
2026-02-27 06:53:00
前来中国进行正式访问的德国总理默茨,于昨日专程飞抵杭州,乘坐红旗车继续访华行程。德国总理一行先后考察了宇树科技、西门子能源等企业
2026-02-27 06:53:00
觅睿科技昨日申购,发行价格为21.52元/股,发行市盈率为14.99倍。本次公开发行股份数量1360.55万股,采用战略配售和网上发行相结合的方式进行
2026-02-27 07:24:00
近日,一份名为《2028年全球智能危机》的报告在外网刷屏,报告仅在其官方账号24小时内阅读量就超2000万。报告推演了若AI技术超预期发展
2026-02-27 07:54:00
■李璐摘要:在高度不确定和动态变化的创新导向型项目中,传统以计划和控制为核心的项目管理模式面临显著挑战。灵活管理机制因其强调适应性
2026-02-27 04:54:00
胶东在线1月24日讯(通讯员 于江涛)1月24日,烟台市2026年度家电以旧换新、数码和智能产品购新补贴活动正式启动。截至目前
2026-02-27 04:03:00
纵览原创丨网传“相机涨价10倍”,石家庄太和电子城商户:“没感觉,相机价格比较平稳”
见习记者 袁欣悦近期,“6年前2459元买入如今涨到4048元”“CCD相机价格翻10倍”等信息频频进入大众视野,照相机被网友戏称为“电子黄金”
2026-02-26 20:34:00
中新经纬2月26日电 (袁媛)2026年被业内视为“智能体加速落地期”,人工智能正从单纯的对话工具走向能够自主执行任务的智能体系统
2026-02-26 21:31:00
江南时报讯 近日,工商银行徐州分行与特来电新能源股份有限公司举办“绿色出行,智联未来”充电生态共建项目启动暨经营家方案发布会
2026-02-26 21:39:00
手握7000万订单,济南起步区这家企业以4倍新产能满弓劲发赶交付
鲁网2月26日讯在济南起步区崔寨街道的绿能智造产业园,济南鼎点数控设备有限公司正以干劲“满格”的姿态,火热推进复工复产
2026-02-26 17:11:00
近日,湖北省洪湖市烟草专卖局围绕信息采集工作推出四项关键措施,全面提升数据的规范性与准确度。强化队伍建设,提升专业能力
2026-02-26 17:12:00
艺龙酒店科技马年新春业绩斐然,品质服务与生态赋能共启新程
2026年春节,得益于“史上最长春节”红利持续释放,国内文旅酒店行业迎来显著增长。经文化和旅游部数据中心测算,春节假日9天
2026-02-26 17:13:00
湖北洪湖烟草:立足实效提升营销服务效能
为切实提升客户服务质量与经营获得感,近期,湖北省洪湖市烟草专卖局(营销部)紧密围绕市场实际与客户需求,采取针对性举措,全力推动营销服务效能再上新台阶
2026-02-26 17:14:00
2026年第37届国际宝饰展近日圆满落幕,在这场汇聚全球顶尖珠宝力量的盛会中,MiNG名皇珠宝以老钱风雅致展位惊艳亮相
2026-02-26 17:12:00
近期,湖北省洪湖市烟草专卖局立足零售客户实际需求,精准把握经营难点,创新实施“四式”服务模式,有效提升了客户的满意度和获得感
2026-02-26 17:13:00