• 我的订阅
  • 科技

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

类别:科技 发布时间:2024-10-23 12:05:00 来源:量子位

微软开源1bit大模型推理框架!

现在1000亿参数大模型量化后单CPU可跑,速度可达每秒5-7个token。

就是今年爆火论文The Era of 1-bit LLMs的官方代码实现,开源不到一周GitHub已揽获7.9k Star。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

传统大模型参数以16位浮点数(如FP16或BF16)形式的存储,而BitNet b1.58将其统统变成了三进制,也就是 {-1, 0, 1}。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

这里的“1.58 bit”指每个参数可以用1.58位的信息来表示。

转换之后,矩阵中的计算就只会涉及到加法,因此会让大模型在保持一定精度的同时,显著减少所需的存储空间和计算资源,也显著提升了在本地设备上运行LLM的可能性。

这个项目开源后,在X上也受到了一波高度关注。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

千亿参数模型量化后单CPU可跑

bitnet.cpp是1bit LLM(例如 BitNet b1.58)的官方推理框架。

该框架配备了一系列优化内核,支持在CPU上进行快速且无损的1.58bit模型推理,未来将扩展支持NPU和GPU。

bitnet.cpp的首版主要支持CPU推理。

具体性能改进方面,在ARM CPU上,该框架可实现1.37至5.07倍的加速,而且更大的模型将有更显著的性能提升。

同时,它能将能耗降低55.4%至70.0%,进一步增强效率。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

在x86 CPU上,加速效果介于2.37至6.17倍之间,能耗减少71.9%至82.2%。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

网友们也发现了华点,在x86上的性能增益量比ARM更大。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

此外,bitnet.cpp能使千亿参数模型量化后单CPU可跑,速度可达每秒5-7个token,接近人类阅读速度。

微软还展示了使用bitnet.cpp推理框架支持的不同1 bit LLM。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

6页论文,引入1 bit LLM

1 bit LLM的实现方法,微软在一年前就有相关研究,称为BitNet(一种Transformer),用BitLinear替换了nn.Linear。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

今年二月,BitNet原班人马在上一篇论文的基础之上做了优化,提出BitNet b1.58,在原始BitNet的基础上增加了一个额外的0值。

然后这篇内容只有6页的论文引发热议:

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

BitNet b1.58模型的权重被量化为三元值{-1, 0, 1},相当于在二进制系统中使用了1.58 bit来表示每个权重。

采用了absmean量化函数来约束权重,将权重矩阵通过其平均绝对值进行缩放,然后四舍五入到最接近的整数值(-1、0或1)。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

激活量化中,激活值被缩放到[−Qb, Qb]的范围,以此来消除零点量化。

在架构设计上,BitNet b1.58借鉴了Llama,使用了RMSNorm、SwiGLU、旋转位置编码等组件,并移除了所有偏置项。这种设计使其能够轻松集成到主流的开源框架中。

实验中,与Llama相比,BitNet b1.58在矩阵乘法方面节省了71.4倍的计算能耗。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

这种方法发布后,也有不少人在这项研究的基础之上进行探索。

其中一个问题是,BitNet b1.58将每个参数仅用三元值表示,但是所有这些都需要从头开始训练模型,并不是谁都有预算来进行LLM预训练。

而Huggingface Transformers最近整合了BitNet b1.58,运用了一些技巧,使得现有模型可以直接微调到1.58bit。

感兴趣的童鞋可以自行查阅。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

不过也有网友指出了这种方法的局限:

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

总之,1 bit LLM具有巨大的潜力。

但也正如网友所言,1 bit LLM关键还得是能在实践中证明自己。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

参考链接:[1]https://github.com/microsoft/BitNet[2]https://x.com/rohanpaul_ai/status/1847814379657462201[3]https://x.com/rohanpaul_ai/status/1848172443258728860?s=46&t=iTysI4vQLQqCNJjSmBODPw[4]https://huggingface.co/blog/zh/1_58_llm_extreme_quantization

以上内容为资讯信息快照,由td.fyun.cc爬虫进行采集并收录,本站未对信息做任何修改,信息内容不代表本站立场。

快照生成时间:2024-10-23 15:45:02

本站信息快照查询为非营利公共服务,如有侵权请联系我们进行删除。

信息原文地址:

系统级玩家微软、苹果先后出牌,端侧大模型路径清晰了?
落地端侧被认为是大模型走向普及的关键。个人PC和智能手机是当前受众最为广泛的两大终端品类。2023年下半年以来,全球范围内各大PC、手机厂商纷纷通过硬件扩容,尝试将大模型在物理意
2024-06-21 09:16:00
DeepSeek“朋友圈”不断扩围:10家国内外云厂商宣布接入,供用户按需部署
...儿。1月20日,中国AI初创公司深度求索(DeepSeek)推出大模型DeepSeek-R1。作为一款开源模型,R1在数学
2025-02-06 07:23:00
蚂蚁自研知识增强大模型服务框架KAG,可显著提升知识推理准确率
...增强的专业智能体” 相关工作,并带来了知识图谱与大模型结合最新研发成果 —— 知识增强大模型服务框架 KAG。梁磊介绍,专业领域增强大模型服务框架 KAG 通过图谱逻辑符号引
2024-09-13 13:33:00
Meta提出“可持续思维链”,让大模型在连续潜空间中推理
今日值得关注的大模型前沿论文北大团队提出「自定义漫画生成」框架UniReal:通过学习真实世界动态实现通用图像生成和编辑苹果团队提出「可扩展视频生成」方法利用扩散 Transformer 进行视频运动迁移ObjCtrl-2
2024-12-13 09:19:00
微软连发3款Phi-3.5模型:128K上下文,首用MoE架构,部分性能超GPT-4o mini
...东西8月21日消息,今天,微软一口气甩出3款超强轻量级模型!微软本次发布的轻量级模型系列名为Phi-3.5,适合在内存和算力受限的环境中运行
2024-08-22 09:49:00
大模型新趋势之MoE:现状、挑战及研究方向
2024年,全球主流企业加快推出MoE大模型,1-5月发布千亿以上大模型均采用MoE优化架构,且数量超过近三年总和。MoE大模型架构凭借平衡大模型训推成本和计算效率等优势,更适合
2024-11-04 16:00:00
微软推出14b参数“最先进”小型语言模型
...13日消息,微软今天宣布推出14B参数“最先进”小型语言模型(SLM)Phi-4,除了传统的语言处理外,它还擅长数学等领域的复杂推理
2024-12-14 00:08:00
微软发布旗下最小语言模型phi-2
...会已拉开帷幕,微软在本次活动中发布了旗下最小的语言模型Phi-2,共有27亿参数,相比较此前版本有明显提升。注:微软于今年6月发布Phi-1,只有13亿代码,适用于QA问答、
2023-11-17 14:00:00
GPU训Llama 3.1疯狂崩溃,竟有大厂用CPU服务器跑千亿参数大模型?
【新智元导读】是时候用CPU通用服务器跑千亿参数大模型了!马斯克19天建成由10万块H100串联的世界最大超算,已全力投入Grok 3的训练中
2024-08-02 09:47:00
更多关于科技的资讯:
鲜养新势力:深度解析斛妈妈品牌的核心竞争力与养生价值在新中式养生浪潮席卷的当下,传统滋补品正经历着从“厚重礼品”到“日常刚需”的转型
2026-01-13 11:06:00
从超越到引领:东芝电视凭“四连冠”定义日本高端电视市场新秩序
日本权威调研机构株式会社BCN最新发布的“BCN AWARD 2026”数据显示,东芝 REGZA在2025年日本电视市场中表现突出
2026-01-13 11:08:00
贵州都匀:冲“鸭”!都匀茶香鸭拼出“开门红”
多彩贵州网讯 临近春节,记者走进贵州青色食品有限责任公司的生产车间,仍旧是一派热火朝天的生产景象。茶香与鸭肉香气交织,身着统一服装的工人们分工协作
2026-01-13 11:10:00
山东商务职业学院与科讯保链共建“创新创业实践基地”
鲁网1月13日讯(记者 魏萱)近日,山东商务职业学院会计金融学院与山东科讯保链数字科技有限公司共建的“创新创业实践基地”正式挂牌成立
2026-01-13 11:12:00
河北新闻网讯(成博浩、刘乾)“氢电无人机飞行姿态稳定,数据传输流畅,拍摄图片清晰……”1月5日,在邢台市南和区10千伏东盛线巡检现场
2026-01-13 11:26:00
文化立根,创新破局:茶馆行业的新趋势与新路径
2024年12月28日,第六届茶馆业大会在北京圆满闭幕。本次大会以“文化立根,创新破局”为主线,聚焦“十五五”时期茶馆行业的新趋势
2026-01-13 11:27:00
非遗手作入驻潮流商圈,VR技术让千年文物“活”起来,沉浸式剧场打破舞台与观众的边界⋯⋯新年伊始,创意迭出的消费新场景,早已跳脱出“买东西”的传统定义
2026-01-13 11:27:00
全项通过!蚂蚁数科FAIR平台完成国家级可信数据空间功能验证
近日,蚂蚁数科宣布其自主研发的FAIR可信数据空间平台在国家数据局指导下、由中国电子技术标准化研究院组织的可信数据空间功能测试中
2026-01-13 11:35:00
海尔X11洗衣机获西班牙“最佳家电及互联设备”奖
2025年12月初,海尔X11洗衣机荣获西班牙权威科技媒体Xataka颁发的年度“最佳家电及互联设备”奖。这一奖项在欧洲科技领域具有重要影响力
2026-01-13 11:47:00
海尔三筒、L+洗衣机登陆巴基斯坦填补高端空白
当地时间1月8日,海尔巴基斯坦经销商大会举办。会上,海尔洗衣机携全价位段产品矩阵亮相,并重点发布了2026年高端新品——三筒洗衣机与L+洗衣机
2026-01-13 11:48:00
如今H5婚礼电子请柬因环保方便成办婚礼“标配”,但近日“婚礼电子请柬访客记录”冲上热搜。网友发现,部分平台将访客浏览、转发记录设为付费会员服务
2026-01-13 11:49:00
中新经纬1月13日电 民政部13日举行专题新闻发布会,介绍《关于培育养老服务经营主体 促进银发经济发展的若干措施》有关情况
2026-01-13 12:20:00
打破国外垄断!芜湖长信“透视眼”传感器上岗,高端装备有了“中国芯”
大皖新闻讯 日前,芜湖长信科技股份有限公司(以下简称“长信科技”)生产车间内,一片片承载核心技术的玻璃器件接连下线。这些元件是高端X射线成像装备的“心脏”——大面积动态X射线成像传感器
2026-01-13 12:48:00
湖南构建一体化产业链助推航运与行业高质量发展
湖南常德聚豪船务有限公司凭借其清晰的战略定位与高效的业务整合能力,成功构建并持续完善覆盖“采挖、运输、销售”三大核心环节的一体化船务运营体系
2026-01-13 11:58:00
中新经纬1月13日电 上海市政府网站13日公布《上海市促进服务业提质增效和消费提振扩容联动发展的若干措施》(下称《若干措施》)
2026-01-13 12:05:00