• 我的订阅
  • 科技

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

类别:科技 发布时间:2024-10-23 12:05:00 来源:量子位

微软开源1bit大模型推理框架!

现在1000亿参数大模型量化后单CPU可跑,速度可达每秒5-7个token。

就是今年爆火论文The Era of 1-bit LLMs的官方代码实现,开源不到一周GitHub已揽获7.9k Star。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

传统大模型参数以16位浮点数(如FP16或BF16)形式的存储,而BitNet b1.58将其统统变成了三进制,也就是 {-1, 0, 1}。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

这里的“1.58 bit”指每个参数可以用1.58位的信息来表示。

转换之后,矩阵中的计算就只会涉及到加法,因此会让大模型在保持一定精度的同时,显著减少所需的存储空间和计算资源,也显著提升了在本地设备上运行LLM的可能性。

这个项目开源后,在X上也受到了一波高度关注。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

千亿参数模型量化后单CPU可跑

bitnet.cpp是1bit LLM(例如 BitNet b1.58)的官方推理框架。

该框架配备了一系列优化内核,支持在CPU上进行快速且无损的1.58bit模型推理,未来将扩展支持NPU和GPU。

bitnet.cpp的首版主要支持CPU推理。

具体性能改进方面,在ARM CPU上,该框架可实现1.37至5.07倍的加速,而且更大的模型将有更显著的性能提升。

同时,它能将能耗降低55.4%至70.0%,进一步增强效率。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

在x86 CPU上,加速效果介于2.37至6.17倍之间,能耗减少71.9%至82.2%。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

网友们也发现了华点,在x86上的性能增益量比ARM更大。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

此外,bitnet.cpp能使千亿参数模型量化后单CPU可跑,速度可达每秒5-7个token,接近人类阅读速度。

微软还展示了使用bitnet.cpp推理框架支持的不同1 bit LLM。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

6页论文,引入1 bit LLM

1 bit LLM的实现方法,微软在一年前就有相关研究,称为BitNet(一种Transformer),用BitLinear替换了nn.Linear。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

今年二月,BitNet原班人马在上一篇论文的基础之上做了优化,提出BitNet b1.58,在原始BitNet的基础上增加了一个额外的0值。

然后这篇内容只有6页的论文引发热议:

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

BitNet b1.58模型的权重被量化为三元值{-1, 0, 1},相当于在二进制系统中使用了1.58 bit来表示每个权重。

采用了absmean量化函数来约束权重,将权重矩阵通过其平均绝对值进行缩放,然后四舍五入到最接近的整数值(-1、0或1)。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

激活量化中,激活值被缩放到[−Qb, Qb]的范围,以此来消除零点量化。

在架构设计上,BitNet b1.58借鉴了Llama,使用了RMSNorm、SwiGLU、旋转位置编码等组件,并移除了所有偏置项。这种设计使其能够轻松集成到主流的开源框架中。

实验中,与Llama相比,BitNet b1.58在矩阵乘法方面节省了71.4倍的计算能耗。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

这种方法发布后,也有不少人在这项研究的基础之上进行探索。

其中一个问题是,BitNet b1.58将每个参数仅用三元值表示,但是所有这些都需要从头开始训练模型,并不是谁都有预算来进行LLM预训练。

而Huggingface Transformers最近整合了BitNet b1.58,运用了一些技巧,使得现有模型可以直接微调到1.58bit。

感兴趣的童鞋可以自行查阅。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

不过也有网友指出了这种方法的局限:

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

总之,1 bit LLM具有巨大的潜力。

但也正如网友所言,1 bit LLM关键还得是能在实践中证明自己。

微软开源爆火1bit大模型推理框架!千亿参数模型量化后单CPU可跑

参考链接:[1]https://github.com/microsoft/BitNet[2]https://x.com/rohanpaul_ai/status/1847814379657462201[3]https://x.com/rohanpaul_ai/status/1848172443258728860?s=46&t=iTysI4vQLQqCNJjSmBODPw[4]https://huggingface.co/blog/zh/1_58_llm_extreme_quantization

以上内容为资讯信息快照,由td.fyun.cc爬虫进行采集并收录,本站未对信息做任何修改,信息内容不代表本站立场。

快照生成时间:2024-10-23 15:45:02

本站信息快照查询为非营利公共服务,如有侵权请联系我们进行删除。

信息原文地址:

系统级玩家微软、苹果先后出牌,端侧大模型路径清晰了?
落地端侧被认为是大模型走向普及的关键。个人PC和智能手机是当前受众最为广泛的两大终端品类。2023年下半年以来,全球范围内各大PC、手机厂商纷纷通过硬件扩容,尝试将大模型在物理意
2024-06-21 09:16:00
DeepSeek“朋友圈”不断扩围:10家国内外云厂商宣布接入,供用户按需部署
...儿。1月20日,中国AI初创公司深度求索(DeepSeek)推出大模型DeepSeek-R1。作为一款开源模型,R1在数学
2025-02-06 07:23:00
蚂蚁自研知识增强大模型服务框架KAG,可显著提升知识推理准确率
...增强的专业智能体” 相关工作,并带来了知识图谱与大模型结合最新研发成果 —— 知识增强大模型服务框架 KAG。梁磊介绍,专业领域增强大模型服务框架 KAG 通过图谱逻辑符号引
2024-09-13 13:33:00
Meta提出“可持续思维链”,让大模型在连续潜空间中推理
今日值得关注的大模型前沿论文北大团队提出「自定义漫画生成」框架UniReal:通过学习真实世界动态实现通用图像生成和编辑苹果团队提出「可扩展视频生成」方法利用扩散 Transformer 进行视频运动迁移ObjCtrl-2
2024-12-13 09:19:00
微软连发3款Phi-3.5模型:128K上下文,首用MoE架构,部分性能超GPT-4o mini
...东西8月21日消息,今天,微软一口气甩出3款超强轻量级模型!微软本次发布的轻量级模型系列名为Phi-3.5,适合在内存和算力受限的环境中运行
2024-08-22 09:49:00
大模型新趋势之MoE:现状、挑战及研究方向
2024年,全球主流企业加快推出MoE大模型,1-5月发布千亿以上大模型均采用MoE优化架构,且数量超过近三年总和。MoE大模型架构凭借平衡大模型训推成本和计算效率等优势,更适合
2024-11-04 16:00:00
微软推出14b参数“最先进”小型语言模型
...13日消息,微软今天宣布推出14B参数“最先进”小型语言模型(SLM)Phi-4,除了传统的语言处理外,它还擅长数学等领域的复杂推理
2024-12-14 00:08:00
微软发布旗下最小语言模型phi-2
...会已拉开帷幕,微软在本次活动中发布了旗下最小的语言模型Phi-2,共有27亿参数,相比较此前版本有明显提升。注:微软于今年6月发布Phi-1,只有13亿代码,适用于QA问答、
2023-11-17 14:00:00
GPU训Llama 3.1疯狂崩溃,竟有大厂用CPU服务器跑千亿参数大模型?
【新智元导读】是时候用CPU通用服务器跑千亿参数大模型了!马斯克19天建成由10万块H100串联的世界最大超算,已全力投入Grok 3的训练中
2024-08-02 09:47:00
更多关于科技的资讯:
杭州小锣号网络科技:在GEO营销领域的深度探索与产业革新
在人工智能‌深度渗透生活‌的今天,数字营销正经历着从“广泛覆盖”到“精准触达”的深刻变革。杭州小锣号网络科技有限公司,作为一家坚持自主创新理念的综合数字营销服务商
2026-02-03 20:57:00
智能非智慧乐符在心↑↑点击上方视频↑↑看肖白谈AI与音乐创作2026年,人工智能技术持续渗透各行各业,音乐领域亦迎来新的思考与挑战
2026-02-03 21:09:00
今天(3日),工业和信息化部等八部门联合发布了《汽车数据出境安全指引(2026版)》(以下简称《安全指引》),这一《安全指引》的发布
2026-02-03 21:41:00
仁怀:以码立质 以价惠民 产区金字招牌持续擦亮
多彩贵州网讯作为中国酱香白酒核心产区,近年来,贵州仁怀通过认证赋码、发布亲民酒等创新举措,由政府与行业协会双重背书,帮助优质产品在市场中脱颖而出
2026-02-03 22:31:00
新春走基层|“AI”上春运,让回家的路更“懂”你
春运,这场承载亿万家庭团圆期盼的“流动史诗”,在2026年的寒冬里因AI技术的深度浸润而暖意倍增。当智能客服毫秒级响应旅途困惑
2026-02-03 16:53:00
鲁网2月3日讯2月3日,济南市槐荫区第十九届人民代表大会第五次会议开幕,槐荫区区长刘敬涛代表区政府作政府工作报告。报告提到
2026-02-03 17:28:00
八部门联合发文 推进汽车数据高效便利安全跨境流动
中国网2月3日讯 据“工信微报”微信公众号消息,为贯彻落实党中央、国务院决策部署,推动建立高效便利安全的汽车数据跨境流动机制
2026-02-03 18:27:00
近日,在上海临港新片区一栋现代化研发楼里,没有黑板与讲台,却有真实的测试机台、高速示波器和正在运行仿真的EDA软件界面
2026-02-03 18:18:00
1月29日下午,“数智赋能 全链护航”吴江区企业全周期服务赋能大会在苏州东太湖大厦举行。吴江区40余家企业和商协会代表参会
2026-02-03 14:42:00
鲁网2月3日讯1月30日晚间,苏宁易购发布2025年度业绩预告。公告显示,公司预计全年实现归属于上市公司股东的净利润5000万元至7500万元
2026-02-03 15:10:00
初瑞雪年货节首秀告捷,辛选合伙人制激发主播新活力
鲁网2月3日讯春节临近,市场的消费热情也逐渐高涨。2月1日,辛选集团董事长、快手头部主播初瑞雪首度开启辛选超级年货节,为用户打造了一场绚丽多彩的春节“线上集市”
2026-02-03 15:42:00
中国消费者报武汉讯(记者吴采平)2月2日,记者从湖北省消费者委员会了解到,2025年,湖北各级消协组织共受理消费者投诉73567件
2026-02-03 15:00:00
中国消费者报报道(记者李燕京)如今,随着健康类可穿戴设备市场规模持续扩大,消费需求也告别了尝鲜猎奇的初级阶段,全面转向健康实用的核心诉求
2026-02-03 15:00:00
鲁网2月3日讯面对自助设备服务投诉这一长期困扰客户体验与银行声誉的痛点,建行临沂分行深入贯彻落实总行关于运营服务提质增效的要求
2026-02-03 11:06:00
新春走基层|从南到北,这群技术牛人为何选择捷翼科技?
在外企拥有稳定职位、优渥待遇的技术专家周同昌,在2025年底,做了一个令许多人意外的决定:放弃原有的“舒适区”,加入长春捷翼汽车科技股份有限公司
2026-02-03 11:31:00