• 我的订阅
  • 头条热搜
1890美元,就能从头训练一个还不错的12亿参数扩散模型
...。现阶段,视觉生成模型擅长创建逼真的视觉内容,然而从头开始训练这些模型的成本和工作量仍然很高。比如 Stable Diffusion 2.1 花费了 200000 个 A100 GPU 小时。即使研究者使用最先进的方法,也需要在 8×H100 GPU 上训练一个多月的...……更多
比Stable Diffusion便宜118倍!1890美元训出11.6亿参数高质量文生图模型
...推进了一大步:论文地址:https://arxiv.org/abs/2407.15811——从头开始训练一个11.6亿参数的扩散模型,只需要1890美元!对比SOTA有了一个数量级的提升,让普通人也看到了能摸一摸预训练的希望。更重要的是,降低成本的技术并没有...……更多
1行代码改进大模型训练,Llama训练速度升至1.47倍,华人团队出品
只要改一行代码,就能让大模型训练效率提升至1.47倍。拥有得州大学奥斯汀分校背景四名华人学者,提出了大模型训练优化器Cautious Optimizers。在提速的同时,Cautious能够保证训练效果不出现损失,而且语言和视觉模型都适用。...……更多
苹果开源7B模型,训练过程数据集一口气全给了,网友:很不像苹果
...次开源的意义,有热心网友也帮忙总结了:对于任何想要从头开始训练模型或微调现有模型的人来说,数据管理过程是必须研究的。当然,除了OpenAI和苹果,上周Mistral AI联合英伟达也发布了一个12B参数小模型。 HuggingFace创始人...……更多
“言出必行”马斯克,全球最大开源模型Grok真的来了
...重和网络架构。xAI 表示,开源版大模型Grok-1是一个由 xAI 从头开始训练的 3140 亿个参数混合专家模型。据介绍,基础模型基于大量文本数据进行训练,没有针对任何具体任务进行微调;3140 亿参数的 MoE 模型,在给定 token 上的激...……更多
高能技巧!60 行 NumPy 代码 从头实现一个 GPT
...,一名工程师 Jay Mody 在一篇文章汇总将用 60 行 NumPy 代码从头实现一个 GPT。并把 GPT-2 模型权重加载到实现中,从而生成文本。原文链接:https://jaykmody.com/blog/gpt-from-scratch/作者 |Jay Mody译者| 禾木木出品 ……更多
16384块NVIDIA H100训练Meta Llama3 4050亿参数大模型:3小时报错一次
...且需要高度同步,一次错误就可能导致整个训练工作必须从头再来。报告显示,为期45天的预训练阶段中,总共出现了466次工作中断,其中47次是计划内的自动维护,419次是意外的,且大部分都来自硬件问题,GPU又是最多的,占...……更多
国产模型指令跟随全球第一!来自LeCun亲推的最难作弊LLM新榜单
...基于已有模型通过upcycle(向上复用)开始训练,不然就从头开始训练。Upcycle方式所需算力相对更低、训练效率更高,但随随便便就到这种方式的天花板了。比如基于拷贝复制得到的MoE模型,非常容易出现专家同质化严重的情况...……更多
Token化一切,甚至网络!北大&谷歌&马普所提出TokenFormer
...size 的 scaling。Scaling model 是通常改变模型结构,往往需要从头训练整个模型,带来了过多的资源消耗,使其越来越不切实际。在本文中,研究团队使用 token 这一概念建模所有的计算,即将 model parameters 也视为一种 token,网络的...……更多
3天把Llama训成Mamba,性能不降,推理更快!
...了整个模型的推理速度。为什么要把Llama变成Mamba?因为从头开始训练一个大模型太贵了。Mamba也火了这么长时间了,相关的研究每天都有,但自己训练大尺寸Mamba模型的却很少。目前比较有名的是AI21的Jamba(进化到了1.5版本,最...……更多
开源社区参数量最大的文生视频模型来了,腾讯版Sora免费使用
...业创新步伐基于腾讯混元的开源模型,开发者及企业无需从头训练,即可直接用于推理,并可基于腾讯混元系列打造专属应用及服务,能够节约大量人力及算力。同时,各大模型研发团队均可基于腾讯混元模型进行研究与创新,...……更多
新视角设计下一代时序基础模型,Salesforce推出Moirai-MoE
...领域正在经历重大转型,从传统的「单一数据集训练单一模型」的模式逐步转向「通用预测基础模型」。目前虽然有不少基础模型已经提出,但如何有效地在高度多样化的时序数据上训练基础模型仍是一个开放问题。近期,来自...……更多
没有这些,别妄谈做 ChatGPT 了
...惜,GPT-3 至今也没有开源,未来也大概率不会开源了。要从头训这么一个 1750 亿参数的大型生成式语言模型,难度非常大。有人可能要说,那我们训一个小点的模型,比如百亿参数的,可行吗?目前来看不可行。 AI 的表现并非...……更多
3D大模型助力,15分钟即可训练高质量、个性化的数字人模型
...界主流的个性化精品数字人通常属于在单个目标人数据上从头训练的小模型,虽然这种小模型能够有效地学到说话人的外表和说话风格,这种做法存在低训练效率、低样本效率、低鲁棒性的问题。相比之下,近年来许多工作专注...……更多
鄂维南院士领衔新作:大模型不止有RAG、参数存储,还有第3种记忆
...来的,其中稀疏记忆格式保持了真实的存储大小;研究者从头开始训练了一个具有 2.4B 非嵌入参数的 Memory3 模型,其性能超过了更大规模的 SOTA 模型。它还比 RAG 具有更好的性能和更快的推理速度; 此外,Memory3 提高了事实性并...……更多
模型即服务,卓世科技MaaS平台 2.0 正式上线
...了优化。 2、自定义模型构建:允许用户根据自己的需求从头开始构建模型,提供灵活的模型架构设计工具。 3、训练环境配置:提供所需的计算资源,包括GPU、TPU等加速硬件,以及相应的软件环境。 4、超参数调优:帮助用户...……更多
还在人工炼丹?自动提示工程指南来了,还带从头实现
...了自动提示词工程的概念、原理和工作流程,并通过代码从头实现了这一方法。自动提示词工程是什么?自动提示词工程(APE)是指自动生成和优化 LLM 提示词的技术,目标是提升模型在特定任务上的性能。其基于提示词工程的...……更多
马斯克承诺开源版大模型 来了!Grok-1:3140亿参数迄今最大,权重架构全开放
...们想了解更多 OpenAI 的开放部分’。回到模型本身,Grok-1 从头开始训练,并且没有针对任何特定应用(如对话)进行微调。相对的,在 X(原 Twitter)上可用的 Grok 大模型是微调过的版本,其行为和原始权重版本并不相同。 Grok-1...……更多
XAI大模型Grok-1已正式开源 但并不是在马斯克说的上周
...k-1的参数是最多的。XAI官网的信息还显示,Grok-1是由他们从头开始训练的模型,此次发布的是预训练阶段结束时的原始基础模型检查点,预训练阶段在去年10月份完成。这也就意味着他们开源的模型,没有进行针对对话等任何具...……更多
Meta祭出三篇最详尽Llama微调指南!千字长文,0基础小白必备
...适配大模型预训练预训练是指,使用数万亿个token数据,从头开始训练LLM的过程,通常使用自监督算法进行训练。最常见的情况是,训练通过自回归预测下一个token(也称为因果语言建模)。预训练通常需要数千个GPU小时(105-107...……更多
开源狂潮让巨头惨败,谷歌内部文件曝光
...到充分重视,尽管它直接影响了我们最寄予厚望的项目。从头开始重新训练模型,是一条艰难的道路LoRA如此有效的部分原因在于,与其他形式的微调一样,它是可堆叠的。可以应用指令调整改进模型,这样在其他贡献者添加对...……更多
马斯克打脸OpenAI!全球最大模型Grok-1开源
...一个由xAI 2023年10月使用基于JAX和Rust的自定义训练堆栈、从头开始训练的3140亿参数的混合专家(MOE)模型,远超OpenAI的GPT模型。而此次开源的模型是是Grok-1预训练阶段的原始基础模型,没有针对任何特定应用(例如对话)进行微...……更多
反击OpenAI,谷歌放出最强悍大模型Gemini
...型都是在大语言模型LLM之上生长出多模态的应用,而并非从头开始训练的多模态的大模型,这是多模态大模型目前“不能言说的秘密”。 图源:中信建投证券谷歌自己也提到,到目前为止,创建多模态模型的标准方法基本是针...……更多
全球十亿级轨迹点驱动,首个轨迹基础大模型来了
...流配送等关键领域具有重要意义。然而,现有的轨迹相关模型往往受限于特定任务、区域依赖、轨迹数据规模和多样性困乏等问题,限制了模型的泛化能力和实际应用范围。近日,来自于香港科技大学(广州)、南方科技大学、...……更多
1-bit大模型还能再突破!新一代BitNet架构启用4位激活值
...ear替换注意力(MHA)和前馈网络(FFN)中的线性投影,以从头开始学习1.58 bit权重。对于激活值,采用混合量化和稀疏化策略来减轻异常值维度引入的误差。图2说明了模型大小为7B的BitNet b1.58中,每个模块输入的分布。注意力层...……更多
Mamba作者新作:将Llama3蒸馏成混合线性 RNN
...在聊天基准测试和一般基准测试中优于使用数万亿 token 从头开始训练的开源混合 Mamba 模型。此外,该研究还提出了一种硬件感知推测解码算法,可以加快 Mamba 和混合模型的推理速度。 论文地址:https://arxiv.org/pdf/2408.15237该研...……更多
百度云升级模型服务,百度版GPTs即日开放 | 最前线
...都要先获得这个场景里的这些数据,根据你所用的模型,从头开始去训练,尽管之前模型不像现在的模型参数这么大,一亿个参数在去年可能还算是一个挺大的,今年大家都说10亿是小模型,其实也是很大规模的模型。图像、语...……更多
Meta首款多模态Llama 3.2开源!1B羊驼宝宝,跑在手机上了
...识也就是,较小的模型可以借助教师模型的指导,获得比从头开始训练更好的性能。为此,Meta在预训练阶段融入了来自Llama 3.1 8B和70B模型的logits(模型输出的原始预测值),并将这些较大模型的输出则用作token级的目标。后训练...……更多
...亿稠密模型能够促进整个开源社区的发展,让大家不需要从头开始训练万亿参数模型,也就不需要从头解决收敛的问题。”具身智能得益于大模型的通用能力,机器人有了注入“灵魂”的可能。王仲远提到,智能体很可能会成为...……更多
GPT-4震惊四座,中国创业者激战“小模型” | Future
...壁。同时,专科的教育资源分散,每个小模型都需要分别从头进行基础训练,作为父母的人类,大多有着培养出全才的期望。2017年,谷歌发明了一种新的教育方式:Transformer模型。以往的“专科教育”中,AI的学习十分依赖人类...……更多
更多关于科技的资讯:
3月11日,中国协作机器人第一股越疆科技(2432.HK)发布了全球首款“灵巧操作+直膝行走”具身智能人形机器人。越疆科技称
2025-03-11 19:01:00
华为新专利可实现电动车自动掉头,漂移掉头或变得易如反掌
天眼查知识产权信息显示,近日,华为数字能源技术有限公司申请的“一种电动车辆自动掉头的控制方法、控制器以及电动车辆”专利公布
2025-03-11 19:06:00
陵城农商银行“一站式”办理,减少个体户融资流程
德州市陵城区滋镇惠农农资店里,店主刘鹏正忙着给村里的种植户配货。他的店铺主要销售化肥、种子、农药等农业生产资料,每到春耕和秋收时节
2025-03-11 20:13:00
云生AI 提质增效  2025AI赋能招聘与人效提升分享会成都站圆满落幕
3月6日,“云生AI提质增效”2025AI赋能招聘与人效提升分享会正式开启全国巡回分享的大幕,首站在四川成都成功举办。数百位企业代表来宾亲临现场学习交流
2025-03-11 20:17:00
世俱杯奖杯首度亮相中国,海信携手FIFA点亮山城
科技之光与足球荣耀在山城重庆璀璨相遇。3月10日,2025世俱杯奖杯震撼亮相海信重庆解放碑快闪店。作为2025海信XFIFA世俱杯奖杯中国行的重要环节
2025-03-11 20:17:00
王腾把小米15 Ultra拆了 指出美中不足的一点
快科技3月11日消息,今晚REDMI品牌总经理王腾晒视频称,自己把友商的小米15 Ultra拆了,看看有啥优秀的影像能力和算法能继承到REDMI
2025-03-11 22:19:00
小米回应SU7 Ultra充电达不到标称的快充速度:使用第三方充电桩有影响
快科技3月11日消息,小米汽车今日晚间发布了答网友问(第122集)。有网友询问,为什么我的小米SU7 Ultra充电达不到标称的快充速度
2025-03-11 22:19:00
最前线|亿咖通科技2024年第四季度当季盈利
亿咖通科技(来源:企业官方)亿咖通科技(纳斯达克股票代码:ECX)于3月11日发布了2024年第四季度及全年业绩报告,宣布实现全面盈利
2025-03-11 22:25:00
“穷游”当道,文旅市场如何接招?聊城大学传媒技术学院专题调研给出答案曾经被视为小众旅行方式的“穷游”,如今已成为席卷文旅市场的文化现象
2025-03-11 22:34:00
禾赛科技盘中股价暴涨超41% 消息称禾赛激光雷达拿下奔驰大单
快科技3月11日消息,今日晚间,美股禾赛科技开盘后股价一路暴涨,截止当前发稿,股价已上涨超41.79%。消息面上,禾赛科技在今日公布的2024年Q4财报中透露
2025-03-11 22:49:00
又一时速350公里高铁有新进展:厦门至广州仅需2.5小时
快科技3月11日消息,中国铁路宣布,漳汕高铁(漳州至汕头)漳江湾跨海特大桥日前迎来了重要的工程节点——海上首个桩基顺利开钻
2025-03-11 22:49:00
神仙姐姐有望代言智界!余承东辟谣网传与刘亦菲恋情:我都没见过她
快科技3月11日消息,不知道从何时起,网上传出了余承东与刘亦菲相恋的消息,这确实让不少网友惊掉下巴。据国内媒体报道称,针对近日网传与刘亦菲恋情
2025-03-11 20:19:00
支付宝严厉打击“0元享、免费租”套路:用户可以主动退
快科技3月11日消息,支付宝开放平台发布公告,通报了对于违规使用“芝麻先享”、“商家扣款”等API接口的治理情况,严厉打击“0元享
2025-03-11 20:19:00
《王者荣耀》全新限时玩法上线:魏蜀吴等八大势力
快科技3月11日消息,《王者荣耀》宣布五五限时玩法【势力对决】现已上线体验服。当五排队伍选择的英雄均属于同一势力时,激活对应的势力技能
2025-03-11 20:19:00
以“精工匠信“重塑品质高度:海信中央空调定义舒适生活新标准
在中央空调行业,产品性能与安装服务始终是用户体验的双重基石。海信中央空调基于对消费痛点的深刻洞察,以“精工匠信”为核心理念
2025-03-11 20:22:00