• 我的订阅
  • 头条热搜
...领域潮头浪尖的这些公司,早在几年前就已经陷入对训练语料的“绝望”追逐中——为此他们不惜修改政策条款、无视互联网信息的使用规则,只为了让自家的产品更加先进一些。《纽约时报》在本周末刊发的调查报道中,揭露...……更多
千行百业加速拥抱大模型(AI前沿观察)
...国内大模型快速发展对高质量数据的迫切需求,推动中文语料数据资源加快共建共享。今年7月,2023世界人工智能大会发起成立了中国大模型语料数据联盟。8月,上海人工智能实验室宣布,联合中国大模型语料数据联盟成员单位...……更多
...工智能大模型比作一位小学生,那么数据训练时所用的“语料”和“算力”,就相当于小学生“刷题”时使用的习题册和计算器,帮助他掌握知识点、更快给出正确答案。如今,北京的大模型有了更全面的“习题册”、更强大的...……更多
知乎 AI 革命:智能搜索与实时问答的融合
...和未来,有三个基本的视角:它是大语言模型预训练中文语料最重要来源之一,例如最近现象级的大模型聊天应用 Kimi Chat,就以知乎为重要的训练资料来源(甚至是 80% 以上的来源)。每一个在知乎上提问的用户,其实都是在发...……更多
...的大量数据仍分散在各个单位或市场主体内部,导致中文语料库“激活”的比例很低。数据交易所通过建立一整套完善的交易服务体系,帮助市场需求对接,将原始数据“挖掘”成为数据产品,释放数据资产的价值。北京国际大...……更多
“弱智吧”成最佳中文AI语料库,究竟什么算优质数据?
...地”的弱智吧,最近竟摇身一变成了——最佳中文AI训练语料库?由此受到启发,是否并不是训练AI的优质数据不够用,而是还有更多宝藏数据资源值得深挖?近日,由中科院深圳先进技术研究院、中科院自动化研究所,滑铁卢...……更多
【聚焦2024中关村论坛】数据安全治理与发展论坛举行:发布7项实践成果
...数字经济高质量发展提供有力保障。成果二:中文互联网语料库CCI 2.0北京智源人工智能研究院发布中文互联网语料库CCI 2.0,规模约500G,且为经过严格清洗过滤的中文数据集。CCI 2.0在1.0版本基础上,进一步扩充数据来源、完善...……更多
APUS带你穿越千载重回故里,看AI眼中的《轩辕大帝》
...了文本到视频的渲染转换,更运用尖端算法精确抓取红色语料库素材,呈现可视化关键要点,相较于传统视频剪辑,大大提升了制作效率。 据了解,在同等条件下,按照传统视频剪辑制作流程计算,《AI绘轩辕》至少需要1-2个...……更多
大模型驱动行业创新 媒体机构探索AI数据要素开发
...未来,AI将创造出一种新型的“人机共存消费模式”。“语料数据是大模型训练的重要‘燃料’,有助于大模型更好地适配实际的应用场景,实现人工智能赋能千行百业的愿景。”王巍表示,从目前的情况来看,虽然我国的数据...……更多
华策影视:目前公司语料主要用于训练自用垂直模型 【华策影视:目前公司语料主要用于训练自用垂直模型】财联社3月22日电,华策影视接受调研时表示,公司的视频语料分两种,包括文字语料,如小说、剧本等;视频语料,...……更多
星环科技成功举办数据要素市场与大模型语料库论坛
...1场数据交易节及20场主题论坛。11月26日,由中国大模型语料数据联盟指导,上海数据交易所、星环信息科技(上海)股份有限公司主办,上海市数商协会协办的“数据要素市场与大模型语料库论坛暨中国大模型语料数据联盟开放日...……更多
APUS李涛阐述AI战略:为中国定制AI大模型,让大模型应用与价值创造接轨
...们必须正视,在国内主流模型训练中,中文数据集在全球语料库中只占据3%的份额,同时夹杂着网络垃圾数据,成为国内大模型发展与应用的一道枷锁。尤其是在不确定因素影响下,A100、A800、H100、H800、RTX 4090等芯片已成为产业...……更多
“世界模拟器”的文化偏见与AIGC时代的文化竞争
...右我们对世界的认识方式。 文化出海应包括数据出海,语料库是未来文化软实力如果仔细分析Sora生成内容的美学要素,就能够轻易发现,它的审美范式依旧是这一“犹他大学—好莱坞—皮克斯”系统的延续。不仅Sora所代表的...……更多
李开复AI公司首发大模型,阿里云领投 | 36氪独家
...000张GPU,我们只要1200张。”Yi的训练数据主要来源于公开语料的爬取和数据库。李开复介绍,训练数据的难点在于重复率高、质量低。通过清晰,团队从100多T的数据中筛选出了3T。由于中文语料的质量较低,目前,Yi的训练数据...……更多
昆仑万维发布开源13B高质量商用大模型 领先Llama2和Baichuan2
...Skywork-13B系列大模型还将开源600GB、150B Tokens的高质量中文语料数据集Skypile/Chinese-Web-Text-150B,这是目前最大的开源中文数据集之一。同时,昆仑万维「天工」Skywork-13B系列大模型即将全面开放商用——开发者无需申请,即可商用...……更多
...细粒度的知识抽取,构建科学知识资源底座,建设高质量语料库和基础科学数据集,支持开展通用人工智能大模型和垂直领域人工智能大模型训练。在保障支撑方面,《征求意见稿》提出提升数据供给水平。完善数据资源体系,...……更多
ChatGPT一周年,机会在大厂还是小公司?
...型四个要素场景、数据、模型、算力,想问大家对于中文语料进一步采集、整理和使用有没有什么建议?这个可以从你们自身企业发展的角度,或者模型发展角度,也可以从公共政策、产业政策的角度,谈一谈中文语料怎么样能...……更多
邬贺铨院士:金融大模型改变了金融科技范式
...要全行业共同参与,合作开发,“基础大模型多数从通用语料训练生成,通识能力强,可作聊天对话,但缺少行业专业知识,需要大模型提供方与垂直行业合作开发行业大模型”。以度小满的开源金融大模型“轩辕”为例,它是...……更多
...见或建议,需在10月25日24:00前反馈。《要求》提出,建立语料来源黑名单,不得使用黑名单来源的数据进行训练。应对各来源语料进行安全评估,单一来源语料内容含违法不良信息超5%应将其加入黑名单。应使用包含个人信息的...……更多
...话,多重AI技术互补,大模型与小模型搭配,专业知识和语料为支撑。这套打法说起来容易,但做起来一点儿也不简单,这需要对产业有极深的理解和实践,对技术有极高的储备。以服务某金融机构的精细化运营场景为例,精细...……更多
大模型应用疯狂加速,洗牌却在静悄悄进行了
...混元大模型,据了解该模型拥有超千亿参数规模,预训练语料超过2万亿Tokens,并已接入腾讯云、腾讯广告、腾讯游戏、腾讯金融科技、腾讯会议、腾讯文档等50多个腾讯业务。而且在国家公布的首批大模型厂商中,腾讯混元大模...……更多
...发展,该公司的数据许可业务将继续增长。“Reddit的信息语料库对于大型语言模型的训练非常重要,”她说,并补充说,随着人工智能生成的内容变得普遍,该网站19年来有组织和有节制的内容将变得更有价值。 ……更多
AI识别方言困难!专家探索用算法度量方言差距,提议构建统一框架
...,缺乏对应文字,并且难以收集,可用于模型训练的方言语料数据偏少。信也科技算法科学家倪博溢。10月24日,第八届信也科技杯算法大赛总决赛上,9支人工智能队伍角逐,探索利用AI技术识别和还原语音数据中的方言信息,...……更多
...厂商将投入巨额资金购买底层数据库,这些数据库涵盖了语料、图片、音视频等多种类型的数据。如果客户在使用这些数据库生成的内容时,其著作权归属于客户,这将对厂商的利益产生不利影响。未来,更应当面向产业链,关...……更多
圆桌|生成式AI时代,大模型数据安全如何保障?
...过训练去组合,去生成新的内容,这些内容可能在过去的语料里根本没出现过,但它依然是有害的。所以,即便把训练数据处理得很干净,在生成式人工智能时代依然会面临有害内容产生的情况。要解决这些问题,需要进行算法...……更多
...共同体数据量”还是有限的。同属汉字文化圈的日本,其语料的汉字属性是中国以外最强的,当年在底层编码技术开发的时代,日本对汉字编码化的贡献有目共睹。今天,我相信日语语料和日本的数据也能为汉字文化圈AI的训练...……更多
3500P算力就位!北京数据基础制度先行区扩至海淀
...挥智源前沿研究优势,凝聚行业力量,建设高质量大模型语料库,构建开源开放平台,推动通用人工智能技术及产业取得重大突破进行介绍。北京海天瑞声科技股份有限公司董事长贺琳表示将推动人工智能数据服务创新,积极参...……更多
...构、企业等科研和产业数据共享开源,成立上海AI4S和AI4E语料库联盟与开发者社区,依托隐私计算、区块链、联邦学习等技术,构建安全可信的数据共享平台,使海量数据发挥更大作用。张磊说:“当下,最重要的莫过于要做两...……更多
研究:网络充斥低质机翻内容,大语言模型训练需警惕数据陷阱
...也可能较低。数据质量对于LLM训练至关重要,其中高质量语料库如书籍和维基百科文章通常会进行多次向上采样。” 返回搜狐,查看更多责任编辑: ……更多
...施。为了满足大模型发展对高质量、大规模、安全可信的语料数据资源的需求,人民网积极建设“主流价值语料库”,大幅提高大模型的安全性。2. 平台升级推动内容产业发展新质生产力2023年,生成式人工智能全方位赋能内容...……更多
更多关于财经的资讯:
绿色动力环保(01330)2024年度实现累计发电量51.47亿度 同比增长8.92%
智通财经APP讯,绿色动力环保(01330)发布公告,截至2024年12月31日止3个月第四季度集团实现未经审核垃圾进厂量367
2025-02-10 19:34:00
推进工业经济“头号工程”,济宁任城开足马力
春节假期刚过,在位于济宁市任城区的山东晨阳新型碳材料股份有限公司,刚完成智能化改造的阳极编组、装出炉设备正在满负荷运转
2025-02-10 19:36:00
尝到直营的甜头,特步和索康尼加码DTC转型,10亿港元资金“入场”
本文来源:时代财经 作者:周航图片来源:特步集团特步正在为“渡过周期”补充“弹药”。2月10日,特步国际(01368.HK)发布公告
2025-02-10 19:37:00
V观财报|国联证券:证券简称变更为“国联民生”
【V观财报|国联证券:证券简称变更为“国联民生”】国联证券公告,经公司申请,并经上海证券交易所办理,公司A股证券简称将于2025年2月14日起由“国联证券”变更为“国联民生”
2025-02-10 19:37:00
鸿路钢构出资300万元成立合肥晓路重工有限公司,持股100%
天眼查工商信息显示,近日,安徽鸿路钢结构(集团)股份有限公司出资300万元成立合肥晓路重工有限公司,持股100%,所属行业为专用设备制造业
2025-02-10 19:37:00
太古股份公司A(00019.HK)2月10日耗资1615万港元回购25万股
格隆汇2月10日丨太古股份公司A(00019.HK)发布公告,2025年2月10日耗资1615万港元回购25万股。/阅读下一篇/返回网易首页下载网易新闻客户端
2025-02-10 19:38:00
绿色动力环保(01330.HK)2024年实现累计垃圾进厂量1438.24万吨 同比增长6.96%
格隆汇2月10日丨绿色动力环保(01330.HK)公告,截至2024年12月31日止3个月第四季度集团实现未经审核垃圾进厂量367
2025-02-10 19:39:00
印度制造梦碎?2783家外资仓惶打包逃离,美媒跳脚:又回中国了
外资大规模撤离?《人民日报》发声了。近年来,中国制造业深陷“唱衰”舆论。部分别有用心的媒体反复鼓吹许多内地厂商搬往越南
2025-02-10 19:39:00
喜茶发布全员内部邮件,拒绝门店规模内卷,暂停事业合伙申请
都市快报讯 喜茶将暂停加盟。2月10日,喜茶发布主题为《不参与数字游戏与规模内卷,回归用户与品牌》的内部全员邮件。喜茶在邮件中表示
2025-02-10 20:00:00
印度药企接连入场,买下中国生物类似药权益
继复宏汉霖之后,又有一家中国生物药企与印度药企达成授权合作。2月10日晚间,百奥泰(688177.SH)宣布,与IntasPharmaceuticalsLtd
2025-02-10 20:08:00
重庆港(600279.SH)控股股东和实际控制人或将发生变更
智通财经APP讯,重庆港(600279.SH)发布公告,2025年2月10日,公司收到公司控股股东重庆港务物流集团有限公司的告知函
2025-02-10 20:10:00
起步即冲刺!诸城企业全力以赴抢订单 奏响开工“奋进曲”
春节假期一结束,走进诸城宏璇智能装备有限公司的生产车间,一派繁忙而有序工作场景映入眼帘,10多位职工正全身心投入工作中
2025-02-10 20:11:00
ST交投(002200.SZ)联合中标生态环境保护工程设计施工总承包(EPC)
ST交投(002200.SZ)发布公告,公司作为联合体牵头人,与滇鹰生态建设集团有限公司组成联合体,被确定为“曲靖市会泽县跃进水库集中式饮用水水源地生态环境保护工程(一期)设计施工总承包(EPC)”的第一中标候选人
2025-02-10 20:12:00
构网型储能遇新机,如何走稳未来路?
近年来,伴随全球能源转型加速,我国电力结构正在快速迈向清洁化。一方面,我国新能源装机规模持续攀升。截至2024年12月底
2025-02-10 20:12:00
泰瑞机器股东户数增加11户,户均持股1.88万股,户均持股市值16.67万元
从2月10日公开信息显示,泰瑞机器截至2025年1月27日公司股东户数为1.56万户,较上期(2025年1月20日)增加11户
2025-02-10 20:13:00