• 我的订阅
  • 头条热搜
...领域潮头浪尖的这些公司,早在几年前就已经陷入对训练语料的“绝望”追逐中——为此他们不惜修改政策条款、无视互联网信息的使用规则,只为了让自家的产品更加先进一些。《纽约时报》在本周末刊发的调查报道中,揭露...……更多
...少业内人士已嗅到一丝危机:全能,意味着需要更强大的语料库来训练AI,而优质的AI语料已经越来越稀缺。AI语料,简单来说,就是用于训练和优化人工智能模型的数据集合。这些数据可以是文本、语音、图像或视频。高质量的...……更多
重磅|标贝科技非平衡专业语料上线 助推GPT大模型技术应用落地
...。而摆在“中国ChatGPT”面前的问题,首当其中就是中文语料库的不足。当前GPT大模型主流数据集和评估基准多以英文为主,缺少中文特点、文化,难以满足关键行业应用选型和优化的实际需求,这就会造成所训练的模型对于中...……更多
...和交易平台,针对AI模型公司等下游客户销售和运营视频语料业务,是今年公司根据市场变化确定重点发展的方向之一。”4月30日,中广天择董事长彭勇在2023年度股东大会上说道。2023年以来,中广天择继续深耕传媒文娱赛道,...……更多
千行百业加速拥抱大模型(AI前沿观察)
...国内大模型快速发展对高质量数据的迫切需求,推动中文语料数据资源加快共建共享。今年7月,2023世界人工智能大会发起成立了中国大模型语料数据联盟。8月,上海人工智能实验室宣布,联合中国大模型语料数据联盟成员单位...……更多
...工智能大模型比作一位小学生,那么数据训练时所用的“语料”和“算力”,就相当于小学生“刷题”时使用的习题册和计算器,帮助他掌握知识点、更快给出正确答案。如今,北京的大模型有了更全面的“习题册”、更强大的...……更多
知乎 AI 革命:智能搜索与实时问答的融合
...和未来,有三个基本的视角:它是大语言模型预训练中文语料最重要来源之一,例如最近现象级的大模型聊天应用 Kimi Chat,就以知乎为重要的训练资料来源(甚至是 80% 以上的来源)。每一个在知乎上提问的用户,其实都是在发...……更多
...的大量数据仍分散在各个单位或市场主体内部,导致中文语料库“激活”的比例很低。数据交易所通过建立一整套完善的交易服务体系,帮助市场需求对接,将原始数据“挖掘”成为数据产品,释放数据资产的价值。北京国际大...……更多
“弱智吧”成最佳中文AI语料库,究竟什么算优质数据?
...地”的弱智吧,最近竟摇身一变成了——最佳中文AI训练语料库?由此受到启发,是否并不是训练AI的优质数据不够用,而是还有更多宝藏数据资源值得深挖?近日,由中科院深圳先进技术研究院、中科院自动化研究所,滑铁卢...……更多
【聚焦2024中关村论坛】数据安全治理与发展论坛举行:发布7项实践成果
...数字经济高质量发展提供有力保障。成果二:中文互联网语料库CCI 2.0北京智源人工智能研究院发布中文互联网语料库CCI 2.0,规模约500G,且为经过严格清洗过滤的中文数据集。CCI 2.0在1.0版本基础上,进一步扩充数据来源、完善...……更多
APUS带你穿越千载重回故里,看AI眼中的《轩辕大帝》
...了文本到视频的渲染转换,更运用尖端算法精确抓取红色语料库素材,呈现可视化关键要点,相较于传统视频剪辑,大大提升了制作效率。 据了解,在同等条件下,按照传统视频剪辑制作流程计算,《AI绘轩辕》至少需要1-2个...……更多
大模型驱动行业创新 媒体机构探索AI数据要素开发
...未来,AI将创造出一种新型的“人机共存消费模式”。“语料数据是大模型训练的重要‘燃料’,有助于大模型更好地适配实际的应用场景,实现人工智能赋能千行百业的愿景。”王巍表示,从目前的情况来看,虽然我国的数据...……更多
华策影视:目前公司语料主要用于训练自用垂直模型 【华策影视:目前公司语料主要用于训练自用垂直模型】财联社3月22日电,华策影视接受调研时表示,公司的视频语料分两种,包括文字语料,如小说、剧本等;视频语料,...……更多
星环科技成功举办数据要素市场与大模型语料库论坛
...1场数据交易节及20场主题论坛。11月26日,由中国大模型语料数据联盟指导,上海数据交易所、星环信息科技(上海)股份有限公司主办,上海市数商协会协办的“数据要素市场与大模型语料库论坛暨中国大模型语料数据联盟开放日...……更多
李开复AI公司首发大模型,阿里云领投 | 36氪独家
...000张GPU,我们只要1200张。”Yi的训练数据主要来源于公开语料的爬取和数据库。李开复介绍,训练数据的难点在于重复率高、质量低。通过清晰,团队从100多T的数据中筛选出了3T。由于中文语料的质量较低,目前,Yi的训练数据...……更多
“世界模拟器”的文化偏见与AIGC时代的文化竞争
...右我们对世界的认识方式。 文化出海应包括数据出海,语料库是未来文化软实力如果仔细分析Sora生成内容的美学要素,就能够轻易发现,它的审美范式依旧是这一“犹他大学—好莱坞—皮克斯”系统的延续。不仅Sora所代表的...……更多
APUS李涛阐述AI战略:为中国定制AI大模型,让大模型应用与价值创造接轨
...们必须正视,在国内主流模型训练中,中文数据集在全球语料库中只占据3%的份额,同时夹杂着网络垃圾数据,成为国内大模型发展与应用的一道枷锁。尤其是在不确定因素影响下,A100、A800、H100、H800、RTX 4090等芯片已成为产业...……更多
垂直大模型竞争,能突破数据“卡点”吗?
...人类那样流畅交谈,研发人员给GPT-3.5提供多达45TB的文本语料,相当于472万套中国“四大名著”。这些语料的来源包括维基百科、网络文章、书籍期刊等,甚至还将代码开源平台Github纳入其中。 但是聚焦到细分行业,数据的获...……更多
昆仑万维发布开源13B高质量商用大模型 领先Llama2和Baichuan2
...Skywork-13B系列大模型还将开源600GB、150B Tokens的高质量中文语料数据集Skypile/Chinese-Web-Text-150B,这是目前最大的开源中文数据集之一。同时,昆仑万维「天工」Skywork-13B系列大模型即将全面开放商用——开发者无需申请,即可商用...……更多
b站开源轻量级index-1.9b系列模型,包含多个版本
...基座模型,具有19亿非词嵌入参数量,在2.8T中英文为主的语料上预训练,多个评测基准上与同级别模型比处于领先。Index-1.9Bpure:基座模型的对照组,与base具有相同的参数和训练策略,不同之处在于严格过滤了该版本语料中所有...……更多
...细粒度的知识抽取,构建科学知识资源底座,建设高质量语料库和基础科学数据集,支持开展通用人工智能大模型和垂直领域人工智能大模型训练。在保障支撑方面,《征求意见稿》提出提升数据供给水平。完善数据资源体系,...……更多
亮相2024中国图象图形大会,合合信息文档解析技术获行业关注
...模型一路“高歌猛进”的背后,隐藏着一场关于模型训练语料的“能源危机”。根据人工智能研究人员小组Epoch研究估计,机器学习数据集可能会在2026年前耗尽所有“高质量语言数据”。现阶段,大量的高质量语料数据存在于书...……更多
迎接新一轮AI狂欢,小i机器人厚积薄发|智氪
...两个维度: 1、具备核心技术,拥有海量且高质量的中文语料库。 2、拥有知识产权且具备大规模商业落地的经验。 先从技术方面来看,数据、算力和算法是驱动生成式AI发展不可或缺的三大要素。通过梳理ChatGPT的技术迭代过程...……更多
邬贺铨院士:金融大模型改变了金融科技范式
...要全行业共同参与,合作开发,“基础大模型多数从通用语料训练生成,通识能力强,可作聊天对话,但缺少行业专业知识,需要大模型提供方与垂直行业合作开发行业大模型”。以度小满的开源金融大模型“轩辕”为例,它是...……更多
ChatGPT一周年,机会在大厂还是小公司?
...型四个要素场景、数据、模型、算力,想问大家对于中文语料进一步采集、整理和使用有没有什么建议?这个可以从你们自身企业发展的角度,或者模型发展角度,也可以从公共政策、产业政策的角度,谈一谈中文语料怎么样能...……更多
...见或建议,需在10月25日24:00前反馈。《要求》提出,建立语料来源黑名单,不得使用黑名单来源的数据进行训练。应对各来源语料进行安全评估,单一来源语料内容含违法不良信息超5%应将其加入黑名单。应使用包含个人信息的...……更多
北京将推动人工智能企业优先在北交所上市
...路径探索。在推进数据要素集聚方面,推动大模型高质量语料库建设,支持服务国家重大战略任务的大模型语料数据库运营平台建设,鼓励各类主体开放共享高质量训练数据,根据数据开放数量和质量予以最高300万元奖励。对于...……更多
AI十二谈 | 清华教授梁正:争论ChatGPT是否有创意能力,背后是人类优越感作祟
...的信息处理能力,遭到学术圈“封杀”。梁正也表示,因语料丰富,ChatGPT在社科人文领域会有高质量的内容输出,人工智能将挑战现有的教育模式,“未来更应该考虑教育模式怎么去激发创造。”以下为搜狐科技与梁正教授的...……更多
对话周鸿祎:ChatGPT像个油腻中年人
...脑的学习过程非常像,为什么ChatGPT的知识训练很重要,语料很重要。我们经常说熟读唐诗三百首,就算不会作诗也会胡诌两句了。一个人一生最多读一万本,ChatGPT是你的500倍,未来ChatGPT如果把5000万本书都读了之后,它写东西...……更多
清华教授唐杰:Scaling Laws虽被质疑,但至今仍是提高大模型性能的重要方法
...以GPT-4为代表的一系列语言模型基于互联网上海量的文本语料进行预训练,在语义理解、指令遵循等方面展现出了惊人的能力。然而,这些语言模型只能以文本形式处理内容,并无法处理图片等其他模态的信息。”他补充解释道...……更多
更多关于财经的资讯:
港交所主席和行政总裁,重磅发声!
中国基金报记者 郭玟君6月21日,在香港交易及结算所有限公司(香港交易所)上市24周年庆祝典礼后,香港交易所主席唐家成和行政总裁陈翊庭一同接受了媒体的采访
2024-06-24 11:56:00
拆解iPhone15 Pro:核心芯片,没有一颗是中国制造
众所周知,在苹果的供应链中,中国的厂商(含台湾省)是最多的,占到了50%以上,而其中,中国大陆厂商的比例,占到了26%左右
2024-06-24 11:56:00
管涛:谈一谈近来社会广泛关注的M1和M2
中银证券全球首席经济学家管涛资料图。本文发表于《第一财经日报》2024年6月24日。本账号接受投稿,投稿邮箱:jingjixuejiaquan@126
2024-06-24 11:57:00
姚洋:反过度西方化
“2024正和岛案例共学年会”于6月22日-24日在上海召开。北京大学博雅特聘教授、中国经济研究中心主任姚洋出席并演讲
2024-06-24 11:57:00
告别加班内卷之后,他们做出了全球第一大的公司
不加班,也能做出全球第一的公司。文 | 华商韬略员工那么“懒”,微软还那么有钱,还能引领创新。这不合常理啊!【1】2008年
2024-06-24 11:57:00
传音,告别专吃“非洲饭”
因为分红近50亿元人民币,几乎分掉2023全年扣非归母净利润,“非洲之王”传音最近又火了一把。传音“财大气粗”的底气从何而来
2024-06-24 11:58:00
扛不住了!又一明星公司破产,市值暴跌99%
作者丨阿飞6月18日,曾立志要成为“汽车界苹果”的电动车品牌Fisker正式向美国特拉华州法院申请破产。根据法院文件,Fisker列出的资产价值估计在5亿至10亿美元之间
2024-06-24 11:58:00
2024年5月银行间本币市场运行报告
内容提要2024年5月,货币市场日均交易量及余额减少,多数回购利率下行;地产政策大幅放松,特别国债发行节奏平稳,债市收益率整体震荡下行
2024-06-24 11:59:00
麦肯锡:近半数美国电动汽车车主“倒戈” 考虑重回油车阵营
财联社6月24日讯(编辑 周子意)由于电动汽车充电设施不完善、成本太高等因素,更多的电动汽车车主正重新考虑内燃机汽车——这是全球知名管理咨询公司麦肯锡(McKinsey &
2024-06-24 11:59:00
618没凉 但电商在从流量回归生意本质
在一个总需求仍显疲惫的环境下,客观理性评判618大促是件困难的事情,在过去几天,不同立场不同机构之间观点可谓是千差万别
2024-06-24 13:38:00
低价,是不是电商的不二法门?
撰文 | 王长胜众所周知的原因,低价正在成为电商的唯一姿势。这不是一个好趋势。“唯低价论”,正在毁掉整个电商生态。商家
2024-06-24 13:38:00
Hugging Face CEO:越来越多AI初创公司创始人希望出售自家公司
IT之家 6 月 22 日消息,据 The decoder 本周四报道,开源 AI 社区 Hugging Face 首席执行官 Clément Delangue 本月中旬接受采访时表示
2024-06-24 13:39:00
二手电商的新焦虑:闲鱼、万物新生急需新故事
配图来自Canva可画年轻人口中的:“不是全新买不起,而是二手更有性价比”,可不是说说而已。据央视网数据,目前全国闲置商品日均交易额已突破10亿元
2024-06-24 13:39:00
碱地柿子出圈 盛京银行“辽农贷”助力打造盘锦农业第三张名片
作为国家农产品地理标志产品,盘锦碱地柿子以其极佳口感、富含多种营养而迅速“出圈”、卖遍全国,这离不开“金融活水”的精准滴灌
2024-06-24 13:40:00
小红书过618:“不完美电商”的进击之路
文|一财商学院王艺霏相比去年在内容和电商之间的模棱两可,小红书在这届618最早开启大促、踏入低价战场,展示出了自己“最电商”的一面
2024-06-24 13:40:00