语料,灰色,训练,产业,数据,训练头条新闻资讯订阅

我的订阅
头条热搜

我们正处于一个信息大暴发的时代，每天都能产生数以百万计的新闻资讯！

虽然有大数据推荐，但面对海量数据，通过我们的调研发现，在一个小时的时间里，您通常无法真正有效地获取您感兴趣的资讯！

头条新闻资讯订阅，旨在帮助您收集感兴趣的资讯内容，并且在第一时间通知到您。可以有效节约您获取资讯的时间，避免错过一些关键信息。

AI产业的灰色暗面：OpenAI、谷歌、META如何搞训练语

...领域潮头浪尖的这些公司，早在几年前就已经陷入对训练语料的“绝望”追逐中——为此他们不惜修改政策条款、无视互联网信息的使用规则，只为了让自家的产品更加先进一些。《纽约时报》在本周末刊发的调查报道中，揭露...……更多

2024-04-07 22:22:00语料,灰色,训练,产业,数据,训练

千行百业加速拥抱大模型（AI前沿观察）

...国内大模型快速发展对高质量数据的迫切需求，推动中文语料数据资源加快共建共享。今年7月，2023世界人工智能大会发起成立了中国大模型语料数据联盟。8月，上海人工智能实验室宣布，联合中国大模型语料数据联盟成员单位...……更多

2023-12-22 03:26:00百业,模型,观察,模型,语料,数据

最强算力设施练就“最强大脑”

...工智能大模型比作一位小学生，那么数据训练时所用的“语料”和“算力”，就相当于小学生“刷题”时使用的习题册和计算器，帮助他掌握知识点、更快给出正确答案。如今，北京的大模型有了更全面的“习题册”、更强大的...……更多

2024-03-30 03:42:00大脑,设施,模型,人工智能,训练,人工

知乎 AI 革命：智能搜索与实时问答的融合

...和未来，有三个基本的视角：它是大语言模型预训练中文语料最重要来源之一，例如最近现象级的大模型聊天应用 Kimi Chat，就以知乎为重要的训练资料来源（甚至是 80% 以上的来源）。每一个在知乎上提问的用户，其实都是在发...……更多

2024-03-31 21:00:00实时,问答,革命,智能,搜索,语料

北京国企为人工智能产业添动能

...的大量数据仍分散在各个单位或市场主体内部，导致中文语料库“激活”的比例很低。数据交易所通过建立一整套完善的交易服务体系，帮助市场需求对接，将原始数据“挖掘”成为数据产品，释放数据资产的价值。北京国际大...……更多

2024-04-07 04:15:00动能,人工智能,北京,人工,智能,产业

“弱智吧”成最佳中文AI语料库，究竟什么算优质数据？

...地”的弱智吧，最近竟摇身一变成了——最佳中文AI训练语料库？由此受到启发，是否并不是训练AI的优质数据不够用，而是还有更多宝藏数据资源值得深挖？近日，由中科院深圳先进技术研究院、中科院自动化研究所，滑铁卢...……更多

2024-04-15 17:00:00语料库,语料,中文,数据,数据,模型

【聚焦2024中关村论坛】数据安全治理与发展论坛举行：发布7

...数字经济高质量发展提供有力保障。成果二：中文互联网语料库CCI 2.0北京智源人工智能研究院发布中文互联网语料库CCI 2.0，规模约500G，且为经过严格清洗过滤的中文数据集。CCI 2.0在1.0版本基础上，进一步扩充数据来源、完善...……更多

2024-04-27 21:00:00中关,中关村,论坛,发展论坛,成果,实践

APUS带你穿越千载重回故里，看AI眼中的《轩辕大帝》

...了文本到视频的渲染转换，更运用尖端算法精确抓取红色语料库素材，呈现可视化关键要点，相较于传统视频剪辑，大大提升了制作效率。据了解，在同等条件下，按照传统视频剪辑制作流程计算，《AI绘轩辕》至少需要1-2个...……更多

2024-04-11 11:00:00轩辕,故里,大帝,模型,文生,中国

大模型驱动行业创新媒体机构探索AI数据要素开发

...未来，AI将创造出一种新型的“人机共存消费模式”。“语料数据是大模型训练的重要‘燃料’，有助于大模型更好地适配实际的应用场景，实现人工智能赋能千行百业的愿景。”王巍表示，从目前的情况来看，虽然我国的数据...……更多

2023-11-15 08:28:00要素,模型,驱动,机构,媒体,数据

华策影视：目前公司语料主要用于训练自用垂直模型

华策影视：目前公司语料主要用于训练自用垂直模型【华策影视：目前公司语料主要用于训练自用垂直模型】财联社3月22日电，华策影视接受调研时表示，公司的视频语料分两种，包括文字语料，如小说、剧本等；视频语料，...……更多

2024-03-23 00:02:00语料,自用,模型,训练,影视,公司

星环科技成功举办数据要素市场与大模型语料库论坛

...1场数据交易节及20场主题论坛。11月26日，由中国大模型语料数据联盟指导，上海数据交易所、星环信息科技(上海)股份有限公司主办，上海市数商协会协办的“数据要素市场与大模型语料库论坛暨中国大模型语料数据联盟开放日...……更多

2023-11-27 16:02:00星环,语料库,语料,要素,模型,成功

APUS李涛阐述AI战略：为中国定制AI大模型，让大模型应用

...们必须正视，在国内主流模型训练中，中文数据集在全球语料库中只占据3%的份额，同时夹杂着网络垃圾数据，成为国内大模型发展与应用的一道枷锁。尤其是在不确定因素影响下，A100、A800、H100、H800、RTX 4090等芯片已成为产业...……更多

2023-11-07 15:40:00李涛,模型,中国,战略,价值,应用

“世界模拟器”的文化偏见与AIGC时代的文化竞争

...右我们对世界的认识方式。文化出海应包括数据出海，语料库是未来文化软实力如果仔细分析Sora生成内容的美学要素，就能够轻易发现，它的审美范式依旧是这一“犹他大学—好莱坞—皮克斯”系统的延续。不仅Sora所代表的...……更多

2024-04-10 10:41:00文化,模拟器,偏见,竞争,时代,世界

李开复AI公司首发大模型，阿里云领投 | 36氪独家

...000张GPU，我们只要1200张。”Yi的训练数据主要来源于公开语料的爬取和数据库。李开复介绍，训练数据的难点在于重复率高、质量低。通过清晰，团队从100多T的数据中筛选出了3T。由于中文语料的质量较低，目前，Yi的训练数据...……更多

2023-11-06 12:13:00李开复AI公司首发大模型，阿里云领投 | 36氪独家

昆仑万维发布开源13B高质量商用大模型领先Llama2和B

...Skywork-13B系列大模型还将开源600GB、150B Tokens的高质量中文语料数据集Skypile/Chinese-Web-Text-150B，这是目前最大的开源中文数据集之一。同时，昆仑万维「天工」Skywork-13B系列大模型即将全面开放商用——开发者无需申请，即可商用...……更多

2023-10-30 15:35:00万维,昆仑,商用,高质量,模型,领先

国家数据局征求意见：支持开展通用人工智能大模型和垂直领域人工

...细粒度的知识抽取，构建科学知识资源底座，建设高质量语料库和基础科学数据集，支持开展通用人工智能大模型和垂直领域人工智能大模型训练。在保障支撑方面，《征求意见稿》提出提升数据供给水平。完善数据资源体系，...……更多

2023-12-15 19:41:00人工智能,人工,模型,智能,训练,领域