• 我的订阅
  • 头条热搜
智源评测体系发布 国内外“百模”评估结果出炉
5月17日,智源研究院举办大模型评测发布会,正式推出智源评测体系,发布并解读国内外140余个开源和商业闭源的语言及多模态大模型全方位能力评测结果。本次智源评测,分别从主观、客观两个维度考察了语言模型的简单理...……更多
月狐数据发布中国市场首份《AIGC应用app智能化评测报告》
...上技术迭代的步伐,月狐数据发布《2023 AIGC应用app智能化评测报告》,该报告为中国市场首份围绕AIGC应用app的智能化水平以及智能体能力的专业测评报告,旨在通过多维度量化指标帮助用户更直观地评估现有主流AIGC应用产品的...……更多
港中文团队提出大模型元推理范式,革新大模型的评价体系
...来源:曾忠燊)前不久,曾忠燊和所在团队提出一个全新评测范式。基于这一评测范式,他们又针对现有数据集,提出了一种改造方法。实验证明,这种方法能有效区分不同模型的能力差异。同时,他们还揭示了这种全新评测范...……更多
国内首个官方“大模型标准符合性评测”公布
...分委会全体会议期间,国内首个官方“大模型标准符合性评测”结果公布,腾讯混元大模型、阿里通义千问等大模型成为首批通过评测的四款国产大模型的其中之二。据介绍,“大模型标准符合性评测”由中国电子技术标准化研...……更多
中国信通院发布大模型安全基准测试报告 360智脑综合排名第一
...、合法合规、隐私保护、文明健康等二十余个维度的中文评测数据集。帮助大模型技术提供方提升安全风险防范能力,为大模型研发和落地保驾护航。此次测评报告即是在大模型安全基准测试AI Safety Bench标准下进行,此次测试数...……更多
上海人工智能实验室公布首个ai高考全卷评测结果
...20日消息,上海人工智能实验室19日公布了首个AI高考全卷评测结果。据介绍,2024年全国高考甫一结束,该实验室旗下司南评测体系OpenCompass选取6个开源模型及GPT-4o进行高考“语数外”全卷能力测试。评测采用全国新课标I卷,参...……更多
不同量级参数模型性能同样优秀 夸克大模型再登行业评测榜首
...百亿级参数大模型同样在法律、医疗、问答等领域的性能评测中夺冠。凭借在搜索业务和智能技术上的长期积累,夸克大模型利用数据、平台、知识增强等优势,可以大幅提升知识正确性。在医疗健康领域,夸克大模型已经可以...……更多
首个AI高考全卷评测结果发布:最高分303,数学全不及格
...平。在前不久高考结束后,上海人工智能实验室旗下司南评测体系OpenCompass选取了7个大模型进行高考“语数外”全卷能力测试。6月19日, OpenCompass发布了首个大模型高考全卷评测结果。语数外三科加起来的满分为420分,此次高考...……更多
...,上海人工智能实验室联合魔搭社区推出中国大语言模型评测竞技场Compass Arena,首度集齐国内主流大模型全阵容,阿里通义千问、百度文心一言、腾讯混元、字节跳动豆包、书生·浦语等20款国产大模型出战,角逐中国大模型“...……更多
东方财富董事长其实:建议进一步推动股权投资支持科技创新
...动高质量垂类语料数据开放共享,进一步完善垂直大模型评测标准体系,并积极打造垂直大模型创新应用场景。支持链主企业开展早期风险投资其实表示,科技创新作为引领现代化产业体系建设的关键力量,是发展新质生产力的...……更多
AI大模型“国标”首批测试结果公布,人工智能成市场新焦点
12月22日,国内首个官方“大模型标准符合性评测”结果公布,百度文心一言、腾讯混元大模型、360智脑、阿里云通义千问四款国产大模型首批通过测试。测试结果称,上述四款模型符合《人工智能大规模预训练模型第2部分:评...……更多
...“智越计划”,对国产人工智能芯片(AI芯片)开展全面评测,为后续算力建设提供依据。此次全面评测将助推国产芯片面向更多应用场景加快升级迭代。面对越来越严苛的AI芯片领域封锁,我国正在加速相关芯片的自主研发和...……更多
商汤商量获SuperCLUE 9月评测总榜和子榜两项第一,AI智能体方向受瞩目
商汤商量获SuperCLUE 9月评测总榜和子榜两项第一,AI智能体方向受瞩目 近日,中文通用大模型综合性评测基准SuperCLUE发布9月总排行榜和各个分类任务榜单,商汤商量SenseChat 3.0 位列中文大模型总榜排名第一。在新增的AI Agent(AI...……更多
首个AI高考全卷评测结果发布:数学全都不及格
6月19日,上海人工智能实验室发布首个AI高考全卷评测结果,月初开源的阿里通义千问大模型Qwen2-72B排名第一,在语数外三科420分的满分中获得303分,OpenAI的GPT-4o和上海人工智能实验室的书生·浦语2.0文曲星(InternLM2-20B-WQX)排...……更多
...私保护、文明健康、人工智能自主意识等27个维度的中文评测数据集,为行业提供全面、细致的安全性能测试指标。作为信息通信行业的重要研究机构,中国信通院在人工智能和大数据领域具有深厚的研究底蕴和丰富的行业经验...……更多
AI潮起 共筑数智之基
...链条产业生态中国移动宣布开放大模型训练基地、大模型评测基地及大模型产业创新基地,面向全社会提供大模型从训到推、AI+原生应用孵化等一站式产业融通带动服务。大模型训练基地是中国移动为大模型提供训练所需智算资...……更多
国家大模型标准测试结果公布 首批仅四家企业产品通过
12月23日,国内首个官方“大模型标准符合性评测”结果公布,首批360集团、百度、腾讯、阿里四家企业大模型产品通过。该测试由工信部中国电子技术标准化研究院(简称“工信部电子标准院”)发起,评测围绕多领域多维度...……更多
科大讯飞刘庆峰:首先需要建立科学系统评测体系
...,快速追赶并努力超越ChatGPT,首先需要一套科学系统的评测体系。刘庆峰表示,已经有非常多的科研机构和企业单位都在开始进行大模型的研究和产业化探索。如果我们要让这种人工智能的技术真正地用于解决社会刚需,就要...……更多
2023移动网络质量“百城”专项评测:打造高质量的5G服务
2023年全国重点区域移动网络质量“百城”专项评测活动11月7日正式开启,来自中国信息通信研究院泰尔系统实验室5支专业的网络质量评测团队奔赴全国百余个城市,对重点和热点区域开展移动网络测试。其实“移动网络质量专...……更多
...脸识别安全合规专家观点及实践分享。发布“护脸计划”评测结果和评估规范解读成为本次大会焦点。会上,中国信通院云大所副所长闵栋公布了通过“人脸识别安全专项评测”“金融APP人脸识别安全能力评测”“人脸识别系统...……更多
智慧芽AI助手“芽仔”:你的智能研发专家,开启创新新范式
...型与其他大模型考试成绩图:智慧芽垂直领域大模型能力评测决定一个垂直领域大模型表现的,除了模型本身外,训练数据集同样起到关键性作用。而这恰恰是智慧芽的优势所在。智慧芽垂直领域大模型的预训练数据达到了千亿...……更多
清华发布2024年3月版《SuperBench大模型综合能力评测报告》
...究中心联合中关村实验室研制的SuperBench大模型综合能力评测框架,正式对外发布2024年3月版《SuperBench大模型综合能力评测报告》。评测共包含了14个海内外具有代表性的模型,结果显示:文心一言4.0表现亮眼。例如在人类对齐能...……更多
字节扣子模型广场,给AI大模型搭了一座擂台
...选择什么模型,市面上也没有类似于豆瓣电影评分这样的评测体系。举个例子,小雷这样的科技爱好者想在扣子上创建一个帮助编辑检查文章配图版权、错别字的Bot,但缺乏大模型开发经验的我并不知道扣子上的哪些模型、哪些...……更多
昆仑万维发布开源13B高质量商用大模型 领先Llama2和Baichuan2
...-Base模型、Skywork-13B-Math模型,它们在CEVAL, GSM8K等多个权威评测与基准测试上都展现了同等规模模型的最佳效果,其中文能力尤为出色,在中文科技、金融、政务等领域表现均高于其他开源模型。除模型开源外,Skywork-13B系列大模...……更多
科学家建立新评价基准,助力评估大模型数据分析能力
...集。虽然这类数据的生成成本较低、人力需求不高,但是评测方法的开发却需要他们逐一校验,因为数据分析的结果并不仅仅依赖于执行的一致性。例如,在生成分类器的问题上,即便参考代码的执行结果和预测代码的结果不一...……更多
容联云容信通过中国信通院“办公即时通信软件安全能力”评测
...院”)“铸基计划-办公即时通信软件安全能力”完备级评测。随着数字化转型的全面提速,场景复杂、边界模糊等问题给移动办公、远程办公带来了诸多网络、数据安全方面的隐患。容联云作为中国信通院铸基计划—办公即时...……更多
智谱AI新一代基座大模型GLM-4在司南评测中跻身前列,位居国内第一
1月30日,上海人工智能实验室发布了大模型开源开放评测体系司南(OpenCompass 2.0),同时揭晓了2023年度大模型公开评测榜单,GPT-4 Turbo在各项评测中均获最佳表现,智谱AI新一代基座大模型GLM-4紧随其后,排名第二。上海人工智...……更多
清华郑纬民院士:AI for Science的出现,让高性能计算与AI的融合成为刚需|MEET2023
...一个分数、可变的问题规模、具有实际的人工智能意义、评测程序包含必要的多机通信;现在要获HPC领域的戈登贝尔奖,必须要有AI的算法,你没有AI的算法,否则奖都得不了。这是开玩笑的说法,但实际上也是一个趋势;AI for S...……更多
新能源车评测,懂车帝算是玩明白了
...新能源汽车的基础上,懂车帝正式推出了“6+2新能源汽车评测体系”。该体系共分续航、充电、辅助驾驶等6大维度和冬夏季极限评测2大场景,基于客观真实的实测数据,对新能源车进行综合评分,为消费者提供选买参考。...……更多
2022-12-15 18:40新能源,评测
“整活”保险业务,AI大模型哪家强?
...险行业?10月10日发布的《人工智能大模型保险行业应用评测报告》(以下简称《报告》)便揭晓了答案。根据《报告》,10个主流大模型在知识问答领域表现普遍较好,在智能核保、智能理赔、话术优化上表现不尽如人意,在营...……更多
更多关于科技的资讯:
快手电商渐入佳境?
号称史上最卷、时间线最长的618大战终于结束。与前几年相比,今年最大的变化无疑是取消预售制,简化促销玩法,并用“质价比”取代了性价比
2024-06-24 17:44:00
红魔9spro系列即将发布,屏幕具备10.7亿色显示能力
红魔9SPro系列即将发布,搭载领先版骁龙8Gen3处理器。该处理器是骁龙8Gen3系列的小幅升级版本,CPU主频提升至3
2024-06-24 17:49:00
割韭菜还是成本高 凭啥苹果的内存比金子还贵
苹果公司在存储容量的定价策略上一直备受争议,无论是手机还是电脑,消费者若想获得更充裕的存储空间或内存,往往需要支付比安卓或Windows系统设备更高的费用
2024-06-24 17:50:00
国内首批!长城与华为正式签署HiCar合作协议
快科技6月24日消息,我们从长城汽车官方获悉,长城汽车与华为在2024年华为开发者大会期间签署了合作协议,共同探索智能出行的新领域
2024-06-24 17:50:00
都2024年了:这家公司竟然出了台支持DOS和Win95的笔记本
快科技6月24日消息,尽管已是2024年,但复古科技的魅力却依旧不减,近日复古设备厂商Pocket推出了一款Pocket 386微型笔记本
2024-06-24 17:50:00
爽露爽孝感米酒2瓶到手17.8元:传统工艺发酵 儿时的味道
爽露爽孝感米酒原价23.8元,领券立减,实付到手价是17.8元(2瓶)。古法传承,源于宋代,传统工艺发酵,还是儿时的味道
2024-06-24 18:05:00
方程豹推出豹5半轴免费升级服务:升级后越野、改装潜能更强
快科技6月24日消息,方程豹汽车官方今日宣布,即将开启方程豹豹5加强半轴服务的预约。官方表示,只要您是豹5车型首任车主
2024-06-24 18:05:00
通讯员 陈波为进一步提升物资管理效能,近日,国网新泰市供电公司物资供应分中心开展了大规模的仓库整理工作。此次整理工作旨在通过优化仓库布局
2024-06-24 18:10:00
苹果加速研发轻量级AR眼镜:佩戴像普通眼镜一样
快科技6月24日消息,据媒体报道,苹果正在积极推进一款开创性的AR眼镜,进一步深耕AR技术领域。据悉,苹果内部专门设立的“视觉产品团队”规模庞大
2024-06-24 18:20:00
NVIDIA已堪比“哥德巴赫难题”:如何预测估值成大难题
快科技6月24日消息,在人工智能爆发的今天,NVIDIA无疑是最耀眼的明星企业之一。然而,随着NVIDIA销售额的飙升
2024-06-24 18:20:00
麦香浓郁:虎标苦荞茶55袋16.5元大促(京东40元)
天猫【虎标旗舰店】虎标原味苦荞茶 385g(约 55 袋)日常售价 36.9 元,现狂促直降至 29.5 元。叠加 10 元限时券
2024-06-24 18:20:00
仰望U8车队已抵达内蒙古四子王旗:参与重大任务
快科技6月24日消息,据仰望汽车总经理胡晓庆透露,仰望U8车队已顺利抵达内蒙古四子王旗,并为即将参与的重大任务做好了充分准备
2024-06-24 18:20:00
《王者荣耀》S36新赛季定档:免费领周瑜新皮肤
快科技6月24日消息,《王者荣耀》宣布,S36新赛季“元流之子” 将于6月27日正式开启。下载指定资源包,即可领取周瑜新皮肤
2024-06-24 18:35:00
轮椅上的他考343分:和妈妈相拥哽咽
6月24日消息,据国内多家媒体报道,重庆綦江考生罗睿燊查到了自己的高考成绩—343分。他和妈妈相拥哽咽,妈妈表示这个成绩超出预期
2024-06-24 18:35:00
本文转自:新华日报加快科创引领 厚植“人才森林”“四个新”驱动仪征产业转型提质□ 通讯员 仪宣本报记者 李源 张韦长江之滨
2024-06-24 18:43:00