• 我的订阅
  • 头条热搜
智源评测体系发布 国内外“百模”评估结果出炉
5月17日,智源研究院举办大模型评测发布会,正式推出智源评测体系,发布并解读国内外140余个开源和商业闭源的语言及多模态大模型全方位能力评测结果。本次智源评测,分别从主观、客观两个维度考察了语言模型的简单理...……更多
月狐数据发布中国市场首份《AIGC应用app智能化评测报告》
...上技术迭代的步伐,月狐数据发布《2023 AIGC应用app智能化评测报告》,该报告为中国市场首份围绕AIGC应用app的智能化水平以及智能体能力的专业测评报告,旨在通过多维度量化指标帮助用户更直观地评估现有主流AIGC应用产品的...……更多
港中文团队提出大模型元推理范式,革新大模型的评价体系
...来源:曾忠燊)前不久,曾忠燊和所在团队提出一个全新评测范式。基于这一评测范式,他们又针对现有数据集,提出了一种改造方法。实验证明,这种方法能有效区分不同模型的能力差异。同时,他们还揭示了这种全新评测范...……更多
国内首个官方“大模型标准符合性评测”公布
...分委会全体会议期间,国内首个官方“大模型标准符合性评测”结果公布,腾讯混元大模型、阿里通义千问等大模型成为首批通过评测的四款国产大模型的其中之二。据介绍,“大模型标准符合性评测”由中国电子技术标准化研...……更多
中国信通院发布大模型安全基准测试报告 360智脑综合排名第一
...、合法合规、隐私保护、文明健康等二十余个维度的中文评测数据集。帮助大模型技术提供方提升安全风险防范能力,为大模型研发和落地保驾护航。此次测评报告即是在大模型安全基准测试AI Safety Bench标准下进行,此次测试数...……更多
不同量级参数模型性能同样优秀 夸克大模型再登行业评测榜首
...百亿级参数大模型同样在法律、医疗、问答等领域的性能评测中夺冠。凭借在搜索业务和智能技术上的长期积累,夸克大模型利用数据、平台、知识增强等优势,可以大幅提升知识正确性。在医疗健康领域,夸克大模型已经可以...……更多
东方财富董事长其实:建议进一步推动股权投资支持科技创新
...动高质量垂类语料数据开放共享,进一步完善垂直大模型评测标准体系,并积极打造垂直大模型创新应用场景。支持链主企业开展早期风险投资其实表示,科技创新作为引领现代化产业体系建设的关键力量,是发展新质生产力的...……更多
AI大模型“国标”首批测试结果公布,人工智能成市场新焦点
12月22日,国内首个官方“大模型标准符合性评测”结果公布,百度文心一言、腾讯混元大模型、360智脑、阿里云通义千问四款国产大模型首批通过测试。测试结果称,上述四款模型符合《人工智能大规模预训练模型第2部分:评...……更多
...“智越计划”,对国产人工智能芯片(AI芯片)开展全面评测,为后续算力建设提供依据。此次全面评测将助推国产芯片面向更多应用场景加快升级迭代。面对越来越严苛的AI芯片领域封锁,我国正在加速相关芯片的自主研发和...……更多
商汤商量获SuperCLUE 9月评测总榜和子榜两项第一,AI智能体方向受瞩目
商汤商量获SuperCLUE 9月评测总榜和子榜两项第一,AI智能体方向受瞩目 近日,中文通用大模型综合性评测基准SuperCLUE发布9月总排行榜和各个分类任务榜单,商汤商量SenseChat 3.0 位列中文大模型总榜排名第一。在新增的AI Agent(AI...……更多
...私保护、文明健康、人工智能自主意识等27个维度的中文评测数据集,为行业提供全面、细致的安全性能测试指标。作为信息通信行业的重要研究机构,中国信通院在人工智能和大数据领域具有深厚的研究底蕴和丰富的行业经验...……更多
国家大模型标准测试结果公布 首批仅四家企业产品通过
12月23日,国内首个官方“大模型标准符合性评测”结果公布,首批360集团、百度、腾讯、阿里四家企业大模型产品通过。该测试由工信部中国电子技术标准化研究院(简称“工信部电子标准院”)发起,评测围绕多领域多维度...……更多
2023移动网络质量“百城”专项评测:打造高质量的5G服务
2023年全国重点区域移动网络质量“百城”专项评测活动11月7日正式开启,来自中国信息通信研究院泰尔系统实验室5支专业的网络质量评测团队奔赴全国百余个城市,对重点和热点区域开展移动网络测试。其实“移动网络质量专...……更多
...脸识别安全合规专家观点及实践分享。发布“护脸计划”评测结果和评估规范解读成为本次大会焦点。会上,中国信通院云大所副所长闵栋公布了通过“人脸识别安全专项评测”“金融APP人脸识别安全能力评测”“人脸识别系统...……更多
智慧芽AI助手“芽仔”:你的智能研发专家,开启创新新范式
...型与其他大模型考试成绩图:智慧芽垂直领域大模型能力评测决定一个垂直领域大模型表现的,除了模型本身外,训练数据集同样起到关键性作用。而这恰恰是智慧芽的优势所在。智慧芽垂直领域大模型的预训练数据达到了千亿...……更多
清华发布2024年3月版《SuperBench大模型综合能力评测报告》
...究中心联合中关村实验室研制的SuperBench大模型综合能力评测框架,正式对外发布2024年3月版《SuperBench大模型综合能力评测报告》。评测共包含了14个海内外具有代表性的模型,结果显示:文心一言4.0表现亮眼。例如在人类对齐能...……更多
科学家建立新评价基准,助力评估大模型数据分析能力
...集。虽然这类数据的生成成本较低、人力需求不高,但是评测方法的开发却需要他们逐一校验,因为数据分析的结果并不仅仅依赖于执行的一致性。例如,在生成分类器的问题上,即便参考代码的执行结果和预测代码的结果不一...……更多
昆仑万维发布开源13B高质量商用大模型 领先Llama2和Baichuan2
...-Base模型、Skywork-13B-Math模型,它们在CEVAL, GSM8K等多个权威评测与基准测试上都展现了同等规模模型的最佳效果,其中文能力尤为出色,在中文科技、金融、政务等领域表现均高于其他开源模型。除模型开源外,Skywork-13B系列大模...……更多
智谱AI新一代基座大模型GLM-4在司南评测中跻身前列,位居国内第一
1月30日,上海人工智能实验室发布了大模型开源开放评测体系司南(OpenCompass 2.0),同时揭晓了2023年度大模型公开评测榜单,GPT-4 Turbo在各项评测中均获最佳表现,智谱AI新一代基座大模型GLM-4紧随其后,排名第二。上海人工智...……更多
清华郑纬民院士:AI for Science的出现,让高性能计算与AI的融合成为刚需|MEET2023
...一个分数、可变的问题规模、具有实际的人工智能意义、评测程序包含必要的多机通信;现在要获HPC领域的戈登贝尔奖,必须要有AI的算法,你没有AI的算法,否则奖都得不了。这是开玩笑的说法,但实际上也是一个趋势;AI for S...……更多
新能源车评测,懂车帝算是玩明白了
...新能源汽车的基础上,懂车帝正式推出了“6+2新能源汽车评测体系”。该体系共分续航、充电、辅助驾驶等6大维度和冬夏季极限评测2大场景,基于客观真实的实测数据,对新能源车进行综合评分,为消费者提供选买参考。...……更多
2022-12-15 18:40新能源,评测
“整活”保险业务,AI大模型哪家强?
...险行业?10月10日发布的《人工智能大模型保险行业应用评测报告》(以下简称《报告》)便揭晓了答案。根据《报告》,10个主流大模型在知识问答领域表现普遍较好,在智能核保、智能理赔、话术优化上表现不尽如人意,在营...……更多
选机指南:你的5G手机在ToP榜吗?
...中国移动2023年智能硬件质量报告快来围观No.15G手机综合评测TOP排行榜5G手机到底有多快?“手机下载APP,来不及看进度条就已经下完了;各个平台看视频,进度条随便拖,就跟已经缓存的视频一样。”这是现在5G手机用户的真实...……更多
拥有三块A6000的性能猛兽 惠普Z6 G5工作站评测
...配置:惠普Z6 G5核心硬件可根据用户需求进行定制,本次评测样机搭载36核72线程的Intel Xeon W9-3475X处理器,插入了8条32GB ECC DDR5内存,内存总容量高达256GB,显卡配满了3块NVIDIA RTX A6000专业独显,硬盘配置了2块2TB SSD和2块12T……更多
...民网北京10月23日电 (记者申佳平)《智能制造效能通用评测方法》标准编制工作组成立暨第一次工作组会议日前在京举行。来自机械工业仪器仪表综合技术经济研究所(以下简称仪综所)、中国信息通信研究院、中国电子技术...……更多
正式签约!合肥首家科创数字化融资平台中科星元平台成立
...下跑金融机构,仅需在平台上提交测评资料,随后5秒出评测结果,3秒匹配金融产品的高效融资服务;其次是成本低,费用透明无任何传统中介融资的种种附加费用,同时后台全流程清晰,融资进程一目了然。在该模式下,平台...……更多
...信通院与北京智源研究院、天津大学等联合发布了大模型评测体系3.0,暨“方升”大模型基准测试体系。据介绍,测试指标重点强化行业和场景导向的能力考查,提出了自适应动态测试方法,测试数据超过百万条,并首次推出面...……更多
百川智能发布baichuan3稳定语言模型
...布超千亿参数的大语言模型Baichuan3。在多个权威通用能力评测如CMMLU、GAOKAO和AGI-Eval中,Baichuan3都展现了出色的能力,尤其在中文任务上更是超越了GPT-4。而在数学和代码专项评测如MATH、HumanEval和MBPP中同样表现出色,证明了Baichua...……更多
小米SU7供应商嘉晨电子拟IPO 雷军背后入股|企业创新评测实验室
...月申请上市辅导验收,对于嘉晨电子的IPO之路,企业创新评测实验室将持续关注。“企业创新评测实验室”:由专注新兴产业与资本的权威媒体《科创板日报》发起,旨在研究公司科创实力,凭借企业科创力评估模型,从技术质...……更多
...型“高分低能”是怎么做到的?原因其实很简单,那就是评测中出现了数据污染和泄露。简单来说,榜单排名类似于有第三方“考官”出了一个题库,题库中大量考题针对性测评大模型各个方面的能力,而有的“考生”提前拿到...……更多
更多关于科技的资讯:
曾刚上市就下架 绿联NAS又曝出严重安全缺陷!官方回应不影响正式用户
快科技7月7日消息,绿联NAS新品在上市之初就遭遇了下架风波,近日又被曝出存在严重的安全设计缺陷。据B站up主发现,绿联NAS系统控制面板中提供的两个域名的通配符证书
2024-07-07 08:07:00
小米gpro2024游戏本7月12日正式开售
今年三月份小米推出了RedmiGPro2024游戏笔记本,这款新产品搭载了顶级的i9-14900HX处理器和强大的RTX4060显卡
2024-07-07 08:25:00
路由器要不要每天关闭?教你一些小窍门,让你的网速飞起来!
你是不是常常觉得家里的网速像蜗牛一样慢,上个网页要等半天,看个视频要卡半天,玩个游戏要断半天?其实,这可能和你的路由器有关
2024-07-07 08:31:00
空调不用时,记得拔掉插头,不然每月电费可能翻倍!
今天我要跟大家分享一个非常重要的话题,那就是如何节约用电。我们都知道,电器和电子设备在现代生活中是必不可少的。但是,如果我们不正确使用它们
2024-07-07 08:32:00
unihertzjelly将发布旗下首款5g手机
之前小白测评频道做过一期「新奇的手机」开箱,里面有一款名为UnihertzJelly2的手机,3英寸大小的屏幕,加上圆润小巧的机身
2024-07-07 08:33:00
直屏灭霸!真我GT6样张首曝:索尼IMX890旗舰主摄 抓怕神器
快科技7月7日消息,真我GT6将于7月9日发布,日前,真我realme副总裁、全球营销总裁、中国区总裁徐起首次晒出真我GT6拍摄的样张
2024-07-07 08:37:00
25亿转让价值超百亿问界商标:华为、赛力斯更多新品年内推出
快科技7月7日消息,在前几天赛力斯宣布以25亿元人民币,收购华为持有的全球所有类别“问界”及相关商标权及申请权、外观设计专利后
2024-07-07 08:37:00
Redmi K80系列最快将在11月登场
作为Redmi旗下主打的高性价比旗舰手机,RedmiK70系列凭借着优秀的外观设计、强劲的配置堆料以及不错的性价比,收获了许多消费者的好评
2024-07-07 08:40:00
手机发不了短信是什么原因引起的?
手机发不了短信可能是由多种原因引起的,包括网络问题、设置问题、SIM卡故障、手机软件故障等。如果您遇到手机发送短信失败的问题
2024-07-07 08:41:00
中兴小鲜60智能手机上架销售
据中国电信终端产品库的信息,中兴小鲜60智能手机已经上架销售。该款手机的型号为“中兴ZTE7551N”,售价从1599元到2399元不等
2024-07-07 08:43:00
什么是5g物联网卡?它能够应用在哪些领域?
5G物联网卡已经成为了物联网时代的关键组成部分。那么,究竟什么是5G物联网卡,它又能够应用在哪些领域呢?本文将由老向详细为您解读
2024-07-07 08:54:00
《绝区零》登录即送30抽
今日,《绝区零》游戏官方宣布,该游戏全球下载量已经达到了5000万次。为了庆祝这一里程碑式的时刻,他们决定为所有的等级达到1级的玩家发放菲林*1600
2024-07-07 08:56:00
Redmi G Pro游戏本i7版正式上架,屏幕配置升级
今年3月份,小米推出了全新游戏本RedmiGPro2024,当时仅推出了i9-14900HX的版本。现在,小米商城显示
2024-07-07 08:57:00
《蓝色监狱》改编电视动画第二季即将开播!
热门漫画《蓝色监狱》改编的电视动画第二季即将于10月5日开播!这部动画自2022年10月至2023年3月在朝日电视台播出后
2024-07-07 09:00:00
《赛博朋克2077》的新一批角色COS指南公布
今日,CDPR公布了《赛博朋克2077》的新一批角色COS指南,其中就包括了海伍德的杰克·威尔斯。这次官方一共放出了40多张游戏内建模细节图
2024-07-07 09:00:00