• 我的订阅
  • 头条热搜
智源评测体系发布 国内外“百模”评估结果出炉
5月17日,智源研究院举办大模型评测发布会,正式推出智源评测体系,发布并解读国内外140余个开源和商业闭源的语言及多模态大模型全方位能力评测结果。本次智源评测,分别从主观、客观两个维度考察了语言模型的简单理...……更多
月狐数据发布中国市场首份《AIGC应用app智能化评测报告》
...上技术迭代的步伐,月狐数据发布《2023 AIGC应用app智能化评测报告》,该报告为中国市场首份围绕AIGC应用app的智能化水平以及智能体能力的专业测评报告,旨在通过多维度量化指标帮助用户更直观地评估现有主流AIGC应用产品的...……更多
...大模型技术哪家强”的讨论不绝于耳,各色名目的大模型评测应运而生。作为国内最权威的考试之一,高考覆盖各类学科及题型,同时在开考前这些题属于“绝密”,非常适合用来作为考查大模型智能水平的评测工具,堪称大模...……更多
多模态模型评测框架lmms-eval发布!全面覆盖,低成本,零污染
...模态大型模型设计的评估框架,为多模态模型(LMMs)的评测提供了一站式、高效的解决方案。代码仓库: https://github.com/EvolvingLMMs-Lab/lmms-eval 官方主页: https://lmms-lab.github.io/ 论文地址: https://arxiv……更多
击败Gemini-1.5-Pro、GPT-4V,从容大模型多模态能力跻身全球前三
...心报道机器之心编辑部近日,云从科技从容大模型在综合评测权威平台 OpenCompass 的多模态评测领域中取得重大进展。最新评测结果显示,云从科技的从容大模型在该体系中的平均得分为 65.5,这一成绩使得从容大模型跻身全球前...……更多
港中文团队提出大模型元推理范式,革新大模型的评价体系
...来源:曾忠燊)前不久,曾忠燊和所在团队提出一个全新评测范式。基于这一评测范式,他们又针对现有数据集,提出了一种改造方法。实验证明,这种方法能有效区分不同模型的能力差异。同时,他们还揭示了这种全新评测范...……更多
国内首个官方“大模型标准符合性评测”公布
...分委会全体会议期间,国内首个官方“大模型标准符合性评测”结果公布,腾讯混元大模型、阿里通义千问等大模型成为首批通过评测的四款国产大模型的其中之二。据介绍,“大模型标准符合性评测”由中国电子技术标准化研...……更多
中国信通院发布大模型安全基准测试报告 360智脑综合排名第一
...、合法合规、隐私保护、文明健康等二十余个维度的中文评测数据集。帮助大模型技术提供方提升安全风险防范能力,为大模型研发和落地保驾护航。此次测评报告即是在大模型安全基准测试AI Safety Bench标准下进行,此次测试数...……更多
上海人工智能实验室公布首个ai高考全卷评测结果
...20日消息,上海人工智能实验室19日公布了首个AI高考全卷评测结果。据介绍,2024年全国高考甫一结束,该实验室旗下司南评测体系OpenCompass选取6个开源模型及GPT-4o进行高考“语数外”全卷能力测试。评测采用全国新课标I卷,参...……更多
AI安全守护计划启动!信通院牵头,AIIA安全治理委员会发布三类模型安全评测
...情况,并启动了AI安全守护计划,发布了三大类别的安全评测结果。AIIA安全治理委员会成立于2023年12月底,经过半年运营,现有治理组、安全组两个工作组,近百家单位加入,主任单位由中国信通院牵头,副主任单位包括多家知...……更多
不同量级参数模型性能同样优秀 夸克大模型再登行业评测榜首
...百亿级参数大模型同样在法律、医疗、问答等领域的性能评测中夺冠。凭借在搜索业务和智能技术上的长期积累,夸克大模型利用数据、平台、知识增强等优势,可以大幅提升知识正确性。在医疗健康领域,夸克大模型已经可以...……更多
首个AI高考全卷评测结果发布:最高分303,数学全不及格
...平。在前不久高考结束后,上海人工智能实验室旗下司南评测体系OpenCompass选取了7个大模型进行高考“语数外”全卷能力测试。6月19日, OpenCompass发布了首个大模型高考全卷评测结果。语数外三科加起来的满分为420分,此次高考...……更多
...,上海人工智能实验室联合魔搭社区推出中国大语言模型评测竞技场Compass Arena,首度集齐国内主流大模型全阵容,阿里通义千问、百度文心一言、腾讯混元、字节跳动豆包、书生·浦语等20款国产大模型出战,角逐中国大模型“...……更多
东方财富董事长其实:建议进一步推动股权投资支持科技创新
...动高质量垂类语料数据开放共享,进一步完善垂直大模型评测标准体系,并积极打造垂直大模型创新应用场景。支持链主企业开展早期风险投资其实表示,科技创新作为引领现代化产业体系建设的关键力量,是发展新质生产力的...……更多
AI大模型“国标”首批测试结果公布,人工智能成市场新焦点
12月22日,国内首个官方“大模型标准符合性评测”结果公布,百度文心一言、腾讯混元大模型、360智脑、阿里云通义千问四款国产大模型首批通过测试。测试结果称,上述四款模型符合《人工智能大规模预训练模型第2部分:评...……更多
...“智越计划”,对国产人工智能芯片(AI芯片)开展全面评测,为后续算力建设提供依据。此次全面评测将助推国产芯片面向更多应用场景加快升级迭代。面对越来越严苛的AI芯片领域封锁,我国正在加速相关芯片的自主研发和...……更多
商汤商量获SuperCLUE 9月评测总榜和子榜两项第一,AI智能体方向受瞩目
商汤商量获SuperCLUE 9月评测总榜和子榜两项第一,AI智能体方向受瞩目 近日,中文通用大模型综合性评测基准SuperCLUE发布9月总排行榜和各个分类任务榜单,商汤商量SenseChat 3.0 位列中文大模型总榜排名第一。在新增的AI Agent(AI...……更多
首个AI高考全卷评测结果发布:数学全都不及格
6月19日,上海人工智能实验室发布首个AI高考全卷评测结果,月初开源的阿里通义千问大模型Qwen2-72B排名第一,在语数外三科420分的满分中获得303分,OpenAI的GPT-4o和上海人工智能实验室的书生·浦语2.0文曲星(InternLM2-20B-WQX)排...……更多
...私保护、文明健康、人工智能自主意识等27个维度的中文评测数据集,为行业提供全面、细致的安全性能测试指标。作为信息通信行业的重要研究机构,中国信通院在人工智能和大数据领域具有深厚的研究底蕴和丰富的行业经验...……更多
AI潮起 共筑数智之基
...链条产业生态中国移动宣布开放大模型训练基地、大模型评测基地及大模型产业创新基地,面向全社会提供大模型从训到推、AI+原生应用孵化等一站式产业融通带动服务。大模型训练基地是中国移动为大模型提供训练所需智算资...……更多
中文大模型最新评测出炉:腾讯混元国内第一!
...月5日消息,在最新发布的中文多模态大模型SuperCLUE-V基准评测中,腾讯混元大模型获国内排名第一,稳居卓越领导者象限。此次评测聚焦于大模型理解复杂现实世界的关键能力,即多模态理解,俗称“图生文”。多模态理解要求...……更多
国家大模型标准测试结果公布 首批仅四家企业产品通过
12月23日,国内首个官方“大模型标准符合性评测”结果公布,首批360集团、百度、腾讯、阿里四家企业大模型产品通过。该测试由工信部中国电子技术标准化研究院(简称“工信部电子标准院”)发起,评测围绕多领域多维度...……更多
科大讯飞刘庆峰:首先需要建立科学系统评测体系
...,快速追赶并努力超越ChatGPT,首先需要一套科学系统的评测体系。刘庆峰表示,已经有非常多的科研机构和企业单位都在开始进行大模型的研究和产业化探索。如果我们要让这种人工智能的技术真正地用于解决社会刚需,就要...……更多
2023移动网络质量“百城”专项评测:打造高质量的5G服务
2023年全国重点区域移动网络质量“百城”专项评测活动11月7日正式开启,来自中国信息通信研究院泰尔系统实验室5支专业的网络质量评测团队奔赴全国百余个城市,对重点和热点区域开展移动网络测试。其实“移动网络质量专...……更多
...脸识别安全合规专家观点及实践分享。发布“护脸计划”评测结果和评估规范解读成为本次大会焦点。会上,中国信通院云大所副所长闵栋公布了通过“人脸识别安全专项评测”“金融APP人脸识别安全能力评测”“人脸识别系统...……更多
智慧芽AI助手“芽仔”:你的智能研发专家,开启创新新范式
...型与其他大模型考试成绩图:智慧芽垂直领域大模型能力评测决定一个垂直领域大模型表现的,除了模型本身外,训练数据集同样起到关键性作用。而这恰恰是智慧芽的优势所在。智慧芽垂直领域大模型的预训练数据达到了千亿...……更多
AMD跑大模型终于Yes!MI300X对比NVIDIA H100/200毫不逊色
...出了与NVIDIA H100/200相媲美的实力。根据The Information发布的评测报告,AMD的Instinct MI300X GPU在AI推理基准测试中的表现与NVIDIA的H100 GPU相当,显示出AMD在高性能AI计算领域的进步。这份评测报告由MLCommons提供数据,在……更多
清华发布2024年3月版《SuperBench大模型综合能力评测报告》
...究中心联合中关村实验室研制的SuperBench大模型综合能力评测框架,正式对外发布2024年3月版《SuperBench大模型综合能力评测报告》。评测共包含了14个海内外具有代表性的模型,结果显示:文心一言4.0表现亮眼。例如在人类对齐能...……更多
字节扣子模型广场,给AI大模型搭了一座擂台
...选择什么模型,市面上也没有类似于豆瓣电影评分这样的评测体系。举个例子,小雷这样的科技爱好者想在扣子上创建一个帮助编辑检查文章配图版权、错别字的Bot,但缺乏大模型开发经验的我并不知道扣子上的哪些模型、哪些...……更多
Bengio团队提出多模态新基准,直指Claude 3.5和GPT-4o弱点
....com/tianyu-z/VCR (点击阅读原文即可直达,包含评用于模型评测和预训练的数据生成代码) Hugging Face 链接:huggingface.co/vcr-org VCR 数据集简介为了开发 VCR 任务,研究人员构建了一个由图像 - 文字生成 VCR 合成图像的流程。在该……更多
更多关于科技的资讯:
华为全新三折叠专利公布:双铰链联动 可一次性完全展开屏幕
快科技9月20日消息,全球首款三折叠手机华为Mate XT今天已经正式开售,19999元的起售价依然被秒抢光,展示了空前热度
2024-09-20 18:24:00
超重磅企业名单一览 数百家央国企、上市公司将齐聚9.26武汉大宗供应链业务对接会!
9月26日,2024新质生产力赋能大宗商品供应链创新发展论坛超重磅拟邀参会名单一览,你想合作的对象都来了。这将是一场全国性大宗商品供应链生态企业商机对接大会
2024-09-20 19:23:00
合肥海关截获输入性蝇蛹2300余只:可传播多种疾病
9月20日消息,据媒体报道,合肥海关所属铜陵海关关员在对两批次装载铅矿石和锌矿石的入境集装箱实施检疫查验时截获蝇蛹2300余只
2024-09-20 19:24:00
新研究发现:少一颗牙大脑衰老近一岁
快科技9月20日消息,据媒体报道,一项发表在《神经科学杂志》上的研究指出,每缺失一颗牙齿,大脑的衰老程度可能接近一岁。研究团队通过定期的认知功能评估与牙齿健康状况记录
2024-09-20 19:24:00
香港小姐正式开撕!亚军回应花钱买奖人品差等传闻
《2024香港小姐竞选》决赛日前圆满结束,出炉冠亚季军分别是2号“城大李嘉欣”倪乐琳(Ellyn)、11号梁嘉莹(Emily)及4号杨梓瑶(Amina)
2024-09-20 19:24:00
历经20年 Linux主线内核终合并史诗级补丁PREEMPT_RT!微秒内响应事件
快科技9月20日消息,在2024年9月的欧洲开源峰会上,Linux创始人Linus Torvalds宣布,“PREEMPT_RT”(实时Linux)补丁已被正式合并进Linux主线内核
2024-09-20 19:24:00
风华十五载!拿声国际水润征程 声动未来
拿声国际,于2009年起碇扬帆,是目前国内唯一一家专门服务于饮用水行业的品牌营销策划公司。立业十五载,拿声国际不仅见证着众多饮用水品牌从无到有
2024-09-20 19:26:00
Lavazza跨界联名“玩”出新高度 续写上海大师赛佳话
在全球市场一体化的时代潮流中,品牌间跨界合作的营销模式屡见不鲜。这种强强联合不仅能共享资源,更能爆发出1+1大于2的效果
2024-09-20 19:26:00
李斌艾铁成共同透露:乐道第二款中大型SUV将于2025年推出
快科技9月20日消息,在9月20日的乐道品牌媒体见面会上,蔚来创始人、董事长兼CEO李斌和蔚来高级副总裁兼乐道汽车总裁艾铁成回答了关于乐道品牌发展的多个问题
2024-09-20 19:54:00
挑战世界级难题!华为主机上云方案正式发布:2秒内发现故障
快科技9月20日消息,在今天的华为全联接大会2024上,华为常务董事、华为云CEO张平安正式发布了华为主机上云解决方案
2024-09-20 19:54:00
2199元!锐龙5 7600X3D正式开卖:102MB缓存超所有Zen5
快科技9月20日消息,AMD锐龙5 7600X3D游戏处理器今日起正式在京东开卖,定价2199元,晒单还有机会赢取50元的京东E卡
2024-09-20 19:55:00
上一款改名的是骁龙888!曝高通骁龙8 Gen4又要改名:网友热议
快科技9月20日消息,博主数码闲聊站暗示,高通下一代骁龙平台不叫骁龙8 Gen4,高通会有新的命名。在评论区,不少网友给骁龙8 Gen4起名
2024-09-20 19:55:00
民宿客人住9天留下358个空酒瓶:屋内整整齐齐摆满
9月20日消息,据媒体报道,辽宁一位民宿老板娘在客人退房后收拾房间,打开房间后却被眼前一幕惊呆,房子里整整齐齐摆满了啤酒瓶子
2024-09-20 19:55:00
《黑神话:悟空》DLC剧情似泄露!美术总监杨奇暗示鹤仙人不能打
快科技9月20日消息,《黑神话:悟空》凭借其深厚的文化底蕴和出色的游戏品质,取得了令人瞩目的成绩,其中的剧情也获得了众多玩家的讨论
2024-09-20 19:55:00
北京首例花木数据资产入表 引领花卉产业数智化转型
本文转自:人民网-北京频道人民网北京9月20日电 (记者鲍聪颖)9月20日,“产业链协同下的花木产业数智化转型”研讨会暨国内首个花木数据资产入表案例发布仪式在北京花乡花木集团开启
2024-09-20 20:01:00