• 我的订阅
  • 头条热搜
智源评测体系发布 国内外“百模”评估结果出炉
5月17日,智源研究院举办大模型评测发布会,正式推出智源评测体系,发布并解读国内外140余个开源和商业闭源的语言及多模态大模型全方位能力评测结果。本次智源评测,分别从主观、客观两个维度考察了语言模型的简单理...……更多
智源研究院发布FlagEval“百模”评测结果
...觉语言、文生图、文生视频、语音语言大模型综合及专项评测结果。智源评测发现,2024年下半年大模型发展更聚焦综合能力提升与实际应用。多模态模型发展迅速,涌现了不少新的厂商与新模型,语言模型发展相对放缓。模型...……更多
月狐数据发布中国市场首份《AIGC应用app智能化评测报告》
...上技术迭代的步伐,月狐数据发布《2023 AIGC应用app智能化评测报告》,该报告为中国市场首份围绕AIGC应用app的智能化水平以及智能体能力的专业测评报告,旨在通过多维度量化指标帮助用户更直观地评估现有主流AIGC应用产品的...……更多
...大模型技术哪家强”的讨论不绝于耳,各色名目的大模型评测应运而生。作为国内最权威的考试之一,高考覆盖各类学科及题型,同时在开考前这些题属于“绝密”,非常适合用来作为考查大模型智能水平的评测工具,堪称大模...……更多
多模态模型评测框架lmms-eval发布!全面覆盖,低成本,零污染
...模态大型模型设计的评估框架,为多模态模型(LMMs)的评测提供了一站式、高效的解决方案。代码仓库: https://github.com/EvolvingLMMs-Lab/lmms-eval 官方主页: https://lmms-lab.github.io/ 论文地址: https://arxiv……更多
媲美OpenAI事实性基准,这个中文评测集让o1-preview刚刚及格
...事实正确性,近期 OpenAI 发布并开源了一个名为 SimpleQA 的评测集。而我们也同样一直在关注模型事实正确性这一领域,目前该领域存在数据过时、评测不准和覆盖不全等问题。例如现在大家广泛使用的知识评测集还是 CommonSenseQA...……更多
安兔兔评测pc版正式发布,欢迎大家下载体验
兔友们,全新的安兔兔评测PC版已经正式发布了,目前已经在安兔兔官网以及各大渠道上线,欢迎大家下载体验。与Android版本测试流程相似,安兔兔评测PC版测试项目同样包括了CPU、GPU、Memroy(内存和存储)和UX(用户体验)四...……更多
击败Gemini-1.5-Pro、GPT-4V,从容大模型多模态能力跻身全球前三
...心报道机器之心编辑部近日,云从科技从容大模型在综合评测权威平台 OpenCompass 的多模态评测领域中取得重大进展。最新评测结果显示,云从科技的从容大模型在该体系中的平均得分为 65.5,这一成绩使得从容大模型跻身全球前...……更多
...更为显著。而智源研究院近日发布最新一期FlagEval大模型评测。结果显示,2024年下半年,国内大模型发展更聚焦综合能力提升与实际应用,其中,多模态模型发展迅速,涌现了不少新的厂商与新模型。国内厂商“全面开花”对于...……更多
全球几十种大模型评测,如何甄别可信度?
...20日讯(记者 武静静)要衡量一个大模型能力是否够强,评测是最直接的维度。大模型评测就是为大模型的一场“考试”,从不同大模型的表现中,不仅可以衡量现有技术水平,还能帮助识别大模型存在的问题,促进模型开发。...……更多
港中文团队提出大模型元推理范式,革新大模型的评价体系
...来源:曾忠燊)前不久,曾忠燊和所在团队提出一个全新评测范式。基于这一评测范式,他们又针对现有数据集,提出了一种改造方法。实验证明,这种方法能有效区分不同模型的能力差异。同时,他们还揭示了这种全新评测范...……更多
国内首个官方“大模型标准符合性评测”公布
...分委会全体会议期间,国内首个官方“大模型标准符合性评测”结果公布,腾讯混元大模型、阿里通义千问等大模型成为首批通过评测的四款国产大模型的其中之二。据介绍,“大模型标准符合性评测”由中国电子技术标准化研...……更多
中国信通院发布大模型安全基准测试报告 360智脑综合排名第一
...、合法合规、隐私保护、文明健康等二十余个维度的中文评测数据集。帮助大模型技术提供方提升安全风险防范能力,为大模型研发和落地保驾护航。此次测评报告即是在大模型安全基准测试AI Safety Bench标准下进行,此次测试数...……更多
上海人工智能实验室公布首个ai高考全卷评测结果
...20日消息,上海人工智能实验室19日公布了首个AI高考全卷评测结果。据介绍,2024年全国高考甫一结束,该实验室旗下司南评测体系OpenCompass选取6个开源模型及GPT-4o进行高考“语数外”全卷能力测试。评测采用全国新课标I卷,参...……更多
AI安全守护计划启动!信通院牵头,AIIA安全治理委员会发布三类模型安全评测
...情况,并启动了AI安全守护计划,发布了三大类别的安全评测结果。AIIA安全治理委员会成立于2023年12月底,经过半年运营,现有治理组、安全组两个工作组,近百家单位加入,主任单位由中国信通院牵头,副主任单位包括多家知...……更多
多样任务真实数据,大模型在线购物基准Shopping MMLU开源
谁是在线购物领域最强大模型?也有评测基准了。基于真实在线购物数据,电商巨头亚马逊终于“亮剑”——联合香港科技大学、圣母大学构建了一个大规模、多任务评测基准Shopping MMLU,用以评估大语言模型在在线购物领域的...……更多
全模态对齐框架align-anything来啦:实现跨模态指令跟随
...法; 支持多种开、闭源对齐评估:支持了 30 多个多模态评测基准,包括如 MMBench、VideoMME 等多模态理解评测,以及如 FID、HPSv2 等多模态生成评测训练框架北大对齐小组设计了高度模块化、扩展性以及简单易用的对齐训练框架,...……更多
迈向多语言医疗大模型:大规模预训练语料,开源模型与全面基准测试
...言医疗语料库 MMedC。2. 开发了一个全新的多语言医疗问答评测标准 MMedBench, 覆盖了 6 种语言,21 种医学子课题。3. 推出了一款名为 MMed-Llama 3 的全新基座模型,以 8B 的尺寸在多项基准测试中超越了现有的开源模型,更加适合通过...……更多
不同量级参数模型性能同样优秀 夸克大模型再登行业评测榜首
...百亿级参数大模型同样在法律、医疗、问答等领域的性能评测中夺冠。凭借在搜索业务和智能技术上的长期积累,夸克大模型利用数据、平台、知识增强等优势,可以大幅提升知识正确性。在医疗健康领域,夸克大模型已经可以...……更多
首个AI高考全卷评测结果发布:最高分303,数学全不及格
...平。在前不久高考结束后,上海人工智能实验室旗下司南评测体系OpenCompass选取了7个大模型进行高考“语数外”全卷能力测试。6月19日, OpenCompass发布了首个大模型高考全卷评测结果。语数外三科加起来的满分为420分,此次高考...……更多
...,上海人工智能实验室联合魔搭社区推出中国大语言模型评测竞技场Compass Arena,首度集齐国内主流大模型全阵容,阿里通义千问、百度文心一言、腾讯混元、字节跳动豆包、书生·浦语等20款国产大模型出战,角逐中国大模型“...……更多
两大AI模型性能提升 登上国际榜单
...第一。OpenLLMLeaderboardV2是由HuggingFace维护的开源语言模型评测平台升级版本,采用更全面和严格评估标准,对各类开源大语言模型进行多维度测试和排名。Newsbang/homer-72B重视提升模型在推理和思考方面的能力,通过搭配数据筛选...……更多
东方财富董事长其实:建议进一步推动股权投资支持科技创新
...动高质量垂类语料数据开放共享,进一步完善垂直大模型评测标准体系,并积极打造垂直大模型创新应用场景。支持链主企业开展早期风险投资其实表示,科技创新作为引领现代化产业体系建设的关键力量,是发展新质生产力的...……更多
AI大模型“国标”首批测试结果公布,人工智能成市场新焦点
12月22日,国内首个官方“大模型标准符合性评测”结果公布,百度文心一言、腾讯混元大模型、360智脑、阿里云通义千问四款国产大模型首批通过测试。测试结果称,上述四款模型符合《人工智能大规模预训练模型第2部分:评...……更多
...“智越计划”,对国产人工智能芯片(AI芯片)开展全面评测,为后续算力建设提供依据。此次全面评测将助推国产芯片面向更多应用场景加快升级迭代。面对越来越严苛的AI芯片领域封锁,我国正在加速相关芯片的自主研发和...……更多
商汤商量获SuperCLUE 9月评测总榜和子榜两项第一,AI智能体方向受瞩目
商汤商量获SuperCLUE 9月评测总榜和子榜两项第一,AI智能体方向受瞩目 近日,中文通用大模型综合性评测基准SuperCLUE发布9月总排行榜和各个分类任务榜单,商汤商量SenseChat 3.0 位列中文大模型总榜排名第一。在新增的AI Agent(AI...……更多
首个AI高考全卷评测结果发布:数学全都不及格
6月19日,上海人工智能实验室发布首个AI高考全卷评测结果,月初开源的阿里通义千问大模型Qwen2-72B排名第一,在语数外三科420分的满分中获得303分,OpenAI的GPT-4o和上海人工智能实验室的书生·浦语2.0文曲星(InternLM2-20B-WQX)排...……更多
...私保护、文明健康、人工智能自主意识等27个维度的中文评测数据集,为行业提供全面、细致的安全性能测试指标。作为信息通信行业的重要研究机构,中国信通院在人工智能和大数据领域具有深厚的研究底蕴和丰富的行业经验...……更多
AI潮起 共筑数智之基
...链条产业生态中国移动宣布开放大模型训练基地、大模型评测基地及大模型产业创新基地,面向全社会提供大模型从训到推、AI+原生应用孵化等一站式产业融通带动服务。大模型训练基地是中国移动为大模型提供训练所需智算资...……更多
中文大模型最新评测出炉:腾讯混元国内第一!
...月5日消息,在最新发布的中文多模态大模型SuperCLUE-V基准评测中,腾讯混元大模型获国内排名第一,稳居卓越领导者象限。此次评测聚焦于大模型理解复杂现实世界的关键能力,即多模态理解,俗称“图生文”。多模态理解要求...……更多
更多关于科技的资讯:
2025年,中国给了世界第一个惊喜,还有些惊吓
毫无疑问,这是2025年,中国给世界的第一个惊喜。当然,对西方某些人来说,这也是惊吓。看了一下,北京时间1月28日凌晨
2025-01-28 09:50:00
【多彩新论】别让“电商专供”成为消费“陷阱”
在当下消费市场,“电商专供”产品似乎陷入了信任危机。卷纸变小、洗衣液变稀、同款产品线下难寻等现象频发,让“电商专供”在许多消费者心中与质量缩水画上了等号
2025-01-28 02:16:00
余承东华为3月重磅新品:别人想不到 全国人民抢购都买得起!
快科技1月28日消息,日前,华为常务董事、终端BG董事长、智能汽车解决方案BU董事长余承东开启直播,驾驶享界S9回安徽老家过年
2025-01-28 06:36:00
如不能正常浏览请选用IE浏览器天津北方网讯:潮购津门,乐呵过年。第二届天津电商节年货节,“一站式”购齐年货,欢欢喜喜过大年。#你好天津 #点赞天津……(津云新闻编辑张麒麟)
2025-01-27 15:37:00
AI入口 “爱”的入口
江南时报讯 春节是团圆的盛宴,凝聚着家的灵魂、力量与温暖。南来北往的游子,对于“家”有着更深的情结与眷恋。春运期间,中国电信联合江苏交通文化传媒有限公司在江苏高速阳澄湖
2025-01-27 15:51:00
完美世界再发反腐通报:开除4人,永不录用
根据一份流传到网上的内部公告,1月24日,完美世界开除了百万工作室四人,其违规行为包括在素材制作外包管理方面玩忽职守,构成严重失职
2025-01-27 16:03:00
过年回家,你锁门了吗?Zigbang直帮(原三星指纹锁)
过年回家,你锁门了吗?Zigbang直帮(原三星指纹锁),自动上锁不操心随着春节的脚步日益临近,人们纷纷踏上了归家的旅程
2025-01-27 16:11:00
这种小番茄有剧毒!很多人还把它当观赏植物 快看你家有没有
去年,美国女演员艾丽西亚·西尔维斯通(Alicia Silverstone)发了一个短视频,说自己在路边摘了一个橙色小番茄
2025-01-27 16:36:00
潍坊美的火三月震撼来袭,超绝福利“高能”释出!
3月7日-3月16日,一年一度的美的火三月将火爆开展,作为美的家电每年的核心活动节点,已经传承了17载。它不仅是美的与消费者之间的约定
2025-01-27 16:46:00
厂商官方承认:RTX 50确实货不多!一家都不到100块
快科技1月27日消息,RTX 5090/5090D、RTX 5080都将在1月30日大年初二晚上正式开售,但这次供货之紧张前所未有
2025-01-27 17:06:00
DeepSeek实习生日薪最高达上千元 招人不看经验只看能力
快科技1月27日消息,近日,国产大模型DeepSeek震动美国硅谷,其移动App一举登顶苹果中国和美国应用商店免费APP下载排行榜
2025-01-27 17:06:00
女子帮忙按600斤年猪脸被踢肿 网友:古有四大按不住
1月27日消息,近日,贵州贵阳一女子帮叔叔们一起按住600斤的年猪,年猪不停挣扎,一脚踢到女子脸上。她表示:“脸被踢肿了
2025-01-27 17:06:00
一谈起自动化汽车工厂,人们脑海中常常浮现出这样的场景:机器人手臂在精确装配线上舞动,高效焊接、喷涂车身;智能AGV小车穿梭其间
2025-01-27 17:06:00
Windows 11 24H2新年第一个补丁惹大祸:各种不正常、崩溃
快科技1月27日消息,Windows补丁惹事儿不是新闻,但是作为Windows 11 24H2 2025年的第一个补丁
2025-01-27 17:36:00
最高补贴2000元!青岛以旧换新“加力扩围”至12类
齐鲁晚报·齐鲁壹点 尚青龙青岛市2025年消费品以旧换新活动已于日前正式启动,记者从青岛市商务局、青岛市财政局获悉,为进一步惠及广大消费者
2025-01-27 17:42:00