• 我的订阅
  • 科技

20款国产大模型角逐“最强王者”

类别:科技 发布时间:2024-06-02 05:34:00 来源:每日看点快看

本文转自:解放日报

20款国产大模型角逐“最强王者”

查睿

本报记者 查睿

近日,上海人工智能实验室联合魔搭社区推出中国大语言模型评测竞技场Compass Arena,首度集齐国内主流大模型全阵容,阿里通义千问、百度文心一言、腾讯混元、字节跳动豆包、书生·浦语等20款国产大模型出战,角逐中国大模型“最强王者”。

当下,“百模大战”厮杀正酣,各类榜单也层出不穷,其中国际开放研究组织LMSYS Org(Large Model Systems Organization)推出的大模型竞技场Chatbot Arena,已成为海外最具公信力的大模型竞技场之一,遗憾的是该竞技场中文化程度相对不足。为此,Compass Arena的推出将有效填补这一领域的空白。

相比考题固定的传统测评,中国大语言模型评测竞技场Compass Arena采用盲测、开放的测评模式,可以更全面地检验模型实力。Compass Arena设置了随机、匿名对战,大模型选手们成为“蒙面唱将”,模型信息隐去后,由系统随机匹配进行PK,用户可以天马行空自由出题,并作为评委主观评判和投票。如果大模型不小心“自报家门”,则对话被过滤,不计入成绩。通过成千上万轮PK挑战和用户投票,系统将对大模型进行自动排名。

Compass Arena由上海人工智能实验室OpenCompass司南评测体系与魔搭社区联合建设,前者负责组织评测,后者负责开源模型引入及社区打造。与Chatbot Arena相比,Compass Arena更聚焦中文大模型,主流国产大模型全覆盖,同时评测用户大多使用中文,可以充分评估国产大模型的性能。

目前,Compass Arena已汇聚超20款商业及社区模型,包括Qwen-Max、ERNIE-4.0-8K、Spark3.5 Max、Abab6.5、GLM4等国内头部厂商的旗舰款大模型,并引入了Llama3、Mixtral等海外标杆模型进行参照。更多模型及厂商还在不断加入中。

以上内容为资讯信息快照,由td.fyun.cc爬虫进行采集并收录,本站未对信息做任何修改,信息内容不代表本站立场。

快照生成时间:2024-06-02 11:45:08

本站信息快照查询为非营利公共服务,如有侵权请联系我们进行删除。

信息原文地址:

国产大模型竞技场首超GPT-4o!零一万物GLM共同跻身Top10
...式对外发布新旗舰模型——Yi-Lightning(闪电)。在大模型竞技场(Chatbot Arena)上,Yi-Lightning性能直冲总榜单并列第6
2024-10-17 09:48:00
帝都、魔都双双押宝 年底了AI圈居然还有高手
...024-11-19而阶跃的 “ 第二步 ”Step-1V 走的也不错。拿?模型竞技场 Chatbot Arena 的数据来看
2024-12-26 00:36:00
多模态竞技场对标90B Llama 3.2!Pixtral 12B技术报告全公开
【新智元导读】以开源极客之姿杀入江湖的Mistral AI,在9月份甩出了自家的首款多模态大模型Pixtral 12B
2024-11-20 09:43:00
GPT-4o mini登顶大模型竞技场,奥特曼:两个月内微调免费
...刚,GPT-4o mini版迎来“高光时刻”——登顶了lmsys大模型竞技场,和满血版并列第一,还把Claude 3
2024-07-25 09:31:00
起猛了,GPT-4o被谷歌新模型击败,ChatGPT官号:大家深吸一口气
...2000人匿名投票,Gemini 1.5 Pro(0801)代表谷歌首次夺得lmsys竞技场第一。(中文任务也第一)而且这次还是双冠王
2024-08-05 09:36:00
AI界新晋王者被曝抄袭、作弊、做假,脸都丢光了
(id:SouthReviews)原标题 | 他们抄袭,作弊,做假,却宣称超越作者 | 南风窗记者 朱秋雨编辑 | 向由排版 | 菲菲AI大模型大战在2023年爆发后
2023-12-20 00:10:00
...,360 通过 CoE 技术架构,构建了大模型竞技平台——模型竞技场(bot.360.com),目前已经入驻360AI浏览器
2024-09-16 17:42:00
国产模型指令跟随全球第一!来自LeCun亲推的最难作弊LLM新榜单
...而且它登上的这个排行榜LiveBench,虽然现在还没有大模型竞技场(LMSYS Chatboat Arena)那么广为人知
2024-11-22 09:54:00
智源评测体系发布 国内外“百模”评估结果出炉
5月17日,智源研究院举办大模型评测发布会,正式推出智源评测体系,发布并解读国内外140余个开源和商业闭源的语言及多模态大模型全方位能力评测结果。本次智源评测,分别从主观、客观两
2024-05-17 17:26:00
更多关于科技的资讯:
上海迪拜同发讯飞AI翻译耳机 “中国技术”连接全球
大皖新闻讯 一个是中国对外开放的前沿窗口,一个是中东地区商业中心和“一带一路”重要节点城市,10月14日下午,科大讯飞在上海世界会客厅举行“对话世界
2025-10-15 17:21:00
近日,一批仿冒新闻机构的自媒体账号被依法关闭,据报道,这些账号以“新闻”为名,行“带货”之实。但记者调查发现,此类“李鬼”账号仍在各大平台潜伏
2025-10-15 17:59:00
蛋糕里吃出“牙”,和解填不满食品安全的信任缺口
齐鲁晚报·齐鲁壹点评论员 刘雅菲10月14日,有上海网友发布视频称,自己在上海的山姆会员商店外高桥店购买的枣泥核桃蛋糕中
2025-10-15 16:00:00
三联家电&海信集团强强联手!10.25重磅惠民活动即将启幕
鲁网10月15日讯为抢占四季度消费市场高地,深化品牌战略合作布局,10月11日,山东三联家用电器有限公司与海信集团联合召开“三联家电10
2025-10-15 14:59:00
京东官宣发布新车,称像买手机一样方便,已注册多枚京东汽车商标
10月14日,京东微博账号发文称:2025京东11.11期间,京东联合广汽、宁德时代将正式推出一款神秘国民好车,官方将在10月底将陆续开启内测版
2025-10-15 10:46:00
固安:开足马力赶订单 满足京津冀市场需求
河北新闻网讯(万倩、陈放)10月13日,走进位于固安县固安镇的秋兹科技(固安)有限公司生产车间,自动化裁切设备高速运转
2025-10-15 09:56:00
参展企业334家,展位数再创新高达840个斩获银奖!“南京智造”闪耀广交会南报网讯(记者黄琳燕通讯员宁商轩)第138届广交会将于10月15日在广州开幕
2025-10-15 08:09:00
“云”上调度 雨中守护|雷沃数智化服务为抢收装上智慧大脑
秋收关键期遭遇连绵阴雨,让秋收秋种受阻。除了满足抢收抢烘抢播的智能农机,潍柴雷沃还创新数智化服务,通过智能调度与精准服务
2025-10-15 01:05:00
茶酒融合催生“微醺”新赛道,新茶饮品牌争饮“昼夜”经济
当白天的提神茶饮与夜晚的放松酒品打破边界,正催生出国内消费市场一股新的“微醺”风潮。近期,茶百道经典白酒奶茶回归即创下销量佳绩
2025-10-14 11:33:00
嘎子谢孟伟被执行超1400万,已被限高,此前因穿警服带货被行拘7日
近日,因穿警服直播带货被行政拘留、账号遭封禁的嘎子谢孟伟发视频称 “我回来了”,并向所有观众诚恳道歉。视频中,其透露公司员工已被安排回老家
2025-10-14 11:33:00
平谷将打造全国农业科创中心
原标题:世界农业科创大会开幕 农业中关村核心区2.0发布平谷将打造全国农业科创中心本报讯(记者 赵婷婷)昨天,2025世界农业科技创新大会(WAFI)在北京平谷开幕
2025-10-14 11:59:00
据大象新闻报道,近期蜜雪冰城的小票成了年轻人追捧的“追更凭证”,其上连载着名为《雪王在古代卖咖啡》的小说,20个章节随机印在消费小票上
2025-10-14 12:10:00
电通创意发布《2025首席营销官报告》:算法与人性的重构力量
AI时代,品牌的长期价值回归于人性与文化共鸣,人类的创造力、同理心与文化相关性愈加重要。•AI已成日常:几乎所有CMO都在使用AI
2025-10-14 13:29:00
近日,一则“美团外卖骑手能屏蔽顾客”的消息在网络上引发热议。据媒体报道,美团已在福建晋江、浙江绍兴等七个城市试点上线骑手评价用户和屏蔽用户功能
2025-10-14 13:40:00
这座产业园一年制造千万颗球胆、百万颗整球——沂南县“造球记”
齐鲁晚报·齐鲁壹点 记者 公绪成 李其峰 通讯员 陈婉塑炼、分切、热压......沂南县泽辉体育产业园内,工人们正紧忙制作新一批篮球内胆10月9日
2025-10-14 15:00:00