• 我的订阅
  • 科技

20款国产大模型角逐“最强王者”

类别:科技 发布时间:2024-06-02 05:34:00 来源:每日看点快看

本文转自:解放日报

20款国产大模型角逐“最强王者”

查睿

本报记者 查睿

近日,上海人工智能实验室联合魔搭社区推出中国大语言模型评测竞技场Compass Arena,首度集齐国内主流大模型全阵容,阿里通义千问、百度文心一言、腾讯混元、字节跳动豆包、书生·浦语等20款国产大模型出战,角逐中国大模型“最强王者”。

当下,“百模大战”厮杀正酣,各类榜单也层出不穷,其中国际开放研究组织LMSYS Org(Large Model Systems Organization)推出的大模型竞技场Chatbot Arena,已成为海外最具公信力的大模型竞技场之一,遗憾的是该竞技场中文化程度相对不足。为此,Compass Arena的推出将有效填补这一领域的空白。

相比考题固定的传统测评,中国大语言模型评测竞技场Compass Arena采用盲测、开放的测评模式,可以更全面地检验模型实力。Compass Arena设置了随机、匿名对战,大模型选手们成为“蒙面唱将”,模型信息隐去后,由系统随机匹配进行PK,用户可以天马行空自由出题,并作为评委主观评判和投票。如果大模型不小心“自报家门”,则对话被过滤,不计入成绩。通过成千上万轮PK挑战和用户投票,系统将对大模型进行自动排名。

Compass Arena由上海人工智能实验室OpenCompass司南评测体系与魔搭社区联合建设,前者负责组织评测,后者负责开源模型引入及社区打造。与Chatbot Arena相比,Compass Arena更聚焦中文大模型,主流国产大模型全覆盖,同时评测用户大多使用中文,可以充分评估国产大模型的性能。

目前,Compass Arena已汇聚超20款商业及社区模型,包括Qwen-Max、ERNIE-4.0-8K、Spark3.5 Max、Abab6.5、GLM4等国内头部厂商的旗舰款大模型,并引入了Llama3、Mixtral等海外标杆模型进行参照。更多模型及厂商还在不断加入中。

以上内容为资讯信息快照,由td.fyun.cc爬虫进行采集并收录,本站未对信息做任何修改,信息内容不代表本站立场。

快照生成时间:2024-06-02 11:45:08

本站信息快照查询为非营利公共服务,如有侵权请联系我们进行删除。

信息原文地址:

国产大模型竞技场首超GPT-4o!零一万物GLM共同跻身Top10
...式对外发布新旗舰模型——Yi-Lightning(闪电)。在大模型竞技场(Chatbot Arena)上,Yi-Lightning性能直冲总榜单并列第6
2024-10-17 09:48:00
帝都、魔都双双押宝 年底了AI圈居然还有高手
...024-11-19而阶跃的 “ 第二步 ”Step-1V 走的也不错。拿?模型竞技场 Chatbot Arena 的数据来看
2024-12-26 00:36:00
多模态竞技场对标90B Llama 3.2!Pixtral 12B技术报告全公开
【新智元导读】以开源极客之姿杀入江湖的Mistral AI,在9月份甩出了自家的首款多模态大模型Pixtral 12B
2024-11-20 09:43:00
GPT-4o mini登顶大模型竞技场,奥特曼:两个月内微调免费
...刚,GPT-4o mini版迎来“高光时刻”——登顶了lmsys大模型竞技场,和满血版并列第一,还把Claude 3
2024-07-25 09:31:00
起猛了,GPT-4o被谷歌新模型击败,ChatGPT官号:大家深吸一口气
...2000人匿名投票,Gemini 1.5 Pro(0801)代表谷歌首次夺得lmsys竞技场第一。(中文任务也第一)而且这次还是双冠王
2024-08-05 09:36:00
AI界新晋王者被曝抄袭、作弊、做假,脸都丢光了
(id:SouthReviews)原标题 | 他们抄袭,作弊,做假,却宣称超越作者 | 南风窗记者 朱秋雨编辑 | 向由排版 | 菲菲AI大模型大战在2023年爆发后
2023-12-20 00:10:00
...,360 通过 CoE 技术架构,构建了大模型竞技平台——模型竞技场(bot.360.com),目前已经入驻360AI浏览器
2024-09-16 17:42:00
国产模型指令跟随全球第一!来自LeCun亲推的最难作弊LLM新榜单
...而且它登上的这个排行榜LiveBench,虽然现在还没有大模型竞技场(LMSYS Chatboat Arena)那么广为人知
2024-11-22 09:54:00
智源评测体系发布 国内外“百模”评估结果出炉
5月17日,智源研究院举办大模型评测发布会,正式推出智源评测体系,发布并解读国内外140余个开源和商业闭源的语言及多模态大模型全方位能力评测结果。本次智源评测,分别从主观、客观两
2024-05-17 17:26:00
更多关于科技的资讯:
中新经纬4月4日电 (张芷菡)一个小篮子加上一把小铲子,钻进郊野就能收获春天。如今,挖野菜已从老年“养生局”变成了年轻人的“潮流局”
2026-04-04 20:12:00
4月4日,央视新闻客户端以《春暖花开换装忙换季消费带热“春日经济”》为题,报道了太原服装市场迎来换季消费高峰,春装热销持续拉动“春日经济”升温
2026-04-04 17:35:00
廊坊建成全国首个省级算力监测调度平台。
2026-04-04 18:26:00
中新经纬4月4日电 (宋亚芬)对于数以万计通过小包裹把“中国制造”卖往全球的中小电商来说,退货这条“回家路”曾困难重重
2026-04-04 18:04:00
近日,平安银行“基于iDeal平台的AI做市报价机器人项目”荣膺2025年深圳金融创新大赛二等奖。该大赛由深圳市地方金融管理局
2026-04-04 15:34:00
4月4日消息,千问AI打车清明假期订单量周环比增长超1500%,用户使用规模极速攀升。该功能于3月23日上线,距今不足两周
2026-04-04 11:41:00
千问3.6Plus大模型登顶全球模型调用排行榜首
4月4日消息,发布仅1天的千问新模型Qwen3.6-Plus,冲上全球知名大模型API调用平台OpenRouter的日榜榜首
2026-04-04 11:41:00
涌金楼丨浙企正在资本市场进行一场“春耕”
浙江企业正在资本市场进行一场“春耕”。截至3月31日,13家浙企登陆港交所、上交所、北交所。短短三个月,春意渐浓——这正是观察浙江产业升级的鲜活切面
2026-04-04 12:46:00
数智赋能新体验 山东移动高唐分公司助力宾馆智慧升级
鲁网4月3日讯随着人工智能、物联网等数字技术的快速发展,智慧化服务正加速融入日常生活。近日,山东移动高唐分公司充分发挥全光网络与云网能力
2026-04-04 08:27:00
中新经纬4月3日电 (宋亚芬)“人车家互联”迎来政策层面的推动。工信部等九部门近日联合印发的《推动物联网产业创新发展行动方案(2026-2028年)》中
2026-04-04 11:00:00
近日,世界超级摩托车锦标赛葡萄牙站赛场上传来好消息,中国摩托车制造商“张雪机车”以近4秒的绝对优势获得冠军,成绩断崖式碾压杜卡迪
2026-04-04 08:54:00
厦企造具身智能机器人加速商业化场景落地
厦企小鹭智能研发的四足巡检机器人,可承担全天候智能巡检任务。(小鹭智能 供图)厦门网讯(厦门日报记者 林露虹 实习生 陈慧)除了登台表演
2026-04-04 08:43:00
亿纬锂能6.9MWh储能系统亮相ESIE 2026,以确定性量产交付领跑储能大电池赛道
当储能行业走过概念验证的探索期,真正的考验才刚刚开始。过去两年,从280Ah、300Ah到500Ah+,从5MWh到6MWh以上
2026-04-03 21:50:00
华之杰(603400)定位于智能控制行业,致力于以锂电池电源管理、智能控制、无刷电机驱动和控制等技术为核心,主要为锂电电动工具
2026-04-03 22:31:00